Standard-OCR-Engines basieren auf einer Grundannahme: Text verläuft horizontal von links nach rechts über die Seite. Diese Annahme gilt für Englisch, Spanisch, Französisch, Deutsch und die meisten europäischen Sprachen. Bei japanischem Text, der vertikal in traditionellen Spalten angeordnet ist, bei chinesischen Zeichen, bei denen die Zeichen von oben nach unten gestapelt sind, und bei arabischen und hebräischen Dokumenten, bei denen der Text von rechts nach links fließt, schlägt dies völlig fehl. Die Ausführung der Standard-OCR auf diesen Dokumenten führt zu einer Ausgabe, bei der Zeichen zwar einzeln erkannt, aber in der falschen Reihenfolge zusammengesetzt werden, wodurch das Ergebnis unbrauchbar wird.
Die Fähigkeit von OCR PDF-Engines, nicht standardmäßige Textrichtungen zu verarbeiten, hat sich mit der neuesten Generation von KI-gestützten Erkennungssystemen erheblich verbessert. Diese Engines erkennen die Textausrichtung vor dem Erkennungsversuch, identifizieren die Leserichtung und rekonstruieren die logische Lesereihenfolge unabhängig vom visuellen Layout. Bei Dokumenten mit gemischten Textrichtungen, beispielsweise einem japanischen Artikel, der horizontale englische Zitate enthält, wechselt die Engine den Modus in der Mitte der Seite.

Wie OCR-Engines die Textrichtung erkennen und verarbeiten
Moderne OCR-Engines beginnen mit einem Layout-Analyseschritt, der Textbereiche identifiziert, ihre Ausrichtung bestimmt und sie nach Leserichtung klassifiziert. Bei horizontalem Text erkennt die Engine die Grundlinie und gruppiert Zeichen entlang dieser. Bei vertikalem Text erkennt die Engine die vertikale Achse und gruppiert Zeichen in Spalten. Bei von rechts nach links verlaufendem Text identifiziert die Engine den dominanten Zeichensatz und kehrt die standardmäßige Wortreihenfolge von links nach rechts um.
Die Erkennung der Textrichtung basiert auf mehreren Signalen. Das Vorhandensein bestimmter Unicode-Zeichenbereiche weist auf wahrscheinliche Sprachen und ihre typischen Textrichtungen hin. Die räumliche Anordnung der erkannten Zeichen, unabhängig davon, ob sie horizontale Linien oder vertikale Spalten bilden, liefert Hinweise auf das Layout. Das Seitenverhältnis der Zeichenbegrenzungsrahmen liefert ein drittes Signal: Lateinische Zeichen sind normalerweise breiter als hoch, während CJK-Zeichen ungefähr quadratisch sind und arabische Zeichen horizontal auf eine Weise verbunden sind, die die Leserichtung erkennen lässt.
Die zuverlässigsten OCR-Engines kombinieren alle drei Signaltypen. Ein Dokument, das sowohl arabische Schrift, also eine Leserichtung von rechts nach links, als auch lateinische Schrift, also eine Leserichtung von links nach rechts, enthält, erfordert, dass die Engine jeden Textbereich unabhängig analysiert. Eine korrekt konfigurierte Extract PDF Data-Pipeline für mehrsprachige Dokumente umfasst die Richtungserkennung pro Region, anstatt eine einzelne Richtung auf die gesamte Seite anzuwenden.
Jedes Schriftsystem erfordert eine grundlegend andere OCR-Konfiguration.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
OCR-Einstellungen für vertikalen Text in Japanisch, Chinesisch und Koreanisch
Japanischer vertikaler Text, Tategaki genannt, ist das heute am häufigsten verwendete vertikale Schriftsystem. Es erscheint in Romanen, Zeitungen, traditionellen Dokumenten und formeller Korrespondenz. Im vertikalen Japanisch werden die Zeichen von oben nach unten gelesen, wobei die Spalten von rechts nach links über die Seite verlaufen. Zahlen und Wörter in lateinischer Schrift, die in vertikalen japanischen Text eingebettet sind, können innerhalb des vertikalen Flusses gedreht oder horizontal platziert werden.
Um vertikalen japanischen Text per OCR zu erfassen, wählen Sie eine Erkennungs-Engine aus, die Tategaki explizit unterstützt. Allzweck-OCR-Engines erkennen die Zeichen möglicherweise korrekt, geben sie jedoch in horizontaler Reihenfolge von links nach rechts aus, was zu fehlerhaften Ergebnissen führt. Japanische OCR-Engines verstehen die spaltenbasierte Lesereihenfolge und geben Text aus, der natürlich gelesen werden kann. Tesseract, die Open-Source-OCR-Engine, hat in Version 5 eine verbesserte vertikale japanische Unterstützung hinzugefügt und wird jetzt von mehreren kommerziellen Engines angeboten.
Für chinesischen vertikalen Text, der in traditionellen Publikationen, Kalligraphie und einigen formellen Dokumenten vorkommt, ist die Erkennungsherausforderung ähnlich, aber der Zeichensatz ist größer. Im vereinfachten Chinesisch werden im allgemeinen Sprachgebrauch etwa 7.000 Zeichen verwendet, während im traditionellen Chinesisch über 13.000 verwendet werden. Die OCR-Engine muss nicht nur das vertikale Layout erkennen, sondern auch zwischen optisch ähnlichen Zeichen unterscheiden, die sich nur in den Strichdetails unterscheiden.
Koreanischer vertikaler Text ist in modernen Dokumenten selten, erscheint jedoch in historischen Texten und einigen traditionellen Veröffentlichungen. Das koreanische Alphabet, Hangul, setzt einzelne Buchstaben zu Silbenblöcken zusammen, und beim vertikalen Schreiben werden diese Blöcke von oben nach unten gestapelt. OCR-Engines, die vertikalen koreanischen Text verarbeiten, müssen die Silbenblockstruktur sowie die einzelnen Buchstabenbestandteile in jedem Block erkennen.
OCR-Einstellungen für Text von rechts nach links in Arabisch, Hebräisch und Persisch
Die arabische OCR stellt einzigartige Herausforderungen dar, die über die Textrichtung hinausgehen. Arabisch ist eine Kursivschrift, bei der die meisten Buchstaben mit ihren Nachbarn verbunden sind und sich die Buchstabenform je nach Position im Wort ändert: Anfangsbuchstaben, Mittelbuchstaben, Endbuchstaben oder isolierte Buchstaben. Die OCR-Engine muss diese kontextuellen Formen erkennen und sie dem richtigen abstrakten Zeichen zuordnen. Fehlende Verbindungen oder falsche Verbindungen zwischen Buchstaben führen zu Erkennungsfehlern, die spezifisch für kursive Schriften sind.
Bei Auswahl der hebräischen OCR ist die Schrift nicht kursiv, sondern enthält Vokalpunkte, Niqqud genannt, die als Punkte und Striche über, unter oder innerhalb von Buchstaben erscheinen. Diese Vokalzeichen sind klein, typischerweise 2 bis 4 Pixel in einem gescannten Bild, und gehen bei der Binärisierung leicht verloren. Eine OCR-Engine, die niqqud nicht explizit verarbeitet, erkennt die Konsonanten korrekt, lässt aber die Vokalzeichen weg und erzeugt so einen Text, den ein menschlicher Leser verstehen kann, der aber technisch unvollständig ist.
Persisch und Urdu verwenden erweiterte Versionen der arabischen Schrift mit zusätzlichen Zeichen. Eine nur auf Arabisch trainierte OCR-Engine wird diese zusätzlichen Zeichen übersehen oder sie fälschlicherweise als ähnliche arabische Buchstaben erkennen. Stellen Sie bei der Auswahl einer OCR-Engine für diese Sprachen sicher, dass sie speziell die Unterstützung für die genaue Sprache und Skriptvariante auflistet, die Ihr Dokument verwendet, und nicht nur für arabische Skripte im Allgemeinen.
Umgang mit Dokumenten mit gemischter Richtung
Viele reale Dokumente vermischen mehrere Textrichtungen auf derselben Seite. Eine japanische Facharbeit kann vertikalen japanischen Text, horizontale englische Bildunterschriften und mathematische Gleichungen enthalten, die ihren eigenen Layoutregeln folgen. Ein arabischer Geschäftsbrief kann einen englischen Firmennamen und einen Adressblock im Links-nach-rechts-Format über dem von rechts nach links verlaufenden Text enthalten.
Bei Dokumenten mit gemischter Richtung ist der OCR-Vorverarbeitungsschritt von entscheidender Bedeutung. Das Dokument muss in Textbereiche segmentiert werden, und jeder Bereich muss unabhängig hinsichtlich der Textrichtung klassifiziert werden, bevor die Erkennung beginnt. Bei komplexen Layouts führt die manuelle Regionsauswahl häufig zu besseren Ergebnissen als die automatische Segmentierung. Zeichnen Sie Begrenzungsrahmen um jeden Textbereich und weisen Sie jedem Rahmen die richtige Sprache und Richtung zu.
Überprüfen Sie nach der OCR die Ausgabe, indem Sie Text prüfen, der Richtungsgrenzen überschreitet. Ein häufiger Fehler bei OCR in gemischter Richtung besteht darin, dass die Grenze zwischen zwei Textbereichen falsch ist, sodass das letzte Wort eines Bereichs mit Leserichtung von links nach rechts an den Anfang eines Bereichs mit Leserichtung von rechts nach links angehängt wird oder umgekehrt. Bei der Stichprobenprüfung dieser Grenzbereiche werden Layout-Segmentierungsfehler erkannt, die andernfalls zu einer verwirrenden Ausgabe führen würden.
Post-OCR-Verarbeitung für nicht standardmäßige Textanweisungen
Nach Abschluss der OCR muss der erkannte Text möglicherweise neu angeordnet werden, um eine natürliche Lesereihenfolge zu gewährleisten. Einige OCR-Engines geben vertikalen japanischen Text in der Reihenfolge aus, in der er erkannt wurde, von oben nach unten in jeder Spalte, Spalte für Spalte von links nach rechts. Diese Reihenfolge stimmt nicht mit der ursprünglichen Lesereihenfolge überein, die spaltenweise von rechts nach links erfolgt. Ein Nachbearbeitungsschritt, der die Spalten neu anordnet, erzeugt die richtige Lesereihenfolge.
Für Dokumente mit Gescannten PDF-Inhalten, die bidirektionalen Text, Arabisch mit eingebetteten englischen Begriffen, enthalten, gibt der bidirektionale Unicode-Algorithmus an, wie die Anzeigereihenfolge bestimmt wird. Die OCR-Ausgabe sollte bidirektionale Unicode-Steuerzeichen enthalten oder dem Algorithmus folgen, damit der Text korrekt angezeigt wird, wenn er in Anwendungen eingefügt wird, die bidirektionalen Text unterstützen.
WukongPDF ermöglicht die OCR-Verarbeitung gescannter PDFs über den Browser mit Sprachauswahloptionen, die die Unterstützung der wichtigsten Rechts-nach-Links- und vertikalen Schreibsysteme umfassen. Durch Testen der OCR auf einer Beispielseite vor der Verarbeitung des gesamten Dokuments können Sie überprüfen, ob die Textrichtung korrekt verarbeitet wird.
Bei Dokumenten, die sowohl vertikalen als auch horizontalen Text auf derselben Seite enthalten, wie z. B. das Layout einer japanischen Zeitschrift, bei der der Hauptartikel vertikal, Bildunterschriften und Seitenleisten jedoch horizontal sind, liefert die manuelle Zoneneinteilung die genauesten OCR-Ergebnisse. Zeichnen Sie separate Erkennungsbereiche für die vertikalen und horizontalen Bereiche, weisen Sie jedem die richtige Textrichtung zu und führen Sie OCR für das in Zonen unterteilte Dokument aus. Der zusätzliche Zeitaufwand für die Zoneneinteilung macht sich durch die Erkennungsgenauigkeit bezahlt.
Wenn Sie historische Dokumente mit nicht standardmäßigen Textlayouts verarbeiten, müssen Sie damit rechnen, dass die OCR-Genauigkeit geringer ist als bei modernen gedruckten Dokumenten. Historische Schriftarten, ungleichmäßiger Druck, gealtertes Papier mit Verfärbungen und nicht standardmäßige Zeichenvarianten beeinträchtigen die Erkennungssicherheit. Betrachten Sie bei wissenschaftlichen oder archivarischen Arbeiten die OCR-Ausgabe als Ausgangspunkt für die manuelle Transkription und nicht als fertiges Produkt.
Einige OCR-Engines unterstützen einen Trainingsmodus, in dem Sie Beispiele für die spezifische Schriftart oder den Handschriftstil bereitstellen, die in Ihrem Dokument verwendet werden. Durch das Training der Engine auf einigen repräsentativen Seiten wird die Erkennungsgenauigkeit im gesamten Dokument verbessert. Dieser Ansatz ist besonders nützlich für Dokumente, die in ungewöhnlichen Schriftarten gedruckt wurden, oder für Dokumentensammlungen desselben Herausgebers, bei denen die Typografie über mehrere Bände hinweg konsistent ist.
Nachdem die OCR für ein von rechts nach links geschriebenes Dokument abgeschlossen ist, überprüfen Sie, ob die Textrichtung korrekt ist, indem Sie einige Sätze aus der Ausgabe kopieren und sie in eine Anwendung einfügen, die bidirektionalen Text unterstützt, z. B. Microsoft Word oder Google Docs. Wenn der Text in umgekehrter Reihenfolge angezeigt wird, hat die OCR-Engine die Richtung von rechts nach links nicht korrekt angewendet und die Ausgabe muss mit korrigierten Richtungseinstellungen erneut verarbeitet werden.
Die Zeit, die in die Einrichtung korrekter OCR-Parameter für nicht standardmäßige Textrichtungen investiert wird, macht sich durch die Erkennungsgenauigkeit sofort bezahlt. Ein Dokument, das nach einer schlechten OCR 30 Minuten manuelle Korrektur erfordert, benötigt nach einer ordnungsgemäß konfigurierten OCR möglicherweise nur 5 Minuten Bereinigung.
| Schreibsystem | Richtung | OCR-Engine-Anforderung | Schlüsselherausforderung |
|---|---|---|---|
| Japanisch (Tategaki) | Spalten von oben nach unten und von rechts nach links | Engine mit expliziter Tategaki-Unterstützung | Gemischtes horizontales Englisch im vertikalen Fluss |
| Chinesisch (traditionell) | Vertikale Spalten, von rechts nach links | Großer Zeichensatz (13.000+) | Visuell ähnliche Charaktere |
| Arabisch | Rechts-nach-links-Kursivverbindung | Arabische Skript-Engine mit Positionsformen | Kontextbezogene Buchstabenformen; diakritische Zeichen |
| hebräisch | Von rechts nach links, mit Niqqud | Hebräische Skript-Engine mit Vokalunterstützung | Kleine Vokalzeichen gehen bei der Binärisierung verloren |
| Persisch / Urdu | Von rechts nach links, erweitertes Arabisch | Sprachspezifische Engine | Zusätzliche Zeichen außerhalb des arabischen Satzes |
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
