Tips & Tricks

So erstellen Sie eine OCR-Erkennung in einer PDF-Datei, die mehrere Sprachen oder nicht-englischen Text enthält

Sie scannen einen zweisprachigen Vertrag. Die linke Spalte ist auf Englisch. Die rechte Spalte ist auf Spanisch. Beide Sprachen müssen durchsuchbar sein, aber ein standardmäßiger OCR-Lauf, der für eine Sprache konfiguriert ist, beeinträchtigt die andere. Die Anwendung der englischen OCR auf spanischen Text erzeugt Unsinn, da die Erkennungsmaschine unterschiedliche Buchstabenhäufigkeiten und Wortmuster erwartet. Die Anwendung der spanischen OCR auf Englisch führt zu ähnlich verstümmelten Ergebnissen. Sie benötigen eine OCR, die beide Sprachen gleichzeitig versteht.

Mehrsprachigkeit OCR PDF ist eine Funktion moderner Erkennungs-Engines, die innerhalb eines einzelnen Dokuments zwischen Sprachmodellen wechseln können. Die Engine erkennt, in welcher Sprache jeder Textblock geschrieben ist, und wendet das entsprechende Erkennungsmodell an. Das Ergebnis ist eine genaue Texterkennung in allen Sprachen im Dokument.

How to OCR a PDF That Contains Multiple Languages or Non-English Text

Wie OCR-Engines mit mehreren Sprachen umgehen

OCR-Engines erkennen Text, indem sie Zeichenformen mit trainierten Modellen vergleichen, die zeigen, wie Buchstaben in den einzelnen Sprachen aussehen. Ein englisches Modell weiß, dass der Buchstabe „e“ am häufigsten ist, dass "th" häufig zusammen vorkommt und dass bestimmte Zeichenkombinationen wie „qx“ kommen fast nie vor. Ein spanisches Model weiß, dass akzentuierte Zeichen wie "a" mit Akzent, "n" mit Tilde und umgekehrte Fragezeichen sind üblich. Ein französisches Modell erwartet häufig akzentuierte Vokale und spezifische Digraphen.

Wenn Sie mehrere Sprachen für einen OCR-Auftrag angeben, lädt die Engine die Zeichenmodelle für alle angegebenen Sprachen. Während es jeden Textblock auf der Seite verarbeitet, bewertet es, welches Sprachmodell am besten zu den beobachteten Zeichenmustern passt, und wendet dieses Modell an. Die Spracherkennung erfolgt automatisch auf Textblockebene, sodass eine Seite mit englischem Fließtext und französischen Fußnoten korrekt behandelt wird, ohne dass eine manuelle Sprachkennzeichnung erforderlich ist.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Mehrsprachige OCR einrichten

Die Sprachauswahl des OCR-Tools ermöglicht mehrere Sprachen. Wählen Sie alle Sprachen aus, die im Dokument erscheinen. Wählen Sie für einen zweisprachigen englisch-spanischen Vertrag sowohl Englisch als auch Spanisch aus. Wählen Sie für ein Dokument der Europäischen Union, das Englisch, Französisch und Deutsch enthält, alle drei aus. Für eine wissenschaftliche Arbeit mit englischen Texten und altgriechischen Zitaten wählen Sie Englisch und Griechisch. Der Motor lädt alle notwendigen Modelle.

Es gibt einen Kompromiss zwischen Sprachabdeckung und Genauigkeit. Jede zusätzliche Sprache fügt dem Erkennungsprozess weitere Zeichenmodelle hinzu, was die Wahrscheinlichkeit einer Verwechslung zwischen ähnlichen Zeichen aus verschiedenen Sprachen erhöht. Der kyrillische Buchstabe „a“ sieht identisch mit dem lateinischen Buchstaben „a“ aus. stellt aber einen anderen Klang dar und erscheint in anderen Kontexten. Das Hinzufügen unnötiger Sprachen erhöht das Risiko, dass die Engine Textblöcke falsch klassifiziert und das falsche Sprachmodell anwendet. Wählen Sie nur die Sprachen aus, die tatsächlich im Dokument vorkommen, nicht jede Sprache, die Ihrer Meinung nach möglicherweise nützlich sein könnte.

Häufige mehrsprachige OCR-Szenarien und wie man damit umgeht

Das häufigste mehrsprachige Szenario ist ein Dokument, das hauptsächlich in einer Sprache verfasst ist und kurze Passagen, Zitate oder Fußnoten in einer anderen enthält. Ein wissenschaftlicher Artikel in englischer Sprache mit französischen Zitaten in den Fußnoten. Eine Bedienungsanleitung auf Deutsch mit englischen Fachbegriffen. Ein rechtsgültiger Vertrag auf Spanisch mit englischdefinierten Bedingungen. Bei diesen Dokumenten enthält die Primärsprache den größten Teil des Textes, und die Sekundärsprache erscheint in kurzen, vorhersehbaren Kontexten.

Die Erkennungs-Engine verarbeitet diese gemischtsprachigen Dokumente gut, da die Sprachumschaltung auf bestimmte Textblöcke beschränkt ist. Der englische Fließtext wird mit dem englischen Modell erkannt. Das französische Zitat wird mit dem französischen Modell anerkannt. Da die beiden Sprachen in separaten Textblöcken erscheinen, identifiziert die Spracherkennung der Engine korrekt, welches Modell für jeden Block verwendet werden soll.

Ein schwierigeres Szenario ist ein Dokument, in dem Sprachen in derselben Zeile verschachtelt sind, beispielsweise ein Sprachlehrbuch, das einen Satz auf Englisch gefolgt von seiner Übersetzung auf Spanisch in derselben Zeile anzeigt. Die OCR-Engine behandelt möglicherweise die gesamte Zeile als einen Textblock und wendet ein Sprachmodell auf sie an, was zu Fehlern in der Hälfte der Zeile führt, die in der anderen Sprache verfasst ist. Für diese Dokumente besteht der genaueste Ansatz darin, das Dokument zweimal, einmal in jeder Sprache, per OCR zu scannen und die Ergebnisse manuell zusammenzuführen. Dies ist arbeitsintensiv und nur für kurze Dokumente praktisch, bei denen es auf die Genauigkeit ankommt.

Überprüfung mehrsprachiger OCR-Ergebnisse

Überprüfen Sie nach dem Ausführen der mehrsprachigen OCR die Ergebnisse, indem Sie den Text in jeder Sprache überprüfen. Suchen Sie nach einem Wort, von dem Sie wissen, dass es in jeder Sprache vorkommt. Bestätigen Sie, dass die Suche es findet. Wählen Sie Text in jeder Sprache aus und kopieren Sie ihn, um zu bestätigen, dass die Zeichen korrekt sind. Achten Sie besonders auf Akzentzeichen und Sonderzeichen. Die Scanned PDF-Erkennung schlägt höchstwahrscheinlich bei Zeichen fehl, die im dominanten Sprachmodell nicht vorhanden sind, da die Engine möglicherweise standardmäßig das nächstgelegene lateinische Äquivalent verwendet.

Zu den häufigsten OCR-Fehlern in mehrsprachigen Dokumenten zählen das Ersetzen akzentuierter Zeichen durch ihre nicht akzentuierten Äquivalente, e mit Akzent wird zu e, n mit Tilde wird zu n, spezielle Satzzeichen wie umgekehrte Fragezeichen im Spanischen werden durch Standardfragezeichen ersetzt und nicht-lateinische Schriften wie Kyrillisch oder Griechisch werden fälschlicherweise als visuell ähnliche lateinische Zeichen erkannt. Diese Fehler konzentrieren sich meist auf die Passagen der Nebensprache. Wenn der Inhalt der Sekundärsprache von entscheidender Bedeutung ist, überprüfen Sie diese Passagen manuell anhand des Originaldokuments. Das OCR-Tool von WukongPDF liefert einen Konfidenzwert für jeden erkannten Textblock, wobei niedrigere Werte auf Blöcke hinweisen, bei denen die Erkennungsmaschine weniger sicher war.

Bei Dokumenten, die Sprachen mit lateinischem Alphabet und nicht-lateinischen Schriften mischen, wie etwa ein englisches Dokument mit chinesischen oder arabischen Zitaten, ist die mehrsprachige OCR-Herausforderung größer, da die Zeichenformen grundlegend unterschiedlich sind. Die Erkennungsmaschine muss zwischen völlig unterschiedlichen Schriftsystemen unterscheiden. Wählen Sie die spezifischen Sprachen für jede Skriptfamilie aus, die im Dokument angezeigt wird. Die Verarbeitung des PDF-Formats von WukongPDF unterstützt das Mischen von lateinischen, kyrillischen, arabischen, CJK- und indischen Skripten in einem einzigen OCR-Auftrag, wobei die Genauigkeit je nach Skript und Scanqualität variiert.

Eine praktische Technik zur Verbesserung der mehrsprachigen OCR bei Dokumenten mit unterschiedlichen Sprachabschnitten: Trennen Sie das Dokument vor der Ausführung der OCR nach Sprachen. Wenn bei einem 20-seitigen Vertrag die ersten 10 Seiten auf Englisch und die letzten 10 Seiten auf Spanisch sind, teilen Sie das Dokument in zwei Dateien auf, führen Sie die englische OCR in der ersten und die spanische OCR in der zweiten aus und führen Sie sie dann erneut zusammen. Dies vermeidet den Mehrsprachenmodell-Overhead vollständig und führt zu einer etwas höheren Genauigkeit, da jeder OCR-Auftrag ein einzelnes Sprachmodell verwendet, das für den genauen Text, den er verarbeitet, optimiert ist. Der Workflow „Split, OCR separat, erneut zusammenführen“ nimmt ein paar zusätzliche Minuten in Anspruch, liefert aber zuverlässig die beste Genauigkeit für Dokumente mit klaren Sprachgrenzen. Reservieren Sie den mehrsprachigen OCR-Ansatz für Dokumente, bei denen die Sprachen tatsächlich auf derselben Seite verschachtelt sind und eine Trennung unpraktisch ist.

Ein letzter Tipp für mehrsprachige OCR: Wenn das Dokument Rechts-nach-links-Schriften wie Arabisch, Hebräisch oder Persisch neben Links-nach-rechts-Schriften wie Englisch oder Französisch enthält, erhöht die Textrichtung die Komplexität. OCR-Engines müssen nicht nur erkennen, in welcher Sprache sich jeder Textblock befindet, sondern auch, in welche Richtung der Text fließt. Ein arabischer Textblock sollte von rechts nach links erkannt werden, während die englische Beschriftung darunter von links nach rechts erkannt werden sollte. Die meisten modernen OCR-Engines verarbeiten Dokumente in gemischter Richtung einigermaßen gut, wenn Sie in den Einstellungen beide Sprachfamilien angeben. Überprüfen Sie nach der OCR die Textrichtung, indem Sie eine arabische Passage kopieren und in einen Texteditor einfügen. Die Zeichen sollten in der richtigen Lesereihenfolge erscheinen, nicht umgekehrt.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →