Tips & Tricks

So extrahieren Sie Text aus einem gescannten PDF in nur einer bestimmten Sprache, wenn mehrere Sprachen vorhanden sind

Sie scannen eine zweisprachige Speisekarte. Die Namen der Gerichte sind auf Italienisch. Die Beschreibungen sind auf Englisch. Bei den Preisen handelt es sich um Zahlen, die sprachunabhängig sind. Sie müssen nur den italienischen Text extrahieren, um eine Wortliste in italienischer Sprache zu erstellen, oder nur den englischen Text, um ihn an einen Übersetzer für ein anderes Sprachpaar zu senden. Das Ausführen von OCR für das gesamte Dokument erzeugt eine Mischung aus beiden Sprachen, was für die Durchsuchbarkeit in Ordnung ist, nicht jedoch für die selektive Extraktion.

Das Extrahieren von Text in nur einer Sprache aus einem mehrsprachigen OCR PDF Dokument erfordert eine OCR-Engine, die erkennen kann, in welcher Sprache jeder Textblock geschrieben ist, und nur die Blöcke extrahieren kann, die Ihrer Zielsprache entsprechen. Dies ist ein selektiverer Vorgang als die Standard-OCR, die den gesamten Text unabhängig von der Sprache erkennt.

How to Extract Text From a Scanned PDF in Only One Specific Language When Multiple Languages Are Present

So funktioniert die sprachselektive OCR

OCR-Engines mit Mehrsprachenunterstützung können so konfiguriert werden, dass sie Text in mehreren Sprachen gleichzeitig erkennen. Wenn Sie "Italienisch und Englisch" Als OCR-Sprachen erkennt die Engine Text in beiden Sprachen. Außerdem wird jeder erkannte Textblock mit der Sprache markiert, in der er erkannt wurde. Ein italienischer Textblock wird als Italienisch markiert. Ein Block mit englischem Text wird als Englisch markiert. Die Sprachkennzeichnung ermöglicht eine selektive Extraktion.

Nach der OCR können Sie den erkannten Text nach Sprach-Tag filtern. Exportieren Sie nur die Blöcke, die als „Italienisch“ gekennzeichnet sind. Die Ausgabe ist ein Dokument, das nur den italienischen Text aus dem Menü enthält. Die erkannten, aber herausgefilterten englischen Beschreibungen erscheinen nicht in der Ausgabe. Diese selektive Extraktion ist nützlich für Übersetzungsworkflows, Sprachlernmaterialien und Inhaltsanalysen, bei denen Sie Text in einer bestimmten Sprache isoliert vom umgebenden Text in anderen Sprachen benötigen.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Schritt für Schritt: Text in einer bestimmten Sprache extrahieren

Laden Sie das gescannte PDF in das OCR-Tool von WukongPDF hoch. Wählen Sie die im Dokument vorhandenen Sprachen aus. Wählen Sie für das Menü Italienisch-Englisch sowohl Italienisch als auch Englisch aus. Führen Sie die OCR aus. Das Tool erkennt den gesamten Text und markiert jeden Block nach Sprache. Nachdem die OCR abgeschlossen ist, verwenden Sie den Sprachfilter, um Italienisch auszuwählen. Exportieren Sie den gefilterten Text als reine Textdatei, als Word-Dokument oder als neues PDF, das nur die italienischen Blöcke enthält.

Die Genauigkeit der Spracherkennung hängt von der Unterscheidungskraft der Sprachen ab. Italienisch und Englisch verwenden dasselbe Alphabet, haben jedoch unterschiedliche Wortmuster. Die OCR-Engine unterscheidet sie durch die Analyse der Worthäufigkeit. Im Italienischen enden viele Wörter mit Vokalen. Im Englischen enden viele Wörter mit Konsonanten. Je ausgeprägter die Sprachen sind, desto genauer ist die Sprachkennzeichnung. Zwei eng verwandte Sprachen wie Spanisch und Portugiesisch können durch die Engine bei kurzen Textblöcken verwechselt werden.

Umgang mit gemischtsprachigem Text in derselben Zeile

In einigen Dokumenten werden Sprachen in einer einzigen Zeile gemischt, beispielsweise in einem Sprachlehrbuch, das einen Satz auf Französisch mit seiner Übersetzung auf Englisch in derselben Zeile verbindet. Die OCR-Engine klassifiziert möglicherweise die gesamte Zeile als dominante Sprache und markiert die Wörter in der Minderheitensprache falsch. Für diese Dokumente ist die sprachselektive Extraktion auf Blockebene nicht präzise genug. Sie brauchen einen anderen Ansatz.

Die Alternative besteht darin, OCR zweimal auszuführen, einmal, wobei jede Sprache die einzige Erkennungssprache ist. Der OCR-Pass nur für Italienisch erkennt italienischen Text gut, verstümmelt jedoch englischen Text. Der Nur-Englisch-Pass erkennt Englisch gut, verstümmelt jedoch Italienisch. Vergleichen Sie die beiden Ausgaben und wählen Sie manuell die richtige Version für jedes Textsegment aus. Dieser Dual-Pass-Ansatz nimmt mehr Zeit in Anspruch, liefert jedoch die genaueste sprachspezifische Extraktion für Dokumente, in denen Sprachen auf Satzebene verschachtelt sind.

Überprüfen und Bereinigen des extrahierten Textes

Überprüfen Sie nach dem Extrahieren von Text in der Zielsprache, ob die Sprachfilterung korrekt war. Scannen Sie den extrahierten Text nach Wörtern, die eindeutig in der falschen Sprache verfasst sind. Eine italienische Textextraktion aus einem Menü sollte keine englischen Wörter wie „gegrillt“ enthalten. oder "serviert mit" es sei denn, das Menü verwendet diese Wörter absichtlich in den italienischen Beschreibungen. Gefilterter Text, der unerwartete Fremdwörter enthält, weist auf Fehler bei der Sprachkennzeichnung hin, die manuell korrigiert werden müssen.

Führen Sie eine Rechtschreibprüfung in der Zielsprache durch. Bei der italienischen Rechtschreibprüfung werden englische Wörter markiert, die fälschlicherweise in die italienische Extraktion einbezogen wurden. Die Markierungen für die Rechtschreibprüfung sind eine effiziente Möglichkeit, Fehler bei der Sprachkennzeichnung zu finden, ohne jedes extrahierte Wort lesen zu müssen. Die sprachgefilterten und auf Rechtschreibung geprüften PDF-Daten extrahieren sind bereit für die Übersetzung, Analyse oder Archivierung. WukongPDFs Gescannte PDF OCR mit Sprachfilterung erzeugt sauberere einsprachige Extrakte als die Nachbearbeitung gemischtsprachiger OCR-Ausgaben, um die unerwünschte Sprache zu entfernen.

Eine praktische Anwendung für sprachselektive OCR: Erstellung zweisprachiger Glossare aus übersetzten Dokumenten. Extrahieren Sie alle Begriffe in der Ausgangssprache und alle Begriffe in der Zielsprache separat. Richten Sie sie nach ihrer Position auf der Seite aus, da jeder Quellbegriff einen entsprechenden Zielbegriff an ungefähr derselben vertikalen Position auf der Seite oder in einer angrenzenden Spalte hat. Die ausgerichtete Ausgabe wird zu einer Begriffsliste, die Übersetzer verwenden können, um die Konsistenz bei zukünftigen Übersetzungen sicherzustellen. Diese Technik zur Glossarerstellung wird häufig bei technischen Übersetzungen eingesetzt, bei denen eine konsistente Terminologie von entscheidender Bedeutung ist.

Bei Dokumenten, in denen sich die Sprachen in separaten Spalten befinden, wie etwa einem zweispaltigen zweisprachigen Vertrag, wird die sprachselektive Extraktion zu einer Spaltenauswahlaufgabe. Die linke Spalte ist eine Sprache, die rechte Spalte eine andere. Anstatt sich auf die Spracherkennung zu verlassen, die ähnliche Sprachen verwirren kann, schneiden Sie die PDF-Datei zu, um jede Spalte separat zu extrahieren. Führen Sie für jede Spalte eine einsprachige OCR aus. Dieser Ansatz des Spaltenbeschneidens ist zuverlässiger als die Sprachfilterung für Dokumente mit klarer spaltenweiser Sprachtrennung.

Bei Archivierungsprojekten mit historischen mehrsprachigen Dokumenten erstellt sprachselektives OCR in Kombination mit Metadaten-Tagging ein durchsuchbares Archiv, in dem Forscher Inhalte in einer bestimmten Sprache in Tausenden von Dokumenten finden können. Die OCR-Ausgabe jedes Dokuments ist mit den erkannten Sprachen gekennzeichnet. Ein Forscher, der nach französischen Dokumenten aus dem 18. Jahrhundert sucht, kann in einer mehrsprachigen Sammlung nur nach französischsprachigem Text filtern. Dieser selektive Ansatz verwandelt die archivierte OCR von einem stumpfen Werkzeug, das Sprachen vermischt, in ein Präzisionsinstrument für die Sprachforschung.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →