Tips & Tricks

So erstellen Sie eine OCR-Erkennung für ein PDF-Dokument, das in einer Sprache verfasst ist, die Sie nicht sprechen

Der Erhalt eines gescannten PDF, das in einer Sprache verfasst ist, die Sie nicht sprechen, ist in der globalen Wirtschaft, in der akademischen Forschung und bei der Überprüfung von Rechtsdokumenten häufiger denn je. Sie müssen den Text extrahieren, übersetzen und verstehen, was im Dokument steht. Die Herausforderung besteht nicht nur darin, OCR für die Datei auszuführen. Es führt OCR mit den richtigen Spracheinstellungen aus, sodass der extrahierte Text genau genug ist, um übersetzt zu werden. Die Auswahl der falschen Sprache während der OCR PDF-Verarbeitung führt zu einer verstümmelten Ausgabe, die keine Übersetzungsmaschine retten kann.

OCR-Engines erkennen keine Buchstaben. Sie sehen Formen und vergleichen diese Formen mit Zeichenmustern für eine bestimmte Sprache. Wenn Sie der OCR-Engine mitteilen, dass das Dokument auf Englisch, aber tatsächlich auf Russisch ist, ordnet die Engine kyrillische Formen den nächstgelegenen lateinischen Zeichen zu, die ihr bekannt sind. Das Ergebnis ist eine Folge zufällig aussehender Buchstaben, die keinen Bezug zum Originaltext haben. Die richtige Spracheinstellung oder die Verwendung der automatischen Erkennung, sofern verfügbar, ist die wichtigste Entscheidung in der gesamten OCR-zu-Übersetzungs-Pipeline.

Die PDF-to-Text- und OCR-Tools von WukongPDF extrahieren Text aus gescannten Dokumenten zur Übersetzung und Analyse. Durch die Kombination der richtigen OCR-Sprachauswahl mit einem zuverlässigen Übersetzungsdienst wird aus einem unlesbaren Fremdsprachenscan in weniger als fünf Minuten ein verständliches Dokument.

How to OCR a PDF Document Written in a Language You Don't Speak

Schritt 1: Identifizieren Sie die Dokumentsprache

Bevor Sie eine OCR-Software verwenden, müssen Sie die Sprache des Dokuments sicher identifizieren. Wenn die Metadaten oder der Dateiname des Dokuments Hinweise auf die Sprache geben, beginnen Sie dort. Wenn nicht, öffnen Sie das PDF und sehen Sie sich einige Seiten an. Selbst ohne das Lesen des Textes schränken visuelle Hinweise die Möglichkeiten erheblich ein. Schriftfamilien sind charakteristisch: Die lateinische Schrift wird in den meisten europäischen Sprachen verwendet. Kyrillisch wird für Russisch, Ukrainisch, Bulgarisch und Serbisch verwendet. Die arabische Schrift umfasst Arabisch, Persisch und Urdu. CJK deckt Chinesisch, Japanisch und Koreanisch ab. Devanagari umfasst Hindi, Marathi und Nepali.

Wenn Sie nicht einmal die Schriftfamilie visuell identifizieren können, machen Sie einen Screenshot eines repräsentativen Absatzes und laden Sie ihn in die Bildübersetzungsfunktion von Google Translate oder eine umgekehrte Bildsuche hoch. Diese Tools identifizieren in den meisten Fällen sowohl das Skript als auch die spezifische Sprache. Zu wissen, dass das Dokument thailändisch statt laotisch oder koreanisch statt japanisch ist, macht den Unterschied zwischen einer genauen OCR-Ausgabe und unnötigem Zeichenrauschen aus.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Schritt 2: Wählen Sie ein OCR-Tool aus, das die Zielsprache unterstützt

Nicht alle OCR-Tools unterstützen alle Sprachen. Adobe Acrobat Pro wird mit OCR-Engines für etwa 40 Sprachen ausgeliefert. Das Werkzeug „Text erkennen“ enthält ein Dropdown-Menü zur Sprachauswahl im Einstellungsdialog. Tesseract, die kostenlose Open-Source-OCR-Engine von Google, unterstützt über 100 Sprachen durch herunterladbare Sprachdatendateien. Die Google Cloud Vision API bietet mit über 200 Sprachen die größte Sprachabdeckung und umfasst als optionale Funktion die automatische Spracherkennung.

Für ein Dokument in einer einzigen Sprache, die Sie identifizieren können, funktioniert jedes dieser Tools, solange Sie die richtige Sprache angeben, bevor Sie OCR ausführen. Für ein Dokument, das mehrere Sprachen enthält, beispielsweise einen zweisprachigen Vertrag mit Klauseln in Englisch und Französisch, benötigen Sie ein Tool, das entweder mehrere gleichzeitige Sprachen unterstützt oder dies automatisch für jeden Absatz erkennt. Google Cloud Vision und Tesseract verarbeiten mit den entsprechenden Sprachdatenpaketen beide mehrsprachige Dokumente, obwohl die Genauigkeit bei Sprachwechselgrenzen nie perfekt ist.

Schritt 3: OCR mit der richtigen Sprache konfigurieren und ausführen

Öffnen Sie in Adobe Acrobat Pro die gescannte PDF-Datei, gehen Sie zu „Extras“, dann „Scannen und OCR“ und wählen Sie „Text erkennen“ und dann „In dieser Datei“. Klicken Sie neben der Sprachauswahl auf die Schaltfläche Bearbeiten. Wählen Sie im Dialogfeld „Text erkennen“ die richtige Primärsprache aus der Dropdown-Liste aus. Wenn das Dokument eine zweite Sprache enthält, klicken Sie auf die Schaltfläche „Sprache hinzufügen“ und wählen Sie diese ebenfalls aus. Acrobat verarbeitet beide Sprachen gleichzeitig. Klicken Sie auf „OK“ und dann auf „Text erkennen“. Acrobat führt den OCR-Durchlauf durch und bettet den erkannten Text als unsichtbare Ebene hinter dem gescannten Bild ein. Das Dokument ist jetzt durchsuchbar.

In Tesseract gibt der Befehlszeilenaufruf die Sprache mit dem Flag -l an: tesseract input.pdf Output -l rus für Russisch, tesseract input.pdf Output -l jpn für Japanisch oder tesseract input.pdf Output -l fra+eng für ein zweisprachiges französisch-englisches Dokument. Installieren Sie zunächst die erforderlichen Sprachdatendateien; Tesseract wird standardmäßig nur in Englisch ausgeliefert. Für Google Cloud Vision enthält der API-Aufruf einen languageHints-Parameter, der ein Array von BCP-47-Sprachcodes akzeptiert. Cloud Vision bietet außerdem einen automatischen Spracherkennungsmodus, der überhaupt keinen Sprachhinweis erfordert, was es zur einfachsten Option macht, wenn Sie die Sprache des Dokuments wirklich nicht kennen.

Schritt 4: Den extrahierten Text kopieren und übersetzen

Überprüfen Sie nach Abschluss der OCR die Textqualität, bevor Sie sie zur Übersetzung senden. Öffnen Sie in Acrobat das Suchwerkzeug und suchen Sie nach einem häufig vorkommenden Wort, das Ihnen im Dokument bekannt ist. Wenn die Suche Übereinstimmungen findet, hat die OCR funktioniert. Wählen Sie einen Absatz des extrahierten Texts aus, kopieren Sie ihn und fügen Sie ihn in einen Nur-Text-Editor ein. Suchen Sie nach offensichtlichen OCR-Fehlern: sich wiederholende Symbole, Wörter, die in der Mitte unterbrochen sind, oder große Blöcke mit nicht erkannten Zeichen. Wenn mehr als 5 Prozent des Textes beschädigt erscheinen, führen Sie die OCR erneut mit einer anderen Spracheinstellung oder einer höheren Auflösungseinstellung aus.

Sobald der extrahierte Text eine visuelle Plausibilitätsprüfung bestanden hat, kopieren Sie den gesamten Text und fügen Sie ihn in ein Übersetzungstool ein. Google Translate, DeepL oder Microsoft Translator akzeptieren alle die Eingabe von reinem Text. Bei längeren Dokumenten unterstützen DeepL und Google Translate den direkten Datei-Upload durchsuchbarer PDFs, wodurch der manuelle Kopierschritt übersprungen wird. Die Übersetzungsergebnisse sind gut genug für das Verständnis, die Recherche und den internen Geschäftsgebrauch. Für juristische, medizinische oder publikationstechnische Genauigkeit senden Sie die durchsuchbare PDF-Datei an einen professionellen menschlichen Übersetzer, der die OCR-Ebene als Ausgangspunkt verwendet und die maschinelle Übersetzung anhand der gescannten Originalseiten korrigiert.

Umgang mit Dokumenten mit gemischten Skripten oder nicht standardmäßigen Schriftarten

Dokumente, die Skripte vermischen, wie etwa eine arabische Forschungsarbeit, die englische Fachbegriffe in lateinischer Schrift enthält, verwirren OCR-Engines, die ein einzelnes Skript erwarten. Konfigurieren Sie zuerst die OCR für das dominante Skript und führen Sie dann einen zweiten Durchgang aus, der auf das Minderheitsskript im selben Dokument abzielt. Führen Sie die Ergebnisse zusammen, indem Sie beide OCR-Ebenen exportieren und in einem Texteditor kombinieren. Die Genauigkeit der Minderheitsskriptpassagen ist geringer, da die Engine für das Primärskript optimiert ist.

Nicht standardmäßige Schriftarten, darunter dekorative Schriftarten, alte Schreibmaschinenschriftarten und handgeschriebene kursive Schriftarten, verringern die OCR-Genauigkeit, selbst wenn die richtige Sprache ausgewählt ist. Verarbeiten Sie diese Dokumente vor, indem Sie die PDF-Seiten in hochauflösende Bilder mit 400 DPI oder höher konvertieren, einen Schärfungsfilter anwenden und den Kontrast erhöhen, bevor Sie sie in die OCR-Engine einspeisen. Die integrierte Vorverarbeitung von Tesseract, die mit --psm 3 für die automatische Seitensegmentierung aktiviert wird, verarbeitet moderate Schriftartvariationen. Bei stark beeinträchtigtem oder stilisiertem Text übertrifft die Google Cloud Vision API im Allgemeinen lokale OCR-Engines, da ihre Modelle anhand eines größeren Korpus realer Schriftbeispiele trainiert wurden.

OCR-ToolMehrsprachige UnterstützungAutomatische ErkennungAm besten für
Adobe Acrobat ProÜber 40 SprachenManuelle AuswahlProfessionelle Dokumente, hohe Genauigkeit
Tesseract (Open Source)Über 100 SprachenManuelle Auswahl erforderlichStapelverarbeitung, Skripterstellung, kostenlos
Google Cloud VisionÜber 200 SprachenAutomatische Erkennung verfügbarAPI-Integration, gemischte Skripte
Online-OCR-Dienste10-50 SprachenManuelle AuswahlSchnelle Einzeldokument-OCR

Überprüfung der Genauigkeit vor der Bearbeitung übersetzter Inhalte

OCR gefolgt von maschineller Übersetzung führt zu zwei Ebenen potenzieller Fehler: OCR-Fehlerkennung und Übersetzungsmehrdeutigkeit. Überprüfen Sie bei kritischen Dokumenten die Ausgabe stichprobenartig, indem Sie einen zweisprachigen Kollegen oder einen professionellen Übersetzer bitten, einen zufällig ausgewählten Absatz der Übersetzung mit dem Original-PDF zu vergleichen. Eine fünfminütige Überprüfung erkennt katastrophale Fehler wie eine falsche Spracheinstellung, die plausibel aussehenden, aber völlig falschen Text erzeugt.

Wenn Sie regelmäßig mit gescannten PDFs in Fremdsprachen arbeiten, erstellen Sie eine Checkliste: Identifizieren Sie die Sprache, wählen Sie die passende OCR-Engine aus, führen Sie OCR mit den richtigen Sprachparametern aus, überprüfen Sie den extrahierten Text stichprobenartig auf Zeichengenauigkeit, übersetzen Sie und überprüfen Sie einen Beispielabsatz. Nach zwei oder drei Dokumenten wird der Arbeitsablauf zur Routine und dauert vom Öffnen der Datei bis zum Lesen des übersetzten Ergebnisses weniger als fünf Minuten.

Wenn es um die Dokumentenverarbeitung geht, vermeidet Offline-OCR bei sicherheitsrelevanten Dokumenten die Cloud-Exposition vollständig. Tesseract wird lokal ohne Netzwerkanfragen ausgeführt, nachdem Sie die Sprachdatendateien einmal heruntergeladen haben. Adobe Acrobat Pro führt OCR auch lokal über die Funktion „Text erkennen“ durch, ohne sich bei Document Cloud anzumelden. Bei vertraulichen fremdsprachigen Materialien wie juristischen Ermittlungen oder sensibler Geschäftskorrespondenz sorgt die lokale OCR gepaart mit der Offline-Textüberprüfung dafür, dass der Originalinhalt des Dokuments in Ihrer kontrollierten Umgebung bleibt.

Wenn OCR allein nicht ausreicht: Unterstützte Transkriptionsdienste

Für Dokumente, bei denen die OCR-Genauigkeit aufgrund extremer Schriftverschlechterung, handgeschriebenem Text oder stark gemischter Skripte unbrauchbar niedrig ist, bieten unterstützte Transkriptionsdienste eine von Menschen überprüfte Ausgabe. Diese Dienste kombinieren einen anfänglichen maschinellen OCR-Durchgang mit menschlicher Überprüfung und Korrektur, wobei in der Regel eine Gebühr pro Seite erhoben wird. Die Bearbeitungszeit beträgt einige Stunden bis einige Tage. Bei einem einzelnen kritischen Dokument, bei dem die Genauigkeit nicht verhandelbar ist, wie etwa einer fremdsprachigen Geburtsurkunde oder einer Patentanmeldung, werden die Kosten einer menschlichen Transkription durch das Risiko gerechtfertigt, auf falsch erkannten Text zu reagieren. Führen Sie zunächst eine Maschinen-OCR aus, um die Qualität zu beurteilen. Wenn mehr als 15 Prozent der Wörter unerkannt oder offensichtlich falsch sind, eskalieren Sie auf die unterstützte Transkription, anstatt Stunden damit zu verbringen, die maschinelle Ausgabe manuell zu korrigieren.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →