OCR PDF-Engines basieren auf dem Textfluss von links nach rechts. Wenn Sie ihnen ein Dokument zuführen, das in einer von rechts nach links geschriebenen Schrift wie Arabisch, Hebräisch, Persisch oder Urdu verfasst ist, muss die Engine die Schriftrichtung erkennen, Zeichen in der richtigen visuellen und logischen Reihenfolge erkennen und Text ausgeben, der sich in der Zielsprache natürlich liest. Wenn einer dieser Schritte falsch ausgeführt wird, entsteht Text, der technisch erkannt, aber funktional unbrauchbar ist: rückwärts geschriebene Wörter, Sätze, die am Ende beginnen, und Zahlen, die auf der falschen Seite des umgebenden Textes erscheinen.
Eine korrekte OCR für Sprachen mit Schreibrichtung von rechts nach links erfordert die Auswahl einer OCR-Engine, die das Zielskript explizit unterstützt, die Konfiguration mit den richtigen Sprachparametern und die Überprüfung der Ausgabe durch bidirektionale textsensitive Tools. Der Prozess ist für von links nach rechts geschriebene Sprachen nicht wesentlich schwieriger als OCR, aber der Konfigurationsschritt, den viele Benutzer überspringen und der Engine mitteilen, welche Sprache zu erwarten ist, ist für von rechts nach links geschriebene Skripte nicht optional. Eine Engine, die auf ihren Standardeinstellungen, normalerweise Englisch, belassen wird, erzeugt aus einem arabischen oder hebräischen Dokument eine unsinnige Ausgabe.
WukongPDFs Gescannte PDF OCR-Tools unterstützen mehrere Sprachen, einschließlich Rechts-nach-Links-Skripten. Die Auswahl der richtigen Sprache vor dem Ausführen von OCR ist der Unterschied zwischen dem Extrahieren von verwendbarem Text und dem Erzeugen von Zeichenrauschen.

Warum die OCR von rechts nach links ohne explizite Konfiguration fehlschlägt
OCR-Engines analysieren Formen und ordnen sie Zeichen im Zeichensatz der angegebenen Sprache zu. Wenn die Engine Englisch erwartet, interpretiert sie Formen als lateinische Buchstaben. Der arabische Buchstabe für B sieht in vielen Schriftarten dem lateinischen Buchstaben B etwas ähnlich, aber der arabische Buchstabe für Ayn hat kein lateinisches Äquivalent. Eine Engine im englischen Modus, die auf Ayn trifft, gibt ein zufälliges Satzzeichen aus oder überspringt das Zeichen vollständig. Im gesamten Dokument führt diese zeichenweise Fehlerkennung zu einer Ausgabe ohne Bezug zum Originaltext.
Selbst wenn das richtige Skript ausgewählt wird, führt die Textrichtung zu einer zweiten Ebene der Komplexität. OCR-Engines verarbeiten Bilder standardmäßig von links nach rechts und bewegen sich dabei über jede Pixelreihe vom linken zum rechten Rand. Ein von rechts nach links geschriebenes Dokument sollte von rechts nach links verarbeitet werden, damit die Engine die Zeichen in der Reihenfolge liest, in der sie geschrieben wurden. Wenn die Engine ihre Verarbeitungsrichtung für Rechts-nach-Links-Skripte nicht umkehrt, sind die erkannten Zeichen innerhalb jedes Wortes in umgekehrter Reihenfolge. Einige Engines führen die Richtungsumkehr automatisch durch, wenn der Sprachparameter festgelegt ist. Andere erfordern eine explizite Markierung der Textrichtung.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Konfigurieren von Tesseract für OCR von rechts nach links
Tesseract, die Open-Source-OCR-Engine, unterstützt Arabisch, Hebräisch, Persisch, Urdu und mehrere andere Rechts-nach-Links-Skripte über sprachspezifische Datendateien. Installieren Sie die Sprachdaten für das Zielskript. Unter Linux heißt das Paket normalerweise tesseract-ocr-ara für Arabisch oder tesseract-ocr-heb für Hebräisch. Laden Sie unter Windows die trainierte Datendatei aus dem Tesseract GitHub-Repository herunter und legen Sie sie im Tessdata-Verzeichnis ab.
Führen Sie Tesseract aus, wobei das Sprachflag auf das richtige Skript eingestellt ist: tesseract input.pdf output -l ara für Arabisch, -l heb für Hebräisch oder -l ara+eng für ein zweisprachiges Arabisch-Englisch-Dokument. Tesseract verarbeitet die Textrichtung automatisch, wenn der Sprachparameter ein Rechts-nach-links-Skript angibt. Die erkannte Textausgabe behält die korrekte Lesereihenfolge bei. Öffnen Sie zur Überprüfung die Ausgabetextdatei und vergewissern Sie sich, dass die Wörter in der erwarteten Richtung gelesen werden und dass die Sätze von rechts nach links fließen.
Geben Sie für Dokumente mit gemischten Skripten, beispielsweise eine arabische Forschungsarbeit, die englische Fachbegriffe enthält, beide Sprachen durch ein Pluszeichen getrennt an: -l ara+eng. Tesseract wechselt wortweise zwischen den Sprachmodellen und wendet das arabische Modell auf Wörter mit arabischer Schrift und das englische Modell auf Wörter mit lateinischer Schrift an. Das Umschalten pro Wort ist nicht perfekt, insbesondere bei kurzen Wörtern, die zu einem der beiden Skripte gehören könnten, aber es verarbeitet die meisten Dokumente mit gemischten Skripten angemessen.
Google Cloud Vision zur automatischen Erkennung verwenden
Zu den OCR-Funktionen von Google Cloud Vision gehört die automatische Spracherkennung. Dies ist besonders nützlich für Skripte mit der Schreibrichtung von rechts nach links, wenn Sie sich über die genaue Sprache nicht sicher sind oder wenn das Dokument mehrere Sprachen mit der Schreibrichtung von rechts nach links enthält. Die API akzeptiert ein Dokumentbild und gibt erkannten Text mit Begrenzungsrahmen für jedes Wort, der erkannten Sprache für jeden Textblock und der Textrichtung zurück. Bei Rechts-nach-Links-Skripten liegt der zurückgegebene Text bereits in der richtigen Lesereihenfolge vor.
Die Erkennungsqualität für Arabisch und Hebräisch von Cloud Vision ist im Allgemeinen höher als die von Tesseract, da die zugrunde liegenden Modelle auf größeren und vielfältigeren Datensätzen trainiert wurden. Der Nachteil besteht darin, dass das Dokumentbild zur Verarbeitung auf die Server von Google hochgeladen werden muss, was für sensible oder vertrauliche Dokumente möglicherweise nicht akzeptabel ist. Für öffentlich zugängliche Dokumente oder interne Dokumente, bei denen die Cloud-Verarbeitung genehmigt ist, bietet Cloud Vision die genaueste verfügbare OCR von rechts nach links, ohne dass eine spezielle Desktop-OCR-Software gekauft werden muss.
| Sprache | OCR-Engine-Unterstützung | Genauigkeitshinweise |
|---|---|---|
| Arabisch | Tesseract, Google Cloud Vision, ABBYY | Diakritische Zeichen können weggelassen werden, die Handhabung von Ligaturen variiert |
| hebräisch | Tesseract, Google Cloud Vision, ABBYY | Nikud-Vokalpunkte gehen bei der OCR oft verloren |
| Persisch/Urdu | Tesseract, Google Cloud Vision | Nastaliq-Skriptvarianten stellen für die meisten Engines eine Herausforderung dar |
Überprüfen der OCR-Ausgabe für Text von rechts nach links
Öffnen Sie nach der OCR den erkannten Text in einem Texteditor, der die bidirektionale Textwiedergabe unterstützt, z. B. Notepad++ mit aktiviertem bidirektionalen Plugin oder Visual Studio Code mit installiertem RTL-Sprachpaket. Standard-Texteditoren, die von links nach rechts verlaufenden Text ausgehen, zeigen möglicherweise von rechts nach links verlaufenden Text korrekt an, wenn der bidirektionale Unicode-Algorithmus implementiert ist. Satzzeichen an Zeilenenden und die relative Reihenfolge von Zahlen im Text sind jedoch häufige Fehlerquellen. Ein Texteditor mit expliziter bidirektionaler Unterstützung zeigt den Text so an, wie es ein Muttersprachler erwarten würde, ihn zu lesen.
Vergleichen Sie die Ausgabe stichprobenartig mit dem gescannten Originaldokument auf drei Ebenen: einzelne Wörter, insbesondere solche, die diakritische Zeichen oder Ligaturen enthalten; vollständige Sätze, die bestätigen, dass sich die Wortreihenfolge in der Zielsprache natürlich liest; sowie Zahlen und Daten, um zu bestätigen, dass sie auf der richtigen Seite des umgebenden Textes erscheinen. Ein Dokument, in dem jedes Wort korrekt erkannt wird, die Wortreihenfolge jedoch innerhalb jedes Satzes umgekehrt ist, ist für die Übersetzung oder Suche ebenso unbrauchbar wie ein Dokument, in dem überhaupt keine Wörter erkannt werden.
OCR für Rechts-nach-Links-Sprachen ist ein gelöstes technisches Problem, wenn der richtige Sprachparameter eingestellt ist. Der wichtigste Schritt besteht darin, der Engine mitzuteilen, welches Skript sie erwarten soll. Alles, was dieser Entscheidung nachgelagert ist, von der Erkennungsgenauigkeit über die Lesereihenfolge bis hin zur Handhabung gemischter Schriften, hängt von der richtigen Sprachkonfiguration ab. Wenn der Sprachparameter konfiguriert ist und ein bidirektionaler Texteditor zur Überprüfung geöffnet ist, erfordert die OCR für ein Dokument mit der Schreibrichtung von rechts nach links nicht mehr Zeit und Mühe als die OCR für jede andere Sprache.
Post-OCR-Übersetzung von Rechts-nach-Links-Sprachtext
Sobald der Text genau erkannt wurde, ist für die Übersetzung von Rechts-nach-Links-Sprachinhalten eine Übersetzungsmaschine erforderlich, die bidirektionalen Text korrekt verarbeitet. Google Translate und DeepL unterstützen beide Arabisch, Hebräisch und Persisch. Fügen Sie den erkannten Text in die Übersetzungsoberfläche ein und bestätigen Sie, dass die Ausgangssprache korrekt identifiziert wird. Die Übersetzungs-Engine erkennt die Skriptrichtung und behält sie in der Ausgabe bei. Bei Dokumenten, deren Übersetzung von einem Muttersprachler überprüft wird, exportieren Sie für einen effizienten Vergleich sowohl den ursprünglich erkannten Text als auch den übersetzten Text nebeneinander in einer zweispaltigen Tabelle.
Die maschinelle Übersetzung von Rechts-nach-links-Sprachen ist im Allgemeinen weniger genau als die Übersetzung zwischen europäischen Links-nach-rechts-Sprachen, da die Trainingsdaten für viele Rechts-nach-links-Sprachpaare kleiner sind. Lassen Sie bei kritischen Dokumenten die Übersetzung von einem Muttersprachler überprüfen, bevor Sie inhaltliche Maßnahmen ergreifen. Der OCR-Schritt erzeugt einen genauen Quelltext. Der Übersetzungsschritt fügt eine Interpretationsebene hinzu. Behandeln Sie die OCR-Ausgabe als grundlegende Wahrheit darüber, was das Dokument sagt, und die maschinelle Übersetzung als Leitfaden für dessen Bedeutung, vorbehaltlich der Überprüfung.
Stapelverarbeitung von Rechts-nach-Links-Sprach-PDFs
Wenn Sie einen Ordner mit von rechts nach links geschriebenen PDFs für OCR haben, akzeptiert die Befehlszeilenschnittstelle von Tesseract die Stapeleingabe. Ein einziger Shell-Befehl verarbeitet jedes PDF: for f in *.pdf; tesseract $f ${f%.pdf} -l ara; Erledigt. Der Befehl durchläuft alle PDFs, führt OCR mit dem arabischen Modell aus und speichert erkannten Text neben jedem PDF mit passenden Basisdateinamen.
Verwenden Sie für gemischtsprachige Stapel einen Spracherkennungsschritt vor der OCR. Ein Python-Skript mit der langdetect-Bibliothek tastet die erste Textseite ab, um die Sprache vorherzusagen. Basierend auf der Vorhersage wählt das Skript den entsprechenden Tesseract-Sprachparameter aus und führt OCR aus. Durch die automatische Spracherkennung entfällt das manuelle Sortieren von PDFs nach Sprache vor der Stapelverarbeitung. Batch-OCR für Rechts-nach-Links-Sprachen verwandelt einen mühsamen Prozess pro Dokument in einen einzigen Befehl, der in wenigen Minuten abgeschlossen ist, unabhängig davon, wie viele Dokumente sich im Eingabeordner befinden.
OCR für Rechts-nach-Links-Sprachen ist kein Sonderfall, der exotische Tools erfordert. Es erfordert die gleichen Tools wie die Links-nach-rechts-OCR, konfiguriert mit den richtigen Sprachparametern. Der Konfigurationsschritt, den viele Benutzer überspringen, weil sie davon ausgehen, dass die OCR-Standardeinstellungen funktionieren, ist der gesamte Unterschied zwischen verwendbarem extrahiertem Text und vollständigem Zeichenrauschen. Setzen Sie die Sprachflagge, führen Sie die OCR aus, überprüfen Sie die Ausgabe in einem bidirektionalen Texteditor, und schon ist der Vorgang abgeschlossen. OCR für Rechts-nach-Links-Skripte belohnt den Benutzer, der sich die Zeit nimmt, die Sprachparameter richtig zu konfigurieren und die Ausgabe in einem bidirektionalen Texteditor zu überprüfen, wodurch präziser, brauchbarer Text aus Dokumenten erstellt wird, auf die sonst niemand zugreifen kann, der die Ausgangssprache nicht liest.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
