Tips & Tricks

So erstellen Sie eine OCR-Erkennung in einer PDF-Datei mit gemischten Quer- und Hochformatseiten

Ein gescanntes PDF, das aus gemischten Quellen zusammengestellt wurde, enthält häufig Seiten sowohl im Hoch- als auch im Querformat. Finanztabellen werden als Seiten im Querformat angezeigt. Begleitende Textdokumente erscheinen als Hochformatseiten. Das Ausführen von OCR für ein solches Dokument ohne Berücksichtigung gemischter Ausrichtungen führt zu erkanntem Text, bei dem Wörter auf Seiten im Querformat durcheinander geraten, gedreht oder ganz übersehen werden, weil die OCR-Engine diese Seiten in der falschen Ausrichtung verarbeitet hat.

OCR PDF-Engines analysieren Textzeilen, um Zeichenpositionen und Lesereihenfolge zu bestimmen. Wenn eine Seite im Verhältnis zu den Erwartungen der Engine um 90 Grad gedreht wird, verlaufen die Textzeilen vertikal statt horizontal. Die Engine erkennt den Text entweder nicht vollständig oder versucht, ihn vertikal zu lesen, was zu einer unsinnigen Ausgabe führt. Dokumente mit gemischter Ausrichtung erfordern vor der OCR-Verarbeitung eine Erkennung der Ausrichtung pro Seite.

WukongPDFs Gescannte PDF OCR-Tools verarbeiten gemischte Seitenausrichtungen mit automatischer Rotationserkennung für jede Seite während des Erkennungsprozesses.

Warum die Seitenausrichtung für die OCR-Genauigkeit wichtig ist

OCR-Engines funktionieren, indem sie Zeichenreihen erkennen und die Formen innerhalb jeder Zeile analysieren. Auf einer Seite im Hochformat verlaufen die Textzeilen horizontal, was von der Engine auf natürliche Weise verarbeitet wird. Wenn eine Seite im Querformat ohne Rotationskorrektur angezeigt wird, verlaufen die Textzeilen aus Sicht der OCR-Engine vertikal. Die Engine erwartet horizontalen Text und kann keinen vertikalen Text lesen.

Die Lösung besteht darin, die Ausrichtung jeder Seite vor der OCR zu erkennen und Seiten im Querformat vor der Verarbeitung in Hochformat zu drehen. Nach der OCR können die Seiten wieder in ihre ursprüngliche Ausrichtung gedreht werden, wobei die erkannte Textebene korrekt positioniert ist. Durch die Drehung während der Bearbeitung wird das Dokument nicht dauerhaft verändert; Es ändert nur, wie die OCR-Engine die Seite sieht.

Die meisten automatisierten OCR-Tools gehen davon aus, dass alle Seiten dieselbe Ausrichtung haben, da dies bei Dokumenten, die von einem einzelnen Scanner in einer einzigen Sitzung erstellt wurden, häufig der Fall ist. Dokumente mit gemischter Ausrichtung, die häufig durch die Kombination von Scans aus verschiedenen Quellen erstellt werden, erfordern eine explizite Konfiguration, um die seitenspezifischen Abweichungen korrekt zu verarbeiten.

Methode 1: Acrobat Pro mit Erkennung der Rotation pro Seite

Die OCR-Funktion von Acrobat Pro kann bei entsprechender Konfiguration Dokumente mit unterschiedlicher Ausrichtung verarbeiten. Öffnen Sie das gescannte PDF in Acrobat Pro und gehen Sie zu „Extras“, „Scannen und OCR“, „Text erkennen“ und „In dieser Datei“. Stellen Sie im Dialogfeld „Texterkennung“ sicher, dass die richtige OCR-Sprache für die Primärsprache des Dokuments ausgewählt ist. Aktivieren Sie im Abschnitt „Einstellungen“ die Option „Entzerren und begradigen“, die Acrobat dabei hilft, die Seitendrehung zu erkennen.

Acrobat verarbeitet jede Seite einzeln und versucht, die vorherrschende Textausrichtung zu erkennen. Bei Seiten, bei denen die Erkennung korrekt ist, ist die OCR-Ausgabe genau und lesbar. Bei Seiten, bei denen die Erkennung fehlschlägt, z. B. Seiten mit wenig Text oder komplexen visuellen Hintergründen, ist die OCR-Ausgabe möglicherweise verfälscht oder fehlt ganz. Überprüfen Sie nach der OCR-Verarbeitung insbesondere die Seiten im Querformat. Suchen Sie nach Text, den Sie auf diesen Seiten visuell sehen können. Wenn die Suche nichts findet, hat Acrobat wahrscheinlich die Ausrichtung falsch identifiziert.

Falsch identifizierte Seiten drehen Sie manuell im Tool „Seiten organisieren“ und führen Sie die OCR nur auf diesen Seiten erneut aus. Der manuelle Eingriff dauert nur einen Moment pro betroffener Seite und stellt sicher, dass jede Seite korrekten erkannten Text zur durchsuchbaren Dokumentausgabe beiträgt.

Methode 2: Vorverarbeitung mit OCRmyPDF

OCRmyPDF, ein Open-Source-Befehlszeilentool, das auf Tesseract OCR basiert, verarbeitet Seiten mit gemischter Ausrichtung über seine integrierte Entzerrungsfunktion. Der Befehl ocrmypdf --deskew input.pdf output.pdf erkennt die Textausrichtung auf jeder Seite, dreht die Seiten nach Bedarf, führt OCR mit Tesseract aus und gibt ein durchsuchbares PDF aus. Das Deskew-Flag ist der wesentliche Parameter für die Dokumentenverarbeitung mit gemischter Ausrichtung.

OCRmyPDF verarbeitet Seiten nacheinander und wendet automatisch eine Ausrichtungskorrektur pro Seite an. Bei Dokumenten mit extremer Drehung oder Seiten, die sowohl horizontalen als auch vertikalen Text enthalten, richtet der Entzerrungsalgorithmus die Seite basierend auf der vorherrschenden Textrichtung aus, was die besten OCR-Ergebnisse für den Großteil des Seiteninhalts liefert. Die Textrichtung der Minderheit weist möglicherweise eine leicht verringerte Genauigkeit auf, wird aber im Allgemeinen immer noch erkannt.

In Dokumenten-Workflows für die Massenverarbeitung von Dokumenten mit unterschiedlicher Ausrichtung bietet OCRmyPDF in Kombination mit einem Shell-Skript, das alle PDF-Dateien in einem Ordner verarbeitet, eine vollautomatische OCR ohne manuelle Konfiguration pro Dokument. Die Automatisierung übernimmt die routinemäßige Verarbeitung und nur Ausnahmefälle erfordern eine menschliche Überprüfung.

Konkrete Überprüfung der OCR-Ausgabe auf Seiten im Querformat

Überprüfen Sie nach der OCR-Verarbeitung die Ausgabe auf Seiten im Querformat als separate, fokussierte Prüfung. Wählen Sie Text auf einer Querformatseite im Ausgabe-PDF aus und kopieren Sie ihn in einen Nur-Text-Editor. Der kopierte Text sollte in der richtigen Reihenfolge gelesen werden und von oben nach unten und von links nach rechts zum visuellen Seiteninhalt passen. Wenn Wörter durcheinander sind, nicht in der richtigen Reihenfolge sind oder in unsinnigen Reihenfolgen erscheinen, ist die Ausrichtungserkennung für diese Seite fehlgeschlagen.

Suchen Sie nach bestimmten bekannten Begriffen, die auf Seiten im Querformat erscheinen. Eine Finanztabelle auf einer Querformatseite kann bestimmte Kontocodes, Abteilungsnamen oder numerische Werte enthalten, nach denen Sie in der OCR-Ausgabe suchen können. Wenn die Suche keine Übereinstimmungen auf Seiten im Querformat, aber Übereinstimmungen auf Seiten im Hochformat desselben Dokuments findet, hat die OCR-Engine wahrscheinlich den Inhalt im Querformat vollständig übersehen. Diese Seiten müssen unter Angabe der manuellen Ausrichtung erneut verarbeitet werden.

In Dokumenten-Workflows für Dokumente, die als durchsuchbare Archive dienen, ist der Verifizierungsschritt ein Qualitätstor, das orientierungsbezogene OCR-Probleme erkennt, bevor das Dokument in die permanente Sammlung gelangt. Eine nicht verifizierte OCR-Ausgabe, bei der stillschweigend ganze Seiten mit Inhalten übersehen werden, untergräbt den Zweck der Erstellung eines durchsuchbaren Archivs.

Stapelverarbeitung gescannter Sammlungen mit gemischter Ausrichtung

Bei großen Sammlungen gescannter Dokumente mit unterschiedlichen Ausrichtungen ist eine manuelle Überprüfung pro Seite unpraktisch. Automatisieren Sie den Prozess mit OCRmyPDF und dem Deskew-Flag und führen Sie dann ein Überprüfungsskript aus, das jede Ausgabeseite auf das Vorhandensein von durchsuchbarem Text überprüft. Seiten ohne erkannte Textzeichen oder mit sehr wenigen Zeichen werden zur manuellen Überprüfung und möglichen erneuten Verarbeitung markiert.

Das Verifizierungsskript liest jedes OCR-verarbeitete PDF, extrahiert die Textebene Seite für Seite und zählt die Anzahl der erkannten Zeichen auf jeder Seite. Jede Seite unter einem Mindestzeichenschwellenwert, z. B. zehn Zeichen, wird als potenziell unbearbeitet oder fehlorientiert gekennzeichnet. Die gekennzeichneten Seiten werden in einem Bericht zusammengestellt, der den manuellen Überprüfungsaufwand nur auf die Seiten lenkt, die tatsächlich menschliche Aufmerksamkeit erfordern, anstatt jede Seite überprüfen zu müssen.

Was die Arbeitsabläufe betrifft, so wird bei laufenden Digitalisierungsprojekten, bei denen regelmäßig neue gescannte Dokumente eingehen, der Stapelverarbeitungs- und Verifizierungsworkflow zu einem Standardverfahren. Neue Dokumente gelangen in die Pipeline, werden automatisch durch OCR mit Ausrichtungserkennung verarbeitet und nur in Ausnahmefällen ist ein menschliches Eingreifen erforderlich. Die Automatisierung übernimmt die Routine. Der menschliche Prüfer kümmert sich um die Ausnahmen.

Verbesserung der OCR auf Seiten mit interner Rotation

Einige gescannte Dokumente enthalten Seiten, auf denen der Inhalt innerhalb der Seite gedreht ist und nicht die Seite selbst. Eine Finanztabelle im Querformat kann in ein Dokument im Hochformat eingefügt werden, indem der Tabelleninhalt um 90 Grad gedreht wird und gleichzeitig die Seitenabmessungen im Hochformat beibehalten werden. Diese Seiten stellen für die Ausrichtungserkennung die größte Herausforderung dar, da die Seitenabmessungen keinen Hinweis darauf geben, dass eine Drehung erforderlich ist.

Bei der Dokumentenverarbeitung ist für Seiten mit interner Rotation die manuelle Vorverarbeitung der zuverlässigste Ansatz. Verwenden Sie in Acrobat Pro das Werkzeug „PDF bearbeiten“, um den gedrehten Inhaltsbereich auszuwählen, ihn in die richtige horizontale Ausrichtung zu drehen und ihn richtig auf der Seite zu positionieren. Nachdem Sie die interne Drehung korrigiert haben, führen Sie OCR auf der korrigierten Seite aus. Der manuelle Vorverarbeitungsschritt dauert etwa eine Minute pro betroffener Seite, liefert aber eine saubere und genaue OCR-Ausgabe.

Die Identifizierung von Seiten mit Innenrotation erfordert eine Sichtprüfung. Scannen Sie das Dokument und suchen Sie nach Seiten, auf denen der Text scheinbar in eine unerwartete Richtung relativ zu den Seitenrändern verläuft. Seiten mit interner Rotation sind in den meisten Dokumentensammlungen relativ selten, wirken sich jedoch unverhältnismäßig stark auf die OCR-Qualität aus, wenn sie auftreten.

Auswahl der richtigen OCR-Engine für Dokumente mit gemischter Ausrichtung

Verschiedene OCR-Engines handhaben die Ausrichtungserkennung mit unterschiedlicher Genauigkeit. Tesseract mit dem Deskew-Präprozessor bewältigt moderate Drehungen gut, kann jedoch Probleme mit Seiten haben, die genau um 90 oder 180 Grad gedreht sind. Google Cloud Vision OCR verfügt über eine integrierte Ausrichtungserkennung, die alle Drehwinkel zuverlässig verarbeitet. Bei kritischen Dokumenten mit gemischter Ausrichtung, bei denen es auf Genauigkeit ankommt, übertreffen cloudbasierte OCR-Dienste im Allgemeinen lokale Engines bei der Ausrichtungsverarbeitung.

Testen Sie die gewählte OCR-Engine anhand einer kleinen Stichprobe von Seiten mit unterschiedlicher Ausrichtung, bevor Sie sich für einen großen Stapel entscheiden. Ein zehnseitiger Test mit bekannten Ausrichtungsmustern zeigt, wie die Engine mit den spezifischen Rotationstypen in Ihren Dokumenten umgeht. Der Test dauert nur wenige Minuten und verhindert stundenlange Nachbearbeitung, wenn sich die Erkennung der Motorausrichtung für Ihre speziellen Dokumenttypen als unzureichend erweist.

Exportieren von OCR-Text aus Dokumenten mit gemischter Ausrichtung zur Überprüfung

Exportieren Sie nach der OCR-Verarbeitung den erkannten Text, um die Vollständigkeit auf allen Seiten zu überprüfen. Gehen Sie in Acrobat Pro zu „Extras“, „PDF exportieren“ und wählen Sie „Text“ als Ausgabeformat. Die exportierte Textdatei sollte den Inhalt jeder Seite in der richtigen Lesereihenfolge enthalten. Öffnen Sie die Textdatei und suchen Sie nach Begriffen, von denen Sie wissen, dass sie auf bestimmten Seiten im Querformat vorkommen. Wenn diese Begriffe im Export fehlen, wurden diese Seiten wahrscheinlich bei der OCR falsch ausgerichtet und müssen erneut verarbeitet werden.

Was die Dokumentenverwaltung betrifft, so dient der exportierte Text bei Dokumenten, die für durchsuchbare Archive bestimmt sind, als unabhängige Überprüfung, dass jede Seite ihren Inhalt zur durchsuchbaren Ebene beigetragen hat. Ein Textexport mit Lücken oder fehlenden Abschnitten weist auf OCR-Fehler hin, die behoben werden müssen, bevor das Dokument in das permanente Archiv gelangt. Der Exportschritt fungiert als Qualitätstor, das orientierungsbezogene OCR-Probleme erkennt, bevor sie zu dauerhaften Archivmängeln werden.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →