Beim Ausführen von OCR PDF auf ein gescanntes Dokument wird der Text extrahiert, bei der Ausgabe wird jedoch häufig die visuelle Struktur entfernt, die das Original lesbar gemacht hat. Überschriften werden zu einfachen Absätzen, Spalten werden zu einem einzigen Textstrom zusammengefasst und Tabellen lösen sich in durcheinandergebrachten Fragmenten auf. Wenn das ursprüngliche Seitenlayout nach der OCR erhalten bleibt, bleibt der erkannte Text dort, wo er hingehört, und die Lesereihenfolge, die Spaltenstruktur und die räumlichen Beziehungen, die dem Dokument seine Bedeutung verleihen, bleiben erhalten. Dies erfordert die Auswahl der richtigen OCR-Einstellungen und des richtigen Ausgabeformats vor der Verarbeitung, nicht danach.

So funktioniert die OCR-Layouterhaltung
OCR-Engines verarbeiten eine gescannte Seite in zwei verschiedenen Phasen. In der ersten Phase wird das Seitenbild analysiert, um Zonen und Inhaltsblöcke wie Textspalten, Bilder, Tabellen und Überschriften zu identifizieren. Die zweite Stufe führt die Zeichenerkennung innerhalb jeder Zone durch. Der Layout-erhaltende OCR-Ansatz behält die räumlichen Koordinaten jedes erkannten Wortes bei und zeichnet nicht nur auf, was der Text sagt, sondern auch, wo auf der Seite er erscheint. Diese Koordinaten definieren die Lesereihenfolge und die visuelle Hierarchie des Dokuments.
Wenn die Layouterhaltung aktiviert ist, bettet die OCR-Ausgabe unsichtbare Textebenen direkt über dem ursprünglich gescannten Bild in die PDF-Datei ein. Jedes erkannte Wort befindet sich im Scan genau an der Pixelposition seines Quellzeichens. Das bedeutet, dass das Dokument beim Betrachten genauso aussieht wie das Original, der Text darunter jedoch auswählbar, durchsuchbar und für Bildschirmleseprogramme zugänglich ist. Das Gescannte PDF wird zu einem Hybriddokument mit der visuellen Wiedergabetreue des Originalscans und der Textfunktionalität einer digital erstellten Datei.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Auswahl des richtigen OCR-Ausgabemodus
Die meisten OCR-Tools bieten mindestens drei Ausgabemodi, und die Wahl zwischen ihnen bestimmt, ob das Layout erhalten bleibt. Der Modus „Durchsuchbares Bild“ behält die ursprünglich gescannte Seite als sichtbare Ebene bei und fügt darunter eine unsichtbare Textebene hinzu. Dadurch bleibt das Layout perfekt erhalten, da sich die visuelle Seite nicht ändert. Der Modus „Text und Bilder“ erstellt eine neue Seite mit erkanntem Text und extrahierten Bildern, die neu positioniert werden, um dem ursprünglichen Layout anzunähern. Dieser Modus behält das Layout teilweise bei und eignet sich gut für einfache einspaltige Dokumente, bei komplexen mehrspaltigen Seiten kann es jedoch zu leichten Verschiebungen kommen.
Der Nur-Text-Modus verwirft alle Bilder und Formatierungen und erzeugt einen reinen Textstrom ohne Layoutinformationen. Dieser Modus sollte vollständig vermieden werden, wenn es auf das Layout ankommt. Für Dokumente, bei denen sowohl PDF-Qualität als auch die Layouttreue wichtig sind, bietet der Modus „Durchsuchbares Bild“ die beste Balance. Die Dateigröße ist größer als bei einem Nur-Text-Export, da die ursprünglichen Bilddaten erhalten bleiben. Der Kompromiss lohnt sich jedoch für jedes Dokument, das in seiner ursprünglichen visuellen Form gelesen, geteilt oder archiviert wird.
Umgang mit mehrspaltigen und komplexen Layouts
Mehrspaltige Dokumente stellen die größte Herausforderung für die Beibehaltung des OCR-Layouts dar, da die Lesereihenfolge über die Seite hinweg im Zickzack verläuft. Bei einer zweispaltigen wissenschaftlichen Arbeit muss die OCR-Engine die linke Spalte ganz nach unten lesen, bevor sie wieder an den Anfang der rechten Spalte springt. Ohne ordnungsgemäße Zonenerkennung kann die OCR-Ausgabe Zeilen aus beiden Spalten verschachteln und so unsinnigen Text erzeugen, bei dem jede zweite Zeile zu einer anderen Spalte gehört.
Moderne OCR-Engines verwenden Zonenerkennungsalgorithmen, die Spaltengrenzen identifizieren, indem sie die Lücken zwischen Textblöcken analysieren. Bevor Sie OCR für ein mehrspaltiges Dokument ausführen, prüfen Sie, ob das Tool eine Spaltenerkennung oder eine automatische Zoneneinstellung bietet. Wenn das Tool Spaltengrenzen falsch identifiziert, können Sie in den meisten Desktop-OCR-Anwendungen manuell Zonenrechtecke auf der Seite zeichnen, um die Erkennungsreihenfolge festzulegen. Das Zeichnen von Zonen nimmt im Vorfeld mehr Zeit in Anspruch, garantiert jedoch die korrekte Lesereihenfolge in der Ausgabe.
Bewahren von Tabellen und numerischen Daten
Tabellen kombinieren Layout und Daten auf eine Art und Weise, die mit der generischen OCR nur schwer zu interpretieren ist. Die Rasterstruktur, die eine Tabelle für das menschliche Auge lesbar macht und abwechselnde Zeilen mit einheitlicher Spaltenbreite und Ausrichtung aufweist, erfordert, dass die OCR-Engine sowohl die Zellgrenzen als auch die Beziehung zwischen Zellen in derselben Zeile oder Spalte erkennt. Wenn die Layouterhaltung korrekt funktioniert, erzeugt eine Tabelle im Originaldokument eine Tabelle in der OCR-Ausgabe mit jedem Wert in seiner richtigen Zelle.
Die folgende Tabelle vergleicht, wie verschiedene OCR-Ausgabemodi mit der Tabellenerhaltung umgehen:
| OCR-Ausgabemodus | Tabellenstruktur | Zellenausrichtung |
|---|---|---|
| Durchsuchbares Bild | Originalbild erhalten | Exakt, in die Quelle integriert |
| Texte und Bilder | Als Texttabelle rekonstruiert | Ungefähr, kann abweichen |
| Nur Text | Völlig verloren | Keine Ausrichtung erhalten |
OCR-Einstellungen, die sich auf die Layoutqualität auswirken
Mehrere über den Ausgabemodus hinausgehende Einstellungen beeinflussen, wie gut das ursprüngliche Layout die Erkennung übersteht. Die DPI-Einstellung für das Eingabebild ist am kritischsten. Scans mit 300 DPI bieten genügend Pixeldichte, damit die OCR-Engine Zeichenformen unterscheiden und Layoutzonen genau erkennen kann. Scans mit 150 DPI oder weniger erzeugen verschwommene Zeichenkanten, die sowohl die Erkennungs-Engine als auch den Zonenerkennungsalgorithmus verwirren. Das Scannen mit 600 DPI verbessert die Genauigkeit geringfügig, erhöht jedoch die Verarbeitungszeit und die Dateigröße, ohne dass dies bei den meisten Dokumenten einen proportionalen Vorteil mit sich bringt.
Die Schräglagenkorrektur richtet Seiten aus, die in einem leichten Winkel gescannt wurden. Selbst eine Neigung von zwei Grad kann dazu führen, dass die Zonenerkennung eine Spaltengrenze fälschlicherweise als diagonale Trennlinie interpretiert. Die Aktivierung der automatischen Geradeausrichtung vor der OCR verbessert in fast allen Fällen die Erhaltung des Layouts. In ähnlicher Weise entfernen Fleckenentfernungsfilter Streupunkte und Scannerrauschen, die der Zonendetektor möglicherweise als winzige Textblöcke interpretiert, die die erkannten Zonen fragmentieren und die Lesereihenfolge stören können. Tools wie WukongPDF wenden diese Vorverarbeitungskorrekturen automatisch an und erzeugen so sauberere Zonenkarten und eine genauere Layouterhaltung über verschiedene Dokumenttypen hinweg.
Überprüfung der Layoutgenauigkeit nach OCR
Nachdem Sie OCR mit aktivierter Layouterhaltung ausgeführt haben, überprüfen Sie das Ergebnis, bevor Sie das Dokument archivieren oder verteilen. Öffnen Sie die Ausgabe-PDF und aktivieren Sie das Textauswahltool. Ziehen Sie den Cursor über einen Absatz in jeder Spalte und vergewissern Sie sich, dass die Auswahl der richtigen Lesereihenfolge folgt, ohne zu benachbarten Spalten zu springen. Suchen Sie nach einem Wort, das in einer Tabelle vorkommt, und stellen Sie sicher, dass das Suchergebnis die richtige Zellenposition hervorhebt. Kopieren Sie einen Absatz aus einer mittleren Spalte und fügen Sie ihn in einen Texteditor ein, um zu überprüfen, ob die Zeilen in der richtigen Reihenfolge angezeigt werden.
Bei kritischen Dokumenten, bei denen Layoutfehler zu Verwirrung führen würden, ist ein seitenweiser Vergleich zwischen dem Originalscan und der OCR-Ausgabe die zuverlässigste Überprüfungsmethode. Öffnen Sie beide Dateien nebeneinander und überprüfen Sie stichprobenartig den ersten Satz jedes Absatzes, jede Tabellenüberschrift und jeden Text, der in Kopf- oder Fußzeilen erscheint. Das Erkennen eines Zonenerkennungsfehlers in dieser Phase dauert Sekunden pro Seite. Es ist weitaus kostspieliger, es Monate später zu entdecken, wenn jemand versucht, das Dokument zu durchsuchen und verstümmelte Ergebnisse erhält.
Auswahl der richtigen OCR-Engine für layoutintensive Dokumente
Verschiedene OCR-Engines handhaben die Layouterhaltung mit unterschiedlicher Komplexität. Tesseract, die von Google verwaltete Open-Source-Engine, schneidet bei einfachen einspaltigen Dokumenten gut ab, kann jedoch bei mehrspaltigen wissenschaftlichen Arbeiten oder Zeitschriftenlayouts ohne zusätzliche Vorverarbeitung Probleme haben. ABBYY FineReader, eine kommerzielle Engine, schneidet bei unabhängigen Benchmarks für die Beibehaltung des Layouts durchweg an der Spitze ab, da sie vor der Zeichenerkennung die gesamte Seitenstruktur analysiert und eine Zonenkarte erstellt, die die räumliche Beziehung zwischen Textblöcken beibehält.
Bei Dokumenten, bei denen die Beibehaltung des Layouts von entscheidender Bedeutung ist, sollten Sie sich die Zeit nehmen, zwei verschiedene OCR-Engines auf einer repräsentativen Beispielseite zu testen, bevor Sie das gesamte Dokument verarbeiten. Erstellen Sie mit jeder Engine eine OCR-Erkennung für eine einzelne komplexe Seite und vergleichen Sie die Ergebnisse nebeneinander. Sehen Sie sich in beiden Ergebnissen die Lesereihenfolge, die Spaltentrennung und die Tabellenstruktur an. Die Engine, die die anspruchsvollste Seite in Ihrem Dokument verarbeitet, wird den Rest wahrscheinlich akzeptabel bewältigen. Diese Testinvestition von fünfzehn Minuten kann später stundenlange manuelle Layoutkorrekturen verhindern.
WukongPDF enthält OCR-Funktionalität, die das Seitenlayout und die Lesereihenfolge beibehält, was es zu einer praktischen Wahl für Benutzer macht, die präzise durchsuchbare PDFs benötigen, ohne eine Desktop-OCR-Software zu installieren. Die cloudbasierte Verarbeitung verarbeitet mehrseitige Dokumente effizient und liefert ein durchsuchbares PDF mit intaktem ursprünglichem visuellen Erscheinungsbild.
Ein oft übersehener Faktor bei der Layouterhaltung ist die Qualität und der Zustand des Originalscans. Eine verzerrte, zerknitterte oder kontrastarme Originalseite zwingt die OCR-Engine dazu, ihre analytischen Ressourcen für die Korrektur von Bildfehlern aufzuwenden, anstatt die Layoutstruktur abzubilden. Überprüfen Sie jede Seite visuell, bevor Sie OCR ausführen. Wenn der Scan einen schiefen Textblock, dunkle Schatten entlang des Buchrückens eines gebundenen Buches oder verblassten Text zeigt, der mit dem Hintergrund verschmilzt, verarbeiten Sie die Bilder vor.
Der Dateigrößenunterschied zwischen der OCR-Ausgabe mit beibehaltenem und dem Layout ohne Layout kann erheblich sein. Ein durchsuchbares Bild-PDF behält die ursprünglich gescannte Seite als vollaufgelöste Bildebene mit einer unsichtbaren Textüberlagerung bei, was zu Dateigrößen führt, die um ein Vielfaches größer sind als bei einer Nur-Text-Ausgabe. Für Archivierungszwecke, bei denen die Speicherung nicht eingeschränkt ist, ist die größere Datei ein lohnender Kompromiss im Hinblick auf die Layouttreue.
Bei Archivierungsprojekten mit historischen Dokumenten kommt der Erhaltung des Layouts eine besondere Bedeutung zu, da das physische Erscheinungsbild des Originaldokuments historischen und beweiskräftigen Wert hat. Eine OCR-Ausgabe, die jedes Wort korrekt erkennt, diese aber in einen einspaltigen Textblock umordnet, hat den visuellen Kontext des Originals zerstört. Bei diesen Projekten ist der Ansatz mit durchsuchbaren Bildern obligatorisch und jede reine Textausgabe sollte als Suchhilfe und nicht als Ersatz für das Originaldokument betrachtet werden.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
