Others

Was ist der Unterschied zwischen OCR-Text und eingebettetem Text in einem PDF?

Öffnen Sie ein gescanntes PDF und Sie können den Text auswählen, kopieren und durchsuchen, als wäre es ein natives digitales Dokument. Dieser Text stammt nicht aus dem Originalscan. Der Scanner erzeugte ein Bild der Seite, ein Pixelraster ohne jegliche Textdaten. Bei dem Text, den Sie auswählen und suchen, handelt es sich um OCR-Text, der von einer Software zur optischen Zeichenerkennung generiert wurde, die das Seitenbild analysiert und Pixelmuster in Zeichen umgewandelt hat. Aber nicht jeder auswählbare Text in einem PDF ist OCR-Text. Einige PDFs enthalten eingebetteten Text, der digital erstellt wurde und nie einen Scanner oder eine Erkennungsmaschine durchlaufen hat. Das Verständnis des Unterschieds zwischen OCR-Text und eingebettetem Text erklärt, warum manche PDFs perfekt durchsucht werden, während andere verstümmelte Ergebnisse liefern.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Was OCR-Text ist und wie er in ein PDF gelangt

OCR-Text wird maschinell generiert. Eine OCR PDF-Engine untersucht jede Zeichenform in einem gescannten Seitenbild, vergleicht sie mit einer Datenbank bekannter Zeichenmuster und gibt das am wahrscheinlichsten passende Zeichen zusammen mit seiner Position auf der Seite aus. Der erkannte Text wird dann als unsichtbare Ebene genau über den Originalbildzeichen in die PDF-Datei eingebettet. Wenn Sie Text aus einer gescannten PDF-Datei auswählen und kopieren, kopieren Sie von dieser unsichtbaren OCR-Ebene und nicht vom sichtbaren Bild. Wenn die OCR-Engine ein Zeichen falsch liest, enthält der kopierte Text diesen Fehler, obwohl das sichtbare Bild korrekt aussieht.

Die Qualität von OCR-Text hängt von mehreren Faktoren ab: der Auflösung und Klarheit des Originalscans, der im Originaldokument verwendeten Schriftart, der Sprache des Textes und der Ausgereiftheit der OCR-Engine. Ein sauberer 300-DPI-Scan eines lasergedruckten englischen Dokuments, das von einer modernen OCR-Engine verarbeitet wird, erzeugt nahezu perfekten Text. Ein 150-DPI-Scan eines punktmatrixgedruckten Dokuments in einer Sprache mit komplexen Zeichenformen, die von einer einfachen OCR-Engine verarbeitet wird, führt zu fehlerbehaftetem Text. Der OCR-Text ist nur so genau, wie es die Erkennungsmaschine und die Scanqualität zulassen.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Was eingebetteter Text ist und wie er in ein PDF gelangt

Eingebetteter Text ist verfasst und wird nicht erkannt. Wenn ein Textverarbeitungsprogramm, eine Desktop-Publishing-Anwendung oder eine PDF-Erstellungsbibliothek eine PDF-Datei generiert, schreibt sie den Text direkt in den PDF-Inhaltsstrom. Jedes Zeichen wird als spezifischer Code gespeichert, der einem Glyphen in einer Schriftart zugeordnet ist. Es gibt keinen Erkennungsschritt, da der Text nie ein Bild war. Die Anwendung, die das PDF erstellt hat, wusste genau, welche Zeichen geschrieben wurden, und zeichnete sie genau auf. Wenn Sie Text aus einer digital erstellten PDF-Datei auswählen und kopieren, kopieren Sie genau die Zeichen, die der Autor eingegeben hat.

Eingebetteter Text enthält Formatierungsinformationen, die OCR-Texten normalerweise fehlen. Schriftartnamen, Fett- und Kursivschrift sowie Zeichenabstände bleiben im eingebetteten Text erhalten, da sie vom Autor im Quelldokument angegeben wurden. OCR-Text rekonstruiert möglicherweise einen Teil dieser Formatierung, sie wird jedoch aus dem visuellen Erscheinungsbild der Zeichen abgeleitet und nicht als explizite Metadaten gespeichert. Ein PDF-Format-Vergleich zwischen einer gescannten und dann OCRED-Seite und einer nativen digitalen Seite zeigt diesen Unterschied. Die OCR-Version ermöglicht möglicherweise die Textauswahl, meldet jedoch jedes Zeichen als dieselbe Schriftart mit derselben Stärke. Die digitale Version behält die vom Autor beabsichtigten Schriftartenunterschiede bei.

So erkennen Sie, ob Text in einer PDF OCR-Text oder eingebettet ist

Der zuverlässigste Weg, um festzustellen, ob Text in einer PDF-Datei durch OCR generiert oder eingebettet wurde, ist die Überprüfung der Dokumenteigenschaften, insbesondere der Schriftartenliste. Öffnen Sie die PDF-Datei in einem Viewer, der Schriftartinformationen anzeigen kann. Adobe Acrobat zeigt die Schriftartenliste unter Datei, Dokumenteigenschaften, Schriftarten an. Wenn in der Schriftartenliste Schriftarten angezeigt werden, deren Namen OCR enthalten, oder wenn die Schriftarten als unbekannt oder als generischer Typ ohne bestimmten Namen aufgeführt sind, ist der Text wahrscheinlich OCR-generiert. Wenn in der Schriftartenliste bestimmte benannte Schriftarten wie Arial, Times New Roman oder Calibri mit Untertypen wie Bold oder Italic angezeigt werden, stammt der Text mit ziemlicher Sicherheit aus einer digitalen Quelle.

Ein weiterer praktischer Test ist die Suche nach einem häufigen OCR-Fehlermuster. Durchsuchen Sie das PDF nach häufigen OCR-Ersetzungsfehlern wie der Buchstabenkombination rn, die von OCR-Engines häufig fälschlicherweise als einzelner Buchstabe m interpretiert wird. Wenn bei der Suche Fälle gefunden werden, in denen aus Scheune Bam oder Mais zu Mais wird, wird der Text durch OCR generiert. Eingebetteter Text enthält diese Ersetzungsfehler nicht, da die Zeichen visuell nie mehrdeutig waren. Die PDF Searchable-Qualität eines Dokuments hängt davon ab, ob der zugrunde liegende Text, OCR oder eingebettet, den sichtbaren Inhalt genau wiedergibt.

Wenn OCR-Text und eingebetteter Text im selben PDF nebeneinander vorhanden sind

Ein einzelnes PDF kann sowohl OCR-Text als auch eingebetteten Text auf verschiedenen Seiten oder sogar auf derselben Seite enthalten. Ein Vertragspaket kann den digital verfassten Vertragstext enthalten, der eingebetteten Text enthält, und eine gescannte und OCR-verarbeitete Unterschriftenseite, die OCR-Text enthält. Ein Forschungsbericht könnte digital erstellte Textseiten mit gescannten und OCR-verarbeiteten Fotos historischer Zeitungsausschnitte kombinieren. Der Text auf Seite drei ist pixelgenau eingebetteter Text. Der Text auf Seite sieben ist OCR-Text, der Erkennungsfehler enthalten kann.

Dieses Szenario mit gemischten Inhalten stellt eine subtile Falle für jeden dar, der nach Text in der PDF-Datei sucht oder diesen extrahiert. Die Suchergebnisse der eingebetteten Textseiten sind korrekt. In den Suchergebnissen der OCR-Textseiten werden möglicherweise Vorkommen übersehen, bei denen die OCR-Engine ein Wort falsch gelesen hat, oder es können falsche Treffer zurückgegeben werden, wenn die OCR-Engine ein ähnliches Wort ersetzt hat. Wenn Sie mit PDFs mit gemischten Inhalten arbeiten, überprüfen Sie den aus den OCR-Seiten extrahierten Text, bevor Sie sich darauf verlassen. Der sicherste Ansatz besteht darin, das entsprechende Seitenbild visuell zu überprüfen, wenn extrahierter Text aus einer OCR-Seite für einen kritischen Zweck verwendet wird.

Nachträgliche Verbesserung der OCR-Textqualität

Wenn ein PDF OCR-Text von schlechter Qualität enthält, sind die Verbesserungsmöglichkeiten dadurch eingeschränkt, dass der ursprüngliche Scan- und OCR-Vorgang bereits abgeschlossen ist. Eine nachträgliche Verbesserung der Scanqualität ist nicht möglich. Was Sie tun können, ist, das PDF mit einer besseren Engine erneut zu OCRen. Extrahieren Sie die Seitenbilder mit der höchsten verfügbaren Auflösung aus dem PDF und lassen Sie sie durch eine moderne OCR-Engine laufen, die möglicherweise genauere Ergebnisse liefert als der ursprüngliche OCR-Durchlauf. Ersetzen Sie die alte OCR-Textebene durch die neue.

Bei einigen PDF-Editoren können Sie OCR-Fehler manuell direkt in der Textebene korrigieren. Öffnen Sie das PDF in einem Bearbeitungsmodus, der den unsichtbaren OCR-Text sichtbar macht. Klicken Sie auf ein falsch erkanntes Wort und geben Sie die Korrektur ein. Dieser manuelle Korrekturvorgang ist bei wenigen Fehlern auf wenigen Seiten praktisch. Bei einem 200-seitigen Dokument, bei dem jeder Absatz Erkennungsfehler enthält, ist dies nicht praktikabel. Bei umfangreichen OCR-Qualitätsproblemen ist die erneute OCR-Erstellung des gesamten Dokuments mit einer besseren Engine der effizientere Ansatz.

Wählen Sie zwischen OCR und eingebettetem Text für die Dokumenterstellung

Bei der Erstellung einer PDF-Datei, die durchsucht, indiziert oder archiviert werden soll, hat die Entscheidung zwischen Scannen und OCR statt der Erstellung einer nativen digitalen PDF-Datei langfristige Konsequenzen. Ein natives digitales PDF mit eingebettetem Text ist kleiner, durchsucht schneller und behält die Textgenauigkeit perfekt bei. Eine gescannte und OCR-verarbeitete PDF-Datei behält das ursprüngliche Erscheinungsbild des Papierdokuments bei, birgt jedoch die Möglichkeit von Erkennungsfehlern, die sich mit der Zeit verstärken, wenn die PDF-Datei kopiert, zitiert und referenziert wird.

Bei Archivierungsprojekten besteht die beste Vorgehensweise darin, beide Formate beizubehalten. Behalten Sie den hochauflösenden Scan als Archivmaster für die visuelle Wiedergabetreue bei. Generieren Sie eine native digitale Version, entweder durch erneutes Eintippen oder durch die Anwendung hochpräziser OCR mit manueller Korrektur für die Textsuche und -analyse. Dieser Dual-Format-Ansatz sorgt für die Authentizität des Originalscans und die Benutzerfreundlichkeit von durchsuchbarem Text. WukongPDF unterstützt die OCR PDF-Verarbeitung zum Konvertieren gescannter Dokumente in durchsuchbare PDFs, und die resultierende OCR-Textebene bietet die Such- und Kopierfunktion, die gescannte Dokumente in digitalen Arbeitsabläufen nutzbar macht.

Die langfristige Zuverlässigkeitslücke zwischen OCR und eingebettetem Text

Mit OCR bearbeitete PDFs altern anders als digital erstellte PDFs. Ein digital erstelltes PDF, das zwanzig Jahre nach der Erstellung geöffnet wird, zeigt seinen Text perfekt an, da die Zeichencodes eindeutig sind und die Schriftarten eingebettet sind. Ein zwanzig Jahre nach der Erstellung geöffnetes OCR-PDF hängt von der Qualität des Originalscans und der Genauigkeit der zu diesem Zeitpunkt verfügbaren OCR-Engine ab. Erkennungsfehler, die im frischen Zustand des Dokuments kaum erkennbar waren, werden zu erheblichen Hindernissen, wenn das ursprüngliche Papierdokument nicht mehr zur Überprüfung zur Verfügung steht.

Bei Dokumenten, die langfristig aufbewahrt werden sollen, ist eingebetteter Text aus einer digitalen Quelle immer dem OCR-Text vorzuziehen. Wenn ein Dokument nur auf Papier vorliegt und gescannt werden muss, investieren Sie in die derzeit hochwertigste Scan- und OCR-Verarbeitung und bewahren Sie das Originalpapierdokument so lange wie möglich auf. Das Papieroriginal ist die ultimative Sicherung gegen OCR-Fehler, die möglicherweise erst Jahre später sichtbar werden.

Ein praktischer Test zur Unterscheidung von OCR PDF Text von eingebettetem Text: Vergrößern Sie einen Absatz auf 300 Prozent oder mehr und schauen Sie sich die Zeichenkanten an. OCR-Text weist häufig eine leichte Fehlausrichtung zwischen dem sichtbaren Zeichenbild und der unsichtbaren Textebene auf. Eingebetteter Text wird mit perfekter Ausrichtung gerendert, da die Zeichenformen und -positionen aus demselben Schriftartprogramm stammen.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →