Tips & Tricks

So erstellen Sie ein gescanntes PDF mit OCR, um es durchsuchbar zu machen

How to OCR a Scanned PDF to Make It Searchable

Was OCR mit einem gescannten PDF macht

Die optische Zeichenerkennung wandelt ein gescanntes PDF, bei dem es sich um eine Sammlung von Seitenbildern handelt, in ein durchsuchbares Dokument um.

Der OCR PDF-Prozess analysiert jedes Seitenbild, identifiziert die Formen von Zeichen und erstellt eine unsichtbare Textebene hinter dem Seitenbild. Nach der OCR können Sie nach Wörtern im Dokument suchen, Text auswählen und kopieren und Bildschirmleseprogramme verwenden, um das Dokument vorzulesen.

OCR wandelt ein passives Textbild in ein aktives, durchsuchbares Dokument um, das Textauswahl und Screenreader unterstützt.

Die Genauigkeit der OCR hängt direkt von der Qualität des Originalscans ab, wobei saubere 300-DPI-Scans die besten Ergebnisse liefern.

Ein gescanntes PDF ohne OCR ist wie ein Fotoalbum mit Text. Sie können die Wörter ansehen, aber nicht mit ihnen interagieren. Sie können nicht nach einem bestimmten Begriff suchen. Sie können einen Absatz nicht kopieren, um ihn zu zitieren. Sie können keinen Screenreader verwenden. OCR fügt die interaktiven Funktionen hinzu, die digitale Dokumente über die bloße Anzeige hinaus nützlich machen.

Die Genauigkeit der OCR hängt von der Qualität des Originalscans ab. Ein sauberer, hochauflösender Scan mit 300 DPI, gleichmäßiger Beleuchtung und scharfem Fokus führt zu einer OCR-Genauigkeit von über 99 Prozent für standardmäßig gedruckten Text. Ein Scan mit niedriger Auflösung, ein schräg aufgenommenes Foto eines Dokuments oder ein Scan eines zerknitterten oder fleckigen Originals führt zu einer geringeren Genauigkeit. Die Qualität des Scans bestimmt direkt die Qualität der OCR-Ausgabe.

Die durch OCR hinzugefügte Textebene PDF Searchable ist vom Seitenbild getrennt. Das optische Erscheinungsbild des PDF ändert sich nach der OCR nicht. Die Seite sieht immer noch wie ein gescanntes Bild aus. Hinter diesem Bild liegt der erkannte Text als unsichtbare Zeichendaten vor, auf die Suchmaschinen, Bildschirmleseprogramme und Textauswahltools zugreifen können.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

So führen Sie OCR für ein gescanntes PDF auf verschiedenen Geräten aus

Unter Windows kann Adobe Acrobat Pro OCR für gescannte PDFs ausführen. Öffnen Sie die PDF-Datei, wählen Sie das Scan- und OCR-Tool aus und wählen Sie „Text erkennen“. Acrobat verarbeitet jede Seite, erkennt den Text und fügt die durchsuchbare Textebene hinzu. Speichern Sie die Datei. Das PDF unterstützt jetzt die Suche und Textauswahl. Acrobat Pro bietet die genaueste OCR unter Windows.

Auf dem Mac umfasst die integrierte Vorschauanwendung keine OCR. Mehrere Mac-PDF-Tools von Drittanbietern bieten OCR-Funktion. PDF Expert und PDFpen enthalten beide OCR-Engines, die gescannte PDFs verarbeiten und durchsuchbare Textebenen hinzufügen. Die OCR-Qualität ist vergleichbar mit Windows-Tools für Standarddokumente.

Das browserbasierte OCR-Tool von WukongPDF funktioniert auf jedem Betriebssystem. Laden Sie das gescannte PDF hoch, wählen Sie die Dokumentsprache für die OCR-Engine aus und führen Sie die Erkennung aus. Laden Sie das durchsuchbare PDF herunter, wenn die Verarbeitung abgeschlossen ist. Der browserbasierte Ansatz macht OCR ohne die Installation von Software zugänglich.

Für iPhone und Android verarbeiten Scanner-Apps mit OCR den Scan während der Erfassung. Adobe Scan, Microsoft Lens und der integrierte Scanner in der iPhone-Notizen-App führen beim Scannen von Dokumenten automatisch OCR durch. Das resultierende PDF ist sofort nach dem Scannen durchsuchbar, ohne einen separaten OCR-Verarbeitungsschritt.

Verbesserung der OCR-Genauigkeit für anspruchsvolle Dokumente

Wählen Sie die richtige Dokumentsprache aus, bevor Sie OCR ausführen. Die OCR-Engine verwendet sprachspezifische Wörterbücher und Zeichenhäufigkeitsdaten, um mehrdeutige Zeichen aufzulösen. Das Ausführen von OCR für ein französisches Dokument mit der französischen Spracheinstellung führt zu besseren Ergebnissen als die Verwendung der englischen Einstellung. Wählen Sie bei mehrsprachigen Dokumenten die Primärsprache aus und korrigieren Sie Fehler in Passagen der Sekundärsprache manuell.

Richten Sie die gescannten Seiten vor der OCR gerade aus. Gescannte Seiten, die leicht gedreht sind, selbst um ein oder zwei Grad, verringern die OCR-Genauigkeit, da die OCR-Engine davon ausgeht, dass die Textzeilen horizontal sind. Die meisten Scanprogramme verfügen über eine Funktion zur automatischen Geradeausrichtung. Wenn der Scan während der Erfassung nicht entzerrt wurde, korrigieren Sie die PDF-Seiten, bevor Sie OCR ausführen.

Erhöhen Sie die Scanauflösung für Dokumente mit kleinem Text oder komplexen Layouts. Text mit weniger als 10 Punkten erfordert eine höhere Scanauflösung für eine genaue OCR. Für die meisten Dokumente reicht ein Scan mit 300 DPI aus. Scannen Sie Dokumente mit 8-Punkt-Text oder kleiner mit 400 oder 600 DPI, um der OCR-Engine genügend Pixeldaten zur Unterscheidung einzelner Zeichen zu geben.

Bei Dokumenten mit gemischten Inhaltstypen, beispielsweise Seiten, die Text mit Fotos oder Illustrationen kombinieren, sollte die OCR-Engine so konfiguriert sein, dass sie nur Textbereiche erkennt. Der Versuch, Text aus Bildbereichen zu erkennen, erzeugt fehlerhafte Zeichen. Die meisten OCR-Tools verfügen über eine Zonenauswahlfunktion, mit der Sie angeben können, welche Seitenbereiche Text enthalten.

Überprüfen und Korrigieren der OCR-Ausgabe

Überprüfen Sie nach Abschluss der OCR die Ausgabe, indem Sie nach einigen Wörtern suchen, die Sie auf der Seite sehen können. Wenn die Suche sie findet, war die OCR erfolgreich. Wenn bei der Suche offensichtliche Wörter fehlen, reicht die OCR-Genauigkeit möglicherweise nicht für die spezifische Schriftart, das Layout oder die Bildqualität dieser Seite aus.

Überprüfen Sie den erkannten Text bei Dokumenten, bei denen die OCR-Genauigkeit von entscheidender Bedeutung ist, z. B. Rechts- oder Krankenakten, die vollständig durchsuchbar sein müssen. Mit einigen PDF-Tools können Sie die ausgeblendete Textebene anzeigen und bearbeiten. Korrigieren Sie Erkennungsfehler, insbesondere bei Eigennamen, Zahlen und Fachbegriffen, die von der OCR-Engine mit größerer Wahrscheinlichkeit falsch erkannt werden.

Die häufigsten OCR-Fehler sind Zeichenverwechslungen. Der Buchstabe l und die Zahl 1 sehen in vielen Schriftarten ähnlich aus. Die Buchstaben rn zusammen können wie der Buchstabe m aussehen.

Die Buchstaben cl können wie der Buchstabe d aussehen. Durch diese Zeichenverwechslungen entstehen Wörter, die optisch dem Original ähneln, aber inhaltlich falsch sind. Durch die manuelle Überprüfung kritischer Abschnitte werden diese Fehler erkannt.

Nachdem Sie die OCR-Ausgabe überprüft haben, speichern Sie das Dokument unter einem Dateinamen, der darauf hinweist, dass es mit OCR verarbeitet wurde. Ein Dateiname wie Report-OCR.pdf oder Report-Searchable.pdf unterscheidet die durchsuchbare Version vom ursprünglichen Nur-Bild-Scan.

Der praktische Nutzen einer durchsuchbaren gescannten PDF-Datei wird deutlich, wenn Sie zum ersten Mal eine bestimmte Information in einem großen Dokument finden müssen. Ein 200-seitiger gescannter Vertrag ohne OCR erfordert das manuelle Durchlesen jeder Seite, um eine bestimmte Klausel zu finden. Eine durchsuchbare Version findet die Klausel in Sekundenschnelle. Für jedes Dokument, auf das Sie voraussichtlich mehr als einmal verweisen, zahlt sich die OCR-Investition aus.

OCR-verarbeitete PDFs sind auch für Bildschirmlesegeräte zugänglich, sodass sie auch von sehbehinderten Menschen verwendet werden können, die beim Lesen von Dokumenten auf unterstützende Technologien angewiesen sind. Ein gescanntes PDF ohne OCR ist für Screenreader völlig unzugänglich, da kein Text zum Vorlesen vorhanden ist. Durch das Hinzufügen von OCR wird das Dokument barrierefrei gemacht, was von Barrierefreiheitsstandards wie Abschnitt 508 und WCAG gefordert wird.

Wählen Sie für Dokumente in anderen Sprachen als Englisch vor der Verarbeitung die richtige OCR-Sprache aus. OCR-Engines verwenden sprachspezifische Zeichenerkennungsmodelle. Ein mit dem japanischen Modell erkanntes Dokument in japanischer Sprache liefert weitaus bessere Ergebnisse als dasselbe Dokument, das mit einem englischen Modell erkannt wird.

OCR ermöglicht auch die Textextraktion zur Wiederverwendung in anderen Dokumenten. Wenn Sie in Ihrem eigenen Bericht eine Passage aus einem gescannten Dokument zitieren müssen, macht OCR den Text kopierbar. Ohne OCR müssten Sie die Passage manuell erneut eingeben. Die Zeitersparnis durch das Kopieren und Einfügen aus OCR-verarbeiteten Dokumenten summiert sich erheblich.

Für gescannte Dokumente, die archiviert werden sollen, ist OCR ein wesentlicher Aufbewahrungsschritt. Ein heute archiviertes, nur aus Bildern bestehendes, gescanntes PDF bietet künftigen Forschern keine Suchfunktion. Ein durchsuchbares PDF ermöglicht den Zugriff auf den Dokumentinhalt über die Textsuche und erhöht so den Nutzen des Dokuments für zukünftige Benutzer erheblich.

Die Dateigröße des PDF ändert sich nach OCR nicht wesentlich. Die OCR-Daten fügen jeder Seite eine kleine Menge Textdaten hinzu, normalerweise einige Kilobyte pro Seite. Die Originalseitenbilder bleiben unverändert. Die Erhöhung der Dateigröße ist für die funktionale Verbesserung, die die durchsuchbare Textebene bietet, vernachlässigbar.

Die durch OCR hinzugefügte durchsuchbare Textebene ist vom visuellen Seitenbild getrennt. Wenn Sie in einer OCR-verarbeiteten PDF-Datei nach einem Wort suchen, entspricht die Suche der Textebene und nicht dem Bild. Das Suchergebnis hebt den Bereich im Seitenbild hervor, in dem der Text gefunden wurde.

OCR-verarbeitete PDFs unterstützen das Lesen von Text in Sprache und machen sie so für Menschen mit Sehbehinderungen und für jeden zugänglich, der Dokumente lieber anhört als sie liest. Diese Barrierefreiheitsfunktion ist ein wesentlicher Vorteil von OCR, der über die einfache Durchsuchbarkeit hinausgeht.

Bei großen OCR-Projekten mit Hunderten oder Tausenden gescannten Seiten spart die Batch-OCR-Verarbeitung erheblich Zeit. Konfigurieren Sie die OCR-Einstellungen einmal und wenden Sie sie auf den gesamten Dokumentstapel an. Überprüfen Sie eine Auswahl von Seiten auf ihre Richtigkeit, anstatt jede Seite zu überprüfen.

Die OCR-Textebene kann als reine Textdatei exportiert werden, sodass der Dokumentinhalt in anderen Anwendungen verwendet werden kann. Exportieren Sie den erkannten Text, öffnen Sie ihn in einem Texteditor oder Textverarbeitungsprogramm und verwenden Sie ihn als Grundlage für ein neues Dokument.

Der langfristige Wert einer OCR-verarbeiteten PDF-Datei wird jedes Mal deutlich, wenn Sie Informationen im Dokument finden müssen. Eine durchsuchbare PDF-Datei eines Vertrags, eines Handbuchs oder eines Referenzdokuments wird zu einer Ressource, die Sie abfragen können, und nicht zu einer statischen Datei, die Sie manuell lesen müssen.

Durch die Implementierung von OCR als Standardschritt in Ihrem Workflow zum Scannen von Dokumenten wird sichergestellt, dass jedes Dokument, das Sie digitalisieren, ab dem Moment, in dem es in Ihre digitale Bibliothek gelangt, durchsuchbar ist. Die wenigen zusätzlichen Sekunden OCR-Verarbeitung beim Scannen machen sich jedes Mal bezahlt, wenn Sie in einem Dokument, das Sie jemals gescannt haben, nach Informationen suchen müssen.

Für jeden, der eine digitale Dokumentenbibliothek verwaltet, ist OCR der wirkungsvollste Verarbeitungsschritt, den Sie auf gescannte PDFs anwenden können. Es wandelt passive Bilddateien in aktive, durchsuchbare und zugängliche Dokumente um.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →