Tips & Tricks

So erstellen Sie eine OCR-Datei in einer PDF-Datei und exportieren den erkannten Text als Markdown-Datei

Sie scannen ein PDF mit OCR und der erkannte Text wird in einem Textfeld in Ihrem PDF-Editor angezeigt. Sie können es lesen. Sie können es kopieren und einfügen. Aber was Sie eigentlich wollen, ist der Text in einer Markdown-Datei, mit Überschriften als Hashes, Listen als Sternchen, Links als Klammer-Klammer-Paare und durch Leerzeilen getrennten Absätzen. Markdown ist die Verkehrssprache von Entwicklern, technischen Redakteuren, Bloggern und allen, die sauberen, portablen Text benötigen, der in einen statischen Site-Generator, eine Notizen-App oder ein Code-Repository eingefügt werden kann.

Der Übergang von einer gescannten PDF-Datei zu einer Markdown-Datei erfolgt in zwei Schritten: OCR erkennt den Text und anschließend wird dieser erkannte Text in einem Formatierungsschritt in Markdown-Syntax konvertiert. Für jeden Schritt gibt es Werkzeugoptionen, die sich auf die Qualität der Endausgabe auswirken.

How to OCR a PDF and Export the Recognized Text as a Markdown File

Schritt 1: OCR im PDF, um erkannten Text zu extrahieren

Der OCR-Schritt ist derselbe wie das Durchsuchbarmachen einer beliebigen PDF-Datei. Verwenden Sie ein OCR PDF-Tool, um die gescannten Seiten zu verarbeiten. Das Tool fügt jeder Seite eine Textebene hinzu. Für den Markdown-Export möchten Sie, dass die OCR-Ausgabe in einem Format erfolgt, das möglichst viele Strukturinformationen beibehält: Welcher Text ist eine Überschrift, welcher Text ist ein Hauptteil, welcher Text ist Teil einer Liste oder Tabelle. Standardmäßige OCR-Engines geben Klartext aus, wodurch alle Strukturinformationen verloren gehen. Eine Überschrift und ein Hauptabsatz werden zu nicht unterscheidbaren Textblöcken, die durch Zeilenumbrüche getrennt sind.

Um optimale Ergebnisse zu erzielen, verwenden Sie eine OCR-Engine, die die textbasierte Textextraktion unterstützt. Diese Engines analysieren die räumliche Anordnung von Text auf der Seite und können anhand der Schriftgröße, Position und Nähe zu anderen Elementen zwischen Überschriften, Fließtext, Bildunterschriften und Fußnoten unterscheiden. Je mehr Strukturinformationen die OCR-Engine erfasst, desto sauberer ist die Markdown-Konvertierung. Die Funktion „Exportieren nach“ von Adobe Acrobat Pro umfasst die Funktion „Text mit Formatierung“. Option, die einige strukturelle Hinweise beibehält. Die OCR-Engine bewahrt Schriftgröße und Positionsmetadaten, die nachgelagerte Konvertierungstools verwenden können, um Überschriftenebenen und Absatzumbrüche abzuleiten.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Schritt 2: Konvertieren Sie den erkannten Text in Markdown

Sobald das PDF über eine Textebene verfügt, kann die Konvertierung in Markdown über mehrere Wege erfolgen. Am einfachsten ist ein direkter Export aus einem PDF-Editor, der Markdown als Ausgabeformat unterstützt. Die Exportoptionen von WukongPDF beinhalten Markdown als Zielformat, wenn das PDF OCR-verarbeitet wurde. Wählen Sie Markdown als Ausgabeformat aus, und das Tool generiert eine .md-Datei mit dem erkannten Text, der gemäß den Markdown-Konventionen formatiert ist: Zeilen, die mit größeren Schriftarten beginnen, werden zu Überschriften mit Hash-Präfix, eingerückte Zeilen werden zu Listenelementen und normale Absätze werden durch Leerzeilen getrennt.

Wenn kein direkter Markdown-Export verfügbar ist, lautet die Pipeline wie folgt: Exportieren Sie den erkannten Text in ein Rich-Text-Format, das die Formatierung beibehält, z. B. RTF oder HTML, und konvertieren Sie dann dieses Zwischenformat mithilfe eines Konvertierungstools in Markdown. Pandoc, der universelle Dokumentenkonverter, kommt mit dieser Pipeline gut zurecht. Exportieren Sie den Text aus der PDF-Datei als HTML und führen Sie dann Folgendes aus: pandoc input.html -f html -t markdown -o output.md. Pandoc übersetzt HTML-Überschriften-Tags in Markdown-Hashes, HTML-Listen-Tags in Markdown-Listenmarkierungen und HTML-Link-Tags in Markdown-Link-Syntax. Die Qualität der Ausgabe hängt von der Qualität des HTML-Exports aus dem PDF ab. Wenn der PDF-Export sauberes, gut strukturiertes HTML erzeugt, erzeugt Pandoc sauberes Markdown. Wenn der Export unordentliches HTML mit Inline-Stilen und nicht-semantischen Tags erzeugt, wird der Markdown entsprechend unordentlich sein.

OCR-Fehler in der Markdown-Ausgabe bereinigen

OCR-Fehler im erkannten Text werden unverändert in die Markdown-Ausgabe übernommen. Zu den häufigsten Fehlern zählen verwechselte Zeichen wie „cl“ oder „cl“. erkannt als "d" „rn“ erkannt als "m" und „1“ erkannt als "l" insbesondere bei kleineren Schriftgrößen oder Scans mit geringerer Qualität. Ein Überprüfungsdurchlauf durch die Markdown-Datei zur Erkennung dieser Fehler ist unerlässlich, wenn der Text veröffentlicht oder geteilt werden soll.

Die meisten Code-Editoren und Markdown-Editoren verfügen über eine Rechtschreibprüfungsfunktion, die nicht erkannte Wörter hervorhebt und so OCR-Fehler leicht erkennt. Arbeiten Sie die hervorgehobenen Wörter durch und korrigieren Sie sie anhand der Original-PDF-Datei. Achten Sie besonders auf Eigennamen, Fachbegriffe und Zahlen, die am wahrscheinlichsten falsch erkannt werden und bei falscher Veröffentlichung auch den größten Schaden anrichten. Ein Finanzbericht, in dem OCR „123.000 US-Dollar“ anerkennt. als „128.000 US-Dollar“ enthält einen wesentlichen Fehler, der von der automatischen Rechtschreibprüfung nicht erkannt wird, da es sich bei beiden um gültige Zahlenformate handelt. Die manuelle Überprüfung kritischer Werte anhand des Quelldokuments ist der einzige zuverlässige Schutz.

Bilder und Tabellen bei der Markdown-Konvertierung erhalten

Markdown verarbeitet Bilder durch Verweis auf externe Dateien: ![alt text](path/to/image.png). Beim Konvertieren einer PDF-Datei in Markdown müssen die Bilder in der PDF-Datei extrahiert und als separate Dateien gespeichert sowie Referenzlinks an den richtigen Positionen in den Markdown-Text eingefügt werden. WukongPDFs PDF-Export nach Markdown beinhaltet die Bildextraktion als Teil der Konvertierung. Jedes Bild im PDF wird als PNG- oder JPEG-Datei in einem Ordner neben der Markdown-Datei gespeichert und der Markdown-Text enthält die entsprechenden Bildreferenz-Tags.

Tische sind anspruchsvoller. Markdown-Tabellen verwenden eine Pipe-and-Dash-Syntax, die für Menschen leicht zu lesen ist, für automatisierte Konverter jedoch schwierig aus PDF-Tabellendaten zu generieren, da PDFs Tabellen nicht als strukturierte Daten speichern. Sie speichern Zeichen an Positionen. Der Konverter muss das Tabellenraster anhand der Zeichenpositionen rückentwickeln, was bei komplexen Tabellen mit zusammengeführten Zellen, mehrzeiligem Zellinhalt oder ungleichen Spaltenbreiten zu unvollständigen Ergebnissen führt. Einfache Rastertabellen mit einheitlichen Spalten und einzeiligem Zellinhalt werden zuverlässig konvertiert. Komplexe Tabellen erfordern möglicherweise eine manuelle Umstrukturierung in der Markdown-Ausgabe. Wenn eine Tabelle schlecht konvertiert werden kann, sollten Sie erwägen, sie als separates Bild statt als Markdown-Tabellensyntax zu exportieren. Ein sauber lesbares Bild einer komplexen Tabelle ist nützlicher als ein verstümmeltes Markdown, das als falsch ausgerichtete Spalten dargestellt wird.

Nutzung der Markdown-Datei

Die resultierende Markdown-Datei wird in einem beliebigen Texteditor, einer Notiz-App wie Obsidian oder Notion, einem statischen Site-Generator wie Hugo oder Jekyll oder einem Code-Editor wie VS Code geöffnet. Mit Markdown können Sie HTML für eine Website, PDF für die Verteilung, DOCX für die Textverarbeitung generieren oder den Text einfach in einem durchsuchbaren, versionierungskontrollierbaren Nur-Text-Format speichern, das jahrzehntelang lesbar ist.

Der Wert dieser Pipeline wird am deutlichsten anhand von Archivmaterial deutlich. Alte gescannte Berichte, historische Dokumente und vergriffene Veröffentlichungen werden nicht nur durchsuchbar, sondern auch umwandelbar. Ein gescannter Bericht aus dem Jahr 2005 wird zu einer Markdown-Datei, die in einem modernen Editor bearbeitet, in eine Website umgewandelt, in einem Blog-Beitrag zitiert oder programmgesteuert analysiert werden kann. Das PDF-Format, das den Text 20 Jahre lang in einem Bild sperrte, schränkt die Verwendung des Inhalts nicht mehr ein.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →