Tips & Tricks

So wandeln Sie ein Foto einer gedruckten Seite mithilfe von OCR in bearbeitbaren, durchsuchbaren Text um

Sie machen mit Ihrem Telefon ein Foto eines gedruckten Dokuments. Vielleicht ist es eine Seite aus einem Buch in der Bibliothek, ein Handout von einer Besprechung, eine Quittung, die Sie für eine Spesenabrechnung benötigen, oder ein Schild mit wichtigen Informationen, das Sie gesehen haben. Das Foto ist klar genug, um es zu lesen, aber es ist nur ein Bild. Sie können darin nicht nach Wörtern suchen. Sie können keinen Text daraus kopieren und einfügen. Sie können es nicht bearbeiten. Es handelt sich um ein Foto eines Textes, nicht um den Text selbst.

Die optische Zeichenerkennung kann dieses Foto in bearbeitbaren, durchsuchbaren Text umwandeln. Die Tools dafür sind auf Ihrem Telefon und in Ihrem Browser verfügbar. Bei diesem Vorgang wird ein Foto einer gedruckten Seite erstellt und ein Dokument erstellt, in dem Sie jedes Wort suchen, auswählen, kopieren und bearbeiten können, als hätten Sie es selbst eingegeben.

How to Turn a Photo of a Printed Page Into Editable, Searchable Text Using OCR

Das bestmögliche Foto für OCR erhalten

Die OCR-Genauigkeit hängt stark von der Qualität des Eingabebildes ab. Ein gut beleuchtetes, scharf fokussiertes Foto einer flachen Seite weist eine OCR-Genauigkeit von 95 % bis 99 % auf. Ein schlecht beleuchtetes, verschwommenes, schiefes Foto einer gekrümmten Seite weist möglicherweise eine OCR-Genauigkeit von 70 % auf, was bedeutet, dass etwa jedes dritte oder vierte Wort einen Fehler enthält. Die Zeit, die für die Erstellung eines guten Fotos aufgewendet wird, wird durch den geringeren Korrekturaufwand um ein Vielfaches zurückgezahlt.

Legen Sie das Dokument auf eine ebene, gut beleuchtete Oberfläche. Ideal ist natürliches Tageslicht, da es diffus und schattenfrei ist. Die Deckenbeleuchtung im Büro funktioniert, wenn Sie sich so positionieren, dass Ihr Schatten nicht auf die Seite fällt. Halten Sie das Telefon direkt über die Seite, parallel dazu, nicht schräg. Benutzen Sie beide Hände oder stützen Sie Ihre Ellbogen auf einer Oberfläche ab, um das Telefon stabil zu halten. Füllen Sie den Rahmen mit der Seite und lassen Sie an den Rändern einen kleinen Rand frei. Tippen Sie auf den Bildschirm, um sich auf den Text zu konzentrieren. Wenn Ihr Telefon über einen Dokumentenscanmodus verfügt, verwenden Sie diesen. Auf dem iPhone verfügt die Notes-App über eine Funktion zum Scannen von Dokumenten, die die Seitenränder automatisch erkennt, die Perspektive korrigiert und den Kontrast verbessert. Auf Android funktioniert die Scanfunktion von Google Drive genauso.

Wenn die Seite aus einem gebundenen Buch stammt und nicht flach liegen kann, drücken Sie leicht auf den Rücken, um die Krümmung zu verringern. Beachten Sie, dass die OCR-Genauigkeit in der Nähe des Bundsteges, wo die Seite von der Kamera weg gebogen ist, geringer ist. Machen Sie bei kritischem Text in der Nähe des Buchrückens ein zweites Foto und konzentrieren Sie sich speziell auf diesen Bereich. Halten Sie dabei das Telefon näher an der Seite, um die Auflösung des gekrümmten Texts zu maximieren.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

OCR auf einem Foto mit den integrierten Tools Ihres Telefons ausführen

iPhones verfügen über Live Text, eine integrierte OCR-Funktion, die direkt in der Kamera-App, Fotos-App und Safari funktioniert. Richten Sie die Kamera auf den Text. In der Ecke des Suchers wird ein Live-Text-Symbol angezeigt. Tippen Sie darauf und das Telefon erkennt den Text in Echtzeit. Sie können es sofort auswählen, kopieren und einfügen. Öffnen Sie ein Foto, das sich bereits in Ihrer Bibliothek befindet, in der Fotos-App und suchen Sie nach dem Live-Text-Symbol. Tippen Sie darauf, um den gesamten erkannten Text hervorzuheben. Sie können ausgewählte Teile oder alles kopieren. Live Text funktioniert vollständig auf dem Gerät, ohne dass eine Internetverbindung erforderlich ist.

Bei Android-Telefonen ist Google Lens in Google Fotos und die Google-App integriert. Öffnen Sie das Foto in Google Fotos und tippen Sie auf das Linsensymbol. Google Lens identifiziert Text im Bild und ermöglicht Ihnen, ihn auszuwählen, zu kopieren, zu übersetzen oder zu durchsuchen. Wie Live Text von Apple funktioniert Google Lens offline für die Texterkennung auf neueren Geräten. Bei beiden Plattformen ist die integrierte OCR auf kurze Passagen, ein paar Sätze oder einen Absatz ausgelegt, nicht auf mehrseitige Dokumente. Der Text wird extrahiert, es wird jedoch kein formatiertes Dokument erstellt.

Konvertieren eines Fotos in ein durchsuchbares PDF mit OCR PDF Tools

Für ein Foto, das in ein richtiges Dokument umgewandelt werden soll, eine PDF-Datei mit einer durchsuchbaren Textebene, übernehmen browserbasierte OCR-Tools die gesamte Pipeline. WukongPDF akzeptiert Foto-Uploads in JPEG, PNG, HEIC und anderen gängigen Formaten. Laden Sie das Foto hoch. Das Tool verarbeitet es, erkennt den Text und gibt ein PDF mit dem Originalfoto als sichtbare Seite und dem erkannten Text als unsichtbare durchsuchbare Ebene dahinter aus. Die Ausgabe sieht genauso aus wie das Foto, aber Sie können jetzt nach Wörtern suchen, Text auswählen und kopieren und die Datei verhält sich wie jedes andere PDF.

Wenn Sie mehrere Fotos von aufeinanderfolgenden Seiten haben, laden Sie diese zusammen hoch. Das Tool verarbeitet jedes einzelne Dokument und Sie können es zu einem einzigen, mehrseitigen, durchsuchbaren PDF zusammenfassen. Dies ist der Arbeitsablauf zum Digitalisieren eines kurzen Dokuments mit Ihrem Telefon: Fotografieren Sie jede Seite, laden Sie den Stapel hoch, führen Sie OCR aus und laden Sie eine einzelne durchsuchbare PDF-Datei des gesamten Dokuments herunter. Der Vorgang dauert für ein 10-seitiges Dokument einige Minuten und führt zu einem Ergebnis, das funktional einem gescannten PDF von einem Flachbettscanner entspricht.

OCR-Ausgabe von Fotos bereinigen

Mit einem Telefon aufgenommene Fotos, selbst gute, weisen eine geringere OCR-Genauigkeit auf als Flachbettscans mit 300 DPI. Ein Telefonfoto einer gedruckten Seite weist normalerweise eine OCR-Genauigkeit von 90 % bis 95 % auf, was bedeutet, dass etwa jedes 20. Wort einen Fehler aufweist. Die Fehler häufen sich an vorhersehbaren Stellen: in der Nähe der Seitenränder, wo das Kameraobjektiv Verzerrungen verursacht, in kleinen Schriftarten unter 10 Punkt und in Bereichen mit Schatten oder ungleichmäßiger Beleuchtung.

Öffnen Sie nach der Konvertierung eines gescannten PDF aus einem Foto das PDF und suchen Sie nach häufigen OCR-Fehlern. Suchen Sie nach „cl“ was oft als „d“ erkannt wird. „rn“ was oft als „m“ erkannt wird. und „1“ was oft als „l“ erkannt wird. Lesen Sie den Text durch und korrigieren Sie alle Fehler, die Sie finden. Die für die Bereinigung erforderliche Zeit hängt von der Länge des Dokuments und der Fotoqualität ab. Das Korrekturlesen eines einseitigen Dokuments dauert 5 bis 10 Minuten. Ein 20-seitiges Dokument dauert eine Stunde oder länger. Der Bereinigungsschritt ist es, der ein schlampiges OCR-Ergebnis von einem polierten, professionellen Dokument trennt.

Wenn ein Foto einen Scanner übertrifft

Ein Handyfoto ist kein Ersatz für einen Flachbettscanner, wenn die Qualität oberste Priorität hat. Aber ein Handyfoto ist unendlich besser als ein Scanner, den Sie nicht dabei haben, wenn Sie ihn brauchen. Die beste Kamera ist die, die Sie haben. Zum Erfassen von Text aus Bibliotheksbüchern, Konferenzunterlagen, Whiteboard-Notizen, Quittungen, Schildern, Speisekarten und allen gedruckten Materialien, auf die Sie außerhalb Ihres Schreibtisches stoßen, verwandelt ein Telefonfoto mit anschließender OCR eine flüchtige visuelle Begegnung in dauerhaften, durchsuchbaren und bearbeitbaren Text. Die Bild-zu-PDF-Pipeline von WukongPDF verbindet ein Telefonfoto in weniger als einer Minute mit einem fertigen PDF und schließt so die Lücke zwischen dem Sehen von Text in der Welt und der Verfügbarkeit als Dokument, das Sie verwenden können.

Eine verständliche Einschränkung: Telefonfotos von Textdokumenten erzeugen in der Regel Dateigrößen, die größer sind als entsprechende Flachbettscans, da Telefonkameras auch bei Schwarzweißdokumenten Farbinformationen erfassen. Ein Telefonfoto einer einzelnen Textseite kann als JPEG 3 bis 5 MB groß sein, während ein Flachbettscan derselben Seite im Schwarzweißmodus möglicherweise 200 KB groß ist. Wenn Sie viele Seiten mit Ihrem Telefon digitalisieren, konvertieren Sie die Fotos in Graustufen, bevor Sie OCR ausführen. Dies reduziert die Dateigröße um 60 bis 80 % und verbessert häufig die OCR-Genauigkeit, da durch die Graustufenkonvertierung Farbrauschen und Schatten eliminiert werden, die die Erkennungsmaschine verwirren. Die meisten Fotobearbeitungs-Apps, einschließlich der integrierten Fotos-App auf iPhone und Android, enthalten einen Graustufen- oder Monofilter, der dies mit einem Fingertipp pro Foto erledigt.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →