Others

So erkennen Sie, ob eine PDF-Datei durch Scannen von Papier oder aus einer digitalen Quelle erstellt wurde

Ein PDF kommt per E-Mail. Beim Öffnen kommt etwas zum Vorschein, das wie ein gedrucktes Dokument aussieht. Der Text ist da, die Formatierung stimmt. Aber kann man den Text mit dem Cursor auswählen, oder fährt der Cursor darüber, als wäre es ein Foto? Die Antwort bestimmt, ob die PDF-Datei durch Scannen von Papier oder aus einer digitalen Quelle erstellt wurde, und bestimmt alles darüber, wie Sie mit der Datei arbeiten können.

Wenn Sie auf den Text klicken und beobachten, ob der Cursor ihn auswählt oder ignoriert, wird die Frage in einer Sekunde beantwortet.

Um festzustellen, ob eine PDF-Datei gescannt oder digital erstellt wurde, müssen Sie auf auswählbaren Text prüfen, die Dateistruktur untersuchen und nach verräterischen visuellen Artefakten beim Scannen suchen. WukongPDFs OCR-PDF-Tools können gescannte Dokumente durchsuchbar machen, und die Gescannte PDF-Identifizierungsschritte unten zeigen Ihnen, ob Sie überhaupt OCR benötigen.

How to Tell If a PDF Was Created by Scanning Paper or From a Digital Source

Der Textauswahltest

Öffnen Sie die PDF-Datei und versuchen Sie, mit dem Textauswahltool ein Textwort auszuwählen. Wenn der Cursor das Wort Zeichen für Zeichen hervorhebt, enthält das PDF auswählbaren Text und wurde digital erstellt oder wurde bereits mit OCR bearbeitet. Zieht der Cursor ein Auswahlrechteck über die gesamte Fläche, ohne einzelne Zeichen hervorzuheben, handelt es sich bei der Seite um ein Bild und das PDF wurde durch Scannen erstellt.

Der Textauswahltest ist schnell und aussagekräftig für Einzelseitenprüfungen. Testen Sie bei mehrseitigen Dokumenten einige Seiten vom Anfang, in der Mitte und am Ende. Einige PDFs mischen digitale und gescannte Seiten, typischerweise ein digital erstelltes Anschreiben, gefolgt von gescannten Anhängen. Der Textauswahltest auf jeder Seite verrät, welche Seiten welche sind.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Überprüfen der Dateigröße und Seitenzahl auf Hinweise

Gescannte PDFs sind in der Regel größer als digitale PDFs mit derselben Seitenanzahl, da jede Seite ein ganzseitiges Bild ist. Ein 10-seitiges gescanntes PDF mit 300 DPI ist oft 5–15 MB groß. Ein 10-seitiges digitales PDF mit demselben Inhalt kann 100–500 KB groß sein. Der Unterschied in der Dateigröße ist schon vor dem Öffnen der Datei ein schneller Hinweis.

Gescannte PDFs weisen tendenziell auch weniger interne Funktionen auf. Keine Lesezeichen, keine Hyperlinks, keine eingebetteten Schriftarten, keine Metadaten über die grundlegenden Dateieigenschaften hinaus. Öffnen Sie die Dokumenteigenschaften und überprüfen Sie die Registerkarte „Schriftarten“. In einem gescannten PDF sind keine Schriftarten aufgeführt, da der gesamte Inhalt aus Bildern besteht. Ein digitales PDF listet die im Dokument verwendeten Schriftarten auf.

Überprüfen der Dateieigenschaften für die Erstellungsmethode

Zu den Dokumenteigenschaften gehört häufig die Anwendung, mit der die PDF-Datei erstellt wurde. Ein mit Adobe Acrobat aus Microsoft Word erstelltes PDF war wahrscheinlich digital. Eine mit Canon Scanner Driver oder HP Scan erstellte PDF-Datei wurde gescannt. Ein von einer OCR-Anwendung erstelltes PDF kann ein gescanntes Dokument sein, das zur Durchsuchbarkeit verarbeitet wurde.

Das Producer-Feld in den Dokumenteigenschaften wird von der erstellenden Anwendung festgelegt und ist nicht immer zuverlässig, da es geändert oder gefälscht werden kann. Kombinieren Sie die Herstellerinformationen mit dem Textauswahltest und der Schriftartenprüfung für eine sichere Entscheidung. Drei unabhängige Tests, die zu derselben Schlussfolgerung führen, sind zuverlässig.

TestDigitales PDF-ErgebnisGescanntes PDF-Ergebnis
TextauswahlDer Cursor hebt einzelne Zeichen hervorDer Cursor zeichnet ein Auswahlrechteck über das Bild
Dateigröße (10 Seiten)100-500 KB5-15 MB
Registerkarte „Schriftarten“ in den EigenschaftenListet eingebettete Schriftarten aufLeer, keine Schriftarten
ErzeugerfeldWord, Acrobat, ChromeScannertreiber, Bildbearbeitungssoftware

Auf der Suche nach visuellen Artefakten beim Scannen

Vergrößern Sie einen Textbereich auf 400 %. Gescannte PDFs weisen die charakteristischen Artefakte der Bilderfassung auf: leichte Unschärfe an den Zeichenrändern, ungleichmäßige Dunkelheit auf der Seite aufgrund der Scannerbeleuchtung sowie Staub- oder Haarflecken auf dem Scannerglas, die als schwache Linien oder Punkte erscheinen. Digitale PDFs zeigen bei jeder Zoomstufe scharfe Zeichenkanten.

Gescannte PDFs doppelseitiger Seiten können Geisterbilder und schwachen, umgekehrten Text von der anderen Seite des Papiers aufweisen, der durchscheint. Dies ist ein eindeutiges Zeichen für das Scannen, da digitale PDFs kein Konzept für die Deckkraft des Papiers haben. Geisterbilder erscheinen als grauer Textschatten hinter dem Primärtext, der am deutlichsten in Bereichen sichtbar ist, in denen der Primärtext spärlich ist.

PDF-Metadatenfelder für zusätzliche Hinweise nutzen

Die PDF-Metadatenfelder, auf die über die Dokumenteigenschaften zugegriffen werden kann, können den Ursprung des Dokuments offenbaren. Ein Feld „Titel“, das den Dateinamen des Originaldokuments enthält, z. B. „Annual-Report-2025-Final.docx“, gibt an, dass die PDF-Datei aus dieser Word-Datei erstellt wurde. Ein leeres Titelfeld oder ein Titel, der mit dem PDF-Dateinamen übereinstimmt, ist neutral. Ein Erstellerfeld, in dem Microsoft Word oder Google Docs aufgeführt sind, weist auf die digitale Herkunft hin.

Die Felder „Erstellungsdatum“ und „Änderungsdatum“ können Hinweise auf die Zeitleiste geben. Ein PDF, das am selben Datum innerhalb weniger Minuten erstellt und geändert wurde, lässt auf einen direkten digitalen Export schließen. Ein PDF mit einem Änderungsdatum Jahre nach dem Erstellungsdatum wurde möglicherweise mit OCR bearbeitet oder verarbeitet. Die Metadaten erzählen den Verlauf des Dokuments und dieser Verlauf verrät, ob ein Scanvorgang beteiligt war.

Was zu tun ist, wenn Sie den PDF-Typ kennen

Für gescannte PDFs, die durchsuchbar sein müssen, führen Sie OCR aus, um eine Textebene hinzuzufügen. Der OCR-Prozess erkennt den Text in den Seitenbildern und fügt dahinter auswählbaren, durchsuchbaren Text hinzu. Das optische Erscheinungsbild ändert sich nicht. Das PDF wird durchsuchbarer und kann kopiert und eingefügt werden.

Bei digitalen PDFs, die wie gescannt aussehen müssen, typischerweise bei Reproduktionen offiziell aussehender Dokumente, ist die Konvertierung in ein Bild und zurück unnötig und beeinträchtigt die Qualität. Das digitale PDF liegt bereits in seiner optimalen Form vor. Jede Verarbeitung, die Text in Bilder umwandelt, verringert die Qualität, ohne einen Mehrwert zu schaffen.

WukongPDF

Probieren Sie PDF-OCR aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →