Durch das Reduzieren einer PDF-Datei werden alle Anmerkungen, Formularfelder und Ebeneninhalte in einer einzigen statischen Bildebene zusammengeführt. Nach dem Reduzieren ist die ursprüngliche Textebene, die vor dem Reduzieren vorhanden war, verschwunden. Die Textzeichen, die früher auswählbar, durchsuchbar und extrahierbar waren, werden im reduzierten Bild zu Pixeln. PDF-Reparatur für ein reduziertes Dokument fragt, ob die ursprüngliche Textebene aus der reduzierten Ausgabe wiederhergestellt werden kann.
Die kurze Antwort hängt davon ab, ob das PDF mit oder ohne Beibehaltung der Textebene reduziert wurde. Bei einigen Reduzierungsvorgängen bleibt der Originaltext hinter dem reduzierten Bild als verborgener Inhalt erhalten. Bei anderen Reduzierungsvorgängen wird der Text vollständig verworfen und durch das gerenderte Bild ersetzt. Im ersten Fall ist eine Wiederherstellung möglich und im zweiten Fall unmöglich.
WukongPDFs PDF-Format-Wiederherstellungstools können erhaltene Textebenen aus reduzierten PDF-Dokumenten erkennen und extrahieren.

Wie die PDF-Reduzierung funktioniert und was sie entfernt
Beim Reduzieren werden alle sichtbaren Ebenen einer PDF-Seite zu einem einzigen gerenderten Bild zusammengefasst. Anmerkungen wie Hervorhebungen, Haftnotizen und Zeichnungsmarkierungen werden mit dem Seiteninhalt zusammengeführt. Formularfelder werden von interaktiven Elementen in statische visuelle Darstellungen ihrer ausgefüllten Werte umgewandelt. Transparenzeffekte werden in undurchsichtige Pixel aufgelöst. Das Ergebnis ist eine Seite, die genauso aussieht wie das Original, aber keine interaktive oder geschichtete Struktur aufweist.
In der Praxis kann es sein, dass beim Reduziervorgang die ursprüngliche Textebene hinter dem reduzierten Bild erhalten bleibt oder auch nicht. Wenn die Reduzierung über die Reduzierungsvorschau von Acrobat Pro oder mit bestimmten Einstellungen über das Preflight-Werkzeug durchgeführt wird, bleibt der Originaltext möglicherweise als unsichtbare Ebene erhalten. Wenn die Reduzierung über „In PDF drucken“ oder über Tools von Drittanbietern durchgeführt wird, wird die Textebene normalerweise vollständig verworfen.
Ein schneller Test stellt fest, ob der Text erhalten blieb. Öffnen Sie die reduzierte PDF-Datei und versuchen Sie, Text auf einer Seite auszuwählen. Wenn Text ausgewählt und kopiert werden kann, hat die Textebene die Reduzierung überstanden. Wenn durch Klicken auf Text nichts oder die gesamte Seite als Bild ausgewählt wird, wurde die Textebene verworfen und nur das visuelle Erscheinungsbild bleibt erhalten.
Versuchen Sie es mit „PDF reparieren“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Methode 1: Suchen nach einer verborgenen Textebene hinter dem reduzierten Bild
Öffnen Sie in Acrobat Pro die reduzierte PDF-Datei und gehen Sie zu „Extras“, „Inhaltsbearbeitung“, „Text und Bilder bearbeiten“. Klicken Sie auf einen sichtbaren Textbereich. Wenn Acrobat einen Begrenzungsrahmen um den Text anzeigt und die Bearbeitung zulässt, befindet sich hinter dem reduzierten Bild eine Textebene. Der Text ist in den Dateidaten vorhanden, auch wenn er bei der normalen Anzeige möglicherweise nicht als auswählbarer Text sichtbar ist.
Wenn der Text vorhanden ist, extrahieren Sie ihn mit der Funktion „PDF in Text exportieren“ von Acrobat Pro. Der extrahierte Text enthält möglicherweise den Originalinhalt, auch wenn die visuelle Seite abgeflacht erscheint. Kopieren Sie den extrahierten Text und vergleichen Sie ihn mit einem Beispiel des Originalinhalts. Wenn der Text übereinstimmt, wurde die ursprüngliche Textebene erfolgreich aus der reduzierten Datei wiederhergestellt.
Wenn Acrobat in realen Szenarien keinen bearbeitbaren Text finden kann, wurde die Textebene beim Reduzieren verworfen. Der visuelle Text auf der Seite besteht aus Pixeln im reduzierten Bild und nicht aus Zeichencodes. Eine Wiederherstellung durch Textextraktion ist nicht möglich, da keine zu extrahierenden Textdaten vorhanden sind.
Methode 2: Verwenden von OCR zum Wiederherstellen der verlorenen Textebene
Wenn die ursprüngliche Textebene beim Reduzieren verworfen wurde, stellt OCR einen Pfad zur Neuerstellung bereit. Führen Sie OCR für die reduzierte PDF-Datei mit der Funktion „Text erkennen“ von Acrobat Pro aus. Die OCR-Engine analysiert das Pixelbild jeder Seite, identifiziert Zeichenformen und erstellt eine neue Textebene mit den erkannten Zeichen.
Wenn man dies im Großen und Ganzen betrachtet, ist die durch OCR neu erstellte Textebene in der Praxis nicht der Originaltext. OCR führt zu Erkennungsfehlern, insbesondere bei kleinem Text, ungewöhnlichen Schriftarten oder Text über komplexen Hintergründen. Der neu erstellte Text ist bei sauberen Standarddokumenten zu etwa 95 bis 99 Prozent genau und bei Dokumenten mit anspruchsvoller Typografie oder Layout weniger genau.
Vergleichen Sie nach der OCR den erkannten Text mit einem bekannten Beispiel des Originalinhalts, falls verfügbar. Korrigieren Sie OCR-Fehler manuell oder akzeptieren Sie die neu erstellte Textebene als Annäherung an das Original. Die OCR-Ausgabe kann für die Suche und Textextraktion verwendet werden, kann jedoch Fehler enthalten, die überprüft werden müssen, bevor der Text für rechtliche, finanzielle oder behördliche Zwecke verwendet werden kann.
Prüfung auf Text in der PDF-Dateistruktur
Für eine definitive Überprüfung, ob Textdaten in einer reduzierten PDF-Datei vorhanden sind, untersuchen Sie die Rohdateistruktur. Öffnen Sie die PDF-Datei in einem Texteditor, der Binärdateien verarbeiten kann, z. B. VS Code oder Notepad++. Suchen Sie nach erkennbaren Textzeichenfolgen aus dem Originaldokumentinhalt. Wenn in den Dateidaten Textzeichenfolgen gefunden werden, ist die Textebene vorhanden, auch wenn sie nicht über die PDF-Reader-Schnittstelle zugänglich ist.
Dieser Ansatz erfordert eine gewisse Vertrautheit mit der internen Struktur von PDF. Text in einer PDF-Datei wird in BT- und ET-Markierungen gespeichert, die den Anfang und das Ende von Textobjekten kennzeichnen. Zwischen diesen Markierungen werden Zeichencodes mit Positionierungsbefehlen aufgelistet. Das Auffinden von BT- und ET-Markern mit erkennbarem Text weist darauf hin, dass die Textdaten die Reduzierung überstanden haben.
Aus praktischer Sicht betrachtet: Wenn in realen Szenarien keine Textzeichenfolgen in den Dateidaten gefunden werden, wird der Inhalt durch die Reduzierungsoperation vollständig gerastert. The pages are images and contain no recoverable text information. OCR is the only available path to creating a text layer.
Verhindern des Verlusts von Textebenen bei zukünftigen Reduzierungsvorgängen
Wenn Sie eine PDF-Datei reduzieren, die ihre Textebene beibehalten muss, verwenden Sie Einstellungen, die verborgenen Text beibehalten. In Acrobat Pro enthält das Reduzierungsvorschau-Tool ein Kontrollkästchen zum Beibehalten von Überdruck- und Sonderfarbeninformationen, was indirekt dazu beiträgt, Textdaten zu bewahren. Das Preflight-Tool bietet Reduzierungskorrekturen, die den Text explizit beibehalten.
Der sicherste Ansatz besteht darin, vor dem Reduzieren eine nicht reduzierte Kopie der PDF-Datei zu speichern. Die nicht reduzierte Kopie behält alle interaktiven Elemente, Anmerkungen und Textebenen bei. Verteilen Sie die abgeflachte Version. Archivieren Sie das nicht reduzierte Original. Sollte jemals eine Wiederherstellung erforderlich sein, stellt das Original die vollständigen Quelldaten bereit.
Aus einer breiteren Sicht können Sie in Dokumenten-Workflows für kritische Dokumente die Reduzierungseinstellungen an einer Kopie testen, bevor Sie sie auf das Original anwenden. Stellen Sie sicher, dass der Text nach der Reduzierung wiederherstellbar bleibt. Passen Sie die Einstellungen an, wenn die Wiederherstellung fehlschlägt. Der Testschritt verlängert den Arbeitsablauf um Minuten und verhindert dauerhaften Textverlust.
Verwenden von Preflight zum Erkennen und Extrahieren versteckter Textebenen
Das Acrobat Pro Preflight-Tool enthält Profile, die speziell für die Analyse der PDF-Inhaltsstruktur entwickelt wurden. Der Inventarbericht listet alle in der Datei vorhandenen Textobjekte auf, einschließlich derjenigen, die bei der normalen Anzeige nicht sichtbar sind. Wenn Sie diesen Bericht für eine reduzierte PDF-Datei ausführen, wird deutlich, ob die Textdaten den Reduzierungsprozess überstanden haben.
Wenn der Preflight-Bericht Textobjekte identifiziert, verwenden Sie die Korrektur „Alle Texte exportieren“, um sie in eine separate Datei zu extrahieren. Der extrahierte Text kann dann mit dem sichtbaren Seiteninhalt verglichen werden, um festzustellen, wie viel vom Originaltext erhalten geblieben ist und ob er korrekt und vollständig ist.
Wiederherstellen von Text aus teilweise reduzierten PDFs
Einige Reduzierungsvorgänge wirken sich nur auf bestimmte Seitenelemente aus, während andere intakt bleiben. Formularfelder können reduziert werden, während der Textkörper als auswählbare Zeichen erhalten bleibt. Anmerkungen werden möglicherweise reduziert, während der zugrunde liegende Seitentext erhalten bleibt. Untersuchen Sie jeden Elementtyp einzeln, um festzustellen, was abgeflacht wurde und was erhalten blieb.
Extrahieren Sie in Dokument-Workflows aus einem weiten Blickwinkel für teilweise reduzierte Dokumente den verbleibenden Text aus den nicht reduzierten Teilen und kombinieren Sie ihn mit der OCR-Ausgabe aus den reduzierten Teilen. Der Hybridansatz maximiert die Textwiederherstellung, indem der Originaltext, sofern verfügbar, und OCR-rekonstruierter Text, sofern der Originaltext verloren ging, verwendet wird.
Wann ist zu akzeptieren, dass eine Wiederherstellung nicht möglich ist?
Sollte es vorkommen, dass in der Dateistruktur keine Textdaten vorhanden sind, Acrobat keinen bearbeitbaren Text finden kann und OCR unzulässig ungenaue Ergebnisse liefert, kann die ursprüngliche Textebene nicht wiederhergestellt werden. Akzeptieren Sie diese Schlussfolgerung und gehen Sie dazu über, das zu bewahren, was noch übrig ist, anstatt mehr Zeit in Wiederherstellungsversuche zu investieren.
Dokumentieren Sie den Wiederherstellungsversuch und sein Ergebnis. Beachten Sie die verwendeten Werkzeuge, die ausprobierten Methoden und die Schlussfolgerung, zu der Sie gelangt sind. Die Dokumentation dient zukünftigen Dokumentenverwaltern, die möglicherweise Zugriff auf bessere Wiederherstellungstools haben und verstehen sollten, was zuvor versucht wurde.
Langfristige Archivierungsstrategie für abgeflachte Dokumente
Reduzierte PDFs werden häufig speziell für Archivierungszwecke erstellt, da sie interaktive Abhängigkeiten beseitigen. Wenn Sie reduzierte Dokumente archivieren, bewahren Sie nach Möglichkeit das nicht reduzierte Original zusammen mit der reduzierten Version auf. Das Original bewahrt die vollständige Dokumentstruktur. Die abgeflachte Version bietet das stabile Archivformat.
Für Dokumente, in denen nur die reduzierte Version vorhanden ist, führen Sie OCR aus, um eine Textebene zu erstellen und diese in die PDF-Datei einzubetten. Der OCR-Text ist möglicherweise nicht perfekt, ermöglicht aber eine zukünftige Suche und Textextraktion, die sonst unmöglich wäre. Die OCR-Ebene ist eine Brücke zwischen dem reduzierten Bild und zukünftigen Dokumentenanalyseanforderungen.
Automatisierte Flattening-Erkennung für Dokumentensammlungen
Unternehmen, die große Dokumentensammlungen verwalten, profitieren von der automatischen Erkennung reduzierter PDFs. Ein Skript, das jedes PDF öffnet, prüft, ob auswählbarer Text vorhanden ist, und Dateien markiert, in denen kein Text vorhanden ist, identifiziert Dokumente, die eine OCR-Verarbeitung benötigen. Der automatische Scan verhindert, dass abgeflachte Dokumente ohne durchsuchbare Textebenen unbemerkt in das Archiv gelangen.
Integrieren Sie die Reduzierungserkennung in den Dokumentenerfassungsworkflow. Wenn eine neue PDF-Datei in das System gelangt, prüfen Sie, ob Text vorhanden ist. Wenn kein Text vorhanden ist, leiten Sie das Dokument an eine OCR-Verarbeitungswarteschlange weiter, bevor es das Archiv erreicht. Durch die automatische Erkennung und Korrektur wird sichergestellt, dass jedes archivierte Dokument durchsuchbar ist.
Versuchen Sie es mit „PDF reparieren“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
