Others

Warum enthält eine PDF-Datei immer noch alten Text, nachdem Sie sie gelöscht und überschrieben haben?

Sie öffnen ein PDF, wählen einen Textabsatz aus, drücken die Entf-Taste, geben an seiner Stelle neuen Text ein und speichern die Datei. Der neue Text erscheint auf dem Bildschirm. Sie versenden das Dokument. Der Empfänger durchsucht das PDF nach einem Begriff, der nur im alten Text vorkommt, und die Suche findet ihn. Der alte Text, den Sie gelöscht zu haben glaubten, befindet sich immer noch in der Datei, versteckt hinter dem neuen Text, unsichtbar auf dem Bildschirm, aber vollständig in den Dokumentdaten vorhanden. Diese beunruhigende Erfahrung offenbart eine grundlegende Wahrheit über die PDF-Bearbeitung: Was Sie sehen, ist nicht alles, was es gibt.

Die in Browsern und einfachen Desktop-Anwendungen verfügbaren PDF-Editor-Tools fügen in der Regel Inhalte zu einer PDF-Datei hinzu, anstatt sie wirklich zu ersetzen. Wenn Sie einen Absatz löschen und neuen Text eingeben, zeichnet der Editor ein weißes Rechteck über den alten Text und platziert neuen Text darüber. Der alte Text verbleibt in der Dateidatenschicht. Jeder, der den Text extrahiert, das Dokument durchsucht oder es in ein anderes Format konvertiert, kann das wiederherstellen, was Sie für gelöscht hielten.

Why Does a PDF Still Contain Old Text After You Delete and Overwrite It

So funktioniert die PDF-Bearbeitung tatsächlich: Überlagerung, nicht Ersetzung

PDF-Dateien sind nicht für die Bearbeitung gedacht. Das Format wurde als endgültiges Ausgabeformat erstellt, das digitale Äquivalent einer gedruckten Seite. Wenn ein PDF-Editor ein Dokument ändert, werden die ursprünglichen Textobjekte nicht neu geschrieben. Es werden neue Objekte hinzugefügt, die die alten überlagern. Die ursprünglichen Textobjekte verbleiben in der Datei, da für deren Entfernung eine Neuerstellung des Seiteninhaltsstroms erforderlich wäre, was ein wesentlich komplexerer Vorgang ist als das Hinzufügen einer Überlagerung.

Dieser Overlay-Ansatz hat eine wichtige Auswirkung auf die Dokumentensicherheit und die Integrität des PDF-Formats. Die Dokumentgröße wächst mit jeder Bearbeitung, da alte Inhalte nie entfernt, sondern nur abgedeckt werden. Eine PDF-Datei, die zehnmal bearbeitet wurde, enthält den Originalinhalt plus neun Bearbeitungsebenen. Die Dateigröße nimmt mit jeder Überarbeitung zu, obwohl die Anzahl der sichtbaren Seiten und der scheinbare Inhalt gleich bleiben.

Der Overlay-Ansatz tauscht Bearbeitungsqualität gegen Bearbeitungsgeschwindigkeit, und der Kompromiss bleibt unsichtbar, bis der verborgene Inhalt wieder auftaucht.

Das Überlagerungsproblem ist bei der Textbearbeitung am akutesten. Ein Redakteur könnte ein weißes Rechteck zeichnen, um alten Text auszublenden und neuen Text in einem separaten Textobjekt zu platzieren. Das weiße Rechteck verdeckt den alten Text optisch, der alte Text befindet sich jedoch noch in der Textebene. Ein Screenreader liest sowohl den alten als auch den neuen Text. Eine Suche findet beides. Ein Textextraktionstool bietet beides. Die Bearbeitung war kosmetischer Natur.

Ein ordnungsgemäß implementiertes PDF-Editor Schwärzungstool entfernt Inhalte aus der Textebene. Das allgemeine Textbearbeitungstool in derselben Anwendung ist möglicherweise nicht verfügbar. Benutzer gehen vernünftigerweise davon aus, dass „Löschen“ „Entfernen“ bedeutet, aber das PDF-Format macht das Entfernen schwieriger als das Hinzufügen, und viele Editoren wählen den einfacheren Weg.

WukongPDF

Versuchen Sie es mit „PDF bearbeiten“.

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Wenn alter Text wieder auftauchen kann

Alter Text, der durch Overlays verdeckt wird, kann in mehreren häufigen Fällen wieder auftauchen. Beim Konvertieren der PDF-Datei in ein anderes Format, beispielsweise Word oder Nur-Text, wird der gesamte Text aus dem Dokument extrahiert, einschließlich des ausgeblendeten alten Textes. Das Konvertierungstool liest die PDF-Textebene direkt und erkennt die weißen Overlay-Rechtecke nicht, da es sich dabei um visuelle Elemente und nicht um Textinhalte handelt.

Wenn Sie die PDF-Datei in einem anderen Viewer öffnen, kann versteckter Text sichtbar werden. Ein Betrachter, der die Seite anders rendert, platziert das weiße Overlay-Rechteck möglicherweise an der falschen Position oder rendert es überhaupt nicht, wodurch der alte Text sichtbar wird. Browserbasierte Viewer, mobile PDF-Apps und ältere Desktop-Viewer haben jeweils ihre eigenen Rendering-Macken, die sich auf die Overlay-Positionierung auswirken können.

Wenn Sie zum Durchsuchen des Dokuments die Funktion „Suchen“ verwenden, wird die Textebene durchsucht, nicht die visuelle Ebene. Wenn Sie nach einem Wort suchen, das im gelöschten Text vorkommt, wird es gefunden, auch wenn das Wort nicht auf dem Bildschirm sichtbar ist. So erfahren Empfänger, dass vermeintlich gelöschte Inhalte noch in der Datei vorhanden sind.

Screenreader und Barrierefreiheitstools lesen die Textebene. Ein sehbehinderter Benutzer, der auf einen Bildschirmleser angewiesen ist, hört sowohl den aktuellen als auch den gelöschten Text, oft ohne Hinweis darauf, dass einiges von dem, was er hört, verborgen bleiben soll. Die PDF-Metadaten und die Struktur können auch Spuren früherer Bearbeitungen im Änderungsverlauf des Dokuments enthalten.

So stellen Sie sicher, dass gelöschter Text wirklich verschwunden ist

Überprüfen Sie nach dem Bearbeiten einer PDF-Datei, ob der gelöschte Text tatsächlich entfernt wurde, indem Sie eine Textextraktion für die bearbeitete Datei durchführen. Kopieren Sie den gesamten Text aus der PDF-Datei mit Strg+A und fügen Sie ihn in einen Texteditor ein. Durchsuchen Sie den eingefügten Text nach gelöschten Phrasen. Wenn die Phrasen auftauchen, war die Löschung rein kosmetischer Natur. Alternativ können Sie das bearbeitete PDF in eine reine Textdatei umwandeln und dort nach den gelöschten Inhalten suchen.

Eine zweite Überprüfungsmethode verwendet die PDF-Suchfunktion. Suchen Sie im gelöschten Text nach einem bestimmten Wort oder Satz. Wenn das Suchwerkzeug ihn findet, befindet sich der Text immer noch in der Dokumentdatenebene. Das Suchtool in den meisten PDF-Readern durchsucht den Textinhaltsstrom direkt und wird nicht durch visuelle Überlagerungen beeinträchtigt.

Verwenden Sie bei vertraulichen Dokumenten zum Entfernen von Inhalten ein spezielles Schwärzungstool anstelle eines allgemeinen Bearbeitungstools. Schwärzungstools dienen dazu, Text aus der Datenschicht zu entfernen und ihn nicht nur visuell zu verdecken. Der Unterschied zwischen Bearbeiten und Schwärzen ist der Unterschied zwischen dem Ausblenden und Entfernen von Inhalten.

So entfernen Sie Text richtig aus einem PDF

WukongPDF bietet Schwärzungswerkzeuge sowie allgemeine Bearbeitungswerkzeuge. Wenn Sie Inhalte dauerhaft aus einer PDF-Datei entfernen müssen, verwenden Sie die Schwärzungsfunktion und nicht die Textbearbeitungsfunktion. Durch die Schwärzung wird Text aus der Datenebene entfernt und an seiner Stelle eine schwarze Markierung oder ein Leerzeichen eingefügt. Bei der anschließenden Textextraktion, Suche und Konvertierung wird der redigierte Inhalt nicht gefunden, da er nicht mehr in der Datei vorhanden ist.

Wenn Sie bereits eine PDF-Datei bearbeitet haben und sicherstellen müssen, dass der alte Text nicht wiederhergestellt werden kann, ist es am sichersten, die PDF-Datei in eine neue PDF-Datei zu drucken. Beim Druckvorgang wird jede Seite als bildähnliche Darstellung gerendert, wobei alle verborgenen Textebenen und Überlagerungen verworfen werden. Das Ausgabe-PDF enthält nur das, was auf der Seite sichtbar ist. Der Nachteil besteht darin, dass das neue PDF die Durchsuchbarkeit von Text, Links und andere interaktive Funktionen verliert.

Ein anderer Ansatz besteht darin, nur die sichtbaren Textebenen zu extrahieren und daraus ein neues PDF zu erstellen und dabei verborgene Inhalte zu verwerfen. Hierzu ist ein Tool erforderlich, das zwischen sichtbaren und ausgeblendeten Textobjekten unterscheiden und selektiv nur die sichtbaren exportieren kann. Das resultierende PDF ist sauber und enthält nur den beabsichtigten Inhalt.

Verhindern einer versehentlichen Aufbewahrung von Inhalten

Wenn Sie PDFs bearbeiten, die extern geteilt werden sollen, richten Sie einen Workflow ein, der einen Schritt zur Inhaltsüberprüfung umfasst. Führen Sie nach der Bearbeitung eine Textextraktion durch und suchen Sie nach Inhalten, die entfernt werden sollten. Bei Dokumenten mit rechtlichen, finanziellen oder persönlichen Daten sollte dieser Überprüfungsschritt obligatorisch sein, bevor die Datei Ihre Kontrolle verlässt.

Erwägen Sie die Verwendung anderer Formate als PDF für Dokumente, die umfangreiche Bearbeitung erfordern. Bearbeiten Sie das Dokument im Originalformat (Word, Google Docs, InDesign) und exportieren Sie ein neues PDF, wenn der Inhalt endgültig ist. Ein neuer Export aus dem Quelldokument enthält keinen Bearbeitungsverlauf und keine versteckten Inhalte. Das PDF erfüllt seinen vorgesehenen Zweck als endgültiges Ausgabeformat und nicht als Bearbeitungsfläche.

Das Problem ist nicht auf Text beschränkt. Bilder, die mit einem einfachen Editor aus einer PDF-Datei gelöscht wurden, können ebenfalls in den Dateidaten verbleiben. Der Editor zeichnet ein weißes Rechteck über das alte Bild und platziert das neue Bild darüber. Die ursprünglichen Bilddaten sind weiterhin in die PDF-Datei eingebettet, wodurch sich die Dateigröße erhöht und sie für jeden extrahierbar bleiben, der die Datei mit einem Tool öffnet, das alle eingebetteten Objekte aufzählen kann.

Die Aufbewahrung vertraulicher Informationen in PDFs ist ein dokumentiertes Sicherheitsrisiko. Im Jahr 2023 gab das Australian Signals Directorate einen Leitfaden heraus, in dem es warnte, dass eine mit nicht spezialisierten Tools durchgeführte PDF-Schwärzung dazu führen könnte, dass geschwärzte Inhalte wiederhergestellt werden könnten. In den Leitlinien wurde ausdrücklich darauf hingewiesen, dass durch das Zeichnen von Blackboxen über Text oder Bildern die zugrunde liegenden Daten nicht entfernt werden und dass konvertierte Dokumente den vermeintlich entfernten Inhalt offenlegen könnten.

Der sicherste Weg, ein bearbeitetes PDF zu teilen, das keine Spuren des vorherigen Inhalts enthalten darf, besteht darin, das PDF nur aus dem sichtbaren Inhalt neu zu erstellen. Drucken Sie das bearbeitete Dokument mithilfe eines PDF-Druckertreibers in ein neues PDF. Dieser Prozess rendert jede Seite so, wie sie auf dem Bildschirm erscheint, und schreibt nur den sichtbaren Inhalt in die neue Datei. Versteckter Text, gelöschte Bilder und der Bearbeitungsverlauf werden alle verworfen, da sie nicht Teil des gerenderten Erscheinungsbilds der Seite sind.

Für Organisationen, die Dokumente bearbeiten, die rechtlichen Offenlegungs- oder Informationsfreiheitsanfragen unterliegen, ist es wichtig, den Unterschied zwischen Bearbeitung und Schwärzung zu verstehen. Ein als Reaktion auf eine Offenlegungsanfrage erstelltes Dokument, das verborgenen, aber wiederherstellbaren Text enthält, kann schwerwiegende rechtliche Konsequenzen nach sich ziehen. Gerichte und Aufsichtsbehörden behandeln versteckte Inhalte als offengelegte Inhalte, unabhängig davon, ob sie auf der Seite sichtbar waren.

Der sicherste Bearbeitungsablauf für PDFs, die sensible oder vertrauliche Informationen enthalten, besteht darin, das Quelldokument und nicht das PDF zu bearbeiten. Nehmen Sie Änderungen an der ursprünglichen Word-Datei, Google Doc oder Designdatei vor und exportieren Sie eine neue PDF-Datei aus der bearbeiteten Quelle. Ein neuer Export enthält keine versteckten Inhalte, keinen Bearbeitungsverlauf und keine Restdaten aus früheren Versionen, die von einem bestimmten Empfänger wiederhergestellt werden könnten.

SzenarioWie verborgener Text sichtbar gemacht wirdRisikostufe
Konvertierung von PDF in WordDer Konverter extrahiert den gesamten Text aus der DatenschichtHoch: Der gesamte verborgene Text wird sichtbar
Suche im PDFDie Suchfunktion durchsucht den Textstrom, nicht die visuelle EbeneMedium: enthüllt die Existenz von verstecktem Text
Zugriff auf den ScreenreaderLiest die Textebene direkt und ignoriert ÜberlagerungenHoch: liest alten und neuen Text zusammen
Anderer PDF-ViewerDer alternative Viewer rendert das Overlay möglicherweise nicht korrektMittel: Inkonsistent bei allen Zuschauern
Textextraktion / Kopieren und Einfügen„Alles auswählen“ erfasst den gesamten Text in der DatenebeneHoch: Versteckter Text wird im Einfügepuffer angezeigt
WukongPDF

Versuchen Sie es mit „PDF bearbeiten“.

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →