Others

Können Sie Informationen aus einem PDF schwärzen, damit es die Formatkonvertierung übersteht?

Mit dem Schwärzungstool Ihres PDF-Editors schwärzen Sie eine Sozialversicherungsnummer aus einem PDF. Sie sehen das schwarze Kästchen, speichern die Datei und senden sie. Der Empfänger konvertiert die PDF-Datei zur Bearbeitung in Word und stellt fest, dass die Sozialversicherungsnummer im konvertierten Dokument vollständig sichtbar ist, als ob die Schwärzung nie stattgefunden hätte. Das ist kein Fehler. Dies ist das erwartete Verhalten der meisten Schwärzungstools, wenn das Dokument einer Formatkonvertierung unterzogen wird, und es hat zu echten Datenschutzverletzungen geführt.

Im Jahr 2024 berichtete das britische Information Commissioner's Office, dass unsachgemäße PDF-Redigierung die dritthäufigste Ursache für Datenschutzverletzungen bei Regierungsdokumenten war (ICO, „Data Security Incident Trends“, 2024). Die häufigste Grundursache war nicht ein Fehler bei der Schwärzung, sondern ein Fehler bei der Überprüfung, ob die Schwärzung den gesamten Lebenszyklus des Dokuments überstanden hat, einschließlich etwaiger Formatkonvertierungen, die es möglicherweise nachgelagert durchläuft.

Can You Redact Information From a PDF So It Survives Format Conversion

Wie die ordnungsgemäße PDF-Redaktion auf Datenebene funktioniert

Die ordnungsgemäße PDF-Redaktion unterscheidet sich grundlegend vom Zeichnen einer Blackbox über Text. Wenn Sie ein echtes Schwärzungswerkzeug verwenden, passieren zwei Dinge: Der sichtbare Text wird mit einem schwarzen Rechteck abgedeckt und der darunter liegende Textinhalt wird aus der Textebene der PDF-Datei entfernt. Die Zeichen selbst werden aus dem Datenstrom der Datei gelöscht. Eine Reader-Anwendung hat unter der Blackbox nichts anzuzeigen, da dort nichts vorhanden ist.

Wenn Sie mithilfe von Anmerkungstools ein schwarzes Rechteck über Text zeichnen und es als geschwärzt bezeichnen, haben Sie das getan, was Sicherheitsexperten als kosmetische Schwärzung bezeichnen. Der Text ist immer noch in der Datenschicht der PDF-Datei vorhanden, vollständig intakt und extrahierbar. Jeder kann den Text auswählen, kopieren, an anderer Stelle einfügen und jedes Wort unter dem schwarzen Feld lesen. Konvertieren Sie die PDF-Datei in ein beliebiges anderes Format und das Konvertierungstool liest den zugrunde liegenden Text, nicht die visuelle Überlagerung. Die Redaktion verschwindet, weil sie von vornherein nie real war.

Die Unterscheidung zwischen echter und kosmetischer Schwärzung ist so wichtig, dass Regierungsbehörden und Anwaltskanzleien sie mittlerweile in die obligatorische Schulung für Mitarbeiter einbeziehen, die mit sensiblen Dokumenten umgehen. Ein einziger unsachgemäß redigierter Gerichtsantrag, eine FOIA-Antwort oder ein behördlicher Antrag kann personenbezogene Daten in großem Umfang preisgeben, und die Reputations- und Rechtsfolgen überwiegen bei weitem die wenigen zusätzlichen Sekunden, die für die Verwendung geeigneter Redaktionstools erforderlich sind.

Ein besonders gefährliches Szenario entsteht, wenn ein Dokument durch mehrere Hände geht. Person A wendet die ordnungsgemäße Schwärzung an, Person B öffnet die Datei und sieht schwarze Kästchen, geht davon aus, dass die Schwärzung abgeschlossen ist, und leitet sie weiter. Aber wenn Person A ein kosmetisches Schwärzungstool verwendet, ohne es zu merken, ist das Vertrauen von Person B in die Black Boxes fehl am Platz. Dieses Vertrauenskettenproblem ist der Grund, warum Unternehmen auf ein einziges, verifiziertes Schwärzungstool standardisieren und alle Mitarbeiter in der korrekten Verwendung schulen sollten.

Eine besonders heimtückische Variante der kosmetischen Schwärzung ist die White-Box-Schwärzung. Einige Benutzer zeichnen ein weißes Rechteck über den Text und gehen davon aus, dass Weiß auf Weiß den Text unsichtbar macht. Dies schlägt fehl, da beim Auswählen von Text oder beim Konvertieren des Dokuments der darunter liegende Text angezeigt wird und die Bildschirmlesesoftware ihn unabhängig von der visuellen Farbe vorliest. White-Box-Schwärzung ist überhaupt keine Schwärzung.

WukongPDF

Versuchen Sie es mit Redact PDF

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Was passiert mit der Schwärzung während der Formatkonvertierung?

Durch die Formatkonvertierung wird ein neues Dokument erstellt, indem das Quell-PDF gelesen und sein Inhalt in ein anderes Format geschrieben wird. Das Konvertierungstool analysiert die PDF-Struktur und extrahiert Text, Bilder und Layoutinformationen. Bei der PDF-Format-Konvertierung ist die entscheidende Frage, welche Textinhalte das Konvertierungstool in den redigierten Bereichen findet.

Wenn die Schwärzung echt war und der Text aus dem Inhaltsstrom der PDF-Datei entfernt wurde, findet das Konvertierungstool in diesen Bereichen nichts und schreibt nichts. Das Ausgabedokument enthält an der Stelle, an der sich die Schwärzungen befanden, keinen Text. Wenn die Schwärzung kosmetischer Natur war, d. h. eine Blackbox-Überlagerung mit darunter noch vorhandenem Text, findet das Konvertierungstool den Text und schreibt ihn gewissenhaft in das Ausgabedokument. Die Blackbox ist ein visuelles Element, kein Datenelement, und die meisten Konvertierungstools ignorieren visuelle Überlagerungen beim Extrahieren von Textinhalten.

WukongPDF bietet ein Schwärzungstool, das Inhalte auf Datenebene und nicht nur auf visueller Ebene entfernt. Wenn Sie die Schwärzung über ein ordnungsgemäß implementiertes PDF-Sicherheit-Tool anwenden, das den Textstrom des Dokuments bearbeitet, können die entfernten Informationen durch die Formatkonvertierung nicht wieder angezeigt werden, da die Daten einfach nicht mehr in der Datei vorhanden sind.

Einige PDF-zu-Word-Konverter versuchen speziell, Anmerkungen, einschließlich Kommentarfeldern, Hervorhebungen und gezeichneten Formen, beizubehalten. Wenn eine kosmetische Schwärzung als Anmerkung angewendet wurde, kann der Konverter das schwarze Rechteck möglicherweise originalgetreu als Word-Form reproduzieren. Da der darunter liegende Text jedoch nie entfernt wurde, zeigt das Word-Dokument sowohl das schwarze Rechteck als auch den darunter liegenden Text an, der auswählbar, kopierbar und für jeden, der das Rechteck verschiebt oder löscht, vollständig sichtbar ist.

Die Formatkonvertierung ist nicht der einzige Weg, über den redigierte Inhalte nach außen dringen können. Durch einfaches Auswählen des gesamten Texts in einer PDF-Datei mit kosmetischen Schwärzungen und Einfügen in einen Texteditor wird der geschwärzte Inhalt angezeigt. Wenn Sie die PDF-Datei mithilfe der Suchfunktion nach einem redigierten Begriff durchsuchen, wird dieser auch dann gefunden, wenn er optisch verdeckt ist. Screenreader und Barrierefreiheitstools lesen die zugrunde liegende Textebene. Diese alternativen Extraktionspfade umgehen alle die visuelle Überlagerung, auf der die kosmetische Schwärzung beruht.

OCR-basierte Schwärzung und das Problem des wiederkehrenden Texts

Gescannte PDFs verleihen der Schwärzung eine weitere Ebene der Komplexität. Ein gescanntes Dokument ist im Wesentlichen ein Foto eines Blattes Papier. Der Text wird nicht als Zeichen, sondern als Pixel in einem Bild gespeichert. Standardmäßige Schwärzungswerkzeuge, die Textebenen bearbeiten, können keinen Text aus einem Bild entfernen, sondern zeichnen stattdessen schwarze Kästchen über das Bild. Hierbei handelt es sich um eine kosmetische Korrektur aus Notwendigkeit, nicht aus freiwilliger Absicht.

Um eine gescannte PDF-Datei ordnungsgemäß zu redigieren, benötigen Sie ein Tool, das die tatsächlichen Bilddaten ändert und die Pixelwerte im redigierten Bereich durch durchgehendes Schwarz ersetzt. Nachdem das Bild geändert wurde, führen Sie dann OCR für das Dokument aus, um eine Textebene nur für den nicht redigierten Inhalt zu erstellen. Wenn Sie vor dem Schwärzen eine OCR-Erkennung durchführen, befindet sich der OCR-Text für den redigierten Inhalt in der Textebene und wird von jedem Formatkonvertierungstool extrahiert.

Ein häufiger Fehler bei der Schwärzung gescannter PDF-Dateien besteht darin, zuerst die OCR-Funktion auszuführen, um das Dokument durchsuchbar zu machen, dann Schwärzungsmarkierungen anzubringen und dann erneut zu speichern. Bei dieser Sequenz bleibt die OCR-generierte Textebene unter den Schwärzungsmarkierungen intakt. Bei jeder nachfolgenden Konvertierung oder Textextraktion wird der redigierte Text aus der OCR-Ebene wiederhergestellt. Die richtige Reihenfolge ist: Zuerst die Bildpixel redigieren, dann das bereinigte Bild per OCR bearbeiten. Durch diese Reihenfolge wird sichergestellt, dass die Textebene niemals den redigierten Inhalt enthält.

So überprüfen Sie, ob die Redaktion die Konvertierung überlebt

Die einzige Möglichkeit, sicher zu sein, dass Ihre Schwärzung dauerhaft ist, besteht darin, sie zu testen. Nachdem Sie ein PDF geschwärzt haben, konvertieren Sie es in eine Nur-Text-Datei und suchen Sie nach geschwärzten Inhalten. Wenn die Textdatei die geschwärzten Daten enthält, war Ihre Schwärzung nicht wirksam. Eine schnellere Überprüfung besteht darin, den gesamten Text im PDF nach der Schwärzung auszuwählen und ihn in einen Texteditor einzufügen. Wenn der Einfügepuffer geschwärzten Text enthält, war die Schwärzung kosmetisch.

Konvertieren Sie bei gescannten PDFs eine Seite in ein Bildformat wie PNG und überprüfen Sie die geschwärzten Bereiche visuell bei hohem Zoom. Wenn Sie durch die schwarze Überlagerung Spuren des Originalinhalts erkennen können, insbesondere auf Bildschirmen mit hoher Helligkeit oder beim Drucken, ist die Schwärzung unzureichend. Manchmal kann ein einziges Pixel sichtbaren Inhalts ausreichen, um die Originalinformationen zu rekonstruieren.

Erstellen Sie eine Überprüfungscheckliste, die jeden dieser Schritte umfasst, und fordern Sie sie als Teil Ihres Dokumentenfreigabeprozesses ein. Die wenigen Minuten, die zur Überprüfung der Schwärzung benötigt werden, sind vernachlässigbar im Vergleich zu den Stunden, Tagen oder Monaten der Behebung, die auf einen durch eine fehlgeschlagene Schwärzung verursachten Datenverstoß folgen. Dieser Schritt ist für Unternehmen, die personenbezogene Daten oder vertrauliche Informationen verarbeiten, nicht optional.

Metadaten-Redaktion: Die oft übersehene Ebene

Selbst wenn sichtbarer Text ordnungsgemäß redigiert wird, können in einer PDF-Datei dennoch vertrauliche Informationen über ihre Metadaten verloren gehen. Zu den PDF-Metadaten gehören der Titel des Dokuments, der Name des Autors, das Erstellungsdatum, der Änderungsverlauf und manchmal auch die Namen von Personen, die das Dokument überprüft oder unterzeichnet haben. Formatkonvertierungstools bewahren Metadaten in der Regel nach Möglichkeit auf, sodass redigierte Metadaten die Konvertierung genauso sicher überstehen wie der beabsichtigte Dokumentinhalt.

Eine Studie des SANS Institute aus dem Jahr 2025 analysierte 500 öffentlich verfügbare redigierte PDFs von Regierungswebsites und stellte fest, dass 12 % vertrauliche Informationen in Metadatenfeldern enthielten, die nicht bereinigt wurden (SANS Institute, „Hidden Data in Publicly Released Documents“, 2025). In mehreren Fällen konnten die geschwärzten Informationen im Dokumenttext mit Querverweisen versehen und mithilfe nicht geschwärzter Metadaten bestätigt werden. Das Bereinigen von Metadaten vor der Veröffentlichung ist ebenso wichtig wie das Schwärzen sichtbarer Inhalte.

Derselbe Überprüfungsprozess sollte auf jedes Dokument angewendet werden, das einer Konvertierung unterzogen wird, unabhängig davon, wie die Konvertierung durchgeführt wird. Wenn Ihr Workflow einen automatisierten Konvertierungsschritt umfasst, integrieren Sie eine Schwärzungsüberprüfung in diese Automatisierung, anstatt sich auf manuelle Stichproben zu verlassen. Ein Skript, das die konvertierte Ausgabe nach bekannten redigierten Begriffen durchsucht, kann Fehler erkennen, die bei der manuellen Überprüfung möglicherweise übersehen werden.

Durch die Integration der Schwärzungsüberprüfung in Ihre Standard-Checkliste für die Dokumentenprüfung wird sichergestellt, dass dieser wichtige Sicherheitsschritt niemals übersprungen wird.

WukongPDF

Versuchen Sie es mit Redact PDF

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →