Das manuelle Durchsuchen einer 200-seitigen PDF-Datei nach jeder Kreditkartennummer und das Schwärzen jeder einzelnen Nummer ist mühsam, langsam und gefährlich fehleranfällig. Eine einzige verpasste Nummer stellt eine vermeidbare Datenschutzverletzung dar. PDF-Schwärzung automatisiert diesen Prozess durch Mustervergleich, indem jede Textzeichenfolge gefunden wird, die einem bestimmten Format entspricht, beispielsweise einer 16-stelligen Kreditkartennummer, und Schwärzungsmarkierungen auf alle Instanzen im gesamten Dokument in einem einzigen Vorgang angewendet werden.
Der Musterabgleich, auch regulärer Ausdruck oder Regex-Abgleich genannt, definiert ein Textmuster und nicht eine bestimmte Zeichenfolge. Das Muster erfasst das Format sensibler Daten, ohne dass die genauen Werte vorher bekannt sein müssen. Wenn das Schwärzungstool ausgeführt wird, durchsucht es den gesamten Text im Dokument nach Übereinstimmungen mit dem Muster, zeichnet die Position jeder Übereinstimmung auf der Seite auf und zeichnet undurchsichtige schwarze Rechtecke über diese Positionen. Der darunter liegende Text wird dann dauerhaft entfernt.
Die PDF-Sicherheit-Tools von WukongPDF umfassen musterbasierte Schwärzungsfunktionen für die automatisierte Entfernung sensibler Daten vor der Dokumentenfreigabe oder -veröffentlichung.

So funktioniert die musterbasierte Schwärzung auf PDF-Textebenen
Die musterbasierte Schwärzung wirkt sich auf die Textebene der PDF-Datei und nicht auf deren visuelles Erscheinungsbild aus. Das Tool extrahiert den gesamten Textinhalt von jeder Seite, sucht nach Übereinstimmungen mit den angegebenen Regex-Mustern und zeichnet die genaue Position jeder Übereinstimmung auf. Anschließend werden undurchsichtige schwarze Rechtecke über diese Positionen gezeichnet, die darunter liegenden Textzeichen werden dauerhaft entfernt und durch Leerzeichen ersetzt, die nicht wiederhergestellt werden können.
Eine entscheidende Einschränkung der musterbasierten Schwärzung besteht darin, dass sie nur Text findet, der als tatsächliche Zeichen gespeichert ist. Kreditkartennummern, die nur als Teil eines gescannten Bildes und nicht als auswählbarer Text vorhanden sind, werden nicht gefunden. Bei gescannten Dokumenten müssen Sie zunächst OCR ausführen, um eine Textebene zu erstellen, und dann eine musterbasierte Schwärzung der OCR-Ausgabe durchführen. Selbst dann können OCR-Fehler dazu führen, dass einige Zahlen beim Mustervergleich übersehen werden.
Das Regex-Muster muss auch berücksichtigen, wie die PDF-Datei den Text intern speichert. Eine Kreditkartennummer, die dem Leser als 1234 5678 9012 3456 angezeigt wird, kann intern als vier separate Textblöcke mit Leerzeichen dazwischen gespeichert werden. Das Muster muss flexibel genug sein, um über diese internen Grenzen hinweg zu passen, was bedeutet, dass optionale Leerzeichen, Bindestriche oder andere Trennzeichen zwischen Zifferngruppen zulässig sind.
Versuchen Sie es mit Redact PDF
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Erstellen präziser Regex-Muster für Kreditkartennummern
Bei einem Kreditkartennummernmuster muss ein ausgewogenes Verhältnis zwischen Präzision und Vollständigkeit bestehen. Ein Muster, das genau dem Format 1234-5678-9012-3456 entspricht, fängt Zahlen ab, die mit Bindestrichen geschrieben sind, übersieht aber die gleichen Zahlen, die wie 1234567890123456 oder 1234 5678 9012 3456 geschrieben sind. Ein Muster, das zu weit gefasst ist, z. B. eine beliebige Folge von genau 16 Ziffern, fängt Kontonummern, Telefonnummern und andere numerische Bezeichner ab das sollte nicht redigiert werden.
Erstellen Sie Muster mit optionalen Trennzeichen zwischen Zifferngruppen. Der Ausdruck, der Bindestriche, Leerzeichen oder kein Trennzeichen zwischen jeder Gruppe von vier Ziffern zulässt, deckt die drei gängigsten Kreditkartennummernformate ab. Testen Sie das Muster an einer Kopie des Dokuments, bevor Sie die vollständige Schwärzung durchführen. Überprüfen Sie jede Übereinstimmung, um zu bestätigen, dass das Muster alle beabsichtigten sensiblen Daten gefunden hat und nichts gefunden hat, was sichtbar bleiben sollte.
Erstellen Sie für Dokumente, die mehrere Arten vertraulicher Daten enthalten, ein separates Muster für jeden Typ und führen Sie sie in einzelnen Schwärzungsdurchgängen aus. Kreditkartennummern erhalten ein Muster und einen Durchgang. Sozialversicherungsnummern bekommen eine andere. E-Mail-Adressen erhalten ein Drittel. Getrennte Durchgänge mit dazwischen liegender individueller Überprüfung verhindern, dass Fehlalarme eines Musters die korrekten Übereinstimmungen eines anderen Musters beeinträchtigen.
Schritt-für-Schritt: Ausführen der Musterschwärzung in Acrobat Pro
Öffnen Sie die PDF-Datei in Adobe Acrobat Pro und gehen Sie zu „Extras“ und dann zu „Schwärzen“. Klicken Sie in der Symbolleiste „Schwärzen“ auf das Dropdown-Menü neben „Zur Schwärzung markieren“ und wählen Sie „Text suchen“. Geben Sie das Regex-Muster in das Suchfeld ein und aktivieren Sie das Kontrollkästchen „Reguläre Ausdrücke verwenden“. Acrobat durchsucht das gesamte Dokument und zeigt im Suchergebnisfenster eine nach Seitenzahl geordnete Liste aller Treffer an.
Überprüfen Sie jede Übereinstimmung, bevor Sie eine Schwärzung anwenden. Klicken Sie auf jede Übereinstimmung im Bedienfeld, um zu ihrer Position auf der Seite zu springen. Stellen Sie sicher, dass der abgeglichene Text tatsächlich vertrauliche Daten enthält, die geschwärzt werden sollten. Wenn eine Übereinstimmung falsch positiv ist, deaktivieren Sie sie in der Übereinstimmungsliste. Nachdem Sie alle Übereinstimmungen überprüft haben, klicken Sie auf „Geprüfte Ergebnisse zur Schwärzung markieren“. Acrobat platziert Schwärzungsmarkierungen über allen markierten Elementen. Klicken Sie abschließend in der Symbolleiste auf Schwärzungen anwenden, um den markierten Text dauerhaft zu entfernen.
Speichern Sie die Datei nach der Schwärzung unter einem neuen Namen, der sie deutlich vom Original unterscheidet. Die ursprüngliche, nicht redigierte Datei sollte sicher aufbewahrt oder vernichtet werden. Die redigierte Datei kann jetzt sicher verteilt werden, da der vertrauliche Text dauerhaft aus den Dokumentdaten entfernt und nicht nur durch eine visuelle Überlagerung verdeckt wurde.
Überprüfen, ob die Schwärzung vollständig ist
Sobald Sie fertig sind und die musterbasierte Schwärzung angewendet haben, überprüfen Sie Ihre Arbeit, bevor Sie das Dokument freigeben. Öffnen Sie das redigierte PDF und suchen Sie nach einer bekannten Kreditkartennummer, die im Original vorhanden war. Die Suche sollte keine Ergebnisse liefern. Wählen Sie den gesamten Text auf jeder Seite aus und kopieren Sie ihn in einen Nur-Text-Editor. Der kopierte Text sollte keine Kreditkartennummern oder Teilnummern enthalten.
Lassen Sie in Dokumenten-Workflows bei Dokumenten mit rechtlichen oder behördlichen Konsequenzen, wenn die Schwärzung fehlschlägt, die Ausgabe von einem zweiten Prüfer unabhängig überprüfen. Der zweite Prüfer sucht nach bekannten sensiblen Mustern und scannt jede Seite visuell. Ein unabhängiger Prüfer erkennt Fehler, die der ursprüngliche Prüfer möglicherweise übersieht, weil er mit dem Inhalt des Dokuments vertraut ist.
Auch nach der automatisierten Verifizierung bleibt eine Sichtprüfung erforderlich. Der Mustervergleich funktioniert bei auswählbarem Text. Es kann keine Kreditkartennummern erkennen, die nur in Bildern erscheinen, beispielsweise ein in das PDF eingebettetes Foto einer Kreditkarte oder eine handgeschriebene Nummer auf einem gescannten Formular. In diesen Fällen ist eine manuelle Schwärzung mithilfe des Zeichenmodus des Schwärzungstools erforderlich.
Umgang mit Grenzfällen und nicht standardmäßigen Formaten
Kreditkartennummern erscheinen gelegentlich in nicht standardmäßigen Formaten, die einfache Regex-Muster umgehen. Eine Zahl, die über zwei Textzeilen verteilt ist, eine Zahl, die mit Leerzeichen zwischen jeder Ziffer geschrieben ist, oder eine Zahl, die in eine längere numerische Zeichenfolge wie eine Kontoreferenz eingebettet ist, alles erfordert Musterverfeinerungen oder eine manuelle Überprüfung.
Erweitern Sie in Dokument-Workflows für Zahlen, die über mehrere Zeilen umgebrochen werden, das Muster, um Zeilenumbruchzeichen als optionale Trennzeichen zwischen Zifferngruppen zuzulassen. Verwenden Sie für in längere Zeichenfolgen eingebettete Zahlen Wortgrenzenzusicherungen im regulären Ausdruck, um sicherzustellen, dass die übereinstimmenden Ziffern eine eigenständige Zahl und nicht Teil eines größeren Bezeichners sind. Trotz dieser Verbesserungen entgeht immer ein kleiner Prozentsatz sensibler Daten der automatischen Erkennung und erfordert eine manuelle Identifizierung.
Dokumentieren Sie Ihre Ergebnisse während der manuellen Überprüfung, um die zukünftige Mustergenauigkeit zu verbessern. Wenn ein bestimmtes, nicht standardmäßiges Format in mehreren Dokumenten derselben Quelle auftritt, entwickeln Sie ein Muster, das speziell darauf abzielt. Mit aufeinanderfolgenden Redaktionsprojekten wird die Musterbibliothek umfassender und der Aufwand für die manuelle Überprüfung nimmt ab.
| Muster | Treffer | Am besten für |
|---|---|---|
| \d{4}[- ]?\d{4}[- ]?\d{4}[- ]?\d{4} | 16-stellige Karte mit optionalen Trennzeichen | Visa, Mastercard, Discover |
| \d{3}-\d{2}-\d{4} | US-amerikanisches Sozialversicherungsnummernformat | SSN-Schwärzung in Steuerdokumenten |
| [A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Za-z]{2,} | E-Mail-Adressen | Entfernung von Kontaktinformationen |
Aufbau einer wiederverwendbaren Schwärzungsmusterbibliothek
Organisationen, die regelmäßig Dokumente für FOIA-Antworten, Gerichtsakten oder die Veröffentlichung öffentlicher Unterlagen redigieren, sollten in den Aufbau einer wiederverwendbaren Musterbibliothek investieren. Testen Sie jedes Muster anhand repräsentativer Dokumentbeispiele, bevor Sie es der Bibliothek hinzufügen. Dokumentieren Sie, welche Muster für welche Dokumenttypen funktionieren. Geben Sie die Bibliothek im gesamten Team frei, damit jedes Mitglied einheitliche Redaktionsstandards anwendet.
Aus praktischer Sicht sollte die Musterbibliothek in der Praxis nicht nur die Regex-Ausdrücke, sondern auch Hinweise dazu enthalten, wann jedes Muster angewendet werden sollte und wann nicht. Ein Muster für US-Sozialversicherungsnummern sollte nicht auf Dokumente aus nicht-amerikanischen Quellen angewendet werden. Ein Muster für 16-stellige Kreditkartennummern sollte das Risiko falsch positiver Ergebnisse bei Kontonummern berücksichtigen. Eine klare Anwendungsanleitung verhindert den Missbrauch von Mustern in Kontexten, für deren Verwendung sie nicht vorgesehen sind.
Überprüfen und aktualisieren Sie die Musterbibliothek mindestens einmal jährlich. Zahlungskartenformate entwickeln sich weiter. Durch die Regulierung entstehen neue Arten sensibler Daten. Alte Muster können zu falsch positiven Problemen führen, wenn sich Dokumentformate ändern. Eine gepflegte Musterbibliothek ist ein lebendiges organisatorisches Gut, das sich mit jeder Nutzung verbessert.
Durch die musterbasierte Schwärzung wird die mühsame und riskante Aufgabe, jede einzelne Instanz sensibler Daten manuell zu finden und zu schwärzen, in einen automatisierten Prozess mit menschlicher Überprüfung umgewandelt. Das Muster findet die Übereinstimmungen. Der Mensch bestätigt sie. Zusammen erzeugen sie eine Redaktionsqualität, die keiner von beiden allein erreichen könnte.
Archivieren von Schwärzungsdatensätzen für Compliance-Audits
Archivieren Sie nach Abschluss eines sensiblen Schwärzungsprojekts die verwendeten Muster, die Anzahl der gefundenen und geschwärzten Übereinstimmungen sowie die Identität des Prüfers, der die Ausgabe überprüft hat. Diese Dokumentation dient als Prüfprotokoll und zeigt, dass ein systematischer Schwärzungsprozess befolgt wurde. Im Falle einer Untersuchung einer Datenschutzverletzung oder eines Compliance-Audits liefern die Redaktionsaufzeichnungen den Nachweis der gebotenen Sorgfalt.
Allgemein betrachtet sollte der Prüfdatensatz in der Praxis den ursprünglichen Dateinamen, das Datum der Schwärzung, die spezifischen angewendeten Muster, die Gesamtzahl der pro Muster gefundenen Übereinstimmungen und den Namen der Person enthalten, die die geschwärzte Ausgabe überprüft und genehmigt hat. Das Ausfüllen einer einfachen Textdatei oder einer Tabellenvorlage, die am Ende jedes Schwärzungsprojekts ausgefüllt wird, dauert nur wenige Minuten und sorgt für einen dauerhaften Compliance-Wert.
Für Organisationen, die Vorschriften wie PCI-DSS, HIPAA oder DSGVO unterliegen, die bestimmte Datenschutzmaßnahmen vorschreiben, unterstützen dokumentierte Schwärzungsverfahren den Compliance-Nachweis. Die Verfahren zeigen, dass die Organisation über einen definierten, wiederholbaren Prozess zum Entfernen sensibler Daten aus Dokumenten verfügt, bevor diese die kontrollierte Umgebung verlassen.
Versuchen Sie es mit Redact PDF
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
