Ein 300-seitiges Dokument zur rechtlichen Offenlegung enthält verstreut Telefonnummern, E-Mail-Adressen und Sozialversicherungsnummern. Das manuelle Auffinden und Redigieren jedes einzelnen Eintrags würde Tage dauern und trotzdem das Risiko eingehen, einige zu übersehen. Die musterbasierte automatische Schwärzung durchsucht das gesamte Dokument nach Text, der mit bestimmten Formaten, Telefonnummern, E-Mail-Adressen und Kreditkartennummern übereinstimmt, und wendet die Schwärzung auf jede Übereinstimmung in einem einzigen Vorgang an. Die Frage ist nicht, ob dies möglich ist, sondern wie genau es ist und welche Aufsicht es erfordert.
Musterbasierte PDF-Redaktion verwendet reguläre Ausdrücke, um Text zu identifizieren, der vordefinierten oder benutzerdefinierten Mustern entspricht. Ein Telefonnummernmuster entspricht Sequenzen wie (555) 123-4567 oder 555-123-4567. Ein E-Mail-Muster entspricht Sequenzen wie name@domain.com. Ein Sozialversicherungsnummernmuster entspricht ###-##-####. Das Tool scannt die PDF-Textebene, findet alle Übereinstimmungen und redigiert sie gleichzeitig.

So funktioniert die musterbasierte Schwärzung
Das Schwärzungstool extrahiert zunächst den Text aus dem PDF-Inhaltsstrom und sucht nach den angegebenen Mustern. Wenn eine Übereinstimmung gefunden wird, zeichnet das Tool die Seitenzahl und die Koordinaten des übereinstimmenden Textes auf dieser Seite auf. Nachdem die Suche auf allen Seiten abgeschlossen ist, wendet das Tool Schwärzungsmarkierungen an jeder aufgezeichneten Stelle an, deckt den Text ab und entfernt ihn aus der Textebene.
Die Genauigkeit der musterbasierten Schwärzung hängt von zwei Faktoren ab: der Präzision des Musters und der Qualität der PDF-Textebene. Ein präzises Muster erfasst den beabsichtigten Text und vermeidet gleichzeitig falsche Übereinstimmungen. Ein Telefonnummernmuster muss zwischen tatsächlichen Telefonnummern und anderen Ziffernfolgen unterscheiden, die zufällig die gleiche Länge haben, wie z. B. Rechnungsnummern, Datumsbereiche oder Teilenummern.
Der Mustervergleich findet heraus, was das menschliche Auge Stunden brauchen würde, um es zu finden.
Die Qualität der Textebene bestimmt, ob das Muster den Text überhaupt finden kann. Wenn die PDF-Datei aus einem gescannten Dokument mit OCR erstellt wurde, hat die OCR möglicherweise einige Zeichen falsch erkannt. Eine Telefonnummer, bei der die Ziffer „5“ fälschlicherweise als „S“ erkannt wurde, stimmt nicht mit dem Telefonnummernmuster überein. Das Schwärzungstool kann nicht schwärzen, was es nicht findet, und OCR-Fehler führen zu Lücken bei der Mustererkennung.
Versuchen Sie es mit Redact PDF
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Gemeinsame Muster und ihre Fallstricke
Sozialversicherungsnummern sind das am häufigsten geschwärzte Muster und führen am wahrscheinlichsten zu falschen Übereinstimmungen. Eine neunstellige Folge mit Bindestrichen an den richtigen Stellen könnte eine Sozialversicherungsnummer sein, es könnte sich aber auch um einen Produktcode, eine Dokumenten-ID oder einen Datumsbereich in einem ungewöhnlichen Format handeln. Die musterbasierte Schwärzung versteht den Kontext nicht. Es entspricht dem Muster, nicht der Bedeutung.
E-Mail-Adressen lassen sich leichter genau zuordnen, da das @-Symbol eindeutig ist und selten außerhalb von E-Mail-Adressen erscheint. E-Mail-Adressen, die in PDFs als Mailto-Links und nicht als sichtbarer Text eingebettet sind, werden jedoch möglicherweise nicht von einer textbasierten Mustersuche gefunden. Das Schwärzungstool durchsucht die sichtbare Textebene, nicht die zugrunde liegenden Linkanmerkungen.
Kreditkartennummern folgen einem bestimmten Format, 16 Ziffern, manchmal in Vierergruppen gruppiert, das die Luhn-Algorithmusprüfung besteht. Musterbasierte Schwärzungstools, die die Luhn-Validierung umfassen, verringern die Zahl falscher Übereinstimmungen erheblich, da zufällige 16-stellige Sequenzen die Prüfung selten bestehen. Wenn Ihr Schwärzungstool keine Luhn-Validierung umfasst, überprüfen Sie manuell die Übereinstimmungen mit der Kreditkarte, bevor Sie die Schwärzung anwenden.
Mit benutzerdefinierten Mustern können Sie organisationsspezifische Informationen schwärzen. Als benutzerdefinierter regulärer Ausdruck können ein Mitarbeiter-ID-Format, ein Kundenkontonummernmuster oder ein interner Projektcode definiert werden. Der PDF-Sicherheit Vorteil von benutzerdefinierten Mustern besteht darin, dass sie auf Informationen abzielen, die generische Muster übersehen würden, wodurch die Schwärzung umfassender wird.
Überprüfen von Musterübereinstimmungen vor dem Anwenden der Schwärzung
Wenden Sie niemals eine musterbasierte Schwärzung an, ohne vorher die Übereinstimmungen zu überprüfen. Im Überprüfungsschritt können Sie falsche Übereinstimmungen abwählen und verpasste Übereinstimmungen manuell hinzufügen. Ein Muster, das 500 Übereinstimmungen hervorbringt, könnte 480 richtige Übereinstimmungen und 20 falsche Übereinstimmungen haben. Die 20 falschen Übereinstimmungen würden, wenn sie angewendet würden, den Text, der sichtbar bleiben sollte, fälschlicherweise schwärzen. Der Überprüfungsschritt verhindert dies.
Die meisten Schwärzungstools zeigen Übereinstimmungen als hervorgehobenen Text in einem Überprüfungsbereich an. Scrollen Sie durch die Trefferliste und überprüfen Sie jeden Treffer anhand seines Kontexts auf der Seite. Deaktivieren Sie Übereinstimmungen, die eindeutig nicht das beabsichtigte Ziel sind. Diese manuelle Überprüfung ist schneller als die manuelle Suche nach jeder Instanz, da das Tool die Suche übernommen hat, ist aber dennoch für die Genauigkeit unerlässlich.
Nachdem Sie die Schwärzung angewendet und das Dokument gespeichert haben, überprüfen Sie die Schwärzung, indem Sie die PDF-Datei in einfachen Text konvertieren und in der Textausgabe nach den geschwärzten Mustern suchen. Wenn eines der Muster in der Textdatei erscheint, war die Schwärzung nicht abgeschlossen. Diese Überprüfung nach der Schwärzung erfasst Musterübereinstimmungen, die sich in der Textebene befanden, aber nicht erfolgreich geschwärzt wurden.
Einschränkungen der musterbasierten Schwärzung
Die musterbasierte Schwärzung funktioniert nur bei textbasierten PDFs, bei denen der Text als Zeichen gespeichert ist. Gescannte PDFs, die nicht OCR-verarbeitet wurden, speichern Text als Bilder und enthalten keine Zeichendaten, die der Mustervergleicher durchsuchen könnte. Führen Sie OCR für gescannte PDFs aus, bevor Sie eine musterbasierte Schwärzung versuchen. Bedenken Sie, dass OCR-Fehler dazu führen, dass einige Musterübereinstimmungen übersehen werden.
Text, der als Vektorkontur statt als Zeichencode gespeichert ist, wie etwa Text, der in Designsoftware in Pfade umgewandelt wurde, ist für die musterbasierte Schwärzung unsichtbar. Der Text sieht aus wie Text auf der Seite, aber die PDF-Datei enthält Zeichenanweisungen für jede Zeichenform, nicht die Zeichencodes. Die musterbasierte Schwärzung kann in diesem Format gespeicherten Text nicht finden.
PDF-Datenschutz-Bestimmungen verlangen von Organisationen zunehmend den Nachweis, dass die Schwärzung korrekt durchgeführt wurde. Ein musterbasierter Schwärzungsbericht, der dokumentiert, welche Muster durchsucht wurden, wie viele Übereinstimmungen gefunden wurden, wie viele angewendet wurden und wie viele manuell überschrieben wurden, liefert den Nachweis der gebotenen Sorgfalt im Schwärzungsprozess.
WukongPDF stellt Schwärzungstools über den Browser bereit, mit denen PDFs lokal verarbeitet werden können. Die musterbasierte Schwärzung durchsucht die Textebene des Dokuments nach passenden Mustern und wendet Schwärzungsmarkierungen an. Durch den browserbasierten Ansatz bleiben Ihre Dokumentdaten während des Schwärzungsprozesses auf Ihrem Gerät.
Bei Mustern, bei denen nur ein Teil des übereinstimmenden Textes ausgeblendet werden soll, ist manchmal eine teilweise Schwärzung erforderlich. Eine Telefonnummer, bei der nur die letzten vier Ziffern sichtbar sein sollen, oder eine E-Mail-Adresse, bei der die Domain sichtbar bleiben soll. Mit musterbasierten Schwärzungstools, die Erfassungsgruppen unterstützen, können Sie definieren, welche Teile des übereinstimmenden Musters geschwärzt und welche sichtbar bleiben sollen.
Durchsuchen Sie das Dokument nach der Anwendung der musterbasierten Schwärzung nach Fragmenten der geschwärzten Informationen. Eine E-Mail-Adresse, die als j***@domain.com redigiert wurde, ist möglicherweise immer noch identifizierbar, wenn die Domain eindeutig ist. Für maximale Privatsphäre schwärzen Sie das gesamte übereinstimmende Muster, anstatt eine teilweise Schwärzung zu versuchen.
Bei Dokumenten, die sowohl textbasierte als auch bildbasierte Instanzen desselben Musters enthalten, z. B. eine PDF-Datei mit sowohl getippten als auch gescannten Seiten, werden die textbasierten Instanzen von der musterbasierten Schwärzung behandelt, während die bildbasierte Schwärzung separat auf die gescannten Seiten angewendet werden muss.
Die musterbasierte Schwärzung ist ein Bestandteil einer umfassenden Strategie zur Dokumentenbereinigung. Zu den weiteren Komponenten gehören das Entfernen von Metadaten, das Löschen versteckter Inhalte sowie das Entfernen von Kommentaren und Anmerkungen. Bei einem Dokument, dessen Muster gründlich geschwärzt wurden, das jedoch immer noch den Namen des Autors und die Organisation in den Metadaten enthält, können dennoch vertrauliche Informationen verloren gehen.
Bei Legal-Discovery-Dokumenten muss die musterbasierte Schwärzung mit einer manuellen Überprüfung kombiniert werden. Ein Muster kann Telefonnummern finden, aber keinen Verweis auf ein Telefongespräch finden, in dem die Telefonnummer nicht enthalten war. Durch die manuelle Überprüfung werden kontextbezogene Referenzen erfasst, die beim Mustervergleich übersehen werden.
Organisationsübergreifend genutzte Musterbibliotheken können die Schwärzungskonsistenz verbessern. Eine Anwaltskanzlei, die Hunderte von Offenlegungsdokumenten bearbeitet, entwickelt eine Bibliothek getesteter Muster für gängige sensible Datentypen. Durch die unternehmensweite gemeinsame Nutzung dieser Bibliothek wird sichergestellt, dass jedes Dokument nach den gleichen Mustern redigiert wird.
Es ist wichtig, neue Muster an einem Beispieldokument zu testen, bevor sie auf das gesamte Dokument angewendet werden. Ein Muster, das beim Testen einwandfrei funktioniert, kann aufgrund von Formatierungsabweichungen, OCR-Artefakten oder ungewöhnlichen Datenformaten zu unerwarteten Übereinstimmungen im tatsächlichen Dokument führen.
Der Schwärzungsprüfpfad sollte zusammen mit dem geschwärzten Dokument aufbewahrt werden. Der Prüfpfad dokumentiert, welche Muster verwendet wurden, wie viele Übereinstimmungen jedes Muster gefunden hat und ob Übereinstimmungen manuell überschrieben wurden. Diese Dokumentation unterstützt die Qualitätssicherung und die Einhaltung gesetzlicher Vorschriften.
Reguläre Ausdrücke für den Mustervergleich können außerhalb des PDF-Tools getestet werden, bevor die Schwärzung ausgeführt wird. Mit Online-Regex-Testern können Sie Beispieltext eingeben und sehen, welche Muster übereinstimmen. Testen Sie Ihre Telefonnummern-, E-Mail- und SSN-Muster anhand repräsentativer Muster des Dokumenttexts, um sicherzustellen, dass sie die beabsichtigten Ziele erreichen.
Die Zeitersparnis durch die musterbasierte Schwärzung im Vergleich zur manuellen Schwärzung ist erheblich. Ein musterbasiertes Tool benötigt weniger als eine Minute, um ein Dokument mit 500 Instanzen sensibler Muster zu finden und zu schwärzen. Die manuelle Schwärzung desselben Dokuments würde Stunden dauern.
Speichern Sie den Mustersatz als Voreinstellung für Dokumente, die nach einem wiederkehrenden Zeitplan geschwärzt werden, z. B. monatliche Berichte, die immer die gleichen Arten vertraulicher Daten enthalten. Durch die Anwendung der Voreinstellung auf jeden neuen Bericht wird eine konsistente Schwärzung gewährleistet, ohne dass die Muster jedes Mal neu konfiguriert werden müssen.
Die Schulung des Personals in geeigneten Redaktionstechniken ist ebenso wichtig wie die Bereitstellung der richtigen Werkzeuge. Ein musterbasiertes Schwärzungstool kann in ungeübten Händen ein falsches Sicherheitsgefühl hervorrufen. Die Mitarbeiter sollten verstehen, was das Tool kann und was nicht, wie wichtig die Überprüfung von Übereinstimmungen ist und welche Schritte zur Überprüfung nach der Schwärzung erforderlich sind.
Für Organisationen, die DSGVO, HIPAA oder ähnlichen Datenschutzbestimmungen unterliegen, sollte die musterbasierte Schwärzung Teil eines dokumentierten Datenschutzprozesses sein. Der Prozess sollte festlegen, nach welchen Mustern gesucht werden soll, wer die Übereinstimmungen überprüft und wie die Schwärzung überprüft wird, bevor das Dokument freigegeben wird.
| Muster | Regex-Beispiel | False-Match-Risiko | Verifizierungstipp |
|---|---|---|---|
| Telefon (USA) | \(\d{3}\) \d{3}-\d{4} | Medium: stimmt mit Rechnungsnummern überein | Kontext prüfen; Deaktivieren Sie Nicht-Telefon-Übereinstimmungen |
| \S+@\S+\.\S+ | Niedrig: @ ist unverwechselbar | Stellen Sie sicher, dass es sich bei der Domäne um eine echte E-Mail-Domäne handelt | |
| SSN | \d{3}-\d{2}-\d{4} | Hoch: stimmt mit Produktcodes überein | Manuelle Überprüfung ist für SSN-Muster unerlässlich |
| Kreditkarte | \d{4}-\d{4}-\d{4}-\d{4} | Niedrig mit Luhn-Karo | Aktivieren Sie die Luhn-Validierung, falls verfügbar |
Versuchen Sie es mit Redact PDF
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
