300 ページにわたる法的証拠開示文書には、電話番号、電子メール アドレス、社会保障番号がページ全体に散りばめられています。それぞれを手動で見つけて編集するには数日かかり、依然として一部を見逃す危険性があります。パターンベースの自動墨消しは、ドキュメント全体で特定の形式、電話番号、電子メール アドレス、クレジット カード番号に一致するテキストを検索し、1 回の操作ですべての一致に墨消しを適用します。問題は、これが可能かどうかではなく、それがどれほど正確であるか、そしてどのような監視が必要かということです。
パターンベースの PDF Redaction では、正規表現を使用して、事前定義されたパターンまたはカスタム パターンに一致するテキストを識別します。電話番号パターンは、(555) 123-4567 や 555-123-4567 のようなシーケンスと一致します。電子メールのパターンは、name@domain.com のようなシーケンスと一致します。社会保障番号パターンは ###-##-#### と一致します。このツールは PDF テキスト レイヤーをスキャンし、一致するものをすべて見つけて、同時に編集します。

パターンベースのリダクションの仕組み
墨消しツールは、まず PDF コンテンツ ストリームからテキストを抽出し、指定されたパターンを検索します。一致するものが見つかると、ツールはページ番号とそのページ上の一致するテキストの座標を記録します。すべてのページで検索が完了すると、ツールは記録されたすべての場所に墨消しマークを適用し、テキストを覆い、テキスト レイヤーから削除します。
パターンベースの墨消しの精度は、パターンの精度と PDF テキスト レイヤーの品質という 2 つの要素によって決まります。正確なパターンは、誤った一致を回避しながら、意図したテキストを捕捉します。電話番号パターンでは、実際の電話番号と、請求書番号、日付範囲、部品番号など、たまたま同じ長さを持つ他の一連の数字を区別する必要があります。
パターン マッチングは、人間の目では見つけるのに何時間もかかるものを見つけます。
テキスト レイヤーの品質によって、パターンがテキストを検出できるかどうかが決まります。 OCR を使用してスキャンしたドキュメントから PDF を作成した場合、OCR が一部の文字を誤認識した可能性があります。数字の「5」が「S」と誤認識された電話番号は、電話番号パターンと一致しません。墨消しツールは、検出できないものを墨消しすることはできず、OCR エラーによりパターン検出にギャップが生じます。
PDF を墨消ししてみる
インストールは必要ありません。ブラウザで直接動作します。
よくあるパターンとその落とし穴
社会保障番号は最も一般的に編集されるパターンであり、誤った一致が生成される可能性が最も高くなります。適切な位置にハイフンが入った 9 桁のシーケンスは社会保障番号である可能性がありますが、製品コード、文書 ID、または通常とは異なる形式で書かれた日付範囲である可能性もあります。パターンベースの編集ではコンテキストを理解できません。意味ではなく、パターンと一致します。
@ 記号は特徴的であり、電子メール アドレス以外にはほとんど表示されないため、電子メール アドレスを正確に照合するのが容易です。ただし、表示テキストではなく mailto リンクとして PDF に埋め込まれた電子メール アドレスは、テキスト ベースのパターン検索では一致しない場合があります。墨消しツールは、基になるリンクの注釈ではなく、表示されているテキスト レイヤーを検索します。
クレジット カード番号は、Luhn アルゴリズム チェックに合格する特定の形式 (16 桁、場合によっては 4 桁にグループ化される) に従っています。 Luhn 検証を含むパターンベースの編集ツールは、ランダムな 16 桁のシーケンスがチェックに合格することはほとんどないため、誤った一致を大幅に削減します。編集ツールに Luhn 検証が含まれていない場合は、編集を適用する前にクレジット カードの一致を手動で確認してください。
カスタム パターンを使用すると、組織固有の情報を編集できます。従業員 ID 形式、顧客アカウント番号パターン、または内部プロジェクト コードをカスタム正規表現として定義できます。カスタム パターンの PDF セキュリティ の利点は、汎用パターンでは見逃してしまう情報をターゲットにし、編集がより包括的になることです。
リダクションを適用する前にパターン一致を確認する
最初に一致を確認せずに、パターンベースの編集を決して適用しないでください。レビュー手順では、誤った一致の選択を解除し、見逃した一致を手動で追加できます。 500 個の一致が生成されるパターンには、480 個の正しい一致と 20 個の誤った一致が含まれる可能性があります。 20 個の誤一致が適用されると、表示されたままにする必要があるテキストが誤って編集されてしまいます。レビューステップはこれを防ぎます。
ほとんどの編集ツールでは、一致した内容がレビュー パネルに強調表示されたテキストとして表示されます。一致リストをスクロールし、ページ上のコンテキストと照らし合わせてそれぞれを確認します。明らかに意図したターゲットではない一致の選択を解除します。この手動レビューは、ツールによって検索が行われるため、各インスタンスを手動で検索するよりも高速ですが、精度を保つためには依然として不可欠です。
墨消しを適用してドキュメントを保存した後、PDF をプレーン テキストに変換し、テキスト出力で墨消しされたパターンを検索して墨消しを確認します。いずれかのパターンがテキスト ファイルに表示される場合は、編集が完了していません。この編集後の検証では、テキスト レイヤー内にあったものの、正常に編集されなかったパターンの一致が検出されます。
パターンベースのリダクションの制限
パターンベースの墨消しは、テキストが文字として保存されているテキストベースの PDF でのみ機能します。 OCR 処理されていないスキャンされた PDF はテキストを画像として保存し、パターン マッチャーで検索するための文字データを含みません。 OCR エラーにより一部のパターン一致が失われることを理解した上で、パターンベースの編集を試みる前に、スキャンした PDF で OCR を実行してください。
デザイン ソフトウェアでパスに変換されたテキストなど、文字コードではなくベクトル アウトラインとして保存されているテキストは、パターン ベースの墨消しでは表示されません。ページ上のテキストはテキストのように見えますが、PDF には文字コードではなく、文字の形状ごとの描画手順が含まれています。パターンベースの墨消しでは、この形式で保存されたテキストが見つかりません。
PDF プライバシー の規制により、組織は編集が正しく実行されたことを証明することがますます求められています。どのパターンが検索されたか、見つかった一致の数、適用されたパターンの数、および手動で上書きされたパターンの数を文書化したパターンベースの秘匿化レポートは、秘匿化プロセスにおけるデューデリジェンスの証拠となります。
WukongPDF は、PDF をローカルで処理できるブラウザを介した編集ツールを提供します。パターンベースの墨消しは、ドキュメントのテキストレイヤーで一致するパターンを検索し、墨消しマークを適用します。ブラウザベースのアプローチでは、編集プロセス中、ドキュメント データがデバイス上に保持されます。
一致したテキストの一部のみを非表示にする必要があるパターンでは、部分的な墨消しが必要になる場合があります。電話番号の下 4 桁のみを表示するか、電子メール アドレスでドメインを表示したままにする必要があります。キャプチャ グループをサポートするパターンベースの秘匿化ツールを使用すると、一致したパターンのどの部分を秘匿化し、どの部分を表示したままにするかを定義できます。
パターンベースの編集を適用した後、文書内で編集された情報の断片を検索します。 j***@domain.com として編集された電子メール アドレスは、ドメインが一意であれば引き続き識別できる可能性があります。プライバシーを最大限に高めるには、部分的な編集を試みるのではなく、一致したパターン全体を編集してください。
入力されたページとスキャンされたページの両方を含む PDF など、同じパターンのテキスト ベースとイメージ ベースの両方のインスタンスを含むドキュメントでは、パターン ベースの墨消しはテキスト ベースのインスタンスを処理しますが、イメージ ベースの墨消しはスキャンされたページに個別に適用する必要があります。
パターンベースの編集は、包括的なドキュメントの無害化戦略の 1 つのコンポーネントです。その他のコンポーネントには、メタデータの削除、非表示のコンテンツの削除、コメントと注釈の削除などがあります。完全にパターン編集されていても、メタデータに作成者名と組織が含まれているドキュメントでも、機密情報が漏洩する可能性があります。
法的証拠開示文書の場合は、パターンベースの編集と手動レビューを組み合わせる必要があります。パターンは電話番号を見つけることはできますが、電話番号が含まれていない電話での会話への参照を見つけることはできません。手動レビューにより、パターン マッチングが見逃す文脈上の参照が見つかります。
組織間で共有されるパターン ライブラリにより、リダクションの一貫性が向上します。数百件の証拠開示文書を扱う法律事務所は、一般的な機密データの種類についてテストされたパターンのライブラリを開発しました。このライブラリを会社全体で共有すると、すべての文書が同じパターンで編集されることが保証されます。
新しいパターンを完全なドキュメントに適用する前に、サンプル ドキュメントでテストすることが重要です。テストでは完全に機能するパターンでも、実際のドキュメントでは、書式設定の変化、OCR アーティファクト、または異常なデータ形式により、予期しない一致が生じる可能性があります。
編集監査証跡は、編集された文書と一緒に保存する必要があります。監査証跡には、どのパターンが使用されたか、各パターンで見つかった一致の数、および一致が手動で上書きされたかどうかが記録されます。このドキュメントは、品質保証と規制遵守をサポートします。
パターン マッチングの正規表現は、墨消しを実行する前に PDF ツールの外部でテストできます。オンライン正規表現テスターを使用すると、サンプル テキストを入力して、どのパターンが一致するかを確認できます。電話番号、電子メール、SSN パターンをドキュメント テキストの代表的なサンプルに対してテストし、意図したターゲットを捕捉していることを確認します。
パターンベースのリダクションにより、手動リダクションと比較して大幅に時間が節約されます。機密パターンのインスタンスが 500 件含まれる文書の場合、パターンベースのツールを使用すると、1 分以内に検索して編集できます。同じ文書を手動で編集するには何時間もかかります。
常に同じ種類の機密データが含まれる月次レポートなど、定期的なスケジュールで編集されるドキュメントの場合は、パターン セットをプリセットとして保存します。新しいレポートごとにプリセットを適用すると、毎回パターンを再構成しなくても、一貫した編集が保証されます。
適切な編集技術についてスタッフをトレーニングすることは、適切なツールを使用することと同じくらい重要です。パターンベースの編集ツールを訓練を受けていない人が使用すると、誤った安心感を与える可能性があります。スタッフは、ツールでできることとできないこと、一致をレビューする重要性、編集後の検証手順を理解する必要があります。
GDPR、HIPAA、または同様のプライバシー規制の対象となる組織の場合、パターンベースの編集は文書化されたデータ保護プロセスの一部である必要があります。このプロセスでは、どのパターンを検索するか、誰が一致をレビューするか、文書の公開前に編集をどのように検証するかを指定する必要があります。
| パターン | 正規表現の例 | 誤一致リスク | 検証のヒント |
|---|---|---|---|
| 電話(米国) | \(\d{3}\) \d{3}-\d{4} | 中: 請求書番号と一致します | コンテキストを確認してください。電話番号以外の一致の選択を解除します |
| 電子メール | \S+@\S+\.\S+ | Low: @ が特徴的 | ドメインが実際の電子メール ドメインであることを確認する |
| SSN | \d{3}-\d{2}-\d{4} | 高: 製品コードと一致します。 | SSN パターンには手動レビューが不可欠 |
| クレジットカード | \d{4}-\d{4}-\d{4}-\d{4} | ルーンチェックで低い | 可能な場合は Luhn 検証を有効にする |
PDF を墨消ししてみる
インストールは必要ありません。ブラウザで直接動作します。
