PDF エディターの墨消しツールを使用して、PDF から社会保障番号を墨消しします。ブラック ボックスが表示されるので、ファイルを保存して送信します。受信者は編集のために PDF を Word に変換すると、編集がまったく行われていないかのように、変換された文書に社会保障番号が完全に表示されることがわかります。これはバグではありません。これは、ドキュメントがフォーマット変換される際のほとんどの編集ツールの予期される動作であり、実際のデータ侵害を引き起こしています。
2024 年、英国情報コミッショナー局は、不適切な PDF 編集が政府文書に関するデータ侵害の 3 番目に多い原因であると報告しました (ICO、「データ セキュリティ インシデントの傾向」、2024 年)。最も一般的な根本原因は、秘匿化の失敗ではなく、秘匿化が下流で行われる可能性のあるフォーマット変換を含むドキュメントのライフサイクル全体にわたって存続することを検証できなかったことです。

データレベルで適切な PDF 墨消しがどのように機能するか
適切な PDF 編集 は、テキスト上にブラック ボックスを描画することとは根本的に異なります。実際の墨消しツールを使用すると、2 つのことが起こります。表示されているテキストが黒い四角形で覆われ、その下にあるテキスト コンテンツが PDF のテキスト レイヤーから削除されます。文字自体はファイルのデータ ストリームから削除されます。リーダー アプリケーションでは、ブラック ボックスの下には何も表示されないため、ブラック ボックスの下には何も表示されません。
注釈ツールを使用してテキスト上に黒い四角形を描画し、それを編集済みと呼ぶと、セキュリティ専門家が表面的な編集と呼ぶものを実行したことになります。テキストは PDF のデータ層にまだ存在しており、完全に無傷で抽出可能です。誰でもテキストを選択し、コピーして別の場所に貼り付け、ブラック ボックスの下にあるすべての単語を読むことができます。 PDF を他の形式に変換すると、変換ツールは視覚的なオーバーレイではなく、基になるテキストを読み取ります。そもそも編集は現実ではなかったので、編集は消えます。
実際の編集と表面的な編集の区別は非常に重要であるため、政府機関や法律事務所は現在、機密文書を扱うスタッフの必須トレーニングにそれを組み込んでいます。裁判所への提出、FOIA 対応、または規制当局への提出が 1 回不適切に編集されると、個人データが大規模に公開される可能性があり、適切な編集ツールを使用するために必要な追加の数秒をはるかに上回る評判や法的影響が生じます。
特に危険なシナリオは、文書が複数の人の手を通過する場合に発生します。ユーザー A は適切な編集を適用し、ユーザー B はファイルを開いてブラック ボックスを確認し、編集が完了したものとみなしてファイルを転送します。しかし、人 A が気づかずに表面編集ツールを使用した場合、人 B のブラック ボックスに対する信頼は見当違いになります。この信頼連鎖の問題があるため、組織は検証済みの単一の編集ツールを標準化し、それを正しく使用できるようにすべてのスタッフをトレーニングする必要があります。
表面編集の特に危険な変種は、ホワイトボックス編集です。白地に白があるとテキストが見えなくなると考えて、テキストの上に白い四角形を描画するユーザーもいます。これは、テキストを選択するか文書を変換すると、その下のテキストが表示され、視覚的な色に関係なくスクリーン リーダー ソフトウェアがそれを読み上げてしまうため、失敗します。ホワイトボックス編集はまったく編集しません。
PDF を墨消ししてみる
インストールは必要ありません。ブラウザで直接動作します。
フォーマット変換中に墨消しはどうなるか
形式変換では、ソース PDF を読み取り、その内容を別の形式で書き込むことによって、新しいドキュメントを作成します。変換ツールは PDF 構造を解析し、テキスト、画像、レイアウト情報を抽出します。 PDF 形式 変換の場合、重要な問題は、変換ツールが編集された領域でどのようなテキスト コンテンツを検出するかです。
編集が本物であり、テキストが PDF のコンテンツ ストリームから削除されている場合、変換ツールはそれらの領域で何も検出せず、何も書き込みません。出力ドキュメントには、編集された部分にテキストがありません。編集が表面的なもの、つまり下にテキストがまだ存在するブラック ボックスのオーバーレイである場合、変換ツールはテキストを見つけて出力ドキュメントに律儀に書き込みます。ブラック ボックスはデータ要素ではなく視覚要素であり、ほとんどの変換ツールはテキスト コンテンツを抽出するときに視覚オーバーレイを無視します。
WukongPDF は、視覚レベルだけでなくデータ レベルでコンテンツを削除する編集ツールを提供します。ドキュメントのテキスト ストリームに対して動作する、適切に実装されたPDF Security ツールを通じて墨消しを適用すると、ファイル内にデータが存在しなくなるため、削除された情報は形式変換によって再現できません。
PDF から Word へのコンバータの中には、特にコメント ボックス、ハイライト、描画された形状などの注釈を保持しようとするものがあります。外観の編集が注釈として適用された場合、コンバータは黒い四角形を Word の図形として忠実に再現する可能性があります。ただし、下にあるテキストは削除されていないため、Word 文書には黒い四角形とその下のテキストの両方が表示され、選択、コピーが可能で、四角形を移動または削除する人には完全に表示されます。
編集されたコンテンツが漏洩する可能性がある経路は形式変換だけではありません。表面を編集した PDF 内のすべてのテキストを選択し、テキスト エディターに貼り付けるだけで、編集されたコンテンツが表示されます。検索機能を使用して編集された用語を PDF 内で検索すると、視覚的に覆われている場合でもその用語が見つかります。スクリーン リーダーとアクセシビリティ ツールは、基礎となるテキスト レイヤーを読み取ります。これらの代替抽出パスはすべて、外観上の編集が依存する視覚的なオーバーレイをバイパスします。
OCR ベースの墨消しとテキストの再表示の問題
スキャンされた PDF では、編集がさらに複雑になります。スキャンされたドキュメントは基本的には紙の写真です。テキストは文字としてではなく、画像内のピクセルとして保存されます。テキスト レイヤーで動作する標準の墨消しツールは画像からテキストを削除できないため、代わりに画像上にブラック ボックスを描画します。これは、選択によるものではなく、必要に応じて表面的に編集したものです。
スキャンした PDF を適切に編集するには、実際の画像データを変更して、編集された領域のピクセル値を黒一色に置き換えるツールが必要です。画像を変更した後、ドキュメントに対して OCR を実行して、編集されていないコンテンツのみのテキスト レイヤーを作成します。編集する前に OCR を実行すると、編集されたコンテンツの OCR テキストがテキスト レイヤー内に存在し、任意の形式変換ツールで抽出されます。
スキャンした PDF の墨消しでよくある間違いは、最初に OCR を行って文書を検索可能にし、次に墨消しマークを適用してから再保存することです。このシーケンスにより、OCR で生成されたテキスト レイヤーが墨消しマークの下にそのまま残されます。その後の変換またはテキスト抽出では、編集されたテキストが OCR レイヤーから復元されます。正しい順序は、最初に画像のピクセルを編集し、次にクリーニングされた画像を OCR します。この順序により、テキスト レイヤーに編集されたコンテンツが含まれないことが保証されます。
リダクションが変換後に存続することを確認する方法
編集が永続的であることを確認する唯一の方法は、テストすることです。 PDF を編集した後、それをプレーン テキスト ファイルに変換し、編集されたコンテンツを検索します。テキスト ファイルに編集されたデータが含まれている場合、編集は有効ではありません。より迅速な検証は、編集後に PDF 内のすべてのテキストを選択し、テキスト エディターに貼り付けることです。貼り付けバッファーに編集されたテキストが含まれている場合、編集は表面的なものでした。
スキャンされた PDF の場合、ページを PNG などの画像形式に変換し、高ズームで編集された領域を視覚的に検査します。特に高輝度の画面や印刷時に、黒いオーバーレイを通して元のコンテンツの痕跡が見える場合は、墨消しが不十分です。可視コンテンツの 1 ピクセルだけで元の情報を再構築できる場合があります。
これらの各ステップを含む検証チェックリストを作成し、文書リリース プロセスの一部としてそれを要求します。リダクションの検証にかかる数分は、リダクションの失敗によって引き起こされたデータ侵害の修復に数時間、数日、または数か月かかることに比べれば、取るに足らないものです。このステップは、個人データまたは機密情報を扱う組織にとってはオプションではありません。
メタデータの編集: 見落とされがちなレイヤー
表示されているテキストが適切に編集されている場合でも、PDF ではメタデータを通じて機密情報が漏洩する可能性があります。 PDF メタデータには、ドキュメントのタイトル、作成者名、作成日、変更履歴、および場合によってはドキュメントをレビューまたは署名した人の名前が含まれます。形式変換ツールは通常、可能な場合にはメタデータを保存するため、編集されたメタデータは、目的のドキュメント コンテンツと同じように確実に変換後も残ります。
SANS Institute による 2025 年の調査では、政府 Web サイトから公開されている編集済み PDF 500 件を分析し、12% のメタデータ フィールドにクリーニングされていない機密情報が含まれていることが判明しました (SANS Institute、「公開文書の隠されたデータ」、2025 年)。場合によっては、文書本文内の編集された情報が、編集されていないメタデータを使用して相互参照され、確認される可能性があります。リリース前にメタデータをクリーニングすることは、表示されているコンテンツを編集することと同じくらい重要です。
変換の実行方法に関係なく、変換されるすべてのドキュメントに同じ検証プロセスを適用する必要があります。ワークフローに自動変換ステップが含まれている場合は、手動のスポット チェックに頼るのではなく、その自動化に墨消し検証チェックを組み込みます。変換された出力で編集された既知の用語を検索するスクリプトは、手動レビューでは見逃される可能性のあるエラーを検出できます。
標準の文書レビューチェックリストに編集検証を組み込むことで、この重要なセキュリティ手順がスキップされることがなくなります。
PDF を墨消ししてみる
インストールは必要ありません。ブラウザで直接動作します。
