Tips & Tricks

墨消しゾーン間に検出可能なテキストの断片を残さずに PDF から複数行のコンテンツを墨消しする方法

PDF から 1 行のテキストを編集するのは簡単です。テキストの上に黒い四角形を描くと、その四角形が表示されなくなります。複数行にまたがるテキストや、異なる長さの複数行にまたがる段落を墨消しする場合、単純なアプローチでは失敗します。複数行ブロック全体に 1 つの大きな四角形を配置すると、隣接するテキスト、空白、および場合によっては表示されたままにしておく必要がある隣接する段落の部分もカバーされます。各行に個別の四角形を配置すると、元の文書の背景色が透けて見える行間の隙間から、テキストの断片、特に上の行の文字のディセンダと下の行のアセンダが現れる可能性があります。

デジタル フォレンジック会社による 2025 年の調査では、政府機関が公開した秘匿化されたとされる PDF の 12% で、個々の秘匿化された四角形の間の狭い隙間からテキストの断片が復元可能であることが判明しました (Forensic Focus、「公記録における秘匿化失敗の分析」、2025 年)。問題は、編集ツールが誤動作したことではありません。問題は、オペレーターが PDF 内でのテキストの位置決めがどのように機能するのか、また編集ゾーン間のギャップがどのように再構成に必要な各文字を保持できるのかを理解せずに、行ごとの編集手法を使用したことです。

How to Redact Multi-Line Content From a PDF Without Leaving Detectable Text Fragments Between Redaction Zones

PDF 内のテキストの配置によって墨消しギャップが生じる仕組み

PDF テキストは、ページに対する相対座標を使用して配置されます。各文字または文字のグループは、そのフォント メトリックによって定義された境界ボックスを占めます。フォントのアセンダの高さ、ディセンダの深さ、行間隔によって、テキストの各行が占める垂直方向のスペースが決まります。画面上のテキストと視覚的に位置を合わせて墨消し長方形を描画する場合、長方形の高さが表示されている文字をカバーするのに十分な大きさになる傾向があります。ただし、表示される文字はテキスト行の境界ボックスの垂直方向の範囲全体を占めているわけではありません。 「h」のような長い文字のアセンダは、そして「l」一般的な文字の高さを超えて拡張され、「g」などの文字のディセンダは、そして「y」ベースラインよりも下に延長します。墨消し長方形のサイズがテキストの本文をカバーするが、アセンダーとディセンダーの範囲全体をカバーするわけではない場合、拡張されたストロークの断片が墨消し線の間の隙間に表示されたままになります。

2 番目の問題は、画面解像度で墨消し領域をマークするPDF Redaction ツールから発生します。 150% ズームで表示されたページ上に描画された墨消し長方形の座標は、別のズーム レベルでレンダリングすると、その下のテキスト座標と正確に一致しない場合があります。 150 パーセントのズームで 2 または 3 ピクセルのギャップがある場合でも、100 パーセントのズームでは 1 または 2 ピクセルのギャップに変換され、認識可能な文字の断片を保存するには十分です。

WukongPDF

PDF を墨消ししてみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

複数行のコンテンツの編集: 正しい四角形の配置

複数行にまたがるテキストのブロックを編集するための最も安全な方法は、最初の行の上から最後の行の下までの長方形領域全体をカバーし、左端の文字の左端から右端の文字の右端まで水平に広がる単一の連続した編集ゾーンを使用することです。これは、テキストが左揃えの場合は 1 行の最後の単語と右マージンの間の空白をカバーし、両端揃えのテキストの場合は行幅全体をカバーすることを意味します。重要な原則は、墨消しゾーンは内部ギャップがなく連続的である必要があり、アセンダー、ディセンダー、および隠しテキストの位置オフセットを考慮して、表示されているテキストの 4 つの側面を超えて拡張する必要があるということです。

文内に改行が含まれ、テキストが自然に折り返される段落の場合、墨消しゾーンは、1 行目の先頭から N 行目の末尾までにわたる単一の長方形である必要があります。リストや表など、各行が個別のエントリである段落では、各長方形が表示テキストの 4 辺すべてから少なくとも 6 ポイント超えていて、間に表の境界線や水平罫線などの明確なテキスト以外のギャップがある場合に限り、1 行ごとに個別の長方形を使用できます。各行。疑わしい場合は、単一の連続ゾーンを使用してください。

墨消しゾーンがすべてのテキスト断片をカバーしていることの確認

編集を適用した後の検証ステップはオプションではありません。編集されたファイルを開き、テキスト選択ツールを使用して編集された領域内のテキストを選択してみます。テキストを選択できる場合、基礎となるテキスト ストリームは削除されず、ファイル内にまだ存在しています。多くの編集ツールは「サニタイズ」機能を提供しています。または「非表示の情報を削除する」リダクション適用後の機能。この手順により、PDF のすべての編集領域の基礎となるテキスト コンテンツが削除され、復元できなくなります。使用しているツールがこれを提供していない場合、編集は表面的なオーバーレイのみであり、テキスト エディタまたは PDF 構造ビューアでファイルを開いた人なら誰でもテキストを復元できます。

2 番目の検証方法は、編集された PDF をプレーン テキストとしてエクスポートすることです。編集された領域のエクスポートされた出力に表示されるテキストは、編集が不完全であることを示します。その領域のテキスト ストリームが適切に削除されませんでした。戻ってサニタイズ オプションを有効にして墨消しを再適用するか、テキスト コンテンツを単に視覚的に覆うのではなく適切に除去する別のツールを使用します。

特殊なケース: テーブル、列、フォーム内のテキストの秘匿化

表では、隣接するセル内のテキストが非常に近くに配置される可能性があり、四角形が大きすぎると、1 つのセルをカバーする編集が隣接するセルににじみ出る可能性があるため、独特の課題があります。表のルールは、セル内のテキストではなくセル全体を編集することです。特定のセルに機密情報が含まれている場合は、表の構造から情報がそのセルから編集されたことが明確になるように、セルの境界線を含むセル領域全体を編集します。列全体を編集することが現実的でない幅の狭い列の場合は、正確に配置するためのガイドとして列グリッドを使用して、編集長方形を列の境界線まで拡張します。

PDF フォームは、フォーム フィールド データが表示されるページ コンテンツとは別に保存されるため、さらに複雑さが加わります。フォームフィールド内のビジュアルテキストを編集しても、PDF の内部データ構造からフィールド値は削除されません。フォーム対応の PDF ビューアでファイルを開いた場合でも、フィールドをクリックして元の値を確認できます。フォーム フィールド データをリダクションするには、最初にフォーム フィールドをフラット化し、フィールド値を通常のページ コンテンツに変換してから、フラット化されたコンテンツにリダクションを適用する必要があります。

よくある編集ミスとその結果

最も有害な編集ミスであり、複数の公開事件を引き起こしたミスは、専用の編集ツールではなく注釈ツールを使用して描画された暗い色の長方形を使用することです。注釈は視覚的なオーバーレイです。 PDF を開いた人は誰でも、これらを移動、削除、または透明にすることができます。その下のテキストは完全にそのまま残り、完全に検索可能です。 PDF プライバシー を適切に保護するには、単に表示されないようにするだけでなく、基礎となるデータを削除する必要があります。墨消しを適用するには、注釈ツールや描画ツールではなく、常に専用の墨消しツールを使用してください。

2 番目のよくある間違いは、メタデータをそのままにして、表示されているページ コンテンツのみを編集することです。 PDF ドキュメントのプロパティには、編集によって隠されるはずだった情報が明らかになる、元のファイル名、作成者名、作成日が含まれる場合があります。表示されているコンテンツを編集した後、ドキュメントのプロパティを確認し、機密情報が含まれる可能性のあるメタデータ フィールドを削除またはサニタイズします。 WukongPDF は、表示されているコンテンツとメタデータの両方を 1 回の操作で処理する結合された編集ワークフローを提供し、メタデータ ベースの情報漏洩のリスクを軽減します。

PDF の増分保存履歴を考慮していないことは、3 番目の重大な間違いです。増分更新で保存された PDF ファイルには、ページ コンテンツの以前のバージョンがすべて保持されます。ページの現在のバージョンに適用される編集は、そのバージョンからテキストを削除しますが、ファイルに保存されている以前の増分保存からテキストを回復できる場合があります。解決策は、すべての変更を統合して改訂履歴を破棄する増分保存ではなく、完全保存を使用して編集されたドキュメントを保存することです。

複数行パターンの自動墨消し

社会保障番号、電子メール アドレス、電話番号など、同じ種類の情報を多くのページまたは多くのドキュメントにわたって編集する必要がある場合、手動で四角形を配置することは非現実的であり、間違いが発生しやすくなります。パターンベースの自動秘匿化では、正規表現を使用して秘匿化するテキスト文字列を識別し、出現するたびに秘匿化ゾーンを自動的に描画します。利点は完全性です。適切に記述されたパターンは、オペレーターが手動レビュー中に見逃してしまう可能性のあるインスタンスも含め、すべてのインスタンスを捕捉します。欠点は、パターンが適切に記述されていないと誤検知が生成され、表示されたままにする必要があるテキストが編集されてしまうことです。

パターンベースの墨消しを安全に使用するには、ツールがサポートしている場合はまずプレビュー モードでパターンを実行します。これにより、墨消しが適用されずに一致が強調表示されます。一致のサンプルをレビューして、パターンが意図したコンテンツだけをキャッチしていることを確認します。必要に応じてパターンを調整し、再度プレビューして、文書全体に墨消しを適用します。適用後、テキスト エクスポートの検証を実行して、ターゲット コンテンツとともに意図しないコンテンツが削除されていないことを確認します。

WukongPDF

PDF を墨消ししてみる

インストールは必要ありません。ブラウザで直接動作します。

始める →