PDF を開き、テキストの段落を選択し、削除を押して、その場所に新しいテキストを入力し、ファイルを保存します。新しいテキストが画面に表示されます。あなたは文書を送ります。受信者は古いテキストにのみ出現した用語を PDF 内で検索し、その用語を見つけます。削除したと思っていた古いテキストはファイル内にまだ残っており、新しいテキストの後ろに隠れて画面上には見えませんが、文書データには完全に存在します。この不安な体験は、PDF 編集に関する基本的な真実を明らかにします。それは、目に見えるものだけがすべてではないということです。
ブラウザや基本的なデスクトップ アプリケーションで使用できるPDF Editor ツールは、通常、PDF を実際に置き換えるのではなく、コンテンツを PDF に追加します。段落を削除して新しいテキストを入力すると、エディタは古いテキストの上に白い四角形を描画し、その上に新しいテキストを配置します。古いテキストはファイル データ レイヤーに残ります。テキストを抽出したり、文書を検索したり、別の形式に変換したりすれば、削除されたと思われる内容を復元できます。

PDF 編集の実際の仕組み: 置換ではなくオーバーレイ
PDF ファイルは編集するように設計されていません。この形式は、印刷されたページと同等の最終出力形式として作成されました。 PDF エディターが文書を変更する場合、元のテキスト オブジェクトは書き換えられません。古いオブジェクトを上書きする新しいオブジェクトを追加します。元のテキスト オブジェクトを削除するにはページ コンテンツ ストリームを再構築する必要があるため、元のテキスト オブジェクトはファイルに残りますが、これはオーバーレイを追加するよりもはるかに複雑な操作です。
このオーバーレイ アプローチは、ドキュメントのセキュリティと PDF フォーマット の整合性にとって重要な結果をもたらします。古いコンテンツは削除されず、カバーされるだけなので、編集するたびにドキュメントのサイズが大きくなります。 10 回編集された PDF には、元のコンテンツに加えて 9 層の編集が含まれています。表示されるページ数と見かけの内容は同じであっても、ファイル サイズは改訂ごとに増加します。
オーバーレイのアプローチでは、編集速度と引き換えに編集品質が犠牲になりますが、そのトレードオフは、非表示のコンテンツが再び表示されるまで目に見えません。
オーバーレイの問題は、テキスト編集の場合に最も深刻です。エディターは白い四角形を描画して古いテキストを非表示にし、新しいテキストを別のテキスト オブジェクトに配置する場合があります。白い四角形は古いテキストを視覚的に覆っていますが、古いテキストはまだテキスト レイヤー内にあります。スクリーン リーダーは古いテキストと新しいテキストの両方を読み上げます。検索すると両方が見つかります。テキスト抽出ツールは両方を実現します。編集は表面的なものでした。
適切に実装された PDF Editor 編集ツールは、テキスト レイヤーからコンテンツを削除します。同じアプリケーション内の汎用テキスト編集ツールはそうでない場合があります。ユーザーは、削除が削除を意味すると合理的に期待していますが、PDF 形式では追加よりも削除が難しく、多くの編集者はより簡単な方法を採用しています。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
古いテキストが再び表示される場合
オーバーレイによって隠された古いテキストは、いくつかの一般的なシナリオで再び現れる可能性があります。 PDF を Word やプレーン テキストなどの別の形式に変換すると、隠された古いテキストを含むすべてのテキストがドキュメントから抽出されます。変換ツールは PDF テキスト レイヤーを直接読み取りますが、白いオーバーレイ四角形は表示されません。これらは視覚要素であり、テキスト コンテンツではないためです。
別のビューアで PDF を開くと、非表示のテキストが表示される場合があります。ページを異なる方法でレンダリングするビューアは、白いオーバーレイ四角形を間違った位置に配置するか、まったくレンダリングせず、古いテキストが露出する可能性があります。ブラウザベースのビューア、モバイル PDF アプリ、および古いデスクトップ ビューアには、それぞれ独自のレンダリングの癖があり、オーバーレイの位置に影響を与える可能性があります。
検索機能を使用してドキュメントを検索すると、ビジュアル レイヤーではなくテキスト レイヤーが検索されます。削除されたテキストに含まれる単語を検索すると、その単語が画面上に表示されなくても見つかります。これにより、受信者は、削除されたはずのコンテンツがファイル内にまだ存在していることを発見します。
スクリーン リーダーとアクセシビリティ ツールはテキスト レイヤーを読み取ります。スクリーン リーダーに依存している視覚障害のあるユーザーは、現在のテキストと削除されたテキストの両方を聞きますが、多くの場合、聞こえている内容の一部が隠されているという兆候はありません。 PDF メタデータ および構造は、ドキュメントの変更履歴に以前の編集の痕跡を保持することもできます。
削除されたテキストが本当になくなったことを確認する方法
PDF を編集した後、編集したファイルに対してテキスト抽出を実行して、削除されたテキストが実際に削除されたことを確認します。 Ctrl+A を使用して PDF からすべてのテキストをコピーし、テキスト エディターに貼り付けます。貼り付けたテキストで削除した語句を検索します。フレーズが表示された場合、削除は表面的なものでした。または、編集した PDF をプレーン テキスト ファイルに変換し、そこで削除されたコンテンツを検索します。
2 番目の検証方法は、PDF 検索機能を使用します。削除されたテキストから特徴的な単語または語句を検索します。検索ツールでテキストが見つかった場合、テキストはまだドキュメント データ レイヤーにあります。ほとんどの PDF リーダーの検索ツールは、テキスト コンテンツ ストリームを直接検索し、ビジュアル オーバーレイの影響を受けません。
機密文書の場合は、一般的な編集ツールではなく、専用の編集ツールを使用してコンテンツを削除します。墨消しツールは、テキストを視覚的に覆うだけでなく、データ レイヤーからテキストを除去するように設計されています。編集と編集の違いは、コンテンツを非表示にすることと削除することの違いです。
PDF からテキストを適切に削除する方法
WukongPDF は、一般的な編集ツールに加えて編集ツールも提供します。 PDF からコンテンツを完全に削除する必要がある場合は、テキスト編集機能ではなく、墨消し機能を使用してください。墨消しでは、データ レイヤーからテキストが削除され、その場所に黒いマークまたは空白が配置されます。後続のテキスト抽出、検索、変換では、編集されたコンテンツはファイル内に存在しないため、検索されません。
すでに PDF を編集しており、古いテキストを復元できないようにする必要がある場合、最も安全な方法は、PDF を新しい PDF として印刷することです。印刷プロセスでは、各ページが画像のような表現としてレンダリングされ、非表示のテキスト レイヤーとオーバーレイがすべて破棄されます。出力 PDF には、ページに表示されているもののみが含まれます。その代償として、新しい PDF ではテキストの検索機能、リンク、その他のインタラクティブな機能が失われます。
もう 1 つのアプローチは、表示されているテキスト レイヤーのみを抽出し、そこから新しい PDF を構築し、非表示のコンテンツを破棄することです。これには、表示されているテキスト オブジェクトと非表示のテキスト オブジェクトを区別し、表示されているテキスト オブジェクトのみを選択的にエクスポートできるツールが必要です。結果として得られる PDF はクリーンで、意図したコンテンツのみが含まれています。
偶発的なコンテンツの保持を防止する
外部に共有する PDF を編集する場合は、内容の検証手順を含むワークフローを確立します。編集後、テキスト抽出を実行し、削除されるはずだったコンテンツを検索します。法的データ、財務データ、または個人データを含む文書の場合、ファイルが管理を離れる前にこの検証手順を必須にする必要があります。
広範囲の編集が必要なドキュメントには PDF 以外の形式を使用することを検討してください。ドキュメントを元の形式 (Word、Google ドキュメント、InDesign) で編集し、コンテンツが完成したら新しい PDF をエクスポートします。ソースドキュメントから新たにエクスポートした場合、編集履歴や非表示のコンテンツは含まれません。 PDF は、編集キャンバスとしてではなく、最終出力形式として本来の目的を果たします。
問題はテキストに限定されません。基本エディタなどでPDFから削除した画像もファイルデータに残る場合があります。エディターは古い画像の上に白い四角形を描画し、その上に新しい画像を配置します。元の画像データは PDF に埋め込まれたままであるため、ファイル サイズは大きくなりますが、すべての埋め込みオブジェクトを列挙できるツールを使用してファイルを開いた場合は誰でも抽出できます。
PDF 内の機密情報の保持は、文書化されたセキュリティ リスクです。 2023 年、オーストラリア信号局は、非専門的なツールを使用して PDF を編集すると、編集されたコンテンツが回復可能な状態になる可能性があると警告するガイダンスを発行しました。このガイダンスでは、テキストや画像の上にブラック ボックスを描画しても、基礎となるデータは削除されず、変換されたドキュメントによって、削除されたはずのコンテンツが公開される可能性があることが特に指摘されています。
以前のコンテンツの痕跡を含んではいけない編集済み PDF を共有する最も安全な方法は、表示されているコンテンツのみから PDF を再構築することです。 PDF プリンター ドライバーを使用して、編集したドキュメントを新しい PDF に印刷します。このプロセスでは、各ページが画面上に表示されるとおりにレンダリングされ、表示されているコンテンツのみが新しいファイルに書き込まれます。非表示のテキスト、削除された画像、および編集履歴は、レンダリングされたページの外観の一部ではないため、すべて破棄されます。
法的開示または情報公開要求の対象となる文書を扱う組織にとって、編集と編集の違いを理解することは不可欠です。開示要求に応じて作成された文書に、隠蔽されているが回復可能なテキストが含まれていると、重大な法的結果が生じる可能性があります。裁判所や規制当局は、ページ上に表示されていたかどうかに関係なく、非表示のコンテンツを開示されたコンテンツとして扱います。
機密情報や機密情報が含まれる PDF の最も安全な編集ワークフローは、PDF ではなくソース ドキュメントを編集することです。元の Word ファイル、Google ドキュメント、またはデザイン ファイルに変更を加え、編集したソースから新しい PDF をエクスポートします。新しいエクスポートには、非表示のコンテンツ、編集履歴、特定の受信者が回復できる以前のバージョンの残存データは含まれません。
| シナリオ | 隠しテキストが公開される仕組み | リスクレベル |
|---|---|---|
| PDFからWordへの変換 | コンバーターはデータレイヤーからすべてのテキストを抽出します | 高: すべての隠しテキストが表示されます。 |
| PDF内を検索 | Find 関数はビジュアル レイヤーではなくテキスト ストリームを検索します | 中: 隠しテキストの存在を明らかにする |
| スクリーンリーダーへのアクセス | オーバーレイを無視してテキストレイヤーを直接読み取ります | 高: 古いテキストと新しいテキストを一緒に読み上げます。 |
| 別の PDF ビューア | 代替ビューアではオーバーレイが正しくレンダリングされない場合があります | 中: 視聴者間で一貫性がありません |
| テキスト抽出/コピー&ペースト | 「すべてを選択」はデータレイヤー内のすべてのテキストをキャプチャします | 高: 貼り付けバッファーに隠しテキストが表示されます。 |
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
