法的証拠開示への対応の一環として、PDF があなたの机に届きます。ドキュメントのプロパティ パネルは空です。作成者、作成日、および変更履歴のフィールドは、意図的にまたは偶発的に削除されています。この文書がいつ、誰によって作成されたのかを明らかにする必要があります。通常これらの質問に答えるメタデータは失われていますが、PDF にはその起源を示す回復可能な証拠がまだ含まれている可能性があります。
PDF メタデータ のストリッピングは、共有前に潜在的に機密情報を削除するように設計されたサニタイズ ツールをドキュメントが通過する場合に一般的です。これらのツールは、文書情報辞書、標準メタデータ フィールド、および多くの場合 XMP メタデータ ストリームを削除します。表示されているページのコンテンツは保持されます。ドキュメンタリーの文脈は削除されます。

ストリップ後にメタデータが隠れる場所
著者、タイトル、件名、キーワード、作成者、プロデューサー、作成日、および変更日が保存されているドキュメント情報ディクショナリは、メタデータ ストリッピングの主なターゲットです。ストリップ後、これらのフィールドはクエリ時に空またはデフォルト値を返します。
PDF 内の別のストリームに保存されている XMP メタデータは、情報辞書のみを対象とする基本的なメタデータ ストリッパーによって見逃されることがよくあります。 XMP には、同じフィールドに加えてカスタム プロパティを含めることができます。完全なファイル構造を検査するRepair PDF 検査ツールを使用すると、削除されても生き残った XMP メタデータを明らかにできます。
元のページのサイズ、各ページを生成したソフトウェア、ページ コンテンツ ストリームに埋め込まれた変更タイムスタンプなどのページ レベルのメタデータは、ストリッピング ツールがページ コンテンツのメタデータのようなデータを検査しないため、ほとんど削除されません。
PDFを修復してみる
インストールは必要ありません。ブラウザで直接動作します。
ストリップされたメタデータを回復するための技術的方法
バイナリ ファイルを処理できるテキスト エディタで PDF ファイルを調べます。ファイル ヘッダーおよび個々のオブジェクト ストリームで Creator 文字列とProducer 文字列を検索します。これらの文字列は、PDF を最初に作成したソフトウェアと最後に変更したソフトウェアを識別します。文書情報辞書が空になった場合でも、文字列は保持されます。
埋め込まれたフォントのメタデータを検査します。 PDF に埋め込まれたフォントには、フォントの作成日やフォント ファイルの作成または変更に使用されたソフトウェアなどの独自のメタデータが保持されます。これらの日付は終了後の終点を提供し、埋め込まれたフォントが存在する前に文書が作成されることはあり得ません。
WukongPDF は、ブラウザを介した PDF バージョン管理 検査を提供します。これにより、ドキュメントのプロパティを検査し、ファイル構造内の回復可能なメタデータ要素を識別できます。
メタデータの回復で明らかにできることとできないこと
回復可能なメタデータは、作成したソフトウェア、オペレーティング システム、および多くの場合、作成日の範囲を識別できます。 2023 年の夏に Windows 10 上の Microsoft Word 2016 で作成された PDF は、原点を大幅に絞り込みます。回復可能なメタデータは、その情報がカスタム メタデータ フィールドに保存されていない限り、ドキュメントを作成した特定のユーザーやドキュメントが作成された特定のコンピュータを識別できません。
変更履歴は作成情報に比べて復元が困難です。一部の PDF エディターによる各保存操作では、新しい変更日が書き込まれますが、以前の日付は保持されません。復元できる変更履歴は、増分保存情報を保存した編集者による保存履歴です。
今後のドキュメントでのメタデータ損失の防止
PDF を外部と共有する前に、メタデータを確認して、保存する必要があるか削除する必要があるかを判断してください。すべてのメタデータを削除すると、後で必要になる可能性のあるドキュメントのコンテキストが削除されます。メタデータを保存すると、機密の可能性がある情報が共有されます。決定は慎重に行われるべきです。
重要なドキュメントの作成日、作成者、バージョン履歴を記録するドキュメント レジスタを PDF の外部に維持します。外部登録は PDF メタデータ操作の影響を受けず、文書の出所に関する独立した記録を提供します。
PDF ファイル システムのメタデータ、つまりオペレーティング システムによってファイル自体に保存される作成日と変更日は、PDF の内部メタデータから独立しています。 PDF の内部作成日が削除された場合でも、ファイル システムはファイルが現在の保存場所に最初に保存された日時を記録することがあります。
電子メールの添付ファイルには、電子メール システムのメタデータに電子メールの日付が保持されます。 PDF が電子メールの添付ファイルとして受信された場合、電子メールの日付により、ドキュメントの最も新しい作成日がわかります。電子メールで送信された後に PDF を作成することはできません。
ファイルのメタデータとは独立して文書履歴を追跡する文書管理システムでは、メタデータが削除される前に、元の作成日、作成者、変更イベントが記録されている可能性があります。文書管理システムで文書 ID またはファイル名を検索すると、除去前のメタデータを回復できます。
PDF 増分保存構造では、ファイルが完全に書き換えられるのではなく増分的に保存された場合、文書情報辞書の以前のバージョンが保持されます。増分保存データのフォレンジック検査により、以前のバージョンには存在していたが、現在のバージョンでは上書きされたメタデータ値が判明する可能性があります。
PDF に埋め込まれたフォントには、フォント ファイルのメタデータに独自の作成日と変更日が含まれています。これらの日付は、PDF メタデータの除去の影響を受けません。最新のフォントの日付は、ドキュメントの作成日の下限を示します。
PDF に埋め込まれた画像には、撮影日、カメラ情報、編集に使用したソフトウェアなど、元の画像ファイルの EXIF メタデータが含まれています。 PDF 画像に埋め込まれた EXIF データは、PDF メタデータの除去操作の影響を受けません。
回復されたメタデータは、回復方法と信頼性評価とともに文書化される必要があります。ファイル システムのタイムスタンプから復元されたメタデータは、埋め込みフォントの作成日から復元されたメタデータよりも信頼性が低くなります。この文書により、将来のユーザーは回復された情報の信頼性を評価できるようになります。
ストリップされた PDF からのメタデータの回復は、ファイル構造の技術的検査と文書の起源に関するコンテキスト調査を組み合わせたフォレンジック演習であり、回復される情報は通常、完全ではなく部分的です。
共有する前に PDF からメタデータを削除する決定は、削除された情報が後で必要になる可能性があること、および回復オプションが限られており不確実であることを認識して行う必要があります。
ストリップされた PDF からのメタデータの回復では、技術分析とコンテキスト調査を組み合わせて、ドキュメントの起源のストーリーを再構築します。
PDF ファイル自体のファイル システム タイムスタンプは、内部 PDF メタデータから独立しています。
ストリップされた PDF からメタデータを回復するには、ファイル構造と外部ソースの両方を調べる必要があります。
メタデータの回復は、技術的分析とコンテキスト分析を組み合わせた調査プロセスです。
ドキュメント情報ディクショナリの PDF プロデューサー フィールドは、ファイルを作成したソフトウェア、つまりほとんどのメタデータが除去されても残る情報を識別します。
生の PDF ファイルを 16 進エディターで検査すると、文書情報辞書が参照しなくなったメタデータの断片が明らかになる場合があります。
PDF 内のフォント ファイルに埋め込まれた作成日は、ドキュメント作成の終了後の終了点となります。
PDF 内の XMP メタデータ ストリームは文書情報辞書から分離されており、ツールが辞書のみをターゲットにしている場合は、削除しても存続する可能性があります。
PDF の変更履歴は、編集のたびに蓄積される増分保存セクションから再構築できる場合があります。
PDF に埋め込まれた画像 EXIF データは、PDF メタデータの操作に関係なく、元の画像キャプチャの日付を保持します。
文書管理システムのログには、PDF が配布用に処理される前の元のメタデータ値が記録される場合があります。
PDF を配信したメッセージの電子メール ヘッダーから、ドキュメントの最新の作成日が得られる可能性があります。
アプリケーションごとにデフォルトのページ サイズが異なるため、ページ数とページ寸法は作成ソフトウェアを識別するのに役立ちます。
PDF バージョン番号 1.4、1.7、2.0 は、ドキュメントの作成時にどの仕様機能が利用可能であったかを示します。
相互参照テーブル分析により、オブジェクトがファイルに追加された順序が明らかになり、相対的な年表が得られます。
PDF 内のオブジェクトの番号付けは連続しており、通常、小さい番号のオブジェクトが大きい番号のオブジェクトより前に作成されます。
PDF カタログのドキュメント言語設定は、元の作成者の言語とロケールを示す場合があります。
作成する組織によって定義されたカスタム メタデータ フィールドでは、ドキュメント ソースを識別する命名規則が使用される場合があります。
PDF 出力インテントが存在する場合、ターゲットの印刷条件を識別し、ドキュメントの使用目的を示すことができます。
埋め込まれたカラー プロファイルは、ドキュメントが作成されたカラー管理環境に関する情報を提供します。
ページ レイアウトの初期表示設定は、ドキュメントが画面表示用に設計されたか印刷表示用に設計されたかを示すことができます。
PDF 内の注釈とコメントには、注釈プロパティに独自の作成日と作成者情報が含まれます。
インタラクティブ PDF のフォーム フィールドには、組織システムや日付を参照するデフォルト値または JavaScript が含まれる場合があります。
PDF ビューアのタイトル バーに表示されるドキュメント タイトルは、メタデータ タイトル フィールドとは異なるように設定される場合があります。
ブックマークとドキュメントのアウトラインは、メタデータが削除されてもセクション構造を保持します。
文書内のハイパーリンクは、日付情報または組織識別子を含む URL を参照する場合があります。
ドキュメントで使用されているフォントのリストは、ページ コンテンツ ストリームから復元でき、作成ソフトウェアを示すことができます。
PDF ビューアに表示される論理ページ番号であるページ ラベルは、物理ページ番号とは異なる場合があり、文書構造が明らかになります。
ページ コンテンツに埋め込まれた透かしテキストには、ドキュメントの作成時に適用された日付または作成者の情報が含まれる場合があります。
ドキュメントのチェックサムまたはハッシュを既知のファイルと比較して、元のソースを識別できます。
ファイル サイズのパターン、大きな画像、多くのフォント、複雑なベクター グラフィックスは、ドキュメントの種類と作成ソフトウェアを示す可能性があります。
特定の PDF 機能、レイヤー、ポートフォリオ、リッチ メディアの存在は、使用されたソフトウェア バージョンを示します。
文書からテキストを抽出すると、日付、文書 ID、または作成者名を含むヘッダーおよびフッターのテキストが明らかになります。
ドキュメントの暗号化方法がパスワードで保護されている場合、ソフトウェアのセキュリティ機能が作成されていることを示します。
各ページの用紙サイズと向きのメタデータは、文書がメートル法またはヤード法で作成されたかどうかを示すことができます。
ドキュメント作成プラットフォーム (Windows、Mac、または Linux) は、多くの場合、PDF プロデューサー文字列から識別できます。
これらの法医学的手がかりをつなぎ合わせると、意図的にメタデータを削除した後でも、文書の起源のかなり完全な全体像を生成できます。
ストリップされたメタデータを回復するには、内部 PDF 構造と外部コンテキスト ソースの両方を調べる必要があります。
| 証拠ソース | それが明らかにするもの | 信頼性 | 剥離抵抗 |
|---|---|---|---|
| XMPメタデータストリーム | 作成者、日付、カスタムフィールド | 高い | 基本的なストリッパーには見逃されることが多い |
| 埋め込まれたフォントの日付 | フォント作成日 | 中くらい | 非常に高い (フォント ファイル内) |
| 画像のEXIFデータ | 撮影日、カメラ、ソフトウェア | 中くらい | 非常に高い(画像データにおいて) |
| ファイルシステムのタイムスタンプ | ファイルの作成・変更 | 低い | 該当なし (PDF の外部) |
PDFを修復してみる
インストールは必要ありません。ブラウザで直接動作します。
