Others

PDF が紙のスキャンによって作成されたのか、デジタル ソースから作成されたのかを確認する方法

PDFがメールで届きます。それを開くと、印刷された文書のようなものが現れます。テキストは存在し、書式設定は正しいです。しかし、カーソルでテキストを選択できますか、それとも写真のようにカーソルがその上を通過しますか?その答えによって、PDF が紙をスキャンして作成されたのか、デジタル ソースから生成されたのかが決まり、ファイルの操作方法に関するすべてが決まります。

テキストをクリックして、カーソルがそのテキストを選択するか無視するかを観察すると、1 秒以内に質問に回答します。

PDF がスキャンされたのかデジタルで作成されたのかを判断するには、選択可能なテキストのチェック、ファイル構造の検査、スキャンによる明らかな視覚的アーチファクトの検索が含まれます。 WukongPDF の OCR PDF ツールを使用すると、スキャンされたドキュメントを検索可能にすることができます。また、以下の Scanned PDF の識別手順により、そもそも OCR が必要かどうかがわかります。

How to Tell If a PDF Was Created by Scanning Paper or From a Digital Source

テキスト選択テスト

PDF を開き、テキスト選択ツールを使用してテキストの単語を選択してみます。カーソルが単語を 1 文字ずつ強調表示する場合、PDF には選択可能なテキストが含まれており、デジタルで作成されたか、すでに OCR 処理されています。カーソルが個々の文字を強調表示せずに領域全体に選択四角形を描画する場合、そのページは画像であり、PDF はスキャンによって作成されたものです。

テキスト選択テストは、単一ページのチェックでは迅速かつ決定的です。複数ページのドキュメントの場合は、最初、中間、最後から数ページをテストします。一部の PDF にはデジタル ページとスキャンされたページが混在しており、通常はデジタルで作成されたカバーレターと、その後にスキャンされた添付ファイルが続きます。各ページのテキスト選択テストにより、どのページがどのページであるかが明らかになります。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

ファイル サイズとページ数を確認して手がかりを得る

スキャンされた PDF は、各ページがフルページ画像であるため、通常、同じページ数のデジタル PDF よりも大きくなります。 300 DPI でスキャンした 10 ページの PDF は、通常 5 ~ 15 MB になります。同じコンテンツの 10 ページのデジタル PDF は 100 ~ 500 KB になる可能性があります。ファイル サイズの違いは、ファイルを開く前にすぐにわかる手掛かりとなります。

スキャンされた PDF の内部機能も少ない傾向があります。ブックマーク、ハイパーリンク、埋め込みフォント、基本的なファイル プロパティ以外のメタデータはありません。 「ドキュメントのプロパティ」を開き、「フォント」タブを確認します。すべてのコンテンツが画像であるため、スキャンされた PDF にはフォントがリストされません。デジタル PDF には、ドキュメントで使用されているフォントがリストされています。

作成方法のファイルプロパティの確認

多くの場合、ドキュメントのプロパティには、PDF を作成したアプリケーションが含まれます。 Microsoft Word から Adobe Acrobat で作成された PDF はデジタルである可能性があります。 Canon Scanner Driver または HP Scan で作成された PDF をスキャンしました。 OCR アプリケーションによって作成された PDF は、検索可能にするために処理されたスキャンされた文書である場合があります。

ドキュメント プロパティのプロデューサー フィールドは作成アプリケーションによって設定されますが、変更またはなりすましの可能性があるため、常に信頼できるわけではありません。制作者情報とテキスト選択テストおよびフォント チェックを組み合わせて、確実な決定を行います。同じ結論を示した 3 つの独立したテストは信頼できます。

テストデジタル PDF 結果スキャンされた PDF 結果
テキストの選択カーソルは個々の文字を強調表示しますカーソルが画像上に選択四角形を描画します
ファイルサイズ(10ページ)100~500KB5~15MB
プロパティの「フォント」タブ埋め込みフォントを一覧表示します空、フォントなし
生産者分野ワード、アクロバット、クロームスキャナードライバー、イメージングソフト

スキャンによる視覚的アーチファクトの検索

テキスト領域を 400% に拡大します。スキャンされた PDF には、画像キャプチャの特徴的なアーティファクトが表示されます。文字の端のわずかなぼやけ、スキャナーの照明によるページ全体の暗さの不均一、スキャナーのガラス上のほこりの斑点や毛の跡がかすかな線や点として表示されます。デジタル PDF では、どのズーム レベルでも文字のエッジが鮮明に表示されます。

両面ページの PDF をスキャンすると、紙の反対側からにじみ出るゴーストやかすかな反転テキストが表示される場合があります。デジタル PDF には紙の不透明度の概念がないため、これはスキャンの決定的な兆候です。ゴーストは、主テキストの背後にあるテキストの灰色の影として表示され、主テキストがまばらな領域で最も目立ちます。

追加の手掛かりとして PDF メタデータ フィールドを使用する

PDF メタデータ フィールドはドキュメント プロパティからアクセスでき、ドキュメントの出所を明らかにすることができます。 Annual-Report-2025-Final.docx など、元のドキュメントのファイル名を含む Title フィールドは、PDF がその Word ファイルから作成されたことを示します。空のタイトルフィールドまたは PDF ファイル名と一致するタイトルは中立です。 Microsoft Word または Google Docs をリストする Creator フィールドは、デジタルの起源を示します。

「作成日」フィールドと「変更日」フィールドは、タイムラインの手掛かりを提供します。同じ日に作成され、数分以内に変更された PDF は、直接デジタル エクスポートされたことを示唆します。作成日から数年後の変更日を持つ PDF は、OCR 処理または処理されている可能性があります。メタデータはドキュメントの履歴を示し、その履歴によってスキャンが関与したかどうかが明らかになります。

PDF の種類がわかったら行うべきこと

スキャンした PDF を検索可能にする必要がある場合は、OCR を実行してテキスト レイヤーを追加します。 OCR プロセスは、ページ画像内のテキストを認識し、その背後に選択可能で検索可能なテキストを追加します。見た目の見た目は変わりません。 PDF には検索機能とコピー&ペースト機能が追加されています。

スキャンしたように見せる必要があるデジタル PDF (通常、公式に見える文書の複製の場合) では、画像への変換とその逆の変換は不要であり、品質が低下します。デジタル PDF はすでに最適な形式になっています。テキストを画像に変換する処理は、付加価値を与えることなく品質を低下させます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →