
スキャンされた PDF とは何か、ネイティブ PDF との違い
スキャン PDF は、スキャナまたは携帯電話のカメラを使用して物理的な紙のページの画像をキャプチャすることによって作成されます。 PDF の各ページはオリジナルの文書の写真です。ページ上に表示されるテキストは、画像内のピクセルとしてのみ存在します。 PDF ファイルには実際のテキスト文字は保存されません。スキャンされた PDF は基本的に、各写真にテキストが含まれるフォト アルバムです。
スキャンされた PDF を識別する最も簡単な方法は、カーソルでページ上のテキストを選択してみることです。
OCR テクノロジーは、検索可能なテキスト レイヤーを追加することで、スキャンされた PDF とネイティブ PDF の間のギャップを埋めます。
ネイティブ PDF (デジタル PDF またはボーンデジタル PDF とも呼ばれます) は、ソフトウェア アプリケーションから直接作成されます。 Word 文書を PDF にエクスポートしたり、スプレッドシートを PDF として保存したり、デザイン アプリケーションから PDF を作成したりすると、結果のファイルには、ベクター グラフィックスや埋め込みフォントとともに、選択および検索可能な実際のテキスト文字が含まれます。
テキストはピクセルとしてではなく、データとして存在します。ネイティブ PDF は構造化ドキュメントであり、ページ画像のコレクションではありません。
PDF 形式 は、同じファイル内の両方のタイプのコンテンツをサポートします。 PDF には、スキャンされた画像のページと、ネイティブのデジタル テキストのページが含まれる場合があります。この混合コンテンツのシナリオは、デジタルで作成されたテキスト ページと印刷ソースからスキャンした付録を組み合わせたレポートなど、ドキュメントが複数のソースから組み立てられている場合に一般的です。
スキャンされた PDF とネイティブ PDF の実質的な違いは、ドキュメントに対して実行できるすべてのことに影響します。ネイティブ PDF ではテキストが検索可能な文字データとして存在するため、単語を検索できます。スキャンした PDF は、画像内のテキストを認識し、検索可能な非表示のテキスト レイヤーを追加する OCR PDF テクノロジで処理されていない限り、検索できません。ネイティブ PDF からテキストを選択してコピーできます。スキャンした PDF からテキストを選択することはできません。 PDF エディターを使用してネイティブ PDF 内のテキストを編集できます。スキャンした PDF には編集するテキスト文字がないため、テキストを編集できません。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
PDF がスキャンされたものであるかネイティブであるかを判断する方法
最も簡単なテストは、PDF 内のテキストを選択してみることです。 PDF を開き、マウスまたは指で単語をクリックしてドラッグします。ドラッグ中にテキストがハイライト表示される場合、PDF にはネイティブの選択可能なテキストが含まれています。テキストを選択しようとしても何も起こらない場合は、そのページはスキャンされた画像である可能性があります。一部の単語が強調表示され、他の単語は強調表示されない場合、PDF のテキスト レイヤーが部分的または破損している可能性があります。
ズーム テストでは、別の簡単なチェックを行うことができます。テキストのセクションを 300 または 400 パーセントに拡大します。高倍率でもテキストが鮮明で鮮明なままである場合、それはネイティブのベクター テキストであり、任意のサイズにスムーズに拡大縮小できる可能性があります。高倍率でテキストがピクセル化し、ギザギザのエッジが表示される場合、それはスキャンされた画像です。このビジュアル テストは、ベクター テキストはどのズーム レベルでもスムーズにレンダリングされるのに対し、画像ベースのテキストは拡大するとピクセル構造が明らかになるため、機能します。
PDF ビューア ツールは、ドキュメントにテキストが含まれているかどうかをレポートすることもできます。 Adobe Acrobat では、「ドキュメントのプロパティ」パネルにページ数と、ファイルに検索可能なテキストが含まれているかどうかが表示されます。一部のビューアにはテキスト レイヤ インジケータが表示されます。ドキュメント分析ツールは PDF をスキャンし、ネイティブ テキストと画像のみのコンテンツを含むページの割合をレポートできます。
ファイル サイズは手がかりになりますが、決定的なものではありません。画像はテキストよりも多くのストレージを必要とするため、ページ画像で構成されるスキャンされた PDF は通常、同じページ数のネイティブ テキスト PDF よりも大きくなります。 10 ページのネイティブ テキスト PDF は 100 ~ 500 キロバイトになる可能性があります。 10 ページのスキャンされた PDF は 2 ~ 10 MB になる可能性があります。ただし、高解像度の埋め込み画像を含むネイティブ PDF もサイズが大きくなる可能性があるため、ファイル サイズだけでは信頼できる指標にはなりません。
日常の PDF タスクに区別が重要な理由
検索は、スキャンとネイティブの区別の影響を受ける最も一般的なタスクです。 50 ページの PDF を受け取り、特定の用語のすべての記述を検索する必要がある場合、ネイティブ PDF の検索機能を使用すると、数秒で答えが得られます。スキャンされた PDF では、各ページを手動で視覚的にスキャンする必要があり、これには数分かかり、必要な箇所を見逃す可能性があります。ドキュメントを検索できると、ドキュメントの操作方法が変わります。
他のドキュメントで再利用するためにテキストを抽出するには、ネイティブ テキストが必要です。独自のレポートで PDF から段落を引用する必要がある場合、ネイティブ PDF を使用すると、テキストを直接コピーして貼り付けることができます。スキャンした PDF では、テキストを再入力するか、OCR を実行して抽出可能にする必要があります。頻繁に参照するドキュメントの場合、即時コピーアンドペーストと手動再入力の違いは大きくなります。
視覚障害者が使用するスクリーン リーダーなどのアクセシビリティ ツールには、ネイティブ テキストが必要です。スクリーン リーダーはテキスト文字にアクセスできるため、ネイティブ PDF を読み上げることができます。アクセスできるテキスト文字がないため、スクリーン リーダーはスキャンされた PDF を読み取ることができません。スキャンした PDF にアクセスできるようにするには、スクリーン リーダーが解釈できるテキスト レイヤーを追加する OCR 処理が必要です。
Scanned PDF 形式は、文書をオリジナルの画像として表示するだけでよいアーカイブ目的には完全に適しています。署名された契約書のスキャンされたコピーは、署名された文書の視覚的な記録として機能します。テキストの操作、検索、コピー、編集、またはアクセシビリティを必要とする目的には、ネイティブ PDF または OCR を使用してスキャンした PDF が必要です。
スキャンした PDF を検索可能なネイティブのような PDF に変換する方法
光学式文字認識は、スキャンしたページ画像をテキスト レイヤーを備えた検索可能なドキュメントに変換するテクノロジーです。 OCR 処理をサポートする PDF ツールを使用して、スキャンした PDF で OCR を実行します。このツールは各ページ画像を分析し、テキスト文字を認識し、ページ画像の背後に非表示のテキスト レイヤーを追加します。 OCR 後、PDF は見た目は同じですが、検索可能になり、認識されたテキストを選択してコピーできるようになります。
OCR の精度は、元のスキャンの品質によって決まります。均一な照明、フラットなページ、鮮明なフォーカスを備えた 300 DPI でのクリーンなスキャンにより、99% 以上の OCR 精度が得られます。
影、湾曲したページ、またはぼやけたテキストを含む 150 DPI の低解像度スキャンでは、精度が 95% 未満になる可能性があり、手動での修正が必要になります。スキャンの品質によって OCR 出力の品質が決まります。
OCR を実行した後、ページ上に表示されるいくつかの単語を検索して結果を確認します。検索でそれらが見つかった場合、OCR は成功しています。検索で明らかな単語が見つからない場合は、そのページの特定のフォント、レイアウト、または画質で OCR に問題があった可能性があります。設定を調整して、または可能な場合は高品質のスキャンで OCR を再実行します。
WukongPDF の OCR PDF ツールは、ブラウザーでスキャンされたドキュメントを処理し、検索可能なテキスト レイヤーを含む PDF を返します。スキャンした PDF をアップロードし、OCR を実行して、検索、テキスト選択、スクリーン リーダー アクセスをサポートするドキュメントをダウンロードします。 OCR プロセスは、元の外観を維持しながら、ドキュメントをインタラクティブにするテキスト レイヤーを追加します。
スキャンされた PDF とネイティブ PDF のファイル サイズの違いは、大規模なドキュメント コレクションを扱う場合に特に重要になります。 PDF にスキャンされた紙文書のファイリング キャビネットでは、各ページが完全な画像であるスキャンされた PDF ページが数万ページ生成される場合があります。一般的な 300 DPI グレースケール スキャンの場合、ページあたり 500 キロバイトの場合、10,000 ページで 5 ギガバイトのストレージが消費されます。これらのスキャンされた PDF で OCR を実行しても、ページ画像が残るためファイル サイズは減りませんが、コレクションを実際に使用できるようにする検索可能なテキスト レイヤーが追加されます。
長期のアーカイブが必要なドキュメントの場合、PDF/A 形式がアーカイブの標準となります。スキャンされた PDF とネイティブ PDF の両方を PDF/A に変換できます。スキャンされた PDF を PDF/A に変換すると、アーカイブ メタデータが追加された画像ベースのドキュメントのままになります。 PDF/A に変換されたネイティブ PDF は、テキストと構造プロパティを保持します。 PDF/A では、ドキュメントのスキャンされた性質とネイティブな性質は変わりません。標準化されたメタデータを追加し、長期保存性を向上させる構造要件を強制します。
スキャンされたページとネイティブ ページが混在する PDF の場合、ネイティブ ページはそのままにして、スキャンされたページに OCR を適用します。ほとんどの OCR ツールは特定のページ範囲を処理できるため、必要なページでのみ OCR を実行できます。処理後、PDF は元のページのネイティブ テキストを保持し、以前は画像のみだったページに検索可能なテキスト レイヤーを備え、文書全体にわたって一貫した検索機能を提供します。
印刷して手書きで記入する文書の場合は、元のフォームをスキャンした PDF が完全に適切です。受信者は PDF を印刷し、空白をペンで埋めて、物理コピーを返送するか、スキャンしてデジタルに戻します。デジタルで記入する必要がある文書の場合、フォーム フィールドを備えたネイティブ PDF の方が、受信者がフィールドに直接入力できるため、非常に優れています。
ドキュメントをスキャンして PDF にするか、元のソース ファイルからネイティブ PDF を作成するかを選択する場合は、当面の必要性だけでなく、ドキュメントのライフサイクル全体を考慮する必要があります。スキャンした契約書の PDF は、レビューのために相手方に電子メールで送信するのに適しています。後で紛争中にその契約書の特定の条項を検索する必要がある場合、スキャンされた PDF に検索機能がないことが重大な問題となります。ドキュメント作成時にネイティブ PDF を作成すると、スキャンにはないオプションが保持されます。
最新のスキャン ソフトウェアには自動 OCR 処理が組み込まれていることが多く、実際の使用ではスキャンされた PDF とネイティブ PDF の区別があいまいになります。キャプチャ直後に OCR を実行する電話アプリでドキュメントをスキャンすると、技術的にはスキャンされた画像ですが、機能的にはネイティブ PDF と同様に検索可能な PDF が生成されます。このハイブリッド アプローチは、スキャンの利便性とネイティブ テキストの検索可能性を組み合わせたものです。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
