スキャンした PDF を開くと、ネイティブのデジタル ドキュメントであるかのようにテキストを選択、コピー、検索できます。そのテキストは元のスキャンから来たものではありません。スキャナーはページの画像、つまりテキスト データをまったく含まないピクセルのグリッドを生成しました。選択および検索しているテキストは OCR テキストであり、ページ画像を分析してピクセル パターンを文字に変換する光学式文字認識ソフトウェアによって生成されます。ただし、PDF 内で選択可能なすべてのテキストが OCR テキストであるわけではありません。一部の PDF には、スキャナーや認識エンジンを通過せず、デジタル的に作成された埋め込みテキストが含まれています。 OCR テキストと埋め込みテキストの違いを理解すると、一部の PDF では完全に検索されるのに、他の PDF では文字化けした結果が生成される理由が説明されます。

OCR テキストとは何か、そしてそれがどのように PDF に組み込まれるのか
OCR テキストは機械によって生成されます。 OCR PDF エンジンは、スキャンされたページ画像内の各文字の形状を検査し、既知の文字パターンのデータベースと比較して、最も一致する可能性の高い文字をページ上の位置とともに出力します。認識されたテキストは、元の画像文字の上に正確に配置された不可視レイヤーとして PDF に埋め込まれます。スキャンした PDF からテキストを選択してコピーする場合、表示される画像からではなく、この非表示の OCR レイヤーからコピーすることになります。 OCR エンジンが文字を誤って読み取った場合、表示される画像は正しく見えても、コピーされたテキストにはそのエラーが含まれます。
OCR テキストの品質は、元のスキャンの解像度と明瞭さ、元の文書で使用されているフォント、テキストの言語、OCR エンジンの機能など、いくつかの要因によって決まります。最新の OCR エンジンで処理されたレーザー印刷された英語文書のクリーンな 300 DPI スキャンにより、ほぼ完璧なテキストが生成されます。基本的な OCR エンジンで処理された複雑な文字形状を持つ言語でドット マトリクスで印刷されたドキュメントを 150 DPI でスキャンすると、エラーだらけのテキストが生成されます。 OCR テキストの精度は、認識エンジンとスキャン品質が許容する範囲内に限られます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
埋め込みテキストとは何か、そしてそれがどのように PDF に取り込まれるのか
埋め込みテキストは作成されたものであり、認識されません。ワード プロセッサ、デスクトップ パブリッシング アプリケーション、または PDF 作成ライブラリが PDF を生成すると、テキストが PDF コンテンツ ストリームに直接書き込まれます。各文字は、フォント内のグリフにマップされる特定のコードとして保存されます。テキストは決して画像ではないため、認識ステップはありません。 PDF を作成したアプリケーションは、どのような文字が書かれているかを正確に認識し、正確に記録しました。デジタルで作成された PDF からテキストを選択してコピーすると、作成者が入力した文字をそのままコピーすることになります。
埋め込みテキストには、OCR テキストには通常欠けている書式設定情報が含まれています。フォント名、太字と斜体のスタイル、文字間隔は、ソース文書内で作成者によって指定されているため、埋め込みテキストに保持されます。 OCR テキストはこの書式設定の一部を再構築する場合がありますが、それは明示的なメタデータとして保存されるのではなく、文字の視覚的な外観から推測されます。スキャンして OCR したページとネイティブのデジタル ページを PDF 形式 で比較すると、この違いが明らかになります。 OCR バージョンではテキストの選択が可能ですが、すべての文字が同じ太さの同じフォントとして報告されます。デジタル版では、作者が意図したフォントの区別が維持されています。
PDF 内のテキストが OCR であるか埋め込まれているかを判断する方法
PDF 内のテキストが OCR によって生成されたものであるか埋め込まれているかを判断する最も信頼できる方法は、ドキュメントのプロパティ、特にフォント リストを確認することです。フォント情報を表示できるビューアで PDF を開きます。 Adobe Acrobat では、[ファイル]、[ドキュメントのプロパティ]、[フォント] の下にフォント リストが表示されます。フォント リストに OCR を含む名前のフォントが表示されている場合、またはフォントが不明または特定の名前のない汎用タイプとしてリストされている場合、テキストは OCR によって生成された可能性があります。フォント リストに、太字や斜体などのサブタイプを持つ Arial、Times New Roman、Calibri などの特定の名前付きフォントが表示されている場合、そのテキストはほぼ確実にデジタル ソースから埋め込まれています。
もう 1 つの実践的なテストは、一般的な OCR エラー パターンを検索することです。 PDF 内で一般的な OCR 置換エラー (OCR エンジンが単一の文字 m と誤読する文字の組み合わせ rn など) を検索します。検索で barn が bam になる、または corn が com になるインスタンスが見つかった場合、テキストは OCR によって生成されます。文字が視覚的に曖昧になることはないため、埋め込みテキストにはこれらの置換エラーは含まれません。文書の PDF 検索可能 の品質は、基になるテキスト (OCR または埋め込み) が表示可能なコンテンツを正確に表現しているかどうかによって決まります。
同じPDF内にOCRテキストと埋め込みテキストが混在する場合
1 つの PDF に、OCR テキストと埋め込みテキストの両方を別のページまたは同じページに含めることができます。契約パッケージには、埋め込みテキストを含むデジタルで作成された契約本文と、OCR テキストを含むスキャンされ OCR 処理された署名ページが含まれる場合があります。研究レポートでは、デジタルで作成されたテキスト ページと、歴史的な新聞の切り抜きをスキャンして OCR 処理した写真を組み合わせる場合があります。 3 ページ目のテキストは、ピクセルパーフェクトな埋め込みテキストです。 7 ページのテキストは OCR テキストであり、認識エラーが含まれている可能性があります。
この混合コンテンツのシナリオは、PDF からテキストを検索または抽出する人にとって微妙な罠を生み出します。埋め込みテキスト ページからの検索結果は正確です。 OCR テキスト ページからの検索結果では、OCR エンジンが単語を読み間違えた箇所が見つからなかったり、OCR エンジンが類似の単語に置き換えた場合に誤った一致が返される場合があります。混合コンテンツ PDF を使用する場合は、OCR ページから抽出されたテキストを信頼する前に検証してください。最も安全なアプローチは、OCR ページから抽出されたテキストが重要な目的で使用されるたびに、対応するページ画像を視覚的に確認することです。
事後の OCR テキスト品質の向上
PDF に低品質の OCR テキストが含まれている場合、元のスキャンと OCR プロセスがすでに完了しているため、PDF を改善するためのオプションが制限されます。スキャン品質を遡って改善することはできません。できることは、より優れたエンジンを使用して PDF を再 OCR することです。利用可能な最高の解像度で PDF からページ画像を抽出し、元の OCR パスよりも正確な結果を生成する最新の OCR エンジンを通して実行します。古い OCR テキスト レイヤーを新しいものに置き換えます。
一部の PDF エディタでは、テキスト レイヤーで OCR エラーを直接手動で修正できます。編集モードで PDF を開くと、非表示の OCR テキストが表示されます。誤って認識された単語をクリックして修正を入力します。この手動修正プロセスは、数ページの少数のエラーに対して実用的です。すべての段落に認識エラーが含まれる 200 ページの文書の場合、これは現実的ではありません。大規模な OCR 品質問題の場合は、より優れたエンジンを使用してドキュメント全体を再 OCR する方が効率的です。
ドキュメント作成に OCR と埋め込みテキストのどちらを選択するか
検索、インデックス付け、またはアーカイブされる PDF を作成する場合、スキャンと OCR を使用するか、ネイティブのデジタル PDF を生成するかの選択は、長期的な影響を及ぼします。テキストが埋め込まれたネイティブのデジタル PDF はサイズが小さく、検索が速く、テキストの正確性が完全に維持されます。スキャンして OCR 処理した PDF は、元の紙文書の外観を保持しますが、PDF がコピー、引用、参照されるにつれて認識エラーが発生する可能性が生じます。
アーカイブ プロジェクトの場合、両方の形式を保存することがベスト プラクティスです。視覚的な忠実性を保つために、高解像度のスキャンをアーカイブ マスターとして保存します。テキストの検索と分析のために、再入力するか、手動修正を伴う高精度 OCR を適用することによって、ネイティブのデジタル バージョンを生成します。この二重形式のアプローチにより、元のスキャンの信頼性と検索可能なテキストの使いやすさが提供されます。 WukongPDF は、スキャンされたドキュメントを検索可能な PDF に変換するための OCR PDF 処理をサポートし、結果として得られる OCR テキスト レイヤーは、スキャンされたドキュメントをデジタル ワークフローで使用できるようにする検索およびコピー機能を提供します。
OCR と埋め込みテキスト間の長期的な信頼性のギャップ
ORed PDF は、デジタルで作成された PDF とは異なります。デジタルで作成された PDF を作成後 20 年経っても開いた場合、文字コードが明確でフォントが埋め込まれているため、テキストが完全に表示されます。作成後 20 年経っても OCRed PDF を開くことができるかどうかは、元のスキャンの品質と、その時点で利用可能な OCR エンジンの精度によって決まります。文書が新鮮なときはほとんど気付かなかった認識エラーは、元の紙文書が検証に利用できなくなると、重大な障害になります。
長期保存を目的とした文書の場合、OCR テキストよりもデジタル ソースからの埋め込みテキストの方が常に適しています。文書が紙上にのみ存在し、スキャンする必要がある場合は、その時点で利用可能な最高品質のスキャンと OCR 処理に投資し、元の紙文書を可能な限り長く保存します。紙の原本は、数年後に判明する可能性のある OCR エラーに対する究極のバックアップです。
OCR PDF テキストと埋め込みテキストを区別するための実践的なテスト: 段落を 300% 以上に拡大して、文字の端を確認します。 OCR テキストでは、表示される文字イメージと非表示のテキスト レイヤーの間にわずかなずれが見られることがよくあります。文字の形状と位置が同じフォント プログラムから取得されているため、埋め込みテキストは完璧な位置でレンダリングされます。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
