Others

スキャナーで作成された PDF 内のテキストを検索できないのはなぜですか

PDF を開いて Ctrl+F を押し、ページ上に表示されていることがわかっている単語を入力すると、検索ボックスには結果が 0 件返されます。ファイルは問題ないようです。すべての単語を自分の目で読むことができます。しかし、あなたのコンピュータに関する限り、その文書にはテキストがまったく含まれていません。

この経験はイライラするものですが、驚くほど一般的です。 UCLA HumTech による 2026 年の分析では、大学のコース全体の PDF の 14.4%、約 15,500 ファイルに OCR テキスト レイヤーが適用されておらず、さらに 4.5% に OCR 品質が不十分であることが判明しました (UCLA HumTech、「PDF Accessibility Audit」、2026)。合計すると、スキャンされた PDF の 5 件に 1 件近くにテキスト検索の問題が発生していました。この問題が発生する理由を理解することが、問題を解決するための第一歩です。

Why Can't I Search for Text Inside a PDF That Was Created From a Scanner

スキャンされた PDF は写真のコレクションであり、テキスト文書ではありません

スキャナーがページをキャプチャするとき、文字や単語は読み取られません。長方形のグリッド全体の明暗の変化を記録し、結果を平らな画像 (通常は TIFF または JPEG 形式) として保存します。その画像は PDF コンテナー内にラップされます。画面上でテキストのように見えるものは、たまたま文字に似た形で配置されたピクセルにすぎません。検索アルゴリズムにとって、これらのピクセル パターンは風景の写真と何ら変わりません。クエリするための基礎となる文字データはありません。

これにより、スキャンされた PDF は、業界で「ボーンデジタル」と呼ばれるものと区別されます。 PDF。ボーンデジタル PDF は、Microsoft Word、Google ドキュメント、Web ブラウザーの PDF 出力機能などのソフトウェアから生まれます。これらのプログラムは、実際の文字コード、フォント参照、およびテキスト位置データをファイルに直接埋め込みます。各文字には Unicode 値があり、Ctrl+F ですぐに見つけることができます。 2 種類の PDF は同じ .pdf ファイル拡張子を共有しますが、内部構造は根本的に異なります。

この問題の規模は重大です。 2025 年から 2026 年の Allyant PDF Accessibility Index は、770 以上の Web サイトにわたる 644,854 の公開 PDF を調査し、94.75% が基本的なアクセシビリティおよびユーザビリティ基準を満たしていないことがわかりました (Allyant、「PDF Accessibility Index」、2026)。これらの失敗のすべてが特に検索に関連しているわけではありませんが、根本的な原因は多くの場合同じです。つまり、ドキュメントが適切なテキスト レイヤーなしで画像として作成されたということです。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

OCR がなければ、スキャナは見たものだけを記録し、その意味は記録しない

スキャナは基本的に光学デバイスです。反射光を測定し、それらの測定値を色付きのドットのグリッドに変換します。言語、アルファベット、単語の境界を理解できません。印刷した契約書、手書きの手紙、または本のページをスキャナー ベッドに置いても、出力されるのは常に同じ、つまり高解像度の画像です。

ここで、OCR PDF テクノロジーが不可欠になります。 OCR は、Optical Character Recognition の略で、画像内のピクセル パターンを分析し、既知の文字形に対応する形状を識別し、それらの形状を機械可読テキスト文字に変換するソフトウェア プロセスです。スキャンされた PDF 上で OCR が正常に実行されると、元のページ画像の背後に非表示のテキスト レイヤーが追加されます。ドキュメントは肉眼では同一に見えますが、その下にあるテキストは完全に検索、選択、コピー可能になります。

PDF Association による 2025 年のベンチマーク テストによると、5 つの一般的なデスクトップ エンジンの OCR 精度は、ソース素材の品質に応じて 82% から 98% の範囲でした (PDF Association、「OCR Accuracy Benchmark Report」、2025 年)。標準ドキュメントのクリーンで高解像度のスキャンにより、ほぼ完璧な結果が得られました。色付きの背景、フォントが混在している、またはページが傾いているドキュメントでは、精度がその範囲の下限に向かって押し上げられます。

OCR が適用されても失敗する一般的な理由

OCR ソフトウェアがスキャンしたファイルを処理する場合でも、テキスト レイヤーが文字化けしたり、不完全になったり、実質的に役に立たなくなったりすることがあります。いくつかの特定の要因により認識品質が低下し、ソフトウェアが OCR を試みたにもかかわらず PDF が検索不能になります。

スキャン解像度は最も影響力のある要素です。 OCR エンジンは、「rn」という文字の組み合わせのように、視覚的に類似した文字を区別するために十分なピクセル密度を必要とします。単一の「m,」に対してまたは数字の「1」小文字の「l」と比較します。信頼性の高いテキスト認識のための業界標準の最小値は 300 DPI (ドット/インチ) です。 150 DPI 以下でキャプチャされたスキャンでは詳細が少なすぎるため、OCR エンジンが生成するテキスト レイヤーはエラーだらけで、検索機能では確実に何も見つけることができません。 200 DPI でスキャンされた文書は人間には完全に読み取れるように見えますが、OCR を実行すると 15% ~ 20% の文字エラー率が発生します。

ページのゆがみもよくある問題です。ドキュメントがスキャナ ガラス上に曲がって置かれた場合、OCR エンジンは、ページ全体で水平方向に走らなくなったテキストのベースラインを推測する必要があります。最新の OCR ソフトウェアのほとんどには自動スキュー補正アルゴリズムが含まれていますが、約 10 度を超える厳しい角度では、最良の補正ソフトウェアでも無効になる可能性があります。その結果、単語が分割、結合、または間違った読み順で配置されたテキスト レイヤーが作成されます。

単一ページ内にコンテンツ タイプが混在すると、さらなる課題が生じます。入力されたテキスト、手書きの欄外メモ、データ テーブル、ロゴ、飾り枠が組み合わされたページでは、OCR エンジンが継続的にコンテキストを切り替える必要があります。それぞれのスイッチにはエラーが発生する可能性があります。装飾フォントやスクリプト フォントは、OCR エンジンが認識するようにトレーニングされていない文字形状を生成するため、特に問題が発生します。手書きは、AI を活用した OCR の活発な研究分野ではありますが、現在利用可能なほとんどのツールで印刷されたテキスト認識よりも精度が大幅に低いままです。

検索不可能なスキャン済み PDF を完全に検索可能にする方法

ファイルに欠けているもの、つまりテキスト レイヤーを理解すれば、スキャンした PDF を検索可能にするのは簡単です。簡単なブラウザベースのツールからフル機能のデスクトップ アプリケーションまで、いくつかの方法で追加できます。

ほとんどの人にとって、ブラウザベースのアプローチが最も早いオプションです。 WukongPDF の OCR ツールは、アップロードされた スキャンされた PDF ファイルをブラウザで直接処理し、元のページ画像の背後に検索可能なクリーンなテキスト レイヤーを追加します。見た目は元のスキャンとまったく同じままであるため、書式変更やレイアウト変更のリスクはありません。一般的な複数ページのドキュメントの場合、プロセス全体に数秒かかり、出力ファイルは標準的な PDF リーダーで動作します。

オフライン処理が必要なユーザー、または非常に大規模なドキュメント セットを所有するユーザーの場合、デスクトップ OCR ソフトウェアを使用すると、より詳細な制御が可能になります。 Adobe Acrobat Pro には「テキスト認識」機能が含まれています。個々のファイルを処理したり、フォルダー全体をバッチ処理したりできるツール。 「検索可能な画像」などの出力オプションを提供します。元のスキャンを保持し、その後ろにテキスト レイヤーを追加するモードと、「編集可能なテキストと画像」モード。モード。ドキュメントの完全な再構築を試みます。検索可能な画像のアプローチは、オリジナルの視覚的な忠実度を変更する危険がないため、一般的により安全です。

無料およびオープンソースの代替手段も存在します。 Google ドライブは、アップロードされた画像や PDF に対して自動 OCR を実行しますが、複雑なレイアウトのドキュメントでは結果が不一致になる可能性があります。 Google が管理するオープンソース OCR エンジンである Tesseract は、開発者や技術に詳しいユーザーが自動処理パイプラインに統合できるコマンドライン ツールを提供します。これらすべての方法のトレードオフは、精度と利便性です。ブラウザベースのツールとクラウド サービスは、速度と使いやすさを優先します。デスクトップ ソフトウェアとオープンソース エンジンは、言語選択、DPI の仮定、出力形式などのパラメーターをより細かく制御できるため、難しいドキュメントの結果を目に見えて改善できます (PDF Association、「OCR Accuracy Benchmark Report」、2025)。

OCR が実際に使用可能なテキスト レイヤーを生成したかどうかを確認する方法

スキャンした PDF で OCR を実行すると、迅速な検証手順が 1 分未満で完了し、後でテキスト レイヤーがまだ見つからないか破損していることに気づいてイライラすることがなくなります。最も直接的なテストは、最初に問題を明らかにするテストです。処理された PDF を開いて Ctrl+F を押します。ページ内に表示される単語を検索します。検索機能がそれを見つけて強調表示した場合、その用語の OCR は成功しました。さまざまなページにわたって、特にテキストが密集している領域、小さいフォント、または特殊な書式設定がある領域で、いくつかの追加の単語をテストします。これらのエッジケースでは、OCR エンジンがサイレントに失敗することがほとんどです。

2 番目の実践的なテストは、カーソルでテキストを選択してみることです。適切に OCR 処理された PDF では、テキスト行をクリックしてドラッグすると、論理的な読み取り順序で個々の単語が強調表示されます。写真を選択しているかのように、ドラッグによってページ全体が 1 つのブロックとして選択される場合は、テキスト レイヤーが欠落しているか、下にある画像に適切に登録されていません。一部の PDF ビューアでは、ドキュメントのプロパティ パネルにテキスト認識ステータスも表示され、OCR レイヤーが存在するかどうかを確認できますが、認識されたテキストが正確かどうかはわかりません。

法的契約書、医療記録、財務諸表など、正確さが実際の結果をもたらす文書の場合は、元のスキャンと照らし合わせて数段落を手動で抜き取りチェックするのが最も安全な方法です。 OCR エラーは、微妙ではありますが、重大な問題を引き起こす可能性があります。契約金額の数字の読み間違い、医薬品名の間違った文字、または財務記録の日付の文字化けは、文書を検証せずに信頼すると、重大なエラーにつながる可能性があります。リスクが高い場合、チェックに費やす数分は価値のある投資です。

今後のスキャンで問題を完全に回避する方法

PDF を確実に検索できるようにするのに最適なタイミングは、PDF を作成した瞬間です。スキャン ワークフローをいくつか調整するだけで、スキャン後の OCR が完全に不要になり、時間を節約し、作成するすべてのドキュメントの一貫性を確保できます。

スキャナのデフォルトの解像度を 300 DPI 以上に設定します。この 1 つの設定は、制御下にある変数の OCR 精度に最も大きな影響を与えます。最新のスキャナ ドライバ ソフトウェアはどれも DPI を調整でき、200 DPI から 300 DPI へのファイル サイズのわずかな増加は、後でファイルを再処理する必要がないことで節約される時間に比べれば無視できます。スキャナーで「PDF」と「PDF」のどちらかを選択できる場合は、および「検索可能な PDF」出力形式としては、常に後者を選択してください。このオプションは、スキャン プロセスの一部として OCR を自動的に実行し、テキスト レイヤーを出力ファイルに直接埋め込むようにスキャナーに指示します。

電子メールで送信された契約書、ベンダーからのスキャンされた請求書、同僚と共有されるアーカイブされた記録など、作成するのではなく受け取る文書については、ファイルを開いたらすぐに 5 秒間の Ctrl+F テストを実行するという簡単な習慣を構築してください。文書をファイルに保存し、数週間後にその文書内で何かを見つける必要がある前に、問題を早期に発見できれば、コンテキストが新しいうちに OCR ツールで文書をすぐに実行できることになります。この小さな習慣により、古いスキャンのフォルダーを調べて、どのスキャンに特定の情報が含まれていたかを思い出すという、あまりにも一般的なシナリオが防止されます。

オフィスで共有スキャナを管理している場合は、そのデフォルト設定を確認してください。多くのオフィス用多機能プリンタは、OCR が無効になっているか、デフォルトで低解像度に設定された状態で出荷されます。自動 OCR を有効にし、デフォルトとして 300 DPI を設定すると、そのデバイスを使用するすべての人にメリットがあります。 1 回限りの構成変更により、機器の耐用年数にわたってチーム全体で数百人時間のフラストレーションが発生するのを防ぐことができます。

WukongPDF

PDF OCRを試してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →