2 つの PDF がフォルダー内に並べて配置されます。どちらも同じページ数です。どちらも同じ年に作成されました。両方に同じ検索語を入力します。ほぼ即座に結果が返されます。もう 1 つは一時停止し、回転する進行状況インジケーターを表示し、その用語が 12 ページで見つかったことを報告するまでに数秒かかります。これら 2 つの PDF 間の検索速度の違いはランダムではありません。これは、PDF の作成方法、テキストが埋め込まれているのか OCR で生成されているのか、フォントのエンコード方法、文書構造に検索最適化機能が含まれているかどうかによって決まります。一部の PDF 検索可能 ドキュメントが他のドキュメントよりも検索が速い理由を理解すると、効率的に検索する PDF を作成し、注意が必要な検索が遅いドキュメントを診断するのに役立ちます。

PDF 検索の実際の仕組み
PDF を検索する場合、ビューアは表示されているページ画像をスキャンして文字の形状を検索しません。 PDF ファイルに埋め込まれたテキスト コンテンツ ストリームをクエリします。各ページには、ページ上の文字、その位置、文字の表示に使用されるフォントをリストする 1 つ以上のコンテンツ ストリームが含まれています。検索機能は、これらのコンテンツ ストリームを 1 文字ずつ順番に読み取り、検索用語に一致するものを探します。この順次スキャンの速度は、テキスト データがどのように構成されているかによって決まります。
適切に構造化されたコンテンツ ストリームを含む PDF では、テキストが一貫したエンコーディングで論理的な読み取り順序で表示され、ビューアがディスクからデータを読み取るのと同じくらい高速に検索できます。断片化されたコンテンツ ストリームを含む PDF では、単一段落のテキストが複数のストリーム オブジェクトに不連続な順序で分散されており、検索機能がファイルの異なる部分間を移動し、検索する前にメモリ内でテキストが再組み立てされます。コンテンツ ストリームの PDF 形式 構造が、検索速度の主な決定要因となります。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
検索パフォーマンスにおける埋め込みテキストと OCR テキストの比較
埋め込みテキスト、つまりワード プロセッサまたはレイアウト アプリケーションで作成され、PDF に直接書き込まれたテキストは、一連の文字コードとして保存されます。各文字は、コンテンツ ストリーム内の既知の位置を占めます。検索機能はストリームを線形に読み取り、一致するものを効率的に見つけます。 OCR PDF テキスト (スキャンされたページ画像から光学式文字認識によって生成されたテキスト) は、別の方法で保存されます。 OCR エンジンは、認識された各単語をページ上のおおよその位置に配置しますが、単語はコンテンツ ストリーム内で厳密に読み取られる順序ではない場合があります。
OCR テキストには認識エラーが含まれる場合もあります。 OCR エンジンによって別の文字として誤って読み取られた文字は、ページ上に表示されている文字が正しいように見えても、検索語と一致しません。 OCR エンジンが誤認識を出力してコンテンツ ストリームに配置した場合でも、contract を検索しても c0ntract は見つかりません。検索機能ではページ画像は表示されません。 OCR テキストのみが表示されます。そのテキスト内のエラーは、検索の失敗に直接変換されます。
フォントエンコーディングとその検索への影響
PDF 内のフォントはいくつかの方法でエンコードでき、エンコードは検索速度に影響します。 WinAnsiEncoding や MacRomanEncoding などの標準エンコーディングのフォントは、文字コードを標準グリフに直接マップします。マッピングは単純であるため、検索機能はこのテキストを迅速に処理できます。文字コードがフォント設計者によって任意に割り当てられるカスタム エンコードのフォントでは、フォント エンコード テーブル内の各コードを検索して、それがどの文字を表しているかを判断する検索機能が必要です。この検索により、すべての文字比較にオーバーヘッドが追加されます。
東アジアの文字セットに使用される CID フォントは、文字コードを CID 値にマップし、次に CID 値を Unicode にマップする 2 レベルのエンコーディングを使用します。 CID エンコードされたフォントでテキストを検索するには、文字ごとにこの 2 レベルのマッピングを解決する必要があります。 CID エンコード フォントで中国語、日本語、または韓国語のテキストを含む PDF は、標準エンコード フォントで英語のテキストを含む PDF よりも検索が遅くなります。これは純粋に追加のエンコード解像度ステップが原因です。 PDF の作成時に選択した PDF フォント エンコーディングは、ドキュメントの存続期間全体にわたる検索パフォーマンスに影響します。
検索におけるページ構造ツリーの役割
タグ付き PDF には、ドキュメントのコンテンツをセクション、段落、図などの論理要素に編成する構造ツリーが含まれています。構造ツリーは、ドキュメントのロードマップを含む検索機能を提供します。ファイルの先頭からコンテンツ ストリームを直線的にスキャンする代わりに、検索機能は構造ツリーをナビゲートして、特定のドキュメント セクション内のテキストを見つけることができます。構造ツリーはフラット コンテンツ ストリームにはないインデックス機能を提供するため、タグ付き PDF 内の検索を高速化できます。
流通している PDF の大部分を構成するタグなし PDF には、この構造ツリーがありません。検索機能には、コンテンツ ストリームを順番にスキャンする以外に選択肢はありません。短いドキュメントの場合、違いは無視できます。数百ページまたは数千ページのドキュメントの場合、構造ツリーの有無によって、ほぼ瞬時の検索結果が得られるか、顕著な遅延が生じるかが決まります。タグ付き PDF の作成はアクセシビリティのベスト プラクティスであり、PDF Searchable のパフォーマンスにもメリットをもたらします。
PDF に埋め込まれた検索インデックス
一部の PDF 作成ツールでは、検索インデックスを PDF ファイルに直接埋め込むことができます。このインデックスは、単語をその単語が表示されるページにマッピングする、事前に構築された検索テーブルです。検索機能はコンテンツ ストリームをスキャンするのではなくインデックスをクエリするため、インデックスが埋め込まれた PDF はほぼ瞬時に検索できます。インデックス検索により、単語が出現するページ番号が返され、閲覧者はそれらのページに直接ジャンプします。
埋め込みインデックスは、ファイル サイズとインデックスの作成時間が増加するため、汎用 PDF では一般的ではありません。これらは、検索速度が優先される大規模なリファレンス PDF、技術マニュアル、ドキュメント コレクションで最も一般的に見られます。ほとんどの PDF 作成ワークフローには、デフォルトではインデックス生成が含まれていません。埋め込みインデックスがないのが普通です。同じサイズの他の PDF よりも著しく高速に検索する PDF に遭遇した場合は、埋め込まれたインデックスが原因である可能性があります。
検索速度を向上させるためにできること
頻繁に検索される PDF を作成する場合は、標準のフォント エンコーディングを使用してタグ付き PDF として生成します。デザイン要件を満たせない場合を除き、カスタム フォント エンコーディングは避けてください。 PDF に非ラテン語のテキストが含まれる場合は、ドキュメント全体に対してエンコード手法を適用する前に、サンプルで検索パフォーマンスをテストしてください。作成設定への少額の投資は、ドキュメントを使用するすべてのユーザーの検索を高速化することに効果があります。
既存の PDF の検索が遅い場合は、よりクリーンなコンテンツ ストリームを生成する最新のエンジンを使用して、OCR で生成されたテキストを再 OCR することを検討してください。ドキュメントが現在タグ付けされていない場合は、タグ付けを追加できる構造分析ツールを通じて PDF を実行します。 WukongPDF は、OCR PDF の再処理とドキュメントのタグ付けをサポートしており、ソース ドキュメントから PDF を再作成することなく、既存の PDF の検索パフォーマンスを向上させることができます。
PDF の作成日と作成に使用されたソフトウェアのバージョンによって、検索速度の違いが説明されることがあります。最新の PDF ライブラリの 2024 バージョンで作成された PDF は、従来のツールの 2008 バージョンで作成された PDF よりもクリーンなコンテンツ ストリームとより効率的なテキスト エンコーディングを備えている可能性があります。 PDF 形式は進化しており、新しい作成ツールではより適切に構造化されたファイルが作成されます。
文書管理ワークフローの一部として頻繁に検索される PDF の場合は、テキストを抽出して外部検索インデックスを構築することを検討してください。全文検索インデックスを備えたドキュメント管理システムは、PDF コンテンツ ストリームではなくインデックスをクエリします。検索速度は PDF の内部構造に依存しません。
フォントを変更するたびに検索機能で新しいエンコード テーブルをロードする必要があるため、PDF で使用されるフォントの数は検索速度に影響します。他のすべての要素が同じ場合、2 つのフォントを使用する PDF は、20 のフォントを使用する PDF よりも高速に検索されます。
ドキュメントの PDF Searchable のパフォーマンスは、フォント エンコーディング、コンテンツ ストリームの構成、ドキュメントのタグ付け、およびインデックスの埋め込みに関する選択によって作成時に決定されます。これらの選択肢は文書の作成者には見えませんが、文書を検索する人にはすぐにわかります。
頻繁に検索されるドキュメント コレクションの場合、標準フォント エンコーディングを使用して適切に構造化され、タグ付けされた PDF を作成するための投資は、ユーザーがクエリを入力してほぼ即座に結果を受け取るたびに利益をもたらします。
この記事では、この特定のシナリオで PDF を操作するための主要なテクニックと考慮事項について説明します。ここで説明する方法はさまざまなツールやプラットフォームに適用できるため、読者はワークフローや技術環境に最適なアプローチを柔軟に選択できます。
概要を説明した実践的な手順は、最初の課題から実際の解決策に至るまでの明確な道筋を示します。各手法は信頼性とアクセシビリティを考慮して選択されており、読者が PDF ツールの使用経験に関係なく一貫した結果を達成できるようにしています。
この記事で説明されている検索速度の違いは、PDF 作成時の選択の直接の結果です。これらの要素を理解することで、ドキュメント作成者はより優れた検索エクスペリエンスを提供する PDF を作成できるようになります。
この記事で説明するツールとテクニックは、最初の質問からさまざまなドキュメントやシナリオに適用できる実用的なソリューションに至る実践的な道筋を提供します。
PDF OCRを試してみる
インストールは必要ありません。ブラウザで直接動作します。
