Others

PDF を Word に変換してから PDF に戻すとテキストが検索できなくなるのはなぜですか

検索可能な PDF があります。 Word に変換して編集します。編集したドキュメントを PDF に保存し直します。新しい PDF は元の PDF と同じように見えますが、文書内に含まれていることがわかっている単語を検索すると、結果が返されません。元の PDF で検索可能だったテキストは、新しい PDF の検索機能では表示されません。 Word を介したラウンドトリップにより、テキストから検索機能が取り除かれました。

PDF から Word への変換とそれに続く Word から PDF への再変換は PDF 編集の一般的なワークフローですが、各変換ステップでテキスト レイヤーが破損する可能性があります。 PDF 形式で返されたテキストは、元のテキストとは異なる方法で保存されたり、文字コードの代わりにベクトル アウトラインとして保存されたり、画像にラスター化されたりする場合があります。これらのそれぞれの結果により、テキストは表示されますが検索はできない PDF が生成されます。

Why Does Text Become Unsearchable After Converting a PDF to Word and Then Back to PDF

フォーマット変換中にテキストが存続するか失われるか

元の検索可能な PDF では、テキストはフォント グリフにマップされた文字コードとして保存されます。文字 H は ASCII コード 72 として保存され、PDF リーダーに埋め込みフォントから H のグリフを表示するよう指示します。検索機能は、検索語の文字コードをスキャンし、ページ上の対応する位置を強調表示します。この文字コードベースのストレージにより、テキストの検索が可能になります。

PDF が Word に変換されると、コンバーターは文字コードを抽出し、編集可能なテキストとして Word 文書に書き込みます。 Word 内のテキストは Unicode 文字コードとして保存されるため、検索可能です。 PDF から Word への変換では、コンバーターが文字コードを正しく抽出する限り、検索可能性が維持されます。

編集した Word 文書を PDF に保存し直すとき、Word PDF エンジンはテキストを保存する方法を決定する必要があります。デフォルト設定では、テキストはフォントが埋め込まれた文字コードとして保存され、検索性が維持されます。ただし、特定の Word 機能と PDF 設定により、テキストがベクター アウトラインとして保存されたり、画像としてラスター化されたりすることがあります。

テキストの影、反射、光彩、3D 回転などの Word のテキスト効果により、Word PDF エンジンは影響を受けるテキストを画像に変換します。テキストは視覚的には正しく見えますが、検索機能で見つけられる文字コードがありません。視覚効果が適用されたテキストでは、PDF Searchable プロパティが失われます。

WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

ラウンドトリップを通じてテキストの検索可能性を維持する方法

編集したWord文書をPDFに保存する前に、保存設定を確認してください。 Word で、[ファイル]、[オプション]、[保存] の順に開き、[ファイルにフォントを埋め込む] がチェックされていることを確認します。この設定により、フォントはアウトラインやイメージに変換されるのではなく、文字ベースのテキストとして埋め込まれます。

検索可能にしておく必要があるコンテンツにはテキスト効果を適用しないでください。シャドウ、反射、グロー効果の代わりに、太字、斜体、色の書式設定を使用します。検索性を犠牲にすることなく、視覚的な区別を実現できます。

WukongPDF は、PDF を処理してテキスト ストレージを最適化できる PDF Converter ツールを提供します。検索不可能なテキストを含む PDF が作成された場合、OCR は既存のビジュアル コンテンツの背後に検索可能なテキスト レイヤーを追加できます。

再変換後の検索可能性の検証

Word 文書を PDF に保存した後、PDF を開いて検索機能をテストします。各ページに表示される単語を検索します。どのページでも、表示されている単語に対して結果が返されない場合、そのページには検索不可能なテキストが含まれています。検索テストには数秒かかり、ドキュメントが配布される前に検索性の損失が検出されます。

検索可能性が失われた場合は、再変換された PDF で OCR を実行して、検索可能なテキスト レイヤーを追加します。 OCR は、表示されているテキストを認識し、その背後に文字コードを作成します。検索機能は、OCR で生成された文字コードを通じてテキストを検索できます。これは予防策ではなく事後修正ですが、検索不可能な PDF を検索可能に戻します。

保証された検索性が必要なドキュメントの場合は、PDF から Word への往復を完全に避けてください。元のソースドキュメント、Word ファイル、InDesign ファイル、Google ドキュメントを編集し、新しい PDF をエクスポートします。ソースから PDF への 1 回のエクスポートにより、中間の変換手順なしで検索性が維持されます。

Word 互換モードは PDF 出力に影響します。 DOCX ではなく古い DOC 形式で保存されたドキュメントは、PDF の検索性に影響を与える別のテキスト保存方法を使用している可能性があります。 PDF にエクスポートする前に、ドキュメントを現在の DOCX 形式で保存します。

Word テキスト ボックス内のテキストは、テキスト ボックスの書式設定によっては PDF エクスポート中にラスタライズされる場合があります。塗りつぶし効果、回転、またはテキスト方向の変更を備えたテキスト ボックスは、プレーン テキスト ボックスよりもラスター化される可能性が高くなります。

PDF エクスポート中にテキストがラスタライズされると、エンコードされたテキストではなくテキストの画像になります。画像は正しく表示されますが、文字はコードではなくピクセルです。 OCR はテキストを回復できますが、OCR テキストには認識エラーが含まれている可能性があります。

Word の PDF エクスポート オプションには、フォントが埋め込まれない場合のビットマップ テキストの設定が含まれています。この設定は、埋め込み制限のあるフォントを使用するテキストをラスタライズします。すべてのフォントで埋め込みが許可されていることを確認すると、この強制的なラスタライズが防止されます。

往復変換後、元の PDF と再変換された PDF のファイル サイズを比較します。再変換された PDF が大幅に大きい場合は、テキストが画像にラスタライズされ、エンコードされたテキストよりも多くのストレージ スペースを消費していることを示している可能性があります。

一部の PDF to Word コンバーターは、スキャンされた PDF 用の OCR ベースの変換モードと、デジタル PDF 用のテキスト抽出モードを提供します。間違ったモードを使用すると、予期しない結果が生じます。デジタル PDF では、元の文字エンコーディングを保持するために、OCR ではなくテキスト抽出を使用する必要があります。

テキストの検索機能が失われると、PDF ビューアの検索機能は、表示されている単語に対して結果を返しません。各ページで「 」や「 」などの一般的な単語を検索すると、文書全体に検索可能なテキストがあるかどうかをすぐに確認できます。

複数の編集サイクルを通じて検索可能性を維持する必要があるドキュメントの場合は、編集可能な形式 (Word、Google ドキュメント、または InDesign) でマスター ドキュメントを作成し、PDF を読み取り専用の配布形式として扱います。すべての編集はマスターで行われ、各編集サイクルの後に PDF がマスターから再生成されます。

アクセシビリティ チェッカーは、テキストの検索可能性を検証し、検索不可能なテキストを含むページを識別できます。再変換された PDF でアクセシビリティ チェックを実行し、すべてのテキストがエンコードされ、アクセス可能であることを確認します。

PDF/UA 標準では、検索性とスクリーン リーダー アクセスを確保するために、すべてのテキストを Unicode 文字としてエンコードする必要があります。 Word から PDF/UA にエクスポートすると、検索性を維持するためのテキスト エンコード要件が強制されます。

PDF から Word へのコンバーターの選択は、テキストの保存に影響します。テキストの編集可能性よりも視覚的な忠実度を優先するコンバーターは、特殊なフォントや配置を使用するテキストをラスタライズする場合があります。テキストの編集可能性を優先するコンバーターは、より検索しやすい出力を生成する場合があります。

テキストが合字 fi、fl、ffi として PDF に保存されている場合、コンバーターは合字を個別の文字に分割するか、単一の文字として保存することがあります。検索関数の動作は、変換中に合字がどのように処理されたかによって異なります。

将来の変換における検索可能性の損失の防止

Word 文書で WordArt、SmartArt、埋め込まれた Excel グラフなどの機能を使用している場合、ソース PDF 内で元々ベクトルベースだったテキストは、Word から PDF へのエクスポート中にラスター イメージに変換されることがあります。これらの機能は、PDF 出力で画像としてレンダリングされます。

Word の PDF 作成設定には、見出しからブックマークを作成するオプションが含まれています。このオプションは文書構造を保持しますが、テキストの検索可能性には影響しません。ブックマークと検索機能は独立した機能です。

ドキュメント言語の一般的な単語など、すべてのページに表示される単語を検索することで検索可能性をテストすると、検索不可能なテキストを含むページがすぐに特定されます。どのページでも一般的な単語の結果が返されない場合、そのページにはテキスト エンコーディングに問題があります。

PDF から Word へ PDF へのラウンドトリップ中にテキストの検索性が失われる条件を理解することで、ドキュメント作成者は編集ワークフローについて十分な情報に基づいた選択を行い、コンテンツのアクセシビリティと検索のしやすさを維持できるようになります。

PDF から Word、PDF への往復でテキストの検索可能性を維持するには、各ステップの変換設定に注意し、テキストが文字としてエンコードされるのではなくラスター化される Word の機能を理解する必要があります。

テキストの検索可能性が要件であるドキュメントの場合、フォーマット変換のたびに元のエンコードされたテキストを保持するワークフローを確立する方が、検索可能性が失われた後に復元しようとするよりも効率的です。

テキストの検索機能は、それが存在しないまではユーザーが当然のことと考える機能であり、検索不能な PDF を検索機能に戻すには、元のソースから再処理するか、影響を受けるページで OCR を実行してテキスト レイヤーを再作成する必要があります。

PDF から Word、PDF への往復は一般的な編集ワークフローであり、テキスト エンコーディングが劣化したり失われたりする機会が複数発生します。各リスク ポイントを理解することは、ユーザーがプロセスを通じて検索可能性を維持するのに役立ちます。

テキストの検索機能は表面的な機能ではなく、アクセシビリティ、検索のしやすさ、コンテンツを抽出して他の用途に再利用する機能に影響を与える基本的なドキュメント機能です。

PDF から Word へのコンバーターの選択は、ラウンドトリップの結果に大きく影響します。テキストの編集性を重視して最適化されたコンバーターは、視覚的な忠実度を重視して最適化されたコンバーターよりも検索可能な出力を生成します。

往復中に検索可能性が失われた場合、OCR は検索可能なテキスト レイヤーを復元できますが、OCR テキストには認識エラーが含まれるため、ドキュメントを完全に信頼できるようにするには、この認識エラーを修正する必要があります。

検索性が要件となるドキュメントの場合、元のソース ファイルを維持し、編集サイクルごとに新しい PDF をエクスポートする方が、Word を往復するよりも信頼性が高くなります。

PDF 形式はワードプロセッサ形式とは根本的に異なる方法でテキストを保存するため、これらの表現間の各変換により、テキスト エンコードにおける情報損失のリスクが生じます。

往復ステージ検索可能性のリスク緩和
PDFからWordへ(抽出)テキスト抽出コンバータを使用する場合は低いテキスト抽出モードでコンバータを使用する
Wordで編集するなし; Word テキストはいつでも検索可能テキスト効果(シャドウ、グロー、3D)を避ける
WordからPDFへ(エクスポート)中くらい;効果によりラスタライズが発生するフォントを埋め込む。検索可能なテキストへの影響を回避する
輸出後の検証該当なしすべてのページで一般的な単語を検索する
WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →