文字化けしたテキスト、ランダムな記号、空白の四角の列、または意味のない文字列が表示された PDF は、実際には回復できない破損したファイルのように見えることがあります。文書はエラー メッセージなしで開き、ページ数は正しく表示され、画像やグラフィックも正常に表示されますが、単語自体は完全に判読できないものに置き換えられています。このパターンは通常、構造ファイルの破損ではなく、フォント エンコーディングの問題を示しています。フォントの問題は、多くの場合、専門のデータ回復ツールやフォレンジック ファイル修復サービスを使用しなくても修正できるため、これは朗報です。基礎となるコンテンツがファイル内にまだ存在しており、フォント データが欠落しているか不一致であるために PDF ビューアが解釈できない方法でエンコードされている可能性があります。

フォント エンコーディングと真のファイル破損の診断
最初の診断手順は、問題の原因がフォント エンコーディングにあるのか、PDF ファイル構造自体にあるのかを判断することです。フォント エンコーディングの問題により、ドキュメント全体で体系的かつ一貫した文字化けが発生します。文字 A のすべてのインスタンスが中空の正方形になる場合もあれば、すべてのテキストが一貫して異なるアルファベットのランダムなアクセント付き文字として表示される場合もありますが、パターンは予測どおりに繰り返されます。実際のファイル破損は、ページのレンダリングにまったく失敗する、ファイルを開こうとしたときにエラー メッセージが表示される、ドキュメントのセクションが完全に空白であるのに他のセクションは正しく表示されるなど、一貫性のない動作を引き起こします。画像は完璧に表示されるが、文字化けしたテキストが表示されるページは、構造的な損傷ではなく、フォントの問題を非常に強く示しています。
少なくとも 2 つの異なるビューアで PDF を開いて、診断を確認します。ファイルが Adobe Acrobat Reader では正しく表示されるが、Chrome や Edge などのブラウザベースのビューアでは正しく表示されない場合は、ブラウザ ビューアが PDF で使用されている特定の埋め込みフォント形式をサポートしていない可能性があります。ファイルが Chrome では正しく表示されるが、Mac のプレビューでは正しく表示されない場合、プレビューでは特定のフォント エンコード スキームがサポートされていない可能性があります。さまざまなオペレーティング システムでテストしたすべてのビューアでファイルのテキストが文字化けして表示される場合は、PDF 自体内のフォント データが破損しているか欠落しているため、フォント リソースに対処する PDF の修復 操作が必要です。
PDFを修復してみる
インストールは必要ありません。ブラウザで直接動作します。
欠落または破損したフォントの再埋め込み
ファイルに埋め込まれておらず、表示システムにもインストールされていないフォントを PDF が参照している場合、PDF ビューアは、使用可能な別のフォントを強制的に置き換えることになります。置換フォントの文字幅、間隔メトリクス、グリフ位置が元のフォントとは異なるため、この置換により文字の位置がずれることがよくあります。 PDF に保存されている文字コードが、文書作成者が意図したものとはまったく異なる代替フォントのグリフにマッピングされるため、テキストはごちゃ混ぜまたはランダムな記号として表示されます。解決策は、正しいフォントを PDF に再埋め込み、閲覧者が推測する必要がないようにすることです。
ドキュメント レベルでフォント リソースを検査および変更できるツールで PDF を開きます。フォント インベントリをチェックして、ドキュメントがどのフォントを参照しているのか、またそれぞれのフォントが完全に埋め込まれているか、使用されている文字のみを含むサブセットとして部分的に埋め込まれているか、またはまったく埋め込まれていないものとしてリストされているかを確認します。フォントが埋め込まれていないと表示される場合は、そのフォントをシステムにインストールし、すべてのフォントを埋め込むオプションを有効にして PDF を再保存するか、独自のライセンスされたフォント ライブラリから必要なフォント データを見つけて埋め込むことができる PDF Fix PDF ツールを使用する必要があります。 Arial、Times New Roman、Helvetica、Courier などの一般的なシステム フォントは、ほとんどのフォント ライブラリで利用でき、ライセンス制限なしで埋め込むことができます。
迅速なリカバリのための Print-to-PDF テクニックの使用
テキスト文字化けの原因が、ある特定のビューアでは正しく処理されるが、他のビューアでは正しく処理されないフォント エンコーディングが原因である場合、最も迅速な実用的な修正は、その単一の動作しているビューアを活用することです。画面上にテキストが正しく表示されるビューアで PDF を開きます。 Ctrl-P または Command-P を押して印刷ダイアログを開き、出力先プリンターとして「Microsoft Print to PDF」または「PDF として保存」を選択します。印刷パイプラインは、画面に表示されるテキストをラスタライズまたは再エンコードし、特別なフォント処理を必要とせずに最新の PDF ビューアが理解できる標準の普遍的にサポートされるフォントとエンコーディングを使用して、新しい PDF に埋め込みます。
この方法では、どこにでも一貫して表示される、きれいで読みやすいテキストを含む Repair PDF コピーが生成されますが、実行する前に理解しておくべき重要なトレードオフがあります。通常、印刷された PDF では、テキストの選択性、検索性、および対話型のフォーム要素が失われます。テキストは実質的にページ画像の一部になります。画面上で読み取って、おそらく 1 回印刷するだけのドキュメントの場合、これは数秒かかる完全に許容可能なソリューションです。修復後も検索、選択、または編集可能にしておく必要があるドキュメントの場合は、まずフォント埋め込みアプローチを試し、フォールバックとして PDF への印刷を予約してください。
中間フォーマットによる PDF の変換
フォントの埋め込みでは問題が解決せず、PDF への印刷でドキュメントの機能が大幅に失われる場合、中間形式で PDF を変換すると、テキストを実際のテキストとして保持しながら壊れたエンコーディングが削除される可能性があります。 PDF から Word へのコンバーターを使用して、PDF を Word 文書にエクスポートします。変換プロセスでは、PDF コンテンツ ストリームを読み取り、認識されたテキストを Word 独自のフォント処理とエンコーディングを使用する新しい形式に出力します。元の PDF の破損内容とは完全に独立しています。結果の Word ファイルを開き、テキストが全体的に正しく読み取れることを確認し、必要な書式設定の小さな修正を行ってから、フォントの埋め込みを有効にして PDF にエクスポートし直します。
Word を介したラウンドトリップにより、破損したエンコーディングが標準に準拠したクリーンなエンコーディングに置き換えられますが、複数の列を含む複雑なレイアウト、正確な位置、または埋め込まれたベクター グラフィックスは、変換後に完全に存続しない可能性があります。以下の表は、適用する方法を選択する際に重要な要素ごとに 3 つの修復アプローチを比較しています。
| メソッド | テキスト選択可能 | レイアウト保持 | 速度 |
|---|---|---|---|
| フォントを再埋め込む | はい | はい | 適度 |
| PDF に印刷 | いいえ | はい | 速い |
| PDFからWordへPDFへ | はい | 部分的 | 遅い |
Unicode および CID フォント エンコーディングの問題への対処
中国語、日本語、韓国語、アラビア語、キリル文字などの非ラテン文字で作成された PDF では、特にフォントが CID (文字識別子) エンコーディングを使用しており、ビューアが数値 CID を対応する Unicode 文字にマッピングできない場合に、テキストが文字化けして表示されることがあります。これは、Unicode が世界標準になる前に設計された、Unicode 以前のエンコード テーブルを使用してフォントを埋め込んだスキャン ソフトウェアや従来の出版システムによって作成された古い PDF によく見られます。たとえば、2005 年の日本語スキャナで作成された PDF では、元のベンダー固有の CMAP ファイルがなければ最新のビューアでは解釈できない CID フォントが使用されている場合があります。
CID から Unicode へのマッピングを明示的にサポートする特殊な PDF Fix PDF ツールは、正しい文字の関連付けを再構築できます。これらのツールは、フォント データおよび埋め込み CMAP テーブル (存在する場合) から生の CID コードを読み取り、Unicode マッピングを再構築します。このプロセスは PDF フォント修復用に設計されたツールで自動化されており、ファイルをアップロードして修正バージョンをダウンロードするだけで済みます。東アジア言語を含む PDF の場合は、機能セットに CJK フォントのサポートが明示的にリストされている修復ツールを選択してください。これは、主にラテン文字用に設計された汎用フォント修復ツールには、これらの書記体系の CMAP データやグリフ認識モデルが含まれていない可能性があるためです。
作成した PDF の文字化けを防ぐ
定期的に作成した PDF が文字化けした状態で受信者に届く場合、根本的な原因はほとんどの場合、PDF を生成するソフトウェアのフォント埋め込み設定にあります。 Word、PowerPoint、InDesign、またはデザイン ツールからエクスポートする場合は、PDF エクスポートまたは保存オプション ダイアログを見つけて、[フォントを埋め込む] または [すべてのフォントを埋め込む] というラベルの付いたボックスをオンにします。一部のアプリケーションでは、「文書内で使用されている文字のみを埋め込む」の追加チェックボックスを提供しています。これにより、フォントをサブセット化することでより小さなファイルが作成されますが、後で PDF を編集したり他のコンテンツと結合したりすると、表示上の問題が発生する可能性があります。クロスプラットフォームの互換性を最大限に高めるには、ファイル サイズの増加が許容される場合は常に、サブセットではなく完全なフォントを埋め込みます。
WukongPDF などのプラットフォームは、デフォルトで有効になっている包括的なフォント埋め込みを使用して PDF 形式 変換を処理し、作成者のコンピュータでのみ機能するシステム固有のフォント依存関係から発生するエンコードの問題を回避します。さまざまなオペレーティング システム、デバイス、ビューア アプリケーション間で正しく表示する必要がある PDF を送信する場合、簡単な検証テストはブラウザ ベースの PDF ビューアでファイルを開くことです。これらのビューアはローカルにインストールされたシステム フォントにアクセスできず、受信者が文字化けを報告するまで気付かないフォント埋め込みの問題がすぐに明らかになります。
PDF が修復できないことを受け入れる場合
最善の修復技術にもかかわらず、一部の PDF は実際の修復を超える損傷を受けています。フォントの再埋め込み、利用可能なすべてのビューアからの新しい PDF への印刷、Word による往復変換を試してもテキストが文字化けしたままの場合は、単なるフォント エンコーディングの問題ではなく、ファイルのコンテンツ ストリーム自体に構造的な損傷がある可能性があります。通常、この時点で最も生産的な方法は、元のソース文書を見つけて、そこから新しい PDF を生成することです。
テキストが回復できない場合でも、画像やページ構造が部分的にそのまま残っている可能性があるため、破損したファイルは参照用に保管しておいてください。ドキュメントがスキャナーから作成された場合、元の紙ドキュメントを再スキャンすると、正しいテキスト エンコーディングを備えたクリーンな PDF が生成されます。ドキュメントが Word ファイルまたはデザイン アプリケーションから作成された場合は、フォントの埋め込みを明示的に有効にしてドキュメントを再エクスポートするよう元の作成者に依頼してください。ソースドキュメントから新たにエクスポートすると、破損したコピーに存在するエンコードの問題がすべて回避され、さらに修復を試みるよりも短い時間でクリーンなファイルが作成されます。
PDFを修復してみる
インストールは必要ありません。ブラウザで直接動作します。
