PDF 翻訳ツールはドキュメント内のテキスト ストリームを処理し、単語をある言語から別の言語に変換します。段落、見出し、キャプションを読み上げます。ただし、画像内のテキストは読み取れません。標識の写真、別の言語でのユーザー インターフェイスのスクリーンショット、画像の一部としてレンダリングされた軸ラベルを含むグラフ、これらすべてには、PDF テキスト ストリームに含まれていないため、標準の翻訳ツールでは無視されるテキストが含まれています。画像のピクセルに埋め込まれています。埋め込まれた画像内のテキストを翻訳するには、画像を抽出し、OCR を実行し、認識されたテキストを翻訳してから、翻訳された画像を再埋め込むか、翻訳をオーバーレイとして追加する必要があります。画像埋め込みテキストの Translate PDF ワークフローは、標準のテキスト翻訳よりも複雑ですが、そうでなければ翻訳されないコンテンツもカバーします。

翻訳可能なテキストを含む画像の識別
PDF 内のすべての画像に翻訳に値するテキストが含まれているわけではありません。装飾写真、背景テクスチャ、会社ロゴには、翻訳可能なコンテンツが含まれていない場合があります。ソフトウェア アプリケーションのスクリーンショット、コンポーネントにラベルが付いている図、文書または標識の写真、軸ラベルが埋め込まれたグラフには、ターゲット言語の読者が理解する必要があるテキストが含まれています。 PDF をスキャンして、テキストを含むすべての画像を特定します。これらの画像に翻訳ワークフローのフラグを立てます。
PDF 内にテキストを含む画像は 2 つのカテゴリに分類されます。1 つはスクリーンショットやラベル付きの図など、設計によりテキストが画像の一部である場合、もう 1 つは文書がデジタル的に作成されたものではなくスキャンされたためにテキストが画像に表示される場合です。スキャンされた PDF は、1 ページにつき 1 つの大きな画像です。スキャンされたページ上のすべてのテキストがページ画像に埋め込まれます。デジタルで作成された PDF には、テキストベースのページに 1 つのスクリーンショットが含まれる場合があります。翻訳が必要なPDF 画像 は、テキストが PDF テキスト ストリームではなく画像ピクセル内に表示されるものです。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
画像の抽出とテキストの認識
利用可能な最高の解像度で PDF から画像を抽出します。元の解像度を維持する PDF 画像抽出ツールを使用します。抽出ステップ中に圧縮アーティファクトが発生するのを避けるために、抽出された各画像を PNG ファイルとして保存します。抽出した各画像を開いて、テキストが判読できることを確認します。画像の解像度が低すぎてテキストをはっきりと読み取ることができない場合は、可能であれば高解像度で再抽出してください。そうでない場合、この画像では信頼性の低い OCR 結果が生成される可能性があることに注意してください。
抽出された各画像に対して OCR を実行してテキストを認識します。 OCR エンジンは画像内のテキスト領域を識別し、認識された文字をその位置とともに出力します。認識されたテキストと各テキスト領域の境界ボックス座標を含む、各画像の OCR 出力を保存します。この情報は、後で翻訳されたテキストを画像上の正しい位置に配置するために必要になります。 WukongPDF は、ドキュメント変換ワークフローの一部として、埋め込まれた画像内のテキストを認識できる OCR PDF 処理を処理します。
コンテキストを保持しながら認識されたテキストを翻訳する
画像から認識されるテキストは断片的なことがよくあります。図には単一の単語のラベルが含まれる場合があります。スクリーンショットには、文のコンテキストのないメニュー項目やボタンのラベルが含まれる場合があります。この断片化されたテキストは、単語の意味を明確にする周囲の言語コンテキストが存在しないため、機械翻訳エンジンにとって困難です。できるだけ多くのコンテキストを提供します。ラベルに「ファイル」という文字があり、ソフトウェア メニューのスクリーンショットに表示されている場合は、翻訳入力で、これが物理オブジェクトではなくメニュー項目であることに注意してください。
複数のテキスト領域を含む画像の場合は、各領域とその翻訳の間のマッピングを維持します。 10 個のラベルを持つ図は 10 個の個別のテキスト文字列を生成し、それぞれに翻訳が必要です。元のテキスト、翻訳されたテキスト、および境界ボックスの座標を、スプレッドシートなどの構造化された形式にまとめて保存します。このマッピングは、翻訳されたテキストを画像上に配置する最終ステップで使用されます。 Translate PDF 出力を有効にするには、翻訳されたテキストが画像上の正しい位置に表示され、元のテキストを置き換えるか、元のテキストに付随する必要があります。
翻訳されたテキストを画像に戻す
翻訳されたテキストを画像上に配置するには 2 つの方法があります。最初のアプローチでは、元のテキストを翻訳で置き換えます。画像エディタで画像を開きます。各テキスト領域について、その領域を背景色で塗りつぶして元のテキストを消去します。オリジナルのスタイルにできるだけ一致するフォントを使用して、翻訳されたテキストを同じ領域に配置します。このアプローチでは、元の画像と同じように見えますが、言語が異なる、きれいに翻訳された画像が生成されます。
2 番目の方法では、元のテキストの横に翻訳を追加します。翻訳されたテキストを元のテキストの下または横に対照的な色で配置します。このアプローチでは、両方の言語を理解し、翻訳を原文と比較したい読者のために原文が保存されます。消去して置換するよりも高速ですが、結果として得られる画像は視覚的に複雑になります。視聴者のニーズに基づいてアプローチを選択してください。ターゲット言語を読むだけのオペレーター向けのトレーニング マニュアルは、置き換えによってメリットが得られます。バイリンガルの参考文書は、並べて表示することでメリットが得られます。
翻訳された画像を PDF に再埋め込む
翻訳されたテキストを使用して画像を処理した後、画像を PDF に戻す必要があります。各元の画像を翻訳された対応する画像に置き換えます。置換画像は、元の画像と同じページ上のスペースに収まる必要があります。翻訳された画像のピクセル寸法が元の画像と異なる場合は、PDF 内の元の境界ボックスに一致するように画像を拡大縮小します。 PDF ページのレイアウトは変更しないでください。目に見える唯一の違いは、画像内のテキストの言語です。
翻訳された画像を含む PDF を新しいバージョンとして保存し、元の翻訳されていない PDF を参照として保持します。翻訳された PDF を開いて各画像を確認し、PDF を確認します。翻訳されたテキストが読みやすく、正しく配置され、OCR や翻訳エラーがないことを確認します。画像翻訳が埋め込まれた Translate PDF は、文書、テキスト ストリーム、画像内のすべてのテキスト要素がターゲット言語の読者にアクセス可能になると完了します。
自動翻訳ではなく手動翻訳を選択する場合
安全上の警告、法的通知、技術仕様などの重要なテキストが含まれる画像については、機械翻訳ではなく人間の翻訳者による手動翻訳を検討してください。 OCR エラーと機械翻訳エラーが組み合わされると、安全に関する指示の意味が変わってしまい、実際の結果につながる可能性があります。少数の重要な画像を人間が翻訳するコストは、不正確な翻訳のコストに比べればわずかです。
手動翻訳が現実的でない大量の画像の場合は、レビュー手順を実装します。機械翻訳して再埋め込んだ後、ターゲット言語を読む人間のレビュー担当者に、翻訳された画像のサンプルの精度をチェックしてもらいます。サンプルでシステムエラーが明らかになった場合は、OCR 設定または翻訳エンジンのパラメータを調整し、バッチを再処理します。
多くの場合、埋め込み画像内のテキストの翻訳は、PDF を世界中のユーザーが完全にアクセスできるようにするための最後のステップです。本文、見出し、キャプションは翻訳されています。画像は最終的な未翻訳のコンテンツとして残ります。このステップを完了すると、あらゆる媒体のあらゆるテキストがターゲット言語で利用できるドキュメントが作成されます。
画像が埋め込まれた文書が頻繁に更新される場合は、文書作成プロセス中に画像テキストを PDF テキスト ストリームに移動できるかどうかを検討してください。画像の一部としてではなく、テキスト オーバーレイとして保存されたラベルを含む図は、標準のテキスト翻訳ツールを使用して翻訳でき、抽出、OCR、翻訳、再埋め込みのワークフローを完全に回避できます。
最終的に変換された画像の品質は、パイプラインの各ステップの品質によって決まります。高解像度の画像抽出により、鮮明な OCR 入力が生成されます。正確な OCR により、翻訳用の正しいテキストが生成されます。優れた翻訳エンジンは意味を保持します。再埋め込みを慎重に行うことで、視覚的な品質が維持されます。各ステップは前のステップに依存します。
画像埋め込みテキストの Translate PDF ワークフローは、画像処理、OCR、翻訳、再埋め込みを 1 つのパイプラインに組み合わせるため、最も労働集約的な翻訳シナリオです。できるだけ多くのステップを自動化すると、手動の労力が軽減されます。
キャッチフレーズ付きの会社ロゴや標準図など、複数の PDF で同じように表示される画像の場合は、画像を一度翻訳して再利用します。翻訳された画像は、元の画像が表示されるすべての PDF に置き換えることができます。
この記事では、この特定のシナリオで PDF を操作するための主要なテクニックと考慮事項について説明します。ここで説明する方法はさまざまなツールやプラットフォームに適用できるため、読者はワークフローや技術環境に最適なアプローチを柔軟に選択できます。
概要を説明した実践的な手順は、最初の課題から実際の解決策に至るまでの明確な道筋を示します。各手法は信頼性とアクセシビリティを考慮して選択されており、読者が PDF ツールの使用経験に関係なく一貫した結果を達成できるようにしています。
WukongPDF および同様のプラットフォームは、この記事で説明する画像テキスト翻訳ワークフローをサポートする OCR および文書処理ツールを提供します。これらのツールを組み合わせることで、包括的な翻訳をカバーできます。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
