必要なのはテキストだけであれば、PDF ドキュメントの翻訳は簡単です。この問題は、PDF に内部相互参照、クリック可能な目次エントリ、脚注リンク、セクション間を移動するハイパーリンクが含まれている場合に発生します。標準的な翻訳ワークフローでは、これらのナビゲーション構造が取り除かれ、読者は文書を結合していた結合組織を失った平らな文書を残すことになります。言語の壁を超えて内部リンクを機能させ続けるには、単語だけでなく文書の構造に基づいて翻訳プロセスを計画する必要があります。適切に翻訳された文書は、テキストの意味だけでなく、読者がテキストをナビゲートするために使用する経路も保持します。

PDF に内部リンクがどのように保存されるかを理解する
PDF 内の内部リンクは、表示されるテキスト レイヤーの一部ではありません。これらは、ページ コンテンツの上にオーバーレイされるクリック可能な注釈オブジェクトとして存在します。各リンクにはリンク先があり、ページ番号、「chapter3」や「appendixA」などの名前付きリンク先、またはページ上の特定の座標を指定できます。テキスト ストリームのみを処理する翻訳ツールを通じて PDF を実行すると、これらの注釈オブジェクトは破棄されるか、元の未翻訳の宛先を指したままになります。その結果、新しいテキストと古いナビゲーションの間に不一致が生じ、リンクがまったくない場合よりもドキュメントが使いにくくなります。
PDF の目次は、対応するセクションを指す内部リンクとペアになったテキスト エントリで構成されます。翻訳によってページ数が変更されると (言語はソースに対して拡張または縮小するため、ほとんどの場合変更されます)、ページ番号の宛先が間違ったものになります。たとえば、ドイツ語のテキストは、同等の英語のテキストよりも 20 ~ 30% 長く実行される傾向があり、コンテンツが後のページに移動し、文書内のすべてのページベースのリンクが壊れます (Common Sense Advisory、「言語別の単語数拡張係数」、2024)。フランス語とスペイン語の翻訳は通常 15 ~ 25 パーセント拡大しますが、中国語と日本語の翻訳は 10 ~ 20 パーセント縮小することがよくあります。言語ペアごとに、異なる大きさのページ シフトが発生します。
ページ番号以外にも、リンク注釈自体には中断される可能性のある特性があります。各注釈には、クリック可能な領域を定義する長方形の境界があり、これらの境界は PDF 座標空間で指定されます。翻訳されたテキストがリフローして改行が変更されると、元の注釈の四角形が対応するテキストと整列しなくなります。ソース内の行の途中に表示されていた相互参照は、行の終わり近くで開始され、クリック可能な領域の一部のみが表示されているテキストをカバーするようになります。リンクはファイル内にまだ存在しますが、読者がページ上に表示するものと一致しなくなりました。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
リンク保存のための翻訳前の準備
翻訳中に内部リンクを保持する最も信頼できる方法は、コンテンツとプレゼンテーションを分離する形式を使用することです。翻訳する前に、ハイパーリンク構造を保持した HTML または DOCX ファイルに PDF をエクスポートします。最新の PDF コンバーターは、テキストを埋め込みリンクや相互参照とともに抽出して、これらの編集可能な形式に変換できます。 WukongPDF の Translate PDF ツールは、構造メタデータを維持しながらドキュメントを処理できますが、ソース PDF からの初期エクスポート品質によって、リンク データが翻訳段階までどの程度残るかが決まります。タグ付けされたコンテンツを含むクリーンで適切に構造化された PDF は、スキャンされたドキュメントや不適切に生成されたドキュメントよりもはるかに完全にエクスポートされます。
翻訳を開始する前に、すべての内部リンクのインベントリを作成します。どのリンクが名前付きの宛先を指しているのか、ページ番号を指しているのかに注目してください。名前付き宛先は、宛先名が変更されない限り有効なシンボリック参照であるため、保存が容易です。ページ番号ベースのリンクは、翻訳後に再計算する必要があります。 PDF に両方が混在している場合は、名前付きの宛先を保持することを優先し、翻訳されたテキストがレイアウトされた後にページベースのリンクを最初から再構築することを計画してください。この目録は、最終検証時のチェックリストとしても機能します。
また、PDF の本文にページ番号を詳しく説明する相互参照テキスト (「詳細については 42 ページを参照」など) が含まれているかどうかも確認してください。翻訳によってページ数が変更されると、これらのインライン参照は不正確になります。最終的なレイアウトが完了した後に番号を更新できるように、準備中にフラグを立てます。長期的には、ページ番号の相互参照を、ページネーションに関係なく有効なセクション タイトルに置き換えることをお勧めします。これにより、手動で調整しなくても参照が正しいままになるため、将来の翻訳や形式変換が容易になります。
リンクをそのまま維持する翻訳方法
内部リンクを維持しながら PDF を翻訳するには、主に 3 つのアプローチがあります。最初の方法では、リンクの保存を明示的にサポートする専用の PDF 変換プラットフォームを使用します。これらのプラットフォームは、ドキュメントの構造的完全性を維持しながらテキストを処理するため、相互参照が重要なレポート、マニュアル、ドキュメント セットに適しています。利点は速度です。1 つのファイルをアップロードすると、リンクがそのままの翻訳版を受け取ることができます。その代償として、個々のリンクの処理方法を制御することが難しくなります。
2 番目の方法は、中間フォーマットのアプローチです。 PDF を HTML または DOCX にエクスポートし、ハイパーリンクを考慮するツールを使用してコンテンツをその形式に翻訳してから、PDF に再変換します。これにより、翻訳された PDF を生成する前にすべてのリンクを検査して修復できるため、最終出力を最大限に制御できます。相互参照の誤りが大きな混乱を引き起こす可能性がある法的契約書、技術仕様書、学術論文では、追加の手順が正当化されます。中間形式では、大規模な文書セット間の一貫性を向上させる翻訳メモリ ツールも使用できます。
3 番目の方法はオーバーレイ アプローチで、単純な構造を持つ短いドキュメントに最適です。元の PDF をベースとして保持し、テキストのみを抽出して翻訳し、翻訳されたテキストを元の PDF の上に配置されたテキスト ボックスに配置します。基礎となる PDF は変更されないため、元のリンクは引き続き機能します。この方法は、翻訳されたテキストの長さがソースと大幅に異なる文書では、オーバーレイされたテキスト ボックスがオーバーフローしたり、空白スペースが残ったりするため、問題があります。証明書、フォーム、テキストが最小限の単一ページのドキュメントに最適です。
翻訳後のリンクの再構築
最善の準備を行ったとしても、一部のリンクは、翻訳された PDF の生成後に手動で処理する必要があります。まず、目次内のすべてのリンクをテストします。各エントリをクリックして、翻訳されたドキュメントの正しいセクションに表示されることを確認します。次に、本文内の相互参照を確認してください。 PDF リーダーのリンク ナビゲーション パネルを使用して体系的にチェックすると、これを管理しやすくなります。このパネルにはすべての内部リンクがドキュメントの順序でリストされているため、リンクを順番に確認して、スプレッドシート内で不一致にフラグを立てることができます。
技術マニュアルや教科書など、内部リンクが多数あるドキュメントの場合、バッチ リンク編集機能を備えた PDF 編集ツールを使用すると、リンクを一括で更新できます。翻訳されたドキュメントですべてのコンテンツが予測可能なページ数だけシフトされている場合は、1 回の操作ですべてのページベースのリンクをその量だけオフセットできます。名前付き宛先ではこの処理は必要ありません。これが、元の文書を作成するときにハードコーディングされたページ番号よりも名前付き宛先を優先するもう 1 つの理由です。
脚注と文末脚注のリンクは双方向であるため、特に注意が必要です。テキストの上付きの数字は注記にリンクしており、通常、注記は参照点に戻ります。読書体験を完成させるには、両方の方向が機能する必要があります。翻訳されたドキュメントでは、メモのテキストが本文とは独立して拡大または縮小することがよくあるため、戻りリンクが予想とは異なるページを指す場合があります。最終的な品質チェックの一環として、各脚注のラウンドトリップを検証します。脚注のリンクが 1 つ切れていることは些細なことのように思えるかもしれませんが、法律文書や学術文書では、アクセスできない引用は文書の信頼性を損ないます。
翻訳された PDF のテストと検証
内部リンクを含む翻訳された PDF を配布する前に、構造化検証パスを実行します。リンクのレンダリング動作はアプリケーションによって異なる可能性があるため、Adobe Acrobat とブラウザベースのビューアなど、少なくとも 2 つの異なる PDF リーダーでドキュメントを開きます。注釈の座標の解釈方法の違いにより、あるリーダーで機能するリンクが別のリーダーでは位置がずれる場合があります。 PDF 仕様では、座標精度にある程度の柔軟性が認められており、リーダーが異なれば丸めの処理方法も異なります。
翻訳されたテキスト内の複数行にまたがるリンクには特に注意してください。語順が異なる言語では、ソースでは 1 行に表示されている相互参照が、翻訳では 2 行にまたがってしまう可能性があります。クリック可能な領域はテキストの最初の部分のみをカバーし、リンク テキストの一部はクリックできないままになる場合があります。最終レイアウトの全テキスト範囲を囲むようにリンク注釈の境界を調整します。これは面倒ですが、プロ品質の出力を得るには必要な手順です。
簡単な検証チェックリストには重要なチェックが含まれています。目次のリンクがすべて正しく解決されていることを確認し、本文内のすべての相互参照が正しいセクションに移動していることを確認し、脚注リンクが両方向に移動していることを確認し、索引エントリをテストし、外部 URL が機能し続けており、該当する場合は外部リソースの正しい言語バージョンを指していることを確認します。 5 つのチェックすべてに合格したドキュメントは、PDF ナビゲーション の経路に依存する読者に提供されます。この検証を省略すると、読者をイライラさせ、翻訳された資料のプロフェッショナルな外観を損なう文書が配布される危険があります。
余分な努力はすぐに報われます。
チェックは5つ。絶対的な自信。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
