Tips & Tricks

すべての書式設定と内部ハイパーリンクを維持したまま PDF ドキュメントを翻訳する方法

オンライン翻訳ツールを介して PDF をフィードし、結果をダウンロードします。テキストはターゲット言語になりましたが、ドキュメントが間違っているように見えます。見出しが移動しました。箇条書きの位置がずれています。画像が元の位置から移動しました。さらに悪いことに、ドキュメント内のすべてのハイパーリンクが無効になってしまいます。翻訳ツールは、表示されているリンク テキストを置き換えましたが、基礎となる URL を削除しました。文書は翻訳されていますが、壊れています。

PDF の書式設定やインタラクティブな要素を維持しながら PDF を翻訳するには、テキスト レイヤーをページ構造から分離する翻訳アプローチが必要です。課題は、PDF テキストと PDF レイアウトが密接に結合していることです。英語からドイツ語、フランス語、スペイン語に翻訳する場合、翻訳文の長さが 20% から 30% 伸びる可能性があり、周囲のテキストや要素の位置がずれてしまいます。その結果、テキストが元の境界からはみ出したり、隣接するコンテンツと重なったりします。

How to Translate a PDF Document While Keeping All Formatting and Internal Hyperlinks

PDF 翻訳で書式設定が頻繁に崩れる理由

ほとんどの Translate PDF ツールは、各ページからテキストを抽出し、それを機械翻訳エンジンに送信し、翻訳されたテキストを元のページ レイアウトに戻そうとします。中心的な問題はテキストのリフローです。英語のテキストをドイツ語に翻訳すると、文字数が平均 20% ~ 30% 増加します。英語用に設計されたテキスト ボックスにきちんと収まる同じ文が、ボックスから溢れ出すようになりました。翻訳ツールがテキスト ボックスのサイズやフォント サイズを調整して補正しないと、翻訳されたテキストが切り詰められたり、隣接する要素に重なったり、ページ レイアウトが崩れたりします。

PDF リンクは、表示されるテキストとは別に、ページ上にオーバーレイされるクリック可能な長方形の領域として保存されるため、ハイパーリンクは失われます。翻訳ツールがテキストを置き換えても、新しいテキストの位置と長さに一致するようにリンク注釈を更新しない場合、リンクは間違った場所を指すか、完全に削除されます。目に見える下線付きの青いテキストは残りますが、その後ろのクリック可能な領域は消えます。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

レイヤーベースのアプローチ: OCR、テキストの翻訳、オリジナルへのオーバーレイ

翻訳中に書式を保持する最も信頼できる方法は、元のページの画像をそのまま保持し、その上に翻訳済みテキスト レイヤーを追加することです。このアプローチでは、元の PDF を視覚的な背景として扱い、翻訳されたテキストを元のテキストの上に配置された透明なテキスト ボックスに配置します。元の書式設定、画像、リンクは削除されないため、そのまま残ります。テキストのみが翻訳され、位置が変更されます。

このアプローチは、視覚的なレイアウトが主な関心事であり、翻訳されたテキストはそれ以上の編集ではなく読み取り用である静的なドキュメントに適しています。翻訳されたテキストは、背景に影響を与えることなく、利用可能なスペースに合わせてフォント サイズとボックスの寸法を調整できます。 WukongPDF は、必要に応じて OCR を実行し、テキストを抽出し、テキスト ブロック間の空間的関係を維持しながら翻訳し、元のページ画像の上の新しいレイヤーに翻訳を配置することで、このレイヤーベースのアプローチをサポートします。

翻訳中のハイパーリンクの保持

ハイパーリンクはテキストとは別の注釈として保存されるため、翻訳中に最も壊れやすい要素です。リンクを保持するには、翻訳ツールは各リンクの注釈を読み取り、そのリンク先 URL を記録し、どのテキストに関連付けられていたかを記録し、そのテキストを翻訳して、新しいテキストの位置にリンクの注釈を再添付する必要があります。リンクの保存を明示的にサポートしていないツールは、リンクを削除します。

ブラウザベースの翻訳ツールには、翻訳プロセスの一部として PDF リンク の保存が含まれています。翻訳前に、ツールはドキュメントをスキャンしてハイパーリンクの注釈を探し、各リンクの URL、表示されるテキスト、および位置を記録します。翻訳後、リンクは対応する翻訳されたテキスト ブロックに再接続されます。 Web サイトを指す外部ハイパーリンクは、元の URL が変更されずに保存されます。同じ PDF 内の他のページを指す内部リンクは、テキスト拡張によるページ番号の変更を考慮して再マップされます。その結果、テキストとナビゲーションの両方が機能したままの翻訳された PDF が生成されます。

言語間でのテキストの拡張および縮小の処理

言語ペアが異なれば、拡張特性も異なります。英語からドイツ語へは通常 20% ~ 30% 拡大します。英語からフランス語へは 15% から 25% 拡大します。英語からスペイン語への翻訳は 10% ~ 20% 拡大します。対照的に、英語から中国語または日本語への変換は、表語文字がより少ない水平スペースにより多くの意味を詰め込むため、20% ~ 40% 縮小します。これらの違いを考慮していない翻訳ツールでは、翻訳されたテキストが溢れたり、厄介な隙間が残ったりする文書が作成されます。

拡張が多い言語ペアの場合、実際的な調整は、翻訳されたテキストのフォント サイズを 1 ポイントまたは 2 ポイント減らすか、テキスト ボックスの水平幅を元の列幅に制限したまま垂直方向に拡張できるようにすることです。垂直方向の拡張は、後続のコンテンツをページの下に押し込みます。これは通常、テキストがページの余白を越えて消えてしまう水平方向のオーバーフローよりも望ましい方法です。短縮が多いペアの場合、スペースを埋めるためにフォント サイズをわずかに大きくすることができますが、これにより、翻訳されたテキストと元の文書のタイポグラフィの間に視覚的な不一致が生じる危険があります。

翻訳された PDF の品質チェック

機械翻訳は完璧ではなく、翻訳の誤りにより、場合によっては微妙な、あるいは重大な意味で文章の意味が変わる可能性があります。翻訳後、ターゲット言語を読む人間に文書をレビューしてもらいます。人間のレビュー担当者がいない場合は、少なくとも、別の翻訳エンジンを使用して翻訳文のサンプルをソース言語に翻訳し、元の文と比較することで、抜き取りチェックを行います。この逆翻訳チェックは明らかなエラーを検出しますが、人間によるレビューに代わるものではありません。

フォーマットを注意深く確認してください。すべてのページをスクロールします。テキストが切り取られたり、重なったり、位置がずれたりしていないことを確認します。すべてのハイパーリンクをクリックして、正しいリンク先に移動することを確認します。画像、表、その他のテキスト以外の要素が元の位置に残っていることを確認します。翻訳ツールがオーバーレイ手法を使用している場合、特に元のテキストが翻訳よりも大きいフォントまたは暗い色である場合、翻訳されたテキストが元のテキストを適切にカバーしていることを確認してください。翻訳の後ろからオリジナルのテキストが覗いていると、プロフェッショナルとは言えない結果が生じます。

定期的に更新され、再翻訳される文書の場合は、翻訳メモリを確立します。翻訳メモリは、以前に翻訳された分節を保存し、同じまたは類似のテキストが新しいバージョンに表示されるときに再利用します。これにより、翻訳コストが削減され、一貫性が向上し、同じ書式設定エラーの再発が防止されます。 WukongPDF の PDF Export パイプラインには、翻訳メモリ データを組み込んで、更新された文書の再翻訳を高速化できます。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →