同じ PDF を 2 つの異なるオンライン翻訳サービスにアップロードすると、結果は異なります。同じフランス語の段落が、あるツールではある方法でレンダリングされ、次のツールでは別の方法でレンダリングされます。違いは、単語の選択や文の構造から、ツールによる書式設定、埋め込みテキスト、単語を含む画像の処理方法まで多岐にわたります。これらの不一致は、伝統的な意味でのエラーではありません。各ツールは、設計上の選択、翻訳エンジン、文書処理パイプラインに基づいて最適な翻訳を生成しました。これらの違いが存在する理由を理解することは、特定のドキュメントに適切なツールを選択し、適切な期待に基づいて出力を解釈するのに役立ちます。

異なる翻訳エンジンは異なる言語出力を生成します
オンライン PDF 翻訳ツールは、汎用機械翻訳エンジン (最も一般的には大規模な多言語コーパスでトレーニングされたニューラル機械翻訳モデルのバリアント) 上に構築されています。 2 つの主要なアプローチは、Google 翻訳およびそのライセンスを取得するツールで使用される Google のニューラル機械翻訳システムと、DeepL の畳み込みニューラル ネットワーク アプローチです。 Microsoft Translator と Amazon Translate は、追加の独立した実装を表します。各システムは、異なるトレーニング データでトレーニングされ、さまざまな品質指標に合わせて最適化され、流暢性と文字通りの正確さの異なる優先順位で調整されました。同じ入力文から、これらのシステム間で異なる出力文が生成されます。
違いは 3 つの領域で最も顕著です。まず、あいまいさの処理: 「アボカット」のようなフランス語は、文脈に応じて弁護士またはアボカドのいずれかを意味します。翻訳エンジンが異なれば、そのような曖昧さは異なる統計モデルで解決されるため、常に同じ結論に達するとは限りません。第 2 に、登録と形式性: 公式と非公式を区別する言語でデフォルトで正式なアドレスを設定するエンジンもあれば、デフォルトで中立的なエンジンもあります。 「Sie」と「du」を使用するドイツ語翻訳では、文書全体の社会的な雰囲気が変わります。第三に、慣用表現: ターゲット言語で直接同等の語句が、あるエンジンでは文字通りに翻訳され、別のエンジンでは慣用的に翻訳され、正しいけれども文体的に異なるテキストが生成される可能性があります。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
文書構造の処理により非言語的な差異が生じる
オンライン PDF ツールは、個々の単語や文章の翻訳を超えて、テキストの周囲の文書構造の処理方法が異なります。一部のツールでは、すべてのテキストを線形ストリームに抽出し、翻訳して元の位置に戻すため、段落の区切り、見出しの階層、本文とキャプションの関係が失われます。他の人は、各レイアウト ブロック内のテキストを個別に翻訳することで文書構造を保持しようとします。 2 番目の方法では、より忠実なレイアウトが生成されますが、ツールは前のインスタンスを認識せずに各インスタンスを独立した翻訳単位として扱うため、各ページに表示される連続ヘッダーなどの繰り返しテキストが、表示されるたびに異なる方法で翻訳される可能性があります。
WukongPDF の Translate PDF ツールは、元のレイアウトと書式設定を維持しながらドキュメントのテキスト レイヤーを処理します。翻訳エンジンは、ドキュメントの視覚的な構造を維持しながら、各テキスト要素を所定の位置にレンダリングします。さまざまなツールからの翻訳を比較する場合、多くの場合、出力の構造の忠実性が言語の品質と同じくらい重要です。美しく読める翻訳でも段落区切りや見出しスタイルがすべて失われている場合は再フォーマットが必要ですが、元のレイアウトを保持した粗い翻訳を改善するよりも時間がかかる可能性があります。
画像およびスキャンされたコンテンツ内の埋め込みテキストの処理
翻訳ツール間の相違の主な原因は、PDF に選択可能な文字として保存されていないテキストをどのように処理するかです。 PDF には、ラベル付きの図、標識の写真、テキストがピクセルとしてのみ存在するスキャンされたページなど、テキストが埋め込まれた画像が含まれる場合があります。一部の翻訳ツールは、画像ベースのテキストを完全に無視し、テキスト レイヤーのみの翻訳を生成し、画像は翻訳されないままにします。最初に画像の OCR を試み、次に認識されたテキストを翻訳する人もいますが、OCR ステップによって独自のエラーが発生し、翻訳が複雑になります。同じ画像を 2 つの異なるツールで処理すると、翻訳が始まる前に異なる OCR 読み取り値が得られる場合があります。
文書の品質への影響は重大です。テキスト レイヤーのみが処理された翻訳済み PDF には、翻訳された本文テキストと翻訳されていない画像のキャプション、図のラベル、埋め込みテキストが混在します。ソース言語を話さない読者は、未翻訳のコンテンツが行き止まりとして島状に存在することに遭遇します。画像内にテキストが埋め込まれているドキュメントの翻訳ツールを比較する場合、各ツールがその埋め込みコンテンツをどのように処理するかを確認することが重要な評価基準であり、テキスト翻訳の言語品質と同じくらい重要です。
形式固有の保存: フォント、色、およびページ レイアウト
翻訳するとテキストの長さが変わります。ドイツ語とフィンランド語の翻訳は、英語の原文より 20 ~ 30% 長い傾向があります。中国語と日本語の翻訳は 10 ~ 20% 短くなる傾向があります。この長さの変更は、ドキュメントのレイアウトのあらゆる側面に影響します。英語では表のセルにきちんと収まるテキストでも、ドイツ語ではテキストがはみ出す場合があります。 1 行でバランスが取れているヘッダーは 2 行に折り返される場合があります。きれいに並んだ箇条書きの点がぼろぼろになる場合があります。各翻訳ツールは、これらのレイアウトの結果を異なる方法で処理します。
一部のツールでは、翻訳されたテキストが元のスペースに収まるようにフォント サイズを下方に調整します。これにより、ページ構造は維持されますが、セクション間でフォント サイズが明らかに異なるページが生成され、一貫性のない読書体験が生じる可能性があります。他のツールでは、元のフォント サイズが保持され、テキストがリフローされるため、改ページが変更され、テキストと隣接する画像の関係が変更される可能性があります。最適なアプローチはドキュメントの種類によって異なります。すべての単語を元のページと同じページに配置する必要がある法的な契約では、フォント サイズの調整が役立ちます。視覚的な一貫性が重要なマーケティング パンフレットでは、フォント サイズを保持し、リフローを受け入れることでより多くのメリットが得られます。
ドキュメントの翻訳ツールを選択および評価する方法
ツール間のばらつきを考慮すると、最も信頼できる選択方法は、ドキュメントの代表的なページを 2 つまたは 3 つの候補ツールでテストし、結果を並べて比較することです。言語の品質に注目してください。翻訳はターゲット言語で自然に読めるか、それとも機械翻訳のように聞こえますか?完全性を確認します。特にヘッダー、フッター、画像のキャプションなどにテキストが抜けていませんか?レイアウトの忠実度を確認します。翻訳されたドキュメントはオリジナルと同じように見えますか、それとも再フォーマットが必要ですか?これらの質問に対する答えは、言語ペア、文書の種類、文書の特定の内容によって異なります。
翻訳の品質が法的またはビジネス上の影響を伴う文書の場合は、人間のレビュー担当者に出力を比較して、各セクションに最適な翻訳を選択してもらうことを検討してください。機械翻訳ツールは高速で精度も向上していますが、完全に信頼できるわけではなく、ツール間の違いにより、すべての文書に最適な単一のツールはないということになります。翻訳を並べて評価する PDF Compare プロセスは、機械翻訳をギャンブルから管理されたプロセスに変える品質保証のステップです。
マルチツール翻訳ワークフローにおけるポストエディットの役割
プロの翻訳ワークフローでは、ソース文書を 2 つまたは 3 つの翻訳エンジンで実行し、出力を比較し、人間の編集者が各パッセージの最適なレンダリングを選択して調整するというベスト プラクティスが増えています。このマルチエンジンのアプローチは、さまざまな翻訳モデルの長所を組み合わせています。あるエンジンは専門用語をより適切に処理し、別のエンジンはより自然な響きの散文を生成する場合があります。人間の編集者は、ゼロから作業する翻訳者ではなく、機械の出力のキュレーターになります。その結果、単一のエンジンが生成できる翻訳を超え、完全な手動翻訳に必要な時間よりも短い時間で翻訳が作成されます。出版、広範囲に配布される文書、または翻訳品質が信頼性に直接影響する状況で使用される文書の場合、マルチエンジン レビュー ワークフローは、現在のテクノロジーから得られる最高品質の出力を提供します。
翻訳ツール間の違いは解消されません。各ツールは、エンジニアリング上の決定、トレーニング データの選択、最適化の優先順位の異なるセットを表します。これらの違いを理解し、それを有利に活用することで、不一致の原因が品質保証戦略に変わります。ドキュメントに最適な翻訳が単一ツールの出力であることはほとんどありません。これは、ターゲット言語で何が適切に聞こえるかについて人間の判断に基づいて、複数のツールが生成できるものの中から厳選された最良のものです。
翻訳ツール間のこのばらつきは、このテクノロジーの弱点ではありません。これは、翻訳を困難な問題にする真の言語的曖昧さの反映です。この曖昧さに直面した場合、ツールが異なれば選択も異なります。これらの選択肢の性質を理解すると、各ドキュメントに適切なツールを選択し、盲信するのではなく情報に基づいた判断で出力を解釈するのに役立ちます。目標は、存在しない単一の最適な翻訳ツールを見つけることではなく、特定の文書と言語のペアごとにどのツールが最良の結果を生み出すかを判断する判断力を養うことです。スキルは翻訳を実行することではなく、出力を評価し、さまざまなツールが提供するオプションの中から最適なレンダリングを選択することにあります。
翻訳ツール間の違いは、現在の技術環境の特徴であり、欠陥ではありません。これらは、単一のユニバーサル トランスレータでは提供できないオプションを提供します。違いが存在する理由を理解しているユーザーは、違いを使用して、単一のツールだけで提供できるよりも高品質の翻訳を作成できます。この理解により、翻訳はボタンをクリックするだけから品質管理されたプロセスに変わります。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
