Others

同じ PDF が、汎用の翻訳ツールとドキュメント特化の翻訳ツールで処理すると翻訳が異なるのはなぜですか

同じ PDF を Google 翻訳などの汎用翻訳ツールと、WukongPDF の内蔵翻訳ツールなどのドキュメントに特化した翻訳ツールにアップロードすると、結果は異なります。場合によっては、ここでは単語の選択が、ここでは文の構造が異なるなど、違いが微妙である場合があります。また、ドラマチックな場合もあります。ある翻訳は人間が自然に書いたもののように読めますが、もう 1 つは機械がすべての文を苦労して読んでいるように読めます。これらの違いは、ランダムなエラーやバグではありません。これらは、速度と正確性、流暢性と文字通りの忠実性、および純粋な言語翻訳と文書構造の保持のバランスをどのように取るかについて、各翻訳システムによって行われる基本的な設計上の選択から生じます。これらの違いが存在する理由を理解することは、各ドキュメントに適切なツールを選択し、適切な信頼レベルで出力を解釈するのに役立ちます。

Why Does the Same PDF Translate Differently When Processed Through a General-Purpose Translator vs a Document-Specialized Translation Tool

汎用トランスレータとドキュメント特化トランスレータの基本的な違い

Google 翻訳、DeepL、Microsoft Translator などの汎用翻訳エンジンは、Web ページ、チャット メッセージ、電子メール、ソーシャル メディアの投稿、そしてドキュメントなど、あらゆるコンテキストのテキストを翻訳できるように設計されています。彼らのトレーニング データはオープン インターネットから取得され、膨大な範囲の文体、ドメイン、品質レベルを網羅しています。この幅広さにより、驚くべき柔軟性が得られます。彼らは、レストランのメニューから法的契約書に至るまで、あなたが投げかけたほとんどすべてのものをまずまずの翻訳を作成できます。しかし、同じ幅が彼らの限界でもあります。これらは特定のドメインに対して最適化されていないため、特定のドメインに対しても最適化されていません。一般的な翻訳者は、法律用語、医療専門用語、技術仕様、ビジネス文書で期待される正式な登録簿などについて特別な理解はありません。契約書はブログのコメントと同じように扱われ、同じ統計モデルを使用してある言語から別の言語に変換されるテキストとして扱われます。

ドキュメントに特化した翻訳ツールは、根本的に異なるアプローチを採用しています。これらはドキュメントの翻訳に特化して設計されており、処理パイプライン全体がそのワークフローを中心に構築されています。彼らは、PDF が単なるテキストのストリームではなく、見出し、段落、表、キャプション、ヘッダー、フッター、ページ番号を含む構造化された文書であることを理解しています。単語だけでなく、見出し階層、段落区切り、表セル内のテキストの配置、本文テキストとキャプションの関係などの文書構造も保持されます。文書専門の翻訳者は、契約書を契約書のように扱い、文書に法的性質を与える条項の番号付け、署名ブロック、形式的なトーンを保持します。 WukongPDF の Translate PDF ツールは、このドキュメントファーストの哲学に基づいて構築されており、テキストを非構造化ストリームに抽出するのではなく、ドキュメント コンテキスト内で処理します。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

トレーニング データによって翻訳出力がどのように異なる形になるか

翻訳エンジンに翻訳方法を教えるトレーニング データは、その出力の性質に多大な影響を与えます。汎用エンジンは、ニュース記事や Wikipedia のエントリからフォーラムのディスカッションや製品レビューに至るまで、あらゆるものを含む Web クロールされた大規模なコーパスでトレーニングされます。この折衷的なトレーニング方法により、汎用性の高いエンジンが生成されますが、場合によっては、正式な文書としてはカジュアルすぎる、または慣用的な表現としては文字通りすぎる翻訳が生成されてしまいます。エンジンは非常に多くの異なるタイプのテキストを認識するため、ユーザーが明示的に指示しない限り、どのレジスターが特定の文書に適切であるかを確実に検出できません。また、長い文書全体にわたって一貫した形式的なトーンを維持する能力には限界があります。

ドキュメントに特化したエンジンは、多くの場合、翻訳された契約書、技術マニュアル、学術論文、政府文書、ビジネス通信などの分野固有のコーパスで一般的なトレーニングを補完します。この集中的なトレーニングにより、ターゲット ドメイン内でより信頼性の高いエンジンが生成されます。法律用語を正確に翻訳し、ビジネスコミュニケーションで期待される正式な登録を維持し、長い文書全体で一貫した用語を維持する可能性が高くなります。その代償として、ドキュメントに特化したエンジンは、カジュアルな会話や創造的な文章など、トレーニング領域から大きく外れたコンテンツではパフォーマンスが低下する可能性があります。しかし、ほとんどの人が実際に翻訳する必要がある文書の場合、ドメインに焦点を当てることは明らかな利点です。

差別化要因としての文書構造の保持

おそらく、汎用翻訳者と文書専門翻訳者の最も目に見える違いは、翻訳されたテキストを取り巻く文書構造をどのように処理するかです。汎用トランスレータは通常、PDF からすべてのテキストを線形ストリームに抽出し、それを単一のブロックとして翻訳し、翻訳されたテキストを各ページの元の位置に戻そうとします。このアプローチでは、多くの場合、テキストとそのコンテキストの関係が壊れます。見出しの太字の書式が失われ、翻訳されたテキストが元のテキストより長いため表のセルがオーバーフローし、キャプションが説明されている画像から分離される可能性があります。翻訳は言語的には正確ですが、構造的に損傷している可能性があり、手動で再フォーマットする必要があり、翻訳品質自体を確認するよりも時間がかかる場合があります。

ドキュメント専門の翻訳者は、レイアウト コンテキスト内でテキストを翻訳します。各テキスト ブロックは、ページ構造内での位置を維持しながら、個別に翻訳されます。見出しスタイルは維持され、表の構造は維持され、テキストと画像の間の空間的関係はそのまま残ります。翻訳されたドキュメントは、言語が異なるだけで、元のドキュメントと似ています。この構造上の忠実さは、単なる美しさだけではありません。構造が保存された文書は、受信者がすぐに使用できるようになります。翻訳中に文書の構造が破損した場合、意図した目的を果たす前に追加の作業が必要になります。翻訳を並べて評価するPDF 比較 プロセスでは、言語の正確さと同じ重みで構造の忠実性を評価する必要があります。

画像およびスキャンされたコンテンツ内の埋め込みテキストの処理

トランスレータ タイプ間の特に明らかな違いは、画像、図のラベル、スキャンされたページのコンテンツに埋め込まれた単語など、PDF 内にピクセルとしてのみ存在するテキストをどのように処理するかです。汎用トランスレータは、テキスト抽出パイプラインが選択可能な文字の実行のみを処理するため、通常、画像ベースのテキストを完全に無視します。翻訳されたドキュメントは、本文テキストがターゲット言語で届きますが、画像のキャプション、図のラベル、埋め込まれたコールアウトはすべてソース言語のままです。対照的に、ドキュメント専門の翻訳者には、翻訳を開始する前に画像からテキストを抽出する OCR 前処理ステップが含まれることが多く、ドキュメントのテキスト レイヤーと画像レイヤーの両方をカバーするより完全な翻訳が可能になります。

完全性の違いは、特定の種類のドキュメントでは特に顕著です。スライド テキストのみが処理され、すべての図、チャート、および埋め込まれた図がソース言語のままである翻訳されたプレゼンテーションは、中途半端な翻訳となり、ソース言語を話さない読者を混乱させます。本文がターゲット言語であるにもかかわらず、すべての回路図のラベルがソース言語のままである翻訳された技術マニュアルは、ほとんど使用できません。 Translate PDF ツールの、テキスト レイヤーだけでなく画像内のテキストにもアクセスできる機能により、翻訳されたドキュメントが完全に翻訳されているか、部分的にのみ翻訳されているかが決まります。

ドキュメントに適した翻訳者の選択

汎用トランスレータとドキュメント特化トランスレータのどちらを選択するかは、ドキュメントのコンテンツ タイプ、その使用目的、および最終結果に対する構造的忠実性の重要性によって決定される必要があります。以下の表は、考慮すべき重要な要素をまとめたものです。

係数汎用トランスレータドキュメント専門の翻訳者
一般的なテキストの言語的正確さ一般的なコンテンツに最適です。専門用語に苦労するかもしれない全体的に良い。トレーニングされたドメイン内のドメイン固有の用語に強い
文書構造の保存限定;通常、テキストはフラット ストリームとして抽出され、再配置されます。強い;見出し、表、スペースを維持しながら、レイアウト コンテキスト内で変換します。
画像に埋め込まれたテキストの処理通常は無視されます。選択可能なテキストのみが処理されます多くの場合、画像内のテキストをキャプチャしてスキャンするための OCR 前処理が含まれます
音域と音色の一貫性長い文書ではフォーマルとカジュアルの間を行き来する可能性がある法務、ビジネス、技術などの訓練を受けた分野での一貫性が向上
こんな方に最適文書の内容を素早く理解する。非公式の共有専門的な配布。オリジナルと同じように見え、機能する必要がある文書

多くの実用的な目的では、両方のツールを組み合わせた最良のアプローチが得られます。文書の内容を最初から理解するには、汎用のトランスレーターを使用します。次に、ドキュメント専門の翻訳者を使用して、元のドキュメントの構造とプロフェッショナルな外観を維持した、洗練された最終的な翻訳を作成します。 2 つのツールは翻訳ワークフローで補完的な役割を果たし、それぞれの利点を理解することで、それぞれのツールが最も効果的に機能するように使用できます。

ワークフローに関する追加の考慮事項

この記事で説明する手法は、さまざまなツール、プラットフォーム、形式で PDF を操作するときに発生する特定の課題に対処します。それぞれの課題には、PDF 形式が特定の種類のコンテンツや関連する変換をどのように処理するかを理解することに根ざした解決策があります。これらのテクニックを一貫して適用すると、PDF タスクがイライラする障害から、適切に管理されたドキュメント ワークフローの日常的な手順に変わります。

PDF の動作をより深いレベルで理解することの価値は、ここで説明する特定のシナリオを超えて広がります。将来 PDF に関する新たな課題に直面した場合、PDF 形式が関連コンテンツをどのように保存および処理するかを尋ねる診断アプローチが、解決策に導きます。この形式は複雑ですが論理的であり、ある動作を説明する原則が他の動作も説明できることがよくあります。

文書の準備は、あなたの仕事がどのように受け入れられるかへの投資です。 PDF が正しく表示され、きれいに変換され、コンテンツがプロフェッショナルに表示されると、その作成に注力したことが反映されます。この記事で説明されている追加の手順は、エクスポート設定の構成、ページの前処理、出力品質の確認など、それほど面倒なものではありません。これらは、機能する文書と、解決するよりも多くの問題を引き起こす文書の違いです。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →