翻訳ツールを使用して PDF を実行すると、結果として得られるドキュメントには、単純なレイアウトの変更を超えた書式設定の問題が発生することがよくあります。数学記号、通貨記号、アクセント付き文字などの特殊文字は、空のボックス、疑問符、または完全に間違った文字に置き換えられる場合があります。埋め込みフォントのレンダリングが停止し、テキストのセクション全体が消えたり、デフォルトのシステム フォントで表示されたりすることがあります。翻訳中にシンボルと PDF フォント に何が起こるかを理解すると、これらの問題を予測し、シンボルの精度が重要な文書に対して適切な翻訳アプローチを選択するのに役立ちます。
重要なポイント
PDF 翻訳ツールは、文書からテキスト レイヤーを抽出し、機械翻訳エンジンを通して実行し、翻訳されたテキストを元のレイアウトに戻すことによって機能します。記号と特殊文字は、このパイプラインのすべての段階で危険にさらされています。抽出では記号エンコーディングが誤って解釈される可能性があり、翻訳エンジンではアルファベット以外の文字が削除または破損される可能性があり、ターゲット言語が元の文書の埋め込みフォントに存在しない文字を使用している場合、再挿入ではフォント置換の問題が発生する可能性があります。

PDF 翻訳によるテキスト抽出段階の処理方法
翻訳を行う前に、ツールは PDF から可読テキストを抽出する必要があります。テキストが埋め込まれたネイティブ デジタル PDF の場合、この抽出はドキュメントのコンテンツ ストリームから文字コードを読み取り、埋め込みフォントのエンコード テーブルを使用して Unicode 値にマッピングします。この段階で、エンコード テーブルが不完全、破損している、または Unicode 規則に従っていないカスタム マッピングを使用している場合、記号と特殊文字が問題になります。古いソフトウェアで作成された PDF では、非標準のエンコードが使用されている場合があります。画面上ではユーロ記号のように見えるものが、標準の Unicode テーブルの何にもマップされない文字コードとして内部的に保存されます。
エンコード マッピングが失敗すると、抽出プロセスで置換文字 (通常は Unicode 置換文字または疑問符) が生成されます。この障害はサイレントに発生します。抽出されたテキストは、記号の周囲の文字と数字に問題がないため、一見正常に見えますが、文書の意味にとって重要な通貨記号、数学演算子、またはアクセント記号付きの文字は、翻訳が開始される前に失われています。財務 PDF のユーロ記号を解決できない抽出ステージでは、「合計: 2,500 ユーロ」になります。 「合計: 2,500」にまたは「合計: 2,500 ?」翻訳された出力はそのエラーを継承します。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
翻訳エンジンが記号と特殊文字に対して行うこと
機械翻訳エンジンは自然言語テキスト用に最適化されています。技術仕様や財務諸表など、単語と記号が混在する文に遭遇した場合、記号の処理は特定のエンジンと言語のペアによって異なります。最新のニューラル機械翻訳システムのほとんどは、通貨記号、パーセント記号、一般的な数学演算子など、非言語として認識される記号を通過させます。ただし、法律文書で使用されるセクション記号、科学文書の度記号、または特定の業界の特殊な表記法など、あまり一般的ではない記号は、翻訳エンジンのテキスト正規化ステップによって削除または置き換えられる場合があります。
正規化ステップは、実際の翻訳の前に実行され、入力テキストを標準化された形式に変換します。テキストを小文字にし、必須ではないとみなされる句読点を削除し、Unicode 文字を標準形式に正規化する場合があります。ほとんどのドキュメントでは、これが役に立ちます。これにより、翻訳エンジンが「Hello」を処理できなくなります。そして「こんにちは」別の言葉として。しかし、特定の記号が意味を持つ文書の場合、正規化は害を及ぼす可能性があります。下付き数字を使用する化学式、度および分の記号を含む一連の GPS 座標、またはセクション記号を含む法的引用はすべて、正規化によって意味が変わったり判読できなくなったりする形で変更される可能性があります。
フォントの置換: 翻訳されたテキストがしばしば異なって見える理由
フォントの置換による視覚的な影響は、軽微なものから重大なものまで多岐にわたります。ラテン語フォントを別のラテン語フォントに置き換えると、文字の幅はわずかに変わりますが、テキストは読みやすいままです。ラテン文字フォントを非ラテン文字体系の代わりに使用すると、ラテン文字フォントには必要な文字が含まれていないため、結果は通常、空の四角形または疑問符の行が表示されます。このため、アラビア語、中国語、日本語、韓国語、またはキリル文字に翻訳する場合は、再挿入段階でフォントの利用可能性に特別な注意を払う必要があります。
翻訳後、新しいテキストを PDF に戻す必要があります。元の文書の埋め込みフォントには、元のテキストに存在していた文字のみが含まれます。翻訳されたテキストに、英語文書のフランス語またはスペイン語翻訳にあるアクセント付き文字など、元の文にはない文字が含まれている場合、元の埋め込みフォントではそれらの文字を表示できません。 PDF ビューアは代替フォントに戻り、ほぼ確実に周囲のテキストとは異なって見えます。その結果、ほとんどのテキストが元の書体で表示されるドキュメントが作成されますが、時折翻訳された単語やアクセント付き文字が明らかに異なるフォントで表示され、ページがまだらでプロフェッショナルらしくない外観になります。
この問題は、まったく異なる書記体系を使用する言語に翻訳する場合に最も深刻になります。英語の PDF をロシア語、アラビア語、中国語、または日本語に翻訳するには、ラテン文字フォントに含まれていない文字が必要です。翻訳されたテキスト全体を代替フォントでレンダリングする必要があり、文書の視覚的特徴が完全に変わります。特定の文字幅と行高さを備えた元のテキストで機能したレイアウト ジオメトリは、翻訳されたテキストには適合しません。改行が移動し、段落が拡大または縮小し、慎重に位置合わせされていた要素の位置がずれてしまいます。
シンボルの機密性に基づいた変換アプローチの選択
実際の翻訳前チェックは、PDF を開いて、特殊文字を含む段落をプレーン テキスト エディターにコピーすることです。特殊文字がコピー アンド ペースト操作でもそのまま残っている場合、PDF のテキスト エンコーディングは標準であり、翻訳の抽出段階で特殊文字が破損する可能性はほとんどありません。貼り付けるときに文字化けしたり消えたりする場合、PDF は標準以外のエンコードを使用しているため、翻訳時に問題が発生します。フォントの埋め込みを有効にして PDF を再作成するなど、ソースでエンコードを修正することは、翻訳後に破損した文字を回復しようとするよりも効果的です。
財務報告書、科学論文、法的書類、技術マニュアルなど、記号が重要な文書の場合、最も安全なアプローチは、
文書を別の書記体系に翻訳する場合は、出力がオリジナルとは異なることを受け入れ、それに応じて計画を立ててください。ピクセル完璧なレイアウトの一致を期待するのではなく、ターゲット言語でクリーンで読みやすいドキュメントを作成することに重点を置きます。翻訳後、手動または半自動のレイアウト調整のための時間を確保します。列の幅を調整し、テーブルを再調整し、すべての特殊文字が正しく表示されていることを確認します。翻訳後の書式設定に費やす余分な時間は、複数の書記体系にまたがる作業のコストであり、レイアウト作業を行わずにシームレスなクロススクリプト翻訳を約束するツールは、真に難しい問題を単純化しすぎています。 WukongPDF の翻訳ツールは、変換プロセス全体を通じて埋め込まれたフォント データを保存し、テキストの再挿入中にフォントが置き換えられるときに発生するシンボルの破損を最小限に抑えます。
よくある質問
PDF を直接翻訳する必要がありますか、それとも最初に編集可能な形式に変換し、それを翻訳してから PDF に再エクスポートする必要がありますか? Word への変換、Word 文書の翻訳、PDF へのエクスポートという 2 段階のアプローチでは、通常、Word が生の PDF テキスト抽出よりも一貫して Unicode を処理するため、より高いシンボル忠実度が得られます。その代償として、Word を往復することでレイアウトが変更され、手動で修正する必要があります。短いドキュメントの場合、2 段階の方法はレイアウトの労力を費やす価値があります。非常に長い文書の場合は、エンコードを保持するツールを使用して PDF を直接変換する方が実用的です。
テキストを抽出して外部翻訳し、手動で PDF レイアウトに戻すことで PDF を翻訳できますか?はい、この手動パイプラインを使用すると、あらゆる段階でシンボルの処理とフォントの選択を完全に制御できますが、時間がかかり、短いドキュメントの場合にのみ実用的です。 50 ページの技術マニュアルの場合、手動で再挿入することは不可能です。自動翻訳と手動翻訳のどちらを選択するかは、最終的には、出力に対してどの程度の制御が必要か、どのくらいの時間を投資できるかによって決まります。
翻訳前に PDF を Word に変換することで、記号の消失を防ぐことができますか?
まず Word に変換すると、翻訳ツールは Microsoft Word の Unicode 処理を通じてテキストにアクセスできるようになります。これは一般に、生の PDF テキスト抽出よりも信頼性が高くなります。この追加の手順により、特に標準の Unicode エンコーディングをすでに使用している最新のソフトウェアで作成されたドキュメントの場合、エンコーディング関連のシンボル損失が解決されることがよくあります。その代償として、Word の変換自体でレイアウトが変更される可能性があります。記号の多い文書の場合、通常、文字の精度が向上するため、レイアウト作業が正当化されます。
PDF の翻訳中に数式が頻繁に崩れるのはなぜですか?
PDF 内の数式は通常、変数と数値のテキスト文字、専用の数学フォントからの特殊な数学記号、ベクトル描画された分数棒、根号記号、その他の表記要素の組み合わせとして保存されます。翻訳エンジンがテキスト レイヤーを処理するとき、方程式を文として扱い、記号シーケンスを再配置または正規化する場合があります。ベクトルで描画された要素はまったくテキストではなく、変更されることなく翻訳を通過しますが、翻訳されたテキストに対するそれらの位置合わせはほとんどの場合壊れます。数学的な内容が多い文書の場合、最も信頼できるアプローチは、翻訳から方程式を除外し、周囲の散文のみを翻訳することです。
他のものよりも優れた翻訳PDF 形式を処理できる PDF 形式はありますか?
Unicode フォントが完全に埋め込まれた PDF/A は、サブセット フォントとカスタム エンコーディングを使用した標準 PDF よりも確実に変換されます。 PDF/A の完全な埋め込みと Unicode 要件により、フォント グリフの欠落と非標準文字マッピングという、翻訳中の記号破損の最も一般的な 2 つの原因が排除されます。文書が翻訳されることがわかっている場合、翻訳を実行する前に文書を PDF/A として保存することは価値のあるステップです。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
