PDF 表の翻訳には、通常の文書翻訳ではできない独特の課題があります。テーブルには、基本的に異なる 2 つのデータ型、つまり変換が必要なテキストと、そのままにしておく必要のある数値が混在しています。ユーロの価格表では、製品説明をフランス語から英語に翻訳する必要がありますが、価格、数量、SKU コードはまったく変更されていなければなりません。財務レポートでは、収益の数値とパーセンテージの値がロックされたままの状態で、コメントを翻訳する必要があります。標準のTranslate PDF ツールは、多くの場合、すべてのコンテンツを均一に処理するため、書式変更、小数点記号の変換、または偶発的な文字置換によって数値が変更される危険があります。
問題は、翻訳ツールがテキストと数字を区別できないことではありません。最新の翻訳エンジンのほとんどは数値パターンを認識し、それらを単独で変更せずに残します。問題は、混合コンテンツ文字列に数字が埋め込まれている場合、PDF 抽出プロセスでセルの境界が誤認されている場合、および翻訳されたテキストの再挿入により表のレイアウトが崩れる場合に発生します。翻訳前にテキストと数値コンテンツを分離する系統的なアプローチにより、一貫して正確な結果が得られます。
WukongPDF の PDF エクスポート および翻訳ツールは、言語変換中にテーブル構造を保持します。表が多い文書の場合、翻訳エンジンを実行する前に表を前処理して数値セルを分離すると、翻訳後の修正が最小限で最も正確な出力が得られます。

翻訳ツールが時々数字を変更する理由
翻訳エンジンはテキスト文字列を言語単位として処理します。テーブルのセルに 1,500 単位が含まれている場合、エンジンはこれを混合文字列とみなして、1,500 がそのままにする数値なのか、それとも翻訳する語句の一部なのかを判断する必要があります。 2024 以降のモデルでトレーニングされたほとんどのエンジンは、一般的な数値形式に対してこれを正しく処理します。引き続き問題を引き起こすエッジ ケースには、ヨーロッパの 1,500,00 表記が不必要に米国の 1,500.00 に変換される可能性がある小数点区切りや、ターゲット言語の規則に基づいてエンジンが記号を移動または複製する可能性がある通貨記号が含まれます。
日付形式もよくある問題です。米国英語のソース文書で 03/07/2025 と書かれた日付は、2025 年 3 月 7 日を意味します。翻訳エンジンが英国英語の視聴者向けに日付の書式設定もローカライズする場合、表示が 07/03/2025 に変換され、意味が完全に変わってしまう可能性があります。最も安全なアプローチは、日付を数値とともに保護されたコンテンツとして扱い、周囲のテキストのみを翻訳することです。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
方法 1: Excel でのテーブルの前処理
最も制御可能なワークフローは、翻訳前に PDF テーブルを Excel に抽出することです。テーブル構造を保持するツールを使用して PDF を Excel に変換します。結果のスプレッドシートで列をスキャンし、どの列に翻訳可能なテキストと数値データが含まれているかを特定します。翻訳されたコンテンツ用に新しいシートを挿入します。テキスト列のみを翻訳しやすい形式にコピーします。翻訳ツールに直接貼り付けるか、別のファイルとしてエクスポートします。
テキスト列を翻訳した後、数値列を完全に変更しないまま、翻訳したテキストをスプレッドシートの対応する位置に貼り付けます。結合されたテーブルでセルの配置に問題がないか確認し、完成したスプレッドシートを PDF にエクスポートします。この方法では、数値が変換エンジンを通過しないため、数値の変更がゼロであることが保証されます。トレードオフは、手動の列ごとのワークフローが必要になることです。これは、10 ~ 50 行のテーブルでは実用的ですが、数百行のドキュメントでは多大な労力を要します。
方法 2: 正規表現ベースのコンテンツ マスキング アプローチの使用
一部の専門的な翻訳ツールおよび CAT (コンピューター支援翻訳) プラットフォームは、特定のテキストを翻訳不可としてマークする正規表現パターンをサポートしています。変換を実行する前に、数値形式 (カンマ付きの数字、小数点付きの数字、通貨の接頭辞付きの数値、パーセンテージ値、および日付パターン) に一致する正規表現パターンを定義します。これらのパターンを保護されたコンテンツ ルールとして適用します。次に、翻訳エンジンは、保護されたパターンに一致するテキスト セグメントをスキップし、残りのテキストのみを翻訳します。
この方法は、ほとんどの数値データが予測可能な形式に従っているドキュメントに適しています。たとえば、すべてのエントリにわたって一貫した価格フォーマットを持つ製品カタログは、ドル金額の \$\d{1,3}(,\d{3})*\.\d{2} のようなパターンで保護できます。さまざまなセクションにわたってさまざまな数値形式を持つドキュメントの場合、正規表現アプローチではより多くのパターンとより多くのテストが必要になります。翻訳後、文書のさまざまな部分で少なくとも 10 個の数値をスポットチェックして、書式設定のずれが発生していないことを確認します。
方法 3: コピー、翻訳、貼り付けのワークフロー
PDF 内の 1 つの表の場合、最も簡単な方法は、テキスト セルを一度に 1 列ずつコピーし、翻訳ツールで実行し、その結果を元の表の複製に貼り付けることです。 PDF エディタを使用すると、表の個々のセルからテキストを選択してコピーできます。各列のテキストを翻訳テキスト ボックスに貼り付け、翻訳された出力をコピーして、Word、Google ドキュメント、または表の編集をサポートする PDF エディターで再構築された表の対応する列に貼り付けます。
この方法は大きなテーブルでは面倒ですが、何を翻訳し、何をオリジナルのままにするかをピクセルレベルで制御できます。貼り付けステップでは、レイアウトの問題が発生します。翻訳されたテキストは原文よりも長くなることが多く、ドイツ語やスペイン語などの言語では 20 ~ 30% 長い場合もあります。表を完成させる前に、表のグリッドを崩さずに長い翻訳テキストを収容できるように列幅を調整します。翻訳されたコンテンツが元のセルのサイズに収まらない場合は、テキストがオーバーフローしたり切り取られたりするのではなく、フォント サイズを 0.5 ~ 1 ポイント縮小することを検討してください。
混合内容セルの処理
一部の表のセルでは、単一の文字列内にテキストと数字が純粋に混在しています。15 ユニットの交換部品 BP-4402 を注文する例は、数字 15 と部品コード BP-4402 が、周囲のテキストがターゲット言語に変換される間、翻訳後も変更されずに存続する必要がある例です。これらのセルの場合、変換前に数値セグメントと識別子をプレースホルダー トークンで囲みます。 15 を NUM1 に、BP-4402 を CODE1 に置き換えます。翻訳を実行します。次に、プレースホルダーを、翻訳された出力内の元の値に置き換えます。
このプレースホルダー手法は、翻訳エンジンがプレースホルダーを翻訳不可能なトークンとして扱い、そのまま保存するため、確実に機能します。翻訳後、単純な検索と置換により、プレースホルダーが元の値に戻されます。多数の混合コンテンツ セルを含むテーブルの場合、プレースホルダーの挿入と置換を手動で行うのではなく、短いスクリプトを使用して自動化します。
| アプローチ | 仕組み | 制限事項 |
|---|---|---|
| 全文翻訳 | すべてを翻訳してから手動で数値を修正する | 時間のかかる修正ステップ |
| 選択的なコピーと翻訳 | テキストセルのみをコピーし、外部で翻訳して貼り付け戻します | 脆弱なレイアウトの保存 |
| 正規表現パターンの保護 | 翻訳ツールで数値パターンを保護されたテキストとしてマークする | 正規表現または保護された範囲をサポートするツールが必要です |
| 2 層 PDF のアプローチ | 数値を個別に抽出し、テキストを翻訳し、再結合する | 複雑なワークフロー、価値の高いドキュメントに最適 |
PDF 表のセル内のテキストのみを翻訳し、数値はそのままにしておくことは、精密な作業です。 Excel の前処理方法は、複雑なテーブルに対して最も信頼性が高くなります。正規表現ベースの保護は、予測可能な数値形式のドキュメントに対して機能します。手動のコピー、翻訳、貼り付けのアプローチは、迅速な 1 回限りのニーズに対応します。どちらの方法を選択しても、翻訳前と翻訳後の数値サンプルを比較する 5 分間の検証パスにより、文書が読者に届く前に問題が発見されます。
翻訳後の品質検証チェックリスト
PDF 表内のテキストを翻訳した後、ドキュメントを共有する前に体系的な品質チェックを実行します。まず、元のテーブルと変換されたテーブルの合計行数を比較します。カウントが異なる場合は、抽出または挿入のステップ中に行が削除または複製されたことになります。次に、元の文書に対してさまざまな列の 5 つの数値を抜き取り検査します。小数点、カンマ、通貨記号、および負号が変更されていないことを確認します。 3 番目に、列の配置がすべての行で一貫していることを確認します。 1 つの列の位置がずれていると、その列内のすべてのデータがヘッダーに対してシフトされます。
専門的または法的使用を目的としてテーブルを翻訳する場合は、ターゲット言語のネイティブ スピーカーに翻訳されたセルのサンプルをレビューしてもらいます。表の内容を機械翻訳すると、業界固有の用語については技術的には正しいものの、文脈上不適切な翻訳が生成されることがあります。 5 分間の人によるレビューにより、自動化された品質チェックでは見逃される用語の問題が見つかります。人間による検証ステップを含むTranslate PDF ワークフローは、ビジネスクリティカルなドキュメントに対して一貫して信頼できる結果を生成します。
翻訳前に数値コンテンツを分離するために費やす余分な時間は、精度の向上につながります。すべての数字は正しいが、製品名が少しぎこちない翻訳された価格表は、使用可能な文書です。翻訳された価格表には完璧な製品名が含まれているが、小数点以下がシフトされている場合、負債となります。数値の正確さを優先し、スポットチェックで検証します。
繰り返しの翻訳ワークフローにおける数値保護の自動化
定期的なスケジュールで同様の表ドキュメントを翻訳する組織の場合、数値セルを自動的に識別して保護する前処理スクリプトを構築すると、ワークフローから手動検査ステップが削除されます。正規表現を使用した Python スクリプトは、PDF から抽出された CSV をスキャンし、80% を超える数値を含む列を保護対象としてタグ付けし、翻訳ツールがどのコンテンツをスキップするかを確認できるマークアップ ファイルを出力できます。このスクリプトは数千行のテーブルに対して 1 秒以内に実行され、その一貫性により、人間のレビュー担当者が翻訳エンジンから保護されるべき数値を誤って見逃してしまうリスクが排除されます。数値保護ワークフローを実装した後、ソース PDF テーブルと翻訳済み PDF テーブルの比較を四半期に 1 回実行して、保護ルールが進化するドキュメント セット内のすべての数値パターンを引き続き捕捉していることを確認します。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
