フランス語で書かれた研究論文には、英語を話す査読者が理解する必要がある、キャプション付きの図とヘッダー付きの表が含まれています。査読者はバイリンガルの同僚と一緒に作業しているため、本文はフランス語のままでもかまいません。文書全体を翻訳する必要はなく、技術的な内容に誤りが生じる危険性があります。図のキャプションと表のヘッダーのみを翻訳すると、本文には触れずに、視覚的要素を解釈するために必要な情報が査読者に提供されます。
キャプションとヘッダーの選択的な PDF の翻訳は、位置、書式設定、またはコンテンツ パターンによって特定のテキスト要素を識別できるツールを必要とする精密なタスクです。通常、キャプションは図の下に小さなフォントで表示されます。テーブルのヘッダーは、テーブルの最初の行に太字で表示されます。これらの書式設定キューにより、選択的な抽出と翻訳が可能になります。

選択的翻訳のためのキャプションとヘッダーの識別
学術および技術 PDF の図のキャプションは、予測可能な書式パターンに従います。それらは図のすぐ下または横に表示されます。本文よりも小さいフォント サイズ (通常は 8 ~ 10 ポイント) が使用されます。多くの場合、図で始まり、その後に数字が続きます。これらのパターンにより、キャプション テキストを手動または自動で識別できます。
表ヘッダーは表の最初の行に表示され、多くの場合、背景が影付きの太字で表示されます。ヘッダー行はデータ行とは構造的に異なります。 PDF テーブル抽出ツールは、位置と書式設定によってヘッダー行を識別し、ヘッダー テキストを抽出して、データ行をそのまま残すことができます。
PDF 形式 は、キャプションとヘッダーを、意味的にタグ付けされた要素としてではなく、位置決めされたテキスト オブジェクトとして保存します。それらを抽出するには、テキストの位置、フォントのプロパティ、画像やテーブル構造への近接性の分析が必要です。汎用のテキスト抽出ツールでは、キャプションと本文を区別できません。ドキュメントのレイアウトを理解する特殊なツールを使用できます。
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
選択的翻訳ワークフロー
まず、PDF からキャプションとヘッダー テキストを抽出します。画像に対する相対的な位置とフォントの特性によって各キャプションを識別します。各テーブル ヘッダーは、テーブル構造内の位置によって識別されます。抽出されたテキストを位置参照を含む翻訳リストにコンパイルします。
次に、抽出したテキストを翻訳します。機械翻訳は、キャプションやヘッダーで使用される単純な言語に適しています。人間による翻訳のレビューにより、技術用語が正しく翻訳され、ドメイン固有の用語が保持されることが保証されます。
WukongPDF は、特定のテキスト要素を分離できる PDF から Text への抽出機能を提供します。抽出と翻訳を組み合わせると、元の本文テキストを保持しながら、翻訳されたキャプションとヘッダーが生成されます。
翻訳されたキャプションとヘッダーの再挿入
翻訳後、翻訳されたテキストを PDF の元の位置に戻します。翻訳されたキャプションは、各図の下にある元のキャプションを置き換えます。変換されたヘッダーは、各テーブルの元のヘッダーを置き換えます。本文は変更されません。
言語間の翻訳長の違いには注意が必要です。フランス語のキャプションを英語の長いテキストに翻訳する場合、同じスペースに収まるようにフォント サイズを若干小さくするか、行間を狭くする必要がある場合があります。ページのレイアウトを崩さずに、翻訳に合わせてテキストの書式を調整します。
選択的翻訳が正しいアプローチである場合
選択的翻訳は、読者が視覚的要素を理解する必要があるが、本文を詳しく読む必要がない場合に適しています。言語の壁を越えた科学的コラボレーション、国際投稿の技術レビュー、多言語出版ワークフローは、この的を絞ったアプローチから恩恵を受けます。
文書全体の翻訳と比較した選択的翻訳のコストと時間の節約は、本文に対するキャプションとヘッダーの比率に比例します。本文が 80%、キャプションが 20% である文書の場合、キャプションのみを翻訳すると、翻訳コストが 80% 節約されます。
選択的翻訳のためのキャプションとヘッダーの識別は、特定の文書または出版物の形式で文書レイアウト分析モデルをトレーニングすることによって部分的に自動化できます。雑誌テンプレートでトレーニングされたモデルは、そのテンプレートを使用するすべての記事にわたってキャプションとヘッダーを高精度で識別できます。
翻訳メモリ ツールは、同じフィールドの複数の文書にわたって繰り返し現れるキャプション フレーズの翻訳を保存できます。図 X のようなフレーズは、数十の論文に登場する と の関係を示しており、すべての論文で一貫した翻訳が得られる利点があります。
選択的翻訳の品質保証プロセスでは、正しいテキストが翻訳されたことと、間違ったテキスト (本文) が翻訳されなかったことの両方を検証する必要があります。査読者は、翻訳されたキャプションのサンプルをオリジナルと照合し、それらのページの本文が元の言語のままであることもチェックします。
キャプションに本文への数値参照が含まれる文書 (詳細についてはセクション 3.2 を参照) は、翻訳でこれらの相互参照を正確に保持する必要があります。存在しないセクションを指す相互参照が誤訳されると、混乱が生じます。
翻訳されたキャプションが PDF に再挿入されるとき、おそらく微妙な色の違いや余白の表記によって、新しいテキストが元の本文テキストと視覚的に区別できるようにする必要があります。これにより、読者は、選択的に翻訳された文書を見ていることを理解できます。
選択的翻訳アプローチは、要約翻訳、国際データベースのキーワード翻訳、多言語出版物の図ラベル翻訳など、ターゲットを絞った翻訳から恩恵を受ける他の文書要素にも拡張できます。
複数の言語でジャーナルを発行する学術出版社にとって、キャプションとヘッダーの選択的翻訳は、高価な完全翻訳とまったく翻訳を行わない間の費用対効果の高い中間点を提供します。
キャプションとヘッダーの選択的翻訳は、特定のニーズに対応する正確なツールであり、視聴者が完全な内容を理解する必要がある場合の文書全体の翻訳に代わるものではありません。
選択的翻訳の費用対効果は、完全な翻訳が法外に高価となる国際共同作業にとって魅力的な選択肢となります。
選択的翻訳は、多言語ドキュメントの共同作業に的を絞ったソリューションを提供します。
科学論文の図のキャプションは、自動抽出ツールが識別できる予測可能なパターンに従います。つまり、図の下に表示され、小さなフォントが使用され、図で始まり、その後に数字が続きます。
テーブル ヘッダーはテーブルの上部に表示され、多くの場合太字のテキストが使用され、抽出ツールが識別に使用する特徴である陰影付きの背景を持つ場合があるため、構造的にデータ行とは異なります。
抽出プロセスでは、翻訳されたテキストを正しいフォント プロパティと間隔で正しい位置に戻すことができるように、元の書式情報を保持する必要があります。
多言語出版物の場合、選択的な翻訳を体系的に適用できます。キャプションとヘッダーを抽出し、すべてのターゲット言語に翻訳し、各バージョンを個別の PDF レイヤーとして挿入します。
科学キャプションの機械翻訳の品質は、これらの構造化テキスト要素を最初から翻訳するよりも人間による後編集の方が高速かつ低コストになるまで向上しました。
本文とキャプションのフォント サイズの違いは、自動抽出ツールがキャプション テキストを識別するために使用する主な信号であり、キャプションは通常、周囲の本文テキストより 2 ~ 4 ポイント小さくなります。
テーブルのヘッダー行は、各テーブルの最初の行としての位置、太字のテキストの書式設定、およびデータ行と区別するための影付きの背景によって識別できます。
抽出されたキャプションとヘッダーは、ページ番号と位置座標を保持する構造化リストにコンパイルされ、翻訳後に正確に再挿入できるようにする必要があります。
翻訳メモリ ツールは、以前の文書から翻訳されたキャプションを同じフィールドに保存できるため、一貫性が向上し、繰り返し使用される用語の翻訳コストが削減されます。
翻訳されたキャプションを再挿入するには、言語間のテキストの長さの違いを考慮し、必要に応じてフォント サイズや行間隔を調整して、翻訳されたテキストを元のキャプション スペースに収める必要があります。
選択的翻訳の品質保証には、正しいテキスト要素が抽出されたこと、翻訳が正確であること、本文テキストが誤って変更されていないことの検証が含まれます。
複数の言語で論文を発行する学術雑誌の場合、キャプションとヘッダーの選択的な翻訳を標準ステップとして制作ワークフローに組み込むことができます。
全翻訳と比較して選択翻訳のコストが削減されるため、翻訳予算が限られているプロジェクトや出版物でも国際協力が可能になります。
科学的なキャプションで使用される構造化された定型的な言語の機械翻訳の品質は、一般に説明文の場合よりも高く、編集後の負担が軽減されます。
本文の元の言語を維持しながら特定の文書要素のみを翻訳できるため、国際的な文書ワークフローに柔軟性が生まれます。
複数の言語コミュニティにまたがる研究共同作業の場合、選択的翻訳により、各共同研究者が好みの言語で視覚的証拠にアクセスできるようになります。
この選択的なアプローチにより、翻訳リソースが限られているチームやプロジェクトでも、多言語ドキュメントのコラボレーションが可能になります。
図のキャプションと表のヘッダーのターゲットを絞った翻訳により、読者が視覚要素を解釈するために必要な重要なコンテキストが提供されます。
キャプションとヘッダーを選択的に翻訳することで、海外の読者は本文の完全な翻訳を必要とせずに文書内の視覚的証拠を理解できるようになります。
文書翻訳に対するこの的を絞ったアプローチにより、言語の壁を超えて視覚情報へのアクセシビリティを高めながら、コストを削減できます。
キャプションの抽出は、周囲の本文テキストとのフォント サイズと位置の違いに依存します。
PDF 内のキャプション テキストは通常、本文テキストより 2 ~ 4 ポイント小さいフォント サイズを使用して、対応する図のすぐ下または横に配置され、テキストの位置と書式特性を分析する自動抽出ツールで識別できるようになります。
キャプションとヘッダーを選択的に翻訳することで、海外の読者が視覚的な情報にアクセスできるようになります。
この機能により、国際的な研究協力がよりアクセスしやすく、コスト効率が高くなります。
文書翻訳に対する選択的なアプローチにより、完全な翻訳を費やすことなく特定のニーズに対応できます。
| 要素 | 識別キュー | 翻訳の優先度 | 再挿入メモ |
|---|---|---|---|
| 図のキャプション | 以下の図。小さいフォント。図 N 接頭語 | 高い | 同じ立場。フォントのサイズ変更が必要な場合があります |
| テーブルヘッダー | 最初の行;大胆な;影付きの背景 | 高い | 同じ細胞。位置合わせを維持する |
| 軸ラベル | グラフの軸に隣接 | 中くらい | 回転調整が必要な場合があります |
| 凡例のエントリ | 色見本+テキスト | 低い | 個別に抽出されないことが多い |
PDFを翻訳してみる
インストールは必要ありません。ブラウザで直接動作します。
