Tips & Tricks

マニュアルやガイドのような長い PDF ドキュメントを翻訳する方法

200 ページの技術マニュアルをある言語から別の言語に翻訳することは、2 ページの手紙を翻訳することと同じではありません。この長さにより、短い文書では決して表面化しない課題が生じます。それは、数百ページにわたる用語の一貫性、見出し階層と相互参照の保持、テキストが埋め込まれた図や表の処理、作成に数か月かかった文書の翻訳に必要な膨大な処理時間です。

長い文書はあらゆる翻訳の不完全性を増幅させます。 7 ページと 143 ページで用語の翻訳が一貫していないため、読者は混乱しています。

長い文書の Translate PDF ワークフローでは、タスクを管理可能なセクションに分割し、翻訳前に用語集を確立し、再組み立て後にセクション間の一貫性を検証する必要があります。 WukongPDF の PDF Converter が抽出ステップを処理し、以下のワークフローは長さが生み出す特有の課題に対処します。

How to Translate a Long PDF Document Like a Manual or Guide

なぜ長い文書には別の翻訳アプローチが必要なのか

短いドキュメントは 1 パスで翻訳できます。翻訳者は文書全体の文脈を頭の中に入れ、1 ページ目で特定の用語がどのように翻訳されたかを覚えて、3 ページ目でそれを一貫して適用することができます。200 ページのマニュアルはこのアプローチに反します。人間の翻訳者は、200 ページにわたるすべての用語の翻訳を覚えていることはできません。機械翻訳システムは、専門用語データベースがドメイン固有の用語ごとに正しい翻訳を提供しない限り、完全な一貫性を維持することはできません。

長い文書は内部構造が複雑になる傾向があります。 「セクション 4.2 を参照」という相互参照は、変更された場合、翻訳されたセクションの番号に一致するように更新する必要があります。翻訳された見出しテキストを反映するには、目次を再生成する必要があります。索引エントリを再翻訳し、ページ番号を更新する必要があります。これらの構造要素には翻訳後の作業が必要ですが、短い文書ではほとんど必要ありません。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

始める前に用語集を作成する

何かを翻訳する前に、ソース文書から固有の技術用語、製品名、ドメイン固有のフレーズをすべて抽出します。用語ごとに、承認された翻訳を定義します。この用語集を、文書を扱うすべての翻訳者または翻訳ツールと共有してください。用語集は、矛盾を防ぐ唯一の真実の情報源です。 200 ページにわたって 50 回出現する用語は、用語集によって強制されるため、50 回すべて同じ方法で翻訳されます。

用語集の作成には長い文書の場合は数時間かかりますが、翻訳されたすべてのページで一貫性が保たれます。将来のバージョンで更新および再翻訳されるドキュメントについては、用語集を生きたドキュメントとして維持してください。更新に新しい用語が表示されたら追加します。削除された退職条件。用語集は、その後の関連文書の翻訳をすべて改善する組織的な資産になります。

対訳用の文書の分割

PDF を独立して並行して翻訳できるセクションに分割します。章の境界は自然な分割点です。 15 章からなる 200 ページのマニュアルは 15 の翻訳単位になります。複数の翻訳者または翻訳ツールが異なる章を同時に作業できるため、総翻訳時間を数週間から数日に短縮できます。用語集により、個別に翻訳された章が再組み立てされたときに一貫した用語が使用されるようになります。

各セクションに明確に番号を付け、どのセクションが進行中、完了、検証されているかを追跡します。セクション番号、ページ範囲、使用した翻訳者またはツール、ステータス、検証日を記載したシンプルなスプレッドシートにより、並列ワークフローが整理されます。すべてのセクションが完了して確認されたら、それらを結合して単一の翻訳された PDF に戻します。マージステップでは、元のページ順序とセクション番号を保持する必要があります。

文書要素翻訳チャレンジ解決策
専門用語章間で一貫性のない翻訳すべての翻訳者によって用語集が強制される
相互参照セクション番号は翻訳中に変更される可能性があります翻訳完了後に相互参照を更新する
テキストが埋め込まれた図標準ツールでは抽出されない画像内のテキスト図のテキストを個別に抽出し、翻訳をオーバーレイする
目次翻訳版ではページ番号が移動しますすべてのセクションを組み立てた後、目次を再生成します
インデックスエントリ用語とページ番号の両方が変更されます翻訳されたコンテンツからインデックスを再構築する

図、表、埋め込みテキストの処理

標準の PDF テキスト抽出では、本文テキスト、見出し、表のセルの内容がキャプチャされます。図の中に埋め込まれたテキスト、図のラベル、イラストの吹き出しは、選択可能なテキスト文字としてではなく、ベクター グラフィックスまたはラスター イメージとして存在するため、見逃されることがよくあります。図のテキストが重要な意味を持つ文書の場合は、図を画像として抽出し、表示されているテキストを翻訳し、翻訳された文書の図の画像にテキスト ボックスとして翻訳をオーバーレイします。

この図の翻訳ステップは、長い技術文書の翻訳の中で最も労力を要する部分であり、最もスキップされることが多い部分です。本文がフランス語であるが、すべての図のラベルが英語のままである翻訳マニュアルは、部分的にのみ翻訳されています。図の翻訳にかかる時間の予算は、文書の図への依存度に比例します。図面を介して伝達されるエンジニアリングマニュアルは、テキストを介して伝達される政策文書よりも図の翻訳に多くの時間を必要とします。

一貫性と効率性のための翻訳メモリの使用

翻訳メモリ (TM) は、以前に翻訳された文のペアを保存するデータベースです。 TM は、以前に見た文に似た文に遭遇すると、以前の翻訳を提案します。繰り返しの内容、標準的な語句、繰り返しの警告、繰り返しのセクション紹介を含む長い文書の場合、TM は文書の 30 ~ 50% を人間による品質の結果で自動的に翻訳できます。これは、これらの文が同じ文書内で既に翻訳されているためです。

SDL Trados、memoQ、OmegaT などの TM ツールは、人間による翻訳ワークフローと機械翻訳システムの両方と統合されます。長い文書の翻訳プロジェクトの場合は、最初に TM を設定し、すべての翻訳者に TM の使用を要求します。 TM はプロジェクトが進行するにつれて成長し、後のセクションでは前のセクションで確立された翻訳の恩恵を受けます。一貫性の利点は、効率の利点と同じくらい価値があります。 TM は、12 ページで翻訳された標準語句が 187 ページでも同じ表現であることを保証します。

翻訳されたドキュメントの再構成と検証

すべてのセクションを翻訳して結合した後、翻訳された文書全体を最初から最後まで読んでください。この検証パスは、用語集で防止できるはずだったが防止できなかった用語の不一致、さまざまなツールを使用するさまざまな翻訳者によって導入された書式設定の問題、相互参照の破損やセクション番号の誤りなどの構造的問題を検出します。

文書の主題に精通し、ターゲット言語のネイティブスピーカーに最終レビューを実行してもらいます。一般的な翻訳者は、文法的に正しいテキストを生成できます。主題の専門家は、翻訳されたテキストが正しいことを意味しているかどうかを検証できます。文法的に正しいことと技術的に正しいことの違いは、使用可能な翻訳と、高価な誤解を引き起こす翻訳との違いです。

将来のドキュメント更新に備えて翻訳を維持する

ソース文書が更新された場合は、文書全体を再翻訳しないでください。変更されたセクションを特定し、そのセクションのみを翻訳します。変更されていないセクションは、以前の翻訳から引き継がれます。この段階的なアプローチにより、後続の各翻訳サイクルのコストと時間が削減されます。用語集は、ドキュメントのバージョン全体にわたって用語の権威として引き続き機能します。

翻訳された文書を翻訳メモリや用語集と一緒にアーカイブします。次のバージョンが到着すると、翻訳メモリは以前に翻訳された文と類似した文の翻訳を提案します。翻訳者またはツールは、真に新しいコンテンツのみを翻訳します。複数のバージョンを重ねると、以前に翻訳された内容と一致する文書の割合が増加するため、翻訳メモリの価値が高まります。長い文書の最初の翻訳には費用がかかります。翻訳メモリによって作業が引き継がれるため、その後の更新のコストは低くなります。

WukongPDF

PDFを翻訳してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →