Tips & Tricks

如何翻譯長 PDF 文件(如手冊或指南)

將 200 頁的技術手冊從一種語言翻譯成另一種語言與翻譯 2 頁的信件不同。長度帶來了短文檔從未出現過的挑戰:數百頁術語的一致性、標題層次結構和交叉引用的保存、嵌入文本的圖形和表格的處理,以及翻譯需要數月編寫的文檔所需的絕對處理時間。

長文檔會放大每一個翻譯缺陷。第 7 頁和第 143 頁上的一個術語翻譯不一致,使讀者感到困惑。

適用於長文件的翻譯 PDF 工作流程需要將任務拆分為可管理的部分,在翻譯前建立術語表,並在重新組裝後驗證各部分之間的一致性。 WukongPDF 的PDF 轉換器 處理提取步驟,以下的工作流程解決了長度帶來的獨特挑戰。

How to Translate a Long PDF Document Like a Manual or Guide

為何長文檔需要不同的翻譯方法

短文檔可以一次翻譯。譯者可以將整個文件的上下文牢記在心,記住第 1 頁上的特定術語是如何翻譯的,並在第 3 頁上一致地應用它。 200 頁的手冊無法採用這種方法。沒有人能記住 200 頁的每個術語翻譯。如果沒有術語資料庫為每個特定領域術語提供正確的翻譯,任何機器翻譯系統都無法保持完美的一致性。

長文檔也往往具有複雜的內部結構。如果交叉引用請參閱第 4.2 節,則必須更新以符合翻譯後的章節編號(如果發生變化)。必須重新產生目錄以反映翻譯後的標題文字。必須重新翻譯索引條目並更新頁碼。這些結構元素需要短文檔很少需要的翻譯後工作。

WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

開始前建立術語表

在翻譯任何內容之前,從來源文件中提取每個獨特的技術術語、產品名稱和特定領域的短語。對於每個術語,定義核准的翻譯。與將處理該文件的每個翻譯人員或翻譯工具共用此術語表。術語表是防止不一致的唯一事實來源。在 200 頁中出現 50 次的術語,會以相同的方式翻譯 50 次,因為詞彙表強制執行這項規定。

對於一個很長的文檔,建立術語表需要幾個小時,並且每個翻譯頁面的一致性都會得到回報。對於將在未來版本中更新和重新翻譯的文檔,請將術語表作為動態文檔進行維護。新增更新中出現的新術語。退休已刪除的條款。此術語表成為一項機構資產,可改善相關文件的後續翻譯。

分割文檔進行並行翻譯

將 PDF 拆分為可以獨立並行翻譯的部分。章節邊界是自然的分割點。一本包含 15 個章節的 200 頁手冊變成了 15 個翻譯單元。多個翻譯人員或翻譯工具可以同時處理不同的章節,將總翻譯時間從幾週縮短到幾天。術語表確保獨立翻譯的章節在重新組合時使用一致的術語。

清楚地對每個部分進行編號,並追蹤哪些部分正在進行、已完成和已驗證。一個簡單的電子表格包含章節編號、頁面範圍、使用的翻譯器或工具、狀態和驗證日期,使平行工作流程井然有序。當所有部分完成並驗證後,將它們合併回單一翻譯後的 PDF 中。合併步驟應保留原始頁面順序和章節編號。

文檔元素翻譯挑戰解決方案
技術術語各章節翻譯不一致所有譯者強制執行的術語表
交叉引用翻譯中的章節編號可能會發生變化翻譯完成後更新交叉引用
帶有嵌入文字的圖形標準工具未提取圖像內的文本單獨提取圖形文本,疊加翻譯
目錄翻譯版本中的頁碼發生變化所有部分組裝完成後重新產生 TOC
索引條目術語和頁碼都發生變化從翻譯內容重建索引

處理圖形、表格和嵌入文本

標準 PDF 文字擷取可擷取正文、標題和表格儲存格內容。嵌入圖形內的文字、圖表上的標籤、插圖上的標註常常被遺漏,因為它們以向量圖形或光柵圖像的形式存在,而不是以可選擇的文字字元的形式存在。對於圖形文字具有關鍵意義的文檔,將圖形提取為圖像,翻譯可見文本,並將翻譯作為文本框覆蓋在翻譯文檔中的圖形圖像上。

這個圖形翻譯步驟是翻譯長篇技術文件中最耗費人力的部分,也是最常被跳過的部分。一份翻譯後的手冊,其正文為法語,但每個圖表標籤仍為英語,僅部分翻譯。圖表翻譯的預算時間與文件對圖表的依賴程度成正比。透過圖面溝通的工程手冊比透過文字溝通的政策文件需要更多的圖形翻譯時間。

使用翻譯記憶庫實現一致性和效率

翻譯記憶庫 (TM) 是儲存先前翻譯的句子對的資料庫。當TM遇到與以前見過的句子相似的句子時,它會建議先前的翻譯。對於包含重複內容、標準短語、反覆出現的警告、重複的章節介紹的長文檔,TM 可以自動翻譯 30-50% 的文檔,並獲得人類質量的結果,因為這些句子已經在同一文檔中較早翻譯過。

SDL Trados、memoQ 和 OmegaT 等 TM 工具與人工翻譯工作流程和機器翻譯系統整合。對於較長的文件翻譯項目,在一開始就設定好TM,並要求所有譯者都使用它。 TM 隨著專案的進展而成長,後面的部分受益於前面部分中建立的翻譯。一致性收益與效率收益一樣有價值。 TM 確保第 12 頁翻譯的標準片語與第 187 頁的措詞相同。

重新組裝和驗證翻譯文檔

翻譯並合併所有部分後,從頭到尾閱讀整個翻譯文件。此驗證過程可以發現詞彙表本應防止但有時卻未能防止的術語不一致、不同譯者使用不同工具引入的格式問題以及結構問題(例如交叉引用損壞或章節編號錯誤)。

讓目標語言的母語人士也熟悉文件主題進行最終審核。一般翻譯人員可以產生語法正確的文字。主題專家可以驗證翻譯文本的意思是否正確。語法正確和技術正確之間的區別在於可用翻譯和導致昂貴誤解的翻譯之間的差距。

維護翻譯以供日後文檔更新

當來源文檔更新時,請勿重新翻譯整個文件。確定哪些部分發生了變更並僅翻譯這些部分。未更改的部分繼承了先前的翻譯。這種增量方法減少了每個後續翻譯週期的成本和時間。該術語表繼續充當跨文檔版本的術語權威。

將翻譯後的文件與翻譯記憶庫和術語表一起存檔。當下一個版本到來時,翻譯記憶庫會建議與先前翻譯的句子類似的句子的翻譯。翻譯器或工具僅翻譯真正的新內容。在多個版本中,翻譯記憶庫變得更有價值,因為越來越多的文件與先前翻譯的內容相符。長文件的第一次翻譯成本高昂。每次後續更新都會更便宜,因為翻譯記憶庫會繼續推進工作。

WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →