將相同的 PDF 上傳到兩個不同的線上翻譯服務,結果會有所不同。同一個法語段落透過一種工具以一種方式呈現,透過另一種工具以另一種方式呈現。差異範圍從單字選擇和句子結構到工具處理格式、嵌入文字和包含單字的圖像的方式。這些差異並不是傳統意義上的錯誤。每個工具都根據其設計選擇、翻譯引擎和文件處理流程產生最佳翻譯。了解存在這些差異的原因有助於您為給定文件選擇正確的工具,並以適當的期望解釋輸出。

不同的翻譯引擎產生不同的語言輸出
線上 PDF 翻譯工具建構在通用機器翻譯引擎之上,最常見的是在大型多語言語料庫上訓練的神經機器翻譯模型的變體。兩種主要方法是 Google 的神經機器翻譯系統(由 Google Translate 及其授權工具使用)以及 DeepL 的捲積神經網路方法。 Microsoft Translator 和 Amazon Translate 代表了額外的獨立實作。每個系統都根據不同的訓練資料進行訓練,針對不同的品質指標進行最佳化,並針對流暢性與字面準確性進行不同的優先順序調整。相同的輸入語句將在這些系統中產生不同的輸出語句。
差異在三方面最為明顯。首先,處理歧義:像“avocat”這樣的法語單字根據上下文可以表示律師或酪梨。不同的翻譯引擎透過不同的統計模型來解決此類歧義,並且它們並不總是得出相同的結論。其次,語域和形式:有些引擎預設使用區分正式和非正式語言的正式位址,而其他引擎則預設使用中性。使用“Sie”與“du”的德語翻譯改變了整個文件的社會基調。第三,慣用表達:在目標語言中具有直接等效項的短語可以由一個引擎進行字面翻譯,並由另一個引擎進行慣用翻譯,產生既正確但風格不同的文本。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
文檔結構處理造成非語言差異
除了翻譯單字和句子之外,線上 PDF 工具的不同之處在於處理文字周圍的文件結構的方式。一些工具將所有文字提取到線性流中,翻譯它,然後將其放回原始位置,丟失段落分隔符號、標題層次結構以及正文和標題之間的關係。其他人則嘗試透過獨立翻譯每個佈局區塊內的文字來保留文件結構。第二種方法產生更忠實的佈局,但可能會翻譯重複的文本,例如出現在每個頁面上的運行標題,每次出現時都會有所不同,因為該工具將每個實例視為獨立的翻譯單元,而不了解先前的實例。
WukongPDF的翻譯PDF工具處理文件的文字層,同時保留原始佈局和格式。翻譯引擎將每個文字元素呈現在適當的位置,從而保持文件的視覺結構。在比較不同工具的翻譯時,輸出的結構保真度通常與語言品質一樣重要。讀起來很漂亮但丟失了所有段落分隔符號和標題樣式的翻譯需要重新格式化,這可能比改進保留原始佈局的粗糙翻譯需要更長的時間。
處理影像和掃描內容中的嵌入文字
翻譯工具之間差異的一個主要來源是它們如何處理未儲存為 PDF 中可選字元的文字。 PDF 可能包含帶有嵌入文字的圖像,例如帶有標籤的圖表、標誌照片或文字僅以像素形式存在的掃描頁面。有些翻譯工具完全忽略基於圖像的文本,僅產生文本圖層的翻譯,而圖像不翻譯。其他人首先嘗試對圖像進行 OCR,然後翻譯識別的文本,但 OCR 步驟會引入自身的錯誤,並與翻譯混合在一起。在翻譯開始之前,由兩種不同工具處理的相同影像可能會產生不同的 OCR 讀數。
這對文檔品質的影響是重大的。僅處理文字圖層的翻譯後的 PDF 將包含翻譯後的正文文字和未翻譯的圖像標題、圖表標籤和嵌入文字的混合。不會說原始語言的讀者會將這些未翻譯內容的孤島視為死胡同。在比較包含圖像中嵌入文字的文件的翻譯工具時,檢查每個工具如何處理嵌入內容是一個關鍵的評估標準,它與文字翻譯的語言品質一樣重要。
特定於格式的保留:字體、顏色和頁面佈局
翻譯會改變文字長度。德語和芬蘭語翻譯往往比英語源長 20% 到 30%。中文和日文翻譯往往要短 10% 到 20%。這種長度變化會影響文件佈局的各個方面。完全適合英語表格單元格的文字在德語中可能會溢出。平衡在一行上的標題可能會換行為兩行。整齊對齊的項目符號點可能會變得參差不齊。每個翻譯工具以不同的方式處理這些佈局結果。
有些工具會向下調整字體大小,以使翻譯後的文字適合原始空間。這保留了頁面結構,但可能會產生各部分之間字體大小明顯不同的頁面,從而產生不一致的閱讀體驗。其他工具保留原始字體大小並允許文字重排,這可能會更改分頁符號並改變文字與相鄰圖像之間的關係。最佳方法取決於文件類型。一份法律合同,其中每個單字都必須保留在與原始字體大小調整相同的頁面上。視覺一致性很重要的行銷手冊從保留字體大小和接受重排中獲益更多。
如何為您的文件選擇和評估翻譯工具
考慮到工具之間的差異,最可靠的選擇方法是使用兩個或三個候選工具測試文件中的代表性頁面,並並排比較結果。查看語言品質:翻譯以目標語言讀起來是否自然,或者聽起來像機器翻譯嗎?查看完整性:是否遺漏了任何文本,尤其是頁首、頁尾和圖像標題中的文本?查看佈局保真度:翻譯後的文檔是否看起來像原始文檔,或者是否需要重新格式化?這些問題的答案將根據語言對、文件類型和文件的具體內容而有所不同。
對於翻譯品質會帶來法律或業務後果的文檔,請考慮讓人工審閱者比較輸出並為每個部分選擇最佳翻譯。機器翻譯工具速度很快且越來越準確,但它們並非絕對可靠,工具之間的差異意味著沒有一個工具適合所有文件。並排評估翻譯的PDF Compare流程是品質保證步驟,可將機器翻譯從賭博轉變為託管流程。
譯後編輯在多元工具翻譯工作流程中的作用
專業翻譯工作流程中不斷增長的最佳實踐是透過兩個或三個翻譯引擎運行源文檔,比較輸出,並讓人工編輯選擇和完善每個段落的最佳渲染。這種多引擎方法結合了不同翻譯模型的優點。一個引擎可以更好地處理技術術語,而另一個引擎可以產生聽起來更自然的散文。人類編輯成為機器輸出的管理者,而不是從頭開始工作的翻譯。其結果是翻譯超出了任何單一引擎可以產生的翻譯,並且比完全手動翻譯所需的時間更短。對於將要發布、廣泛分發或在翻譯品質直接影響可信度的情況下使用的文檔,多引擎審查工作流程可提供當前技術可用的最高品質輸出。
翻譯工具之間的差異不會消失。每個工具代表一組不同的工程決策、訓練資料選擇和最佳化優先順序。了解這些差異並利用它們來發揮自己的優勢,可以將不一致的根源轉變為品質保證策略。文件的最佳翻譯很少是單一工具的輸出。它是多種工具所能產生的最佳結果,由人類對目標語言中聽起來正確的內容的判斷提供資訊。
翻譯工具之間的這種差異並不是該技術的弱點。它反映了真正的語言歧義,使翻譯成為一個難題。面對這種模糊性時,不同的工具會做出不同的選擇。了解這些選擇的本質有助於您為每個文件選擇正確的工具,並透過明智的判斷而不是盲目信任來解釋輸出。我們的目標不是找到單一的最佳翻譯工具(這種工具並不存在),而是建立判斷力,了解哪種工具可以為每個特定文件和語言對產生最佳結果。技能不在於運行翻譯,而是評估輸出並從不同工具提供的選項中選擇最佳渲染。
翻譯工具之間的差異是當前技術格局的一個特徵,而不是缺陷。它們提供了單一通用翻譯器無法提供的選項。了解差異存在原因的使用者可以使用它們產生比任何單一工具單獨提供的更高品質的翻譯。這種理解將翻譯從點擊按鈕轉變為品質控制的過程。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
