Others

為什麼翻譯 PDF 有時會導致文字溢出或從原始佈局中消失

您透過翻譯工具執行 PDF,將文字從英文轉換為德語。翻譯是準確的,但輸出是一團糟。德語文本通常比英語長百分之三十,但現在已經衝出文本框並溢出到鄰近區域。在某些頁面上,溢出的文字完全消失,被原始文字框架的邊界剪掉。翻譯捕捉到了文字,但失去了佈局,一份格式亂碼的文檔幾乎和翻譯亂碼的文檔一樣毫無用處。

翻譯 PDF作業期間的文字溢位是 PDF 翻譯中最常見的品質問題。出現這種情況是因為原始 PDF 是針對特定長度的文字設計的,而目標語言的翻譯文字幾乎從來沒有完全相同的長度。當翻譯工具以翻譯文字取代原始文字而不調整周圍佈局時,文字長度和文字框架大小之間的不匹配會產生溢出、剪裁或兩者兼而有之。

Why Does Translating a PDF Sometimes Cause Text to Overflow or Disappear From the Original Layout

為什麼翻譯文字的長度幾乎永遠不會與原始文字相同

不同的語言使用不同數量的字元和單字來表達相同的想法。英語中需要十五個單字的句子在漢語中可能需要十二個單詞,但在德語中可能需要二十個單字。字元數的變化甚至更加顯著。一個五個字元的英文單字會變成一個漢字,但可能會變成一個十五個字元的德語複合名詞。

語言擴展和收縮比率在翻譯行業中有詳細記錄。英語到德語的翻譯範圍通常會擴大百分之二十到三十五。英語到西班牙語的比例擴大了百分之十五到百分之二十五。英語到法語的擴展百分之十到百分之二十。英文到中文的字元數減少了百分之三十到百分之五十。這些比率意味著為英語文本設計的文本框架對於德語文本來說太小,對於中文文本太大。

PDF 格式 使翻譯過程變得複雜,因為文本儲存為定位字符,而不是流動段落。每個字元在頁面上都有特定的 x 和 y 座標。具有不同字元寬度的翻譯文字無法放置在同一座標處而不重疊或產生間隙。翻譯工具必須調整字元位置(這可能會破壞佈局),或保留位置並接受溢出。

語言之間的字體差異為長度不匹配增加了另一個維度。德語翻譯可能需要原始英語字體中不存在的帶有變音符號的字元。法文翻譯需要重音字元。波蘭語翻譯需要帶有變音符號的字元。如果原始字體不包含這些字符,則翻譯工具必須替換不同的字體,即使對於相同的磅值,替換的字體也可能具有不同的字符寬度。

WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

為什麼文字會消失而不是溢出

PDF 文字框架有剪切邊界。當文字超出框架尺寸時,超出部分將被隱藏。剪切是 PDF 渲染中的預設行為,因為它以犧牲內容可見性為代價保留視覺佈局。為三行英文地址設計的文字框架會剪輯德語翻譯的第四行,翻譯擴展到四行。

比剪切更糟糕的是翻譯工具識別出溢出並截斷文字以適應。被截斷的文字在句子中間結束,讀者永遠看不到缺少的內容。沒有警告的截斷是資料遺失問題,而不僅僅是格式問題。讀者假設他們擁有完整的翻譯文檔,但其中的部分內容被悄悄刪除以保留佈局。

一些翻譯工具嘗試透過減少字體大小來適應文字。翻譯後的文字仍然存在且完整,但可能小得難以閱讀。八點字體縮小為五點,以將德語翻譯放入英語大小的文字框架中,這在技術上是完整的,但實際上難以辨認。此類翻譯的PDF Export通過了完整性檢查,但未通過可用性檢查。

如何防止 PDF 翻譯過程中出現佈局問題

最有效的預防措施是在設計原始 PDF 時考慮到翻譯。在文字框架中添加額外的空白以適應語言擴展。使用寬大的行距並避免緊湊的佈局。專為翻譯而設計的文檔在其原始語言中看起來稍微鬆散,但可以容納百分之三十的文本擴展而不會中斷。

委託翻譯 PDF 時,要求設計人員提供可編輯格式的來源文件,而不僅僅是 PDF。翻譯人員可以直接在原始檔案中工作,根據每種語言的需要調整文字框架。然後,翻譯後的原始檔案將匯出為具有該語言的正確佈局的 PDF。此工作流程可產生專業的結果,但需要存取原始設計文件。

WukongPDF 透過瀏覽器提供翻譯工具,可以處理 PDF 文字並產生翻譯輸出。該平台處理文字提取和重新插入,同時保留盡可能多的原始佈局。

翻譯後佈局修復

翻譯後,檢查每個頁面是否有溢出、剪裁和字體替換問題。審核應由精通兩種語言的人員進行,以識別翻譯文本被切斷的位置。只會說一種語言的審查者可以發現視覺問題,但無法驗證缺少的文字是否重要。

對於佈局問題導致翻譯無法使用的頁面,請手動重建這些頁面。使用 PDF 中的翻譯文字並將其放入具有適當大小文字框架的新文件中。此手動步驟非常耗時,但對於佈局完整性至關重要的文件可以產生最高品質的結果。

對於經常性的翻譯需求,例如以多種語言發布的產品文檔,請投資將內容與佈局分開的翻譯工作流程。以 XML 或 Markdown 等結構化格式創作內容。翻譯內容文件。應用每種語言的佈局模板。從翻譯內容和佈局範本產生特定於語言的 PDF。這種內容和佈局的分離完全消除了溢出問題。

從右到左的語言,例如阿拉伯語和希伯來語,為文本長度挑戰添加了方向挑戰。整個文字流會反轉方向,並且定位為從左到右閱讀的 UI 元素可能需要移動到頁面的另一側。只替換文字而不調整方向的翻譯工具產生的文檔中,文字從右到左閱讀,但佈局卻假定從左到右,從而產生一種令人迷惑的閱讀體驗。

使用非拉丁文字的語言(例如中文、日文、韓文、西里爾文和阿拉伯文)可能需要原始 PDF 中未嵌入的字體。翻譯工具必須用適當的字型取代目標腳本。如果替換字體的規格與原始字體不同,則文字位置會變更。 SimSun 字體中的一行中文文字與 Microsoft YaHei 中的相同字元所佔據的水平空間不同。

由於表單欄位具有固定尺寸,因此 PDF 表單的翻譯帶來了額外的挑戰。對於英文姓名大小的姓名欄位可能對於德國或西班牙姓名來說太短,而德國或西班牙姓名往往較長。針對北美號碼 (XXX) XXX-XXXX 格式化的電話號碼欄位無法容納不同格式的國際號碼。

對於出於監管或法律目的而翻譯的文件,翻譯必須經過認證是完整且準確的。溢出並被剪切的文字不完整。被截斷以適合的文字不準確。譯者或翻譯服務必須驗證原始文字的每個字元是否都存在於翻譯的輸出中。

神經機器翻譯的機器翻譯品質得到了顯著提高,但佈局處理卻沒有以相同的速度提高。翻譯可能很流暢、準確,但佈局卻被破壞了。機器翻譯輸出的人工後期編輯應包括佈局審查,而不僅僅是語言審查。

對於必須以多種語言發布的文檔,最可靠的方法是為每種語言維護單獨的佈局模板,並根據該語言的預期文字長度調整文字框架的大小。翻譯會流入適當的模板,並且佈局問題是透過模板設計而不是透過翻譯後清理來捕獲的。

專業翻譯人員使用的翻譯記憶工具儲存先前翻譯的片段。當 PDF 包含與先前翻譯的內容相似的文字時,翻譯人員會重複使用儲存的翻譯。重複使用的翻譯可能已針對具有不同文字框架尺寸的不同文件進行了格式化。翻譯人員必須根據目前文件上下文調整格式。

翻譯後版式修復的費用應包含在翻譯專案預算中。對於格式複雜的文檔,佈局修復通常會增加 20% 到 40% 的翻譯成本。引用翻譯而不修復佈局會產生不切實際的預算,從而導致偷工減料。

最可靠的 PDF 翻譯工作流程將文字擷取、翻譯和佈局重建分為不同的步驟,並在每個轉換點進行人工審核,生成翻譯後的文檔,來源中的每個字元都存在且位置正確。

專門從事文件翻譯的專業翻譯服務了解每種語言對的文字擴展和收縮模式,並在生成翻譯後的 PDF 輸出之前相應地調整文字框架。

翻譯後的 PDF 中的字體嵌入對於不同系統之間的一致顯示至關重要,對於非拉丁文字尤其重要,因為接收系統可能沒有任何支援目標語言字元的字體。

語言對膨脹/收縮佈局影響
英語到德語+20-35%文字方塊溢出;需要減小字體大小
英語到西班牙語+15-25%適度溢出;豐厚的利潤有幫助
英文轉中文-30-50% 字符多餘的空白;文字顯得稀疏
英語至阿拉伯語+15-25% + RTL文字方向反轉; UI 元素發生變化
WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →