當您透過翻譯工具執行 PDF 時,產生的文件通常會出現格式問題,而不僅僅是簡單的佈局轉換。數學符號、貨幣符號和重音字母等特殊字元可能會被替換為空框、問號或完全錯誤的字元。嵌入字體可能會停止渲染,導致整個文字部分消失或以預設系統字體顯示。了解翻譯過程中符號和PDF 字體 發生的情況有助於您預測這些問題,並為符號準確性至關重要的文檔選擇正確的翻譯方法。
要點
PDF 翻譯工具的工作原理是從文件中提取文字層,透過機器翻譯引擎運行它,然後將翻譯後的文字放回原始佈局中。在此管道的每個階段,符號和特殊字符都面臨風險:提取可能會誤解符號編碼,翻譯引擎可能會刪除或損壞非字母字符,當目標語言使用原始文檔嵌入字體中不存在的字符時,重新插入可能會遇到字體替換問題。

PDF 翻譯如何處理文本提取階段
在進行任何翻譯之前,該工具必須從 PDF 中提取可讀文字。對於具有嵌入文字的本機數位 PDF,此擷取會從文件的內容流中讀取字元代碼,並使用嵌入字型的編碼表將它們對應到 Unicode 值。當編碼表不完整、損壞或使用不遵循 Unicode 約定的自訂映射時,符號和特殊字元在此階段就會出現問題。由舊軟體建立的 PDF 可能使用非標準編碼,其中螢幕上看起來像歐元符號的內容在內部儲存為字元代碼,該字元代碼會對應到標準 Unicode 表中的任何內容。
當編碼映射失敗時,提取過程會產生替換字符,通常是 Unicode 替換字符或問號。這種失敗悄無聲息地發生。提取的文字乍看之下很正常,因為符號周圍的字母和數字都很好,但對文件含義至關重要的貨幣符號、數學運算符或重音字母在翻譯開始之前就已經遺失了。無法解析財務 PDF 中歐元符號的提取階段將「總計:2,500 歐元」變為「總計:2,500 歐元」。進入「總計:2,500」或「總計:2,500?」並且翻譯後的輸出將繼承該錯誤。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
翻譯引擎對符號和特殊字元的作用
機器翻譯引擎針對自然語言文字進行了最佳化。當他們遇到包含單字和符號混合的句子(例如技術規格或財務報表)時,符號處理取決於特定的引擎和語言對。大多數現代神經機器翻譯系統都會傳遞它們識別為非語言的符號,例如貨幣符號、百分號和常見的數學運算符。但不太常見的符號,例如法律文件中使用的部分符號、科學文本中的學位符號或來自特定行業的專用符號,可能會被翻譯引擎的文本規範化步驟刪除或替換。
規範化步驟在實際翻譯之前運行,將輸入文字轉換為標準化形式。它可能會小寫文本,刪除它認為不重要的標點符號,並將 Unicode 字元規範為其規範形式。對於大多數文件來說這很有幫助。它阻止翻譯引擎處理“Hello”和“你好”作為不同的單字。但對於特定符號有意義的文檔,規範化可能會造成損害。使用下標數字的化學式、一組帶有度數和分鐘符號的 GPS 座標或帶有部分標記的法律引文都可能透過標準化而改變,從而改變其含義或使其不可讀。
字體替換:為什麼翻譯文本通常看起來不同
字體替換的視覺影響從微妙到嚴重不等。當拉丁字體替換另一種拉丁字體時,字元寬度會略有變化,但文字仍然可讀。當拉丁字體取代非拉丁書寫系統時,結果通常是一行空矩形或問號,因為拉丁字體不包含任何必要的字元。這就是為什麼翻譯成阿拉伯語、中文、日文、韓文或西里爾語需要在重新插入階段特別注意字體可用性。
翻譯後,新文字必須放回 PDF 中。原始文檔的嵌入字體僅包含原始文字中存在的字元。當翻譯後的文字包含原始文字中沒有的字符時,例如英語文檔的法語或西班牙語翻譯中的重音字符,原始嵌入字體無法呈現它們。 PDF 檢視器會使用替代字體,幾乎肯定會與周圍的文字看起來有所不同。結果是文件中大多數文字以原始字體顯示,但偶爾翻譯的單字或重音字元以明顯不同的字體顯示,使頁面看起來不完整、不專業。
當翻譯成使用完全不同的書寫系統的語言時,這個問題最為嚴重。將英文 PDF 翻譯成俄語、阿拉伯語、中文或日文需要拉丁文字字體不包含的字元。整個翻譯文字必須使用替換字型呈現,且文件的視覺特徵完全改變。適用於原始文字的佈局幾何圖形及其特定的字元寬度和行高將不適合翻譯後的文字。換行符移動,段落增大或縮小,精心對齊的元素變得不對齊。
根據符號敏感性選擇翻譯方法
實用的預翻譯檢查是開啟 PDF 並將包含特殊字元的段落複製到純文字編輯器中。如果特殊字元在複製貼上操作中完好無損,則 PDF 的文字編碼是標準的,並且翻譯的提取階段不太可能損壞它們。如果貼上時字元出現亂碼或消失,則 PDF 使用非標準編碼,會導致翻譯過程中出現問題。從來源修復編碼(例如透過啟用字體嵌入重新建立 PDF)比翻譯後嘗試恢復損壞的字元更有效。
對於符號至關重要的文檔,例如財務報告、科學論文、法律文件和技術手冊,最安全的方法是使用
對於要翻譯成不同書寫系統的文檔,請接受輸出看起來與原始版本不同的事實,並相應地進行規劃。不要期望像素完美的佈局匹配,而是專注於用目標語言產生乾淨、可讀的文件。翻譯後,預算手動或半自動佈局調整的時間。調整列寬,重新對齊表格,並檢查所有特殊字元是否已正確呈現。在翻譯後格式化上花費的額外時間是跨書寫系統工作的成本,而那些承諾無縫跨腳本翻譯而不需要任何佈局工作的工具過於簡單化了一個真正困難的問題。 WukongPDF 的翻譯工具在整個轉換過程中保留嵌入的字體數據,最大限度地減少在文字重新插入期間替換字體時發生的符號損壞。
常見問題
我應該直接翻譯 PDF 還是先將其轉換為可編輯格式,然後翻譯,然後重新匯出為 PDF?轉換為 Word、翻譯 Word 文件以及匯出回 PDF 的兩步驟方法通常會產生更好的符號保真度,因為 Word 比原始 PDF 文字擷取更一致地處理 Unicode。代價是 Word 的往返過程會帶來必須手動修正的版面變更。對於較短的文檔,兩步驟方法值得在佈局上付出努力。對於很長的文檔,使用保留編碼的工具直接翻譯 PDF 更為實用。
我可以透過提取文字、在外部翻譯並手動將其放回 PDF 佈局來翻譯 PDF嗎?是的,這個手動管道可以讓您在每個階段完全控制符號處理和字體選擇,但它非常耗時且僅適用於短文件。對於50頁的技術手冊,手動重新插入是不可行的。自動翻譯和手動翻譯之間的決定最終取決於您需要對輸出進行多少控制以及您可以投入多少時間。
翻譯前將 PDF 轉換為 Word 可以防止符號遺失嗎?
首先轉換為 Word 使翻譯工具可以透過 Microsoft Word 的 Unicode 處理來存取文本,這通常比原始 PDF 文本提取更可靠。此額外步驟通常可以解決與編碼相關的符號遺失問題,特別是已使用標準 Unicode 編碼的現代軟體建立的文件。代價是Word 轉換本身可能會引入佈局變更。對於符號較多的文檔,字元準確性的提高通常證明佈局工作是合理的。
為什麼 PDF 翻譯過程中數學方程式常出現錯誤?
PDF 中的數學方程式通常儲存為變數和數字的文字字元的混合,加上專用數學字體的特殊數學符號,加上向量繪製的分數條、根號和其他符號元素。當翻譯引擎處理文字層時,它將方程式視為句子,並可能重新排列或規範化符號序列。向量繪製的元素根本不是文本,並且在不被觸及的情況下通過翻譯,但它們相對於翻譯文本的對齊幾乎總是被破壞。對於數學內容較多的文檔,最可靠的方法是從翻譯中排除方程式,只翻譯周圍的散文。
是否有 PDF 格式可以比其他格式更好地處理PDF 格式 的翻譯?
具有完全嵌入的 Unicode 字體的 PDF/A 比具有子集字體和自訂編碼的標準 PDF 的翻譯更可靠。 PDF/A 中的完整嵌入和 Unicode 要求消除了翻譯過程中符號損壞的兩個最常見的來源:遺失字體字形和非標準字元對應。如果您知道文件將被翻譯,那麼在執行翻譯之前將其儲存為 PDF/A 是值得採取的步驟。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
