翻譯 PDF 表格提出了常規文件翻譯所沒有的獨特挑戰。表格混合了兩種根本不同的資料類型:需要翻譯的文字和必須保持原樣的數字。歐元價目表需要將產品描述從法語翻譯成英語,但價格、數量和 SKU 代碼必須絕對不變。財務報告需要翻譯評論,同時收入數字和百分比值保持鎖定。標準翻譯 PDF工具通常統一處理所有內容,這存在因格式更改、小數點分隔符號轉換或意外字元替換而改變數字的風險。
問題不在於翻譯工具無法區分文字和數字。大多數現代翻譯引擎都能辨識數字模式並保持它們獨立不變。當數字嵌入到混合內容字串中、PDF 提取過程錯誤識別單元格邊界以及重新插入翻譯文字破壞表格佈局時,就會出現問題。在翻譯之前將文字和數位內容分開的有條不紊的方法可產生一致的準確結果。
WukongPDF 的PDF Export 和翻譯工具在語言轉換期間保留表結構。對於表格較多的文檔,在運行翻譯引擎之前對錶格進行預處理以隔離數位單元格,從而以最少的翻譯後更正產生最準確的輸出。

為什麼翻譯工具有時會改變數字
翻譯引擎將文字字串作為語言單位進行處理。當表格儲存格包含 1,500 個單位時,引擎會將其視為混合字串,並且必須決定 1,500 是單獨保留的數字還是要翻譯的短語的一部分。大多數在 2024 年及以後的模型上訓練的引擎都能正確處理常見數字格式的問題。仍然會導致問題的邊緣情況包括小數分隔符號(其中歐洲 1.500,00 表示法可能會不必要地轉換為美國 1,500.00)和貨幣符號(其中引擎可能會根據目標語言的約定移動或複製符號)。
日期格式是另一個常見的受害者。美國英語來源文檔中寫為 03/07/2025 的日期表示 2025 年 3 月 7 日。如果翻譯引擎也針對英國英語受眾在地化日期格式,則可能會將顯示轉換為 07/03/2025,這會完全改變含義。最安全的方法是將日期與數字一起視為受保護的內容,僅翻譯周圍的文字。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
方法1:在Excel中預處理表格
最可控的工作流程是在翻譯之前將 PDF 表格提取到 Excel 中。使用保留表格結構的工具將 PDF 轉換為 Excel。在產生的電子表格中,掃描列並確定哪些列包含可翻譯文字與數字資料。插入翻譯內容的新工作表。僅將文字列複製為適合翻譯的格式:將它們直接貼上到翻譯工具中或將它們匯出為單獨的文件。
翻譯文字列後,將翻譯後的文字貼回電子表格中的對應位置,保持數字列完全不變。檢查組合表中的儲存格對齊問題,然後將完成的電子表格匯出為 PDF。此方法保證零數字更改,因為數字永遠不會通過翻譯引擎。代價是它需要手動逐列工作流程,這對於具有 10 到 50 行的表來說很實用,但對於具有數百行的文件來說卻是勞動密集型的。
方法 2:使用基於正規表示式的內容屏蔽方法
一些專業翻譯工具和 CAT(電腦輔助翻譯)平台支援將特定文字標記為不可翻譯的正規表示式模式。在執行翻譯之前,定義與您的數字格式相符的正規表示式模式:帶有逗號的數字、帶有小數點的數字、貨幣前綴數字、百分比值和日期模式。將這些模式套用為受保護的內容規則。然後,翻譯引擎會跳過與受保護模式相符的任何文字段,僅翻譯剩餘的文字。
此方法適用於大多數數字資料遵循可預測格式的文件。例如,所有條目價格格式一致的產品目錄可以使用 \$\d{1,3}(,\d{3})*\.\d{2} 等美元金額模式進行保護。對於不同部分具有不同數字格式的文檔,正規表示式方法需要更多模式和更多測試。翻譯後,抽查文件不同部分的至少 10 個數值,以確認沒有發生格式偏誤。
方法 3:複製-翻譯-貼上工作流程
對於 PDF 中的單一表格,最簡單的方法是一次複製一列文字儲存格,透過翻譯工具執行它們,然後將結果貼回原始表格的副本中。使用 PDF 編輯器,您可以從各個表格儲存格中選取和複製文字。將每列的文字貼上到翻譯文字方塊中,複製翻譯的輸出,然後將其貼上到 Word、Google 文件或支援表格編輯的 PDF 編輯器中重建表格的相應列中。
對於大型表格來說,該方法很乏味,但可以讓您對翻譯的內容和保持原始的內容進行像素級控制。貼上步驟是出現佈局問題的地方。翻譯文本通常比源文本長,對於德語或西班牙語等語言,有時要長 20% 到 30%。在最終確定表格之前,調整列寬以適應較長的翻譯文本,而不會破壞表格網格。如果翻譯的內容不適合原始單元格尺寸,請考慮將字體大小減小 0.5 到 1 磅,而不是讓文字溢出或被剪切。
處理混合內容單元
一些表格單元格真正將文字和數字混合在一個字串中:訂購 15 個單位的替換零件 BP-4402 是一個示例,其中數字 15 和零件代碼 BP-4402 必須在翻譯後保持不變,而它們周圍的文本則轉換為目標語言。對於這些單元格,在翻譯之前將數字段和標識符包裝在佔位符標記中。將 15 替換為 NUM1,將 BP-4402 替換為 CODE1。運行翻譯。然後將佔位符替換為翻譯輸出中的原始值。
這種佔位符技術工作可靠,因為翻譯引擎將佔位符視為不可翻譯的標記並逐字保留它們。翻譯後,簡單的查找和替換會將佔位符交換回原始值。對於具有許多混合內容單元格的表格,使用簡短的腳本自動插入和替換佔位符,而不是手動執行。
| 方法 | 工作原理 | 限制 |
|---|---|---|
| 完整翻譯 | 翻譯所有內容,然後手動修復數字 | 耗時的校正步驟 |
| 選擇性複製翻譯 | 僅複製文字單元格,從外部翻譯,貼上回 | 脆弱的佈局保存 |
| 正規表示式模式保護 | 在翻譯工具中將數字模式標記為受保護文本 | 需要支援正規表達式或受保護範圍的工具 |
| 兩層 PDF 方法 | 分別提取數字、翻譯文字、重新組合 | 複雜的工作流程,最適合高價值文檔 |
僅翻譯 PDF 表格單元格中的文本,同時保持數字不變,這是一項精確的任務。對於複雜的表格,Excel 預處理方法是最可靠的。基於正規表示式的保護適用於具有可預測數字格式的文件。手動複製-翻譯-貼上方法可以滿足快速、一次性的需求。無論您選擇哪種方法,在文件到達受眾之前,透過比較翻譯前後的數值樣本進行五分鐘的驗證即可發現任何問題。
翻譯後品質驗證檢查表
翻譯 PDF 表格中的文字後,在共用文件之前進行系統的品質檢查。首先,比較原始表和翻譯表中的總行數。如果計數不同,則在提取或插入步驟期間刪除或重複了一行。其次,根據原始文件抽查不同欄位中的五個數值。確認小數點、逗號、貨幣符號和負號不變。第三,驗證所有行的列對齊方式是否一致。單一未對齊的列會相對於標題移動該列中的所有資料。
當翻譯後的表格用於專業或法律用途時,請讓目標語言的母語人士檢查翻譯後的單元格範例。表格內容的機器翻譯有時會為行業特定術語產生技術上正確但上下文不合適的翻譯。五分鐘的人工審核可以發現自動品質檢查遺漏的術語問題。 翻譯 PDF包含人工驗證步驟的工作流程可為關鍵業務文件產生一致可靠的結果。
在翻譯之前花費額外的時間隔離數位內容會在準確性方面得到回報。一份翻譯後的價格表,其中每個數字都是正確的,但產品名稱有點尷尬,是一個可用的文件。具有完美產品名稱但移動了小數點的翻譯價格表是一種負擔。優先考慮數字準確性並透過抽查進行驗證。
重複翻譯工作流程中的自動化數位保護
對於定期翻譯類似表格文件的組織來說,建立自動識別和保護數位單元格的預處理腳本可以從工作流程中刪除手動檢查步驟。使用正規表示式的 Python 腳本可以掃描從 PDF 中提取的 CSV,將包含超過 80% 數值的列標記為受保護,並輸出一個標記文件,翻譯工具可以在其中查看要跳過哪些內容。對於具有數千行的表,該腳本的運行時間不到一秒,其一致性消除了人工審閱者意外錯過本應受到翻譯引擎保護的數字的風險。實施數位保護工作流程後,每季對來源 PDF 表格和翻譯後的 PDF 表格進行一次比較,以確認保護規則仍能捕捉不斷發展的文件集中的每個數位模式。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
