Tips & Tricks

如何翻譯 PDF 中嵌入圖像內的文本

PDF 翻譯工具處理文件中的文字流,將單字從一種語言轉換為另一種語言。它會讀取段落、標題和說明文字。但它不會讀取圖像內的文字。標誌的照片、不同語言的使用者介面的螢幕截圖、帶有作為圖像一部分呈現的軸標籤的圖表,所有這些都包含標準翻譯工具忽略的文本,因為這些文本不在 PDF 文字流中。它嵌入在圖像像素中。翻譯嵌入圖像內的文本需要提取圖像,對其運行 OCR,翻譯識別的文本,然後重新嵌入翻譯後的圖像或將翻譯添加為疊加層。圖像嵌入文字的翻譯 PDF工作流程比標準文字翻譯更複雜,但它涵蓋了原本無法翻譯的內容。

How to Translate Text Inside Embedded Images in a PDF

辨識包含可翻譯文字的圖像

並非 PDF 中的每個圖像都包含值得翻譯的文字。裝飾照片、背景紋理和公司徽標可能不包含可翻譯的內容。軟體應用程式的螢幕截圖、帶有標記組件的圖表、文件或標誌的照片以及帶有嵌入軸標籤的圖表都包含目標語言讀者需要理解的文本。掃描 PDF 並識別每張包含文字的圖像。為翻譯工作流程標記這些圖像。

PDF 中包含文字的圖像分為兩類:一類是文字故意成為圖像一部分的圖像,例如螢幕截圖或標籤的圖表,另一類是文字出現在圖像中,因為文件是掃描的而不是數位創建的。掃描的 PDF 是每頁一張大圖像。掃描頁面上的所有文字都嵌入到頁面圖像中。數位建立的 PDF 可能在基於文字的頁面上有一個螢幕截圖。需要翻譯的PDF影像是文字出現在影像像素而不是PDF文字流中的影像。

WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

提取圖像並識別文字

以可用的最高解析度從 PDF 中提取圖像。使用保留原始解析度的 PDF 影像擷取工具。將每個提取的圖像儲存為 PNG 文件,以避免在提取步驟中引入壓縮偽影。打開每個提取的圖像並確認文字清晰可辨。如果影像解析度太低而無法清晰讀取文本,請盡可能以更高的解析度重新提取,否則請注意該影像可能會產生不可靠的 OCR 結果。

對每個提取的圖像運行 OCR 以識別文字。 OCR 引擎會辨識影像中的文字區域並輸出辨識的字元及其位置。保存每個影像的 OCR 輸出,包括識別的文字和每個文字區域的邊界框座標。稍後需要此資訊才能將翻譯後的文字放置在圖像上的正確位置。 WukongPDF 處理OCR PDF 處理,可以識別嵌入圖像中的文本,作為文件轉換工作流程的一部分。

在保留上下文的同時翻譯識別的文本

從圖像中辨識出的文字通常是碎片化的。圖表可能包含單字標籤。螢幕截圖可能包含沒有句子上下文的選單項目和按鈕標籤。這種碎片化的文字對於機器翻譯引擎來說是一個挑戰,因為消除單字意義歧義的周圍語言上下文不存在。提供盡可能多的背景資訊。如果標籤顯示「檔案」並出現在軟體選單的螢幕截圖上,請在翻譯輸入中註意這是一個選單項,而不是實體物件。

對於具有多個文字區域的圖像,請維護每個區域及其翻譯之間的映射。具有十個標籤的圖表會產生十個單獨的文字字串,每個文字字串都需要翻譯。將原始文字、翻譯文字和邊界框座標以結構化格式(例如電子表格)保存在一起。此映射用於最後一步,將翻譯後的文字放置到圖像上。為了使翻譯 PDF輸出有用,翻譯文字必須出現在圖像上的正確位置,替換或伴隨原始文字。

將翻譯後的文字放回圖像上

有兩種將翻譯後的文字放置到圖像上的方法。第一種方法用譯文替換原文。在圖像編輯器中開啟圖像。對於每個文字區域,透過用背景顏色填滿該區域來擦除原始文字。使用盡可能與原文風格相符的字體將翻譯後的文字放置在同一區域中。這種方法可以產生乾淨的翻譯影像,看起來與原始影像相似,但語言不同。

第二種方法將翻譯加入原文旁邊。將翻譯後的文字以對比色放置在原始文字下方或旁邊。這種方法為了解兩種語言並希望將翻譯與原始程式碼進行比較的讀者保留了原文。它比擦除和替換更快,但生成的圖像在視覺上更繁忙。根據受眾需求選擇方法。針對僅閱讀目標語言的操作員的培訓手冊可以從替換中受益。雙語參考文件受益於並排演示。

將翻譯後的影像重新嵌入 PDF 中

使用翻譯文字處理圖像後,必須將它們放回 PDF 中。將每個原始影像替換為其翻譯後的對應影像。替換圖像必須與原始圖像放置在頁面上相同的空間。如果翻譯後的影像的像素尺寸與原始影像不同,請將其縮放以匹配 PDF 中的原始邊界框。 PDF 頁面佈局不應變更。唯一可見的區別應該是圖像中文字的語言。

將包含翻譯影像的 PDF 儲存為新版本,保留原始未翻譯的 PDF 作為參考。打開 PDF 並檢查每個圖像來驗證翻譯後的 PDF。確認翻譯的文字清晰、位置正確且沒有 OCR 或翻譯錯誤。當目標語言的讀者可以存取文件、文字流和圖像中的每個文字元素時,帶有嵌入圖像翻譯的翻譯 PDF 就完成了。

何時選擇手動翻譯而非自動翻譯

對於包含關鍵文字(例如安全警告、法律聲明或技術規範)的圖像,請考慮由人工翻譯人員進行手動翻譯,而不是機器翻譯。 OCR 錯誤與機器翻譯錯誤結合可能會改變安全指令的含義,從而產生實際後果。與錯誤翻譯的成本相比,少量關鍵影像的人工翻譯成本很小。

對於手動翻譯不可行的大批量影像,請實施審核步驟。機器翻譯和重新嵌入後,請一位閱讀目標語言的人工審查者檢查翻譯圖像的樣本以確保準確性。如果樣本顯示系統錯誤,請調整 OCR 設定或翻譯引擎參數並重新處理批次。

嵌入圖像中的文字翻譯通常是使 PDF 完全可供國際受眾訪問的最後一步。正文、標題和說明文字已翻譯。圖像保留為最終未翻譯的內容。完成此步驟會產生一個文檔,其中每種媒體中的每段文字都可以以目標語言提供。

對於經常更新且嵌入圖像的文檔,請考慮是否可以在文件建立過程中將圖像文字移至 PDF 文字流中。可以使用標準文字翻譯工具來翻譯帶有儲存為文字覆蓋而不是圖像一部分的標籤的圖表,從而完全避免了提取-OCR-翻譯-重新嵌入的工作流程。

最終翻譯影像的品質取決於管道中每個步驟的品質。高解析度影像擷取可產生清晰的 OCR 輸入。準確的 OCR 可以產生正確的翻譯文字。一個好的翻譯引擎可以保留意義。仔細的重新嵌入可以保持視覺品質。每一步都取決於前一步。

用於圖像嵌入文字的翻譯 PDF 工作流程是勞動力最密集的翻譯場景,因為它將圖像處理、OCR、翻譯和重新嵌入結合到單一管道中。盡可能多的自動化步驟減少了手動工作量。

對於在多個 PDF 中顯示相同的圖像,例如帶有標語或標準圖表的公司徽標,只需翻譯一次圖像即可重複使用。翻譯後的影像可以替換到原始影像出現的每個 PDF 中。

本文介紹了在此特定場景中處理 PDF 的關鍵技術和注意事項。這裡描述的方法適用於不同的工具和平台,使讀者可以靈活地選擇最適合其工作流程和技術環境的方法。

概述的實際步驟提供了從最初的挑戰到可行的解決方案的清晰路徑。每種技術都因其可靠性和可訪問性而被選擇,以確保讀者無論以前使用 PDF 工具的經驗如何,都可以獲得一致的結果。

WukongPDF 和類似平台提供 OCR 和文件處理工具,支援本文中所述的圖像文字翻譯工作流程。這些工具的組合可實現全面的翻譯覆蓋。

WukongPDF

嘗試翻譯 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →