科學論文、技術報告和插圖文件包含圖形標題,用於解釋每個圖像、圖表或圖表所顯示的內容。當此類文件的正文已經是讀者可以理解的語言,但圖形標題不是時,僅翻譯標題可以避免翻譯讀者已經可以理解的內容的不必要的工作。挑戰是將標題文字與周圍的正文文字隔離,以便只有標題通過翻譯引擎。
PDF 中的標題通常設定為與正文略有不同的字體大小或樣式。它們位於圖像下方或旁邊,通常以圖或表開頭,後面跟著數字。這些視覺和位置提示可以幫助人類讀者一目了然地識別標題。僅針對標題的翻譯 PDF工作流程使用這些提示來選擇正確的文本,無論是透過手動選擇、基於樣式的過濾或匯出和提取方法。
WukongPDF 的PDF Export 和翻譯工具處理文檔範圍內的語言轉換。對於選擇性的僅字幕翻譯,以下手動和半自動工作流程將字幕文字與周圍內容隔離。

方法 1:手動複製-翻譯-貼上字幕
對於標題數量可管理(通常少於 20 個)的文檔,最可靠的方法是手動。在任何支援文字選擇的編輯器中開啟 PDF。對於每個標題,選擇文本,複製它,將其貼上到翻譯工具(例如 Google Translate 或 DeepL)中,複製翻譯的輸出,然後將其貼上回 PDF 中的同一位置,替換原始標題文本。
手動方法是精確的。您可以準確控制翻譯哪些文字以及翻譯的位置。它避免了意外翻譯正文或丟失自動檢測可能會跳過的標題的風險。精確度是以時間為代價的。每個字幕大約需要 30 到 60 秒來選擇、翻譯和替換。包含 15 個標題的文檔大約需要 10 到 15 分鐘。對於單一文件的一次性翻譯,手動方法就足夠了。對於重複翻譯或具有數百個標題的文檔,下面的自動化方法更實用。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
方法 2:PDF 編輯器中基於樣式的選擇
Adobe Acrobat Pro 的編輯 PDF 工具包含一項功能,可選擇與特定字體、大小或顏色相符的所有文字。如果 PDF 中的標題使用一致的樣式(例如 9 號斜體),您可以透過一次操作來選擇所有標題文字。在 Acrobat Pro 中開啟 PDF,前往“編輯 PDF”,按一下標題文字區域,然後右鍵並選擇“選擇全部使用此字型”。 Acrobat 選擇頁面上使用相同字體和大小的每個文字區塊。複製選定的文字並將其貼上到文字文檔中。
檢查貼上的文字。意外使用與標題相同字體的正文將與實際標題一起選取。手動刪除所有非標題文字。文字文檔現在僅包含標題內容。將其貼到翻譯工具中進行翻譯,然後將每個翻譯後的標題貼回 PDF 中的原始位置。與單獨選擇每個標題相比,基於樣式的選擇顯著加快了提取步驟。
方法 3:匯出到 Word 並按樣式過濾
使用 Acrobat Pro 的匯出到 Word 功能或線上 PDF 到 Word 轉換器將 PDF 轉換為 Word 格式。在 Microsoft Word 中開啟產生的 DOCX。 Word 保留 PDF 中的字體樣式,因此標題的字體和大小與原始標題相同。使用 Word 的「選擇具有相似格式的所有文字」功能來選擇整個文件中的所有標題文字。右鍵單擊標題段落,轉到樣式,然後選擇全部。 Word 會選擇每個有比對格式的段落。
將選取的文字複製到新文件的表格中。每個標題佔一行。為翻譯後的文字新增第二列。使用翻譯工具翻譯每個標題,將翻譯貼到相鄰的列中。翻譯完所有標題後,使用兩個清單作為參考,將 PDF 中的每個標題替換為其翻譯。基於 Word 的方法提供了比基於 PDF 的方法更容易追蹤的結構化工作流程,因為翻譯進度在表格中可見。
| 方法 | 工作原理 | 最適合 |
|---|---|---|
| 選擇性複製貼上 | 僅複製 PDF 中的標題文字、翻譯、貼上回來 | 帶有 5-10 個標題的簡短文檔 |
| PDF編輯器按樣式查找-替換 | 選擇所有與字幕字體相符的文本,複製到翻譯器 | 帶有樣式標題的文檔 |
| 將字幕匯出到文字文件 | 將 PDF 匯出到 Word,透過格式隔離標題 | 具有多個標題的文件、重複的工作流程 |
處理跨多行的標題
PDF 中的多行標題可以分為單獨的文字區塊,每行一個。當您選擇並複製標題時,您會得到三個單獨的文字選擇,而不是一個連續的段落。透過用空格將它們連接起來,將所有三個作為一個區塊貼到翻譯工具中。翻譯將是一個段落。將譯文貼回 PDF 時,將其拆分為與原始文字相同數量的文字區塊,以保持版面配置。
當涉及文件工作流程時,對於包含技術術語、縮寫或測量單位的標題,請透過在翻譯工具支援的情況下將它們標記為不翻譯來保護這些術語免於翻譯,或者用佔位符標記替換它們,運行翻譯並恢復原始內容。圖 3:TiO2 奈米粒子在 50kx 放大倍率下的 SEM 影像的說明文字應與文字完全一致,保留 TiO2 和 50kx。
僅翻譯圖形標題會使正文保留原始語言,同時使目標語言的讀者可以理解視覺內容。與完整文件翻譯相比,選擇性方法可以節省時間,並產生可供雙語讀者(部分翻譯的技術內容的最常見受眾)高效導航的文件。
跨多個 PDF 批次翻譯字幕
對於管理帶有外語標題的文件庫的研究人員或技術作家來說,跨多個 PDF 的批量翻譯遵循相同的擴展工作流程。使用批次轉換器將所有 PDF 匯出為 Word 格式。使用 Word 的查找和替換以及格式過濾器來查找與特定字體和大小匹配的所有文本,這應該會捕獲所有匯出文件中的標題。將所有找到的文字複製到單一翻譯批次中。
透過 DeepL 或 Google Translate 在一次操作中翻譯整個批次。這兩種服務都接受大文本區塊並保留與各個標題邊界相對應的段落分隔符號。翻譯後,透過段落分隔符號將翻譯後的文字拆分回單獨的標題,並將每個標題貼到對應的 PDF 中。批次方法將每個標題的翻譯開銷從 30 秒減少到大約 5 秒,這對於具有數百個標題的文件集合來說非常實用。
替換翻譯字幕時保留佈局
翻譯後的字幕通常比原文更長或更短。德語翻譯比英語長 20% 到 30%。中文翻譯通常較短。將翻譯後的標題的字體大小調整半個磅,以吸收長度變化,而不改變文字方塊尺寸。小字體調整可保留佈局,同時適應翻譯長度差異。
在整個文件工作流程中,如果長度發生重大變化,請手動將翻譯後的標題拆分為多行。將換行符與原始標題的視覺寬度大致相符。目標是翻譯後的標題佔據與原始標題大致相同的視覺空間,保留標題與其描述的圖形之間的關係。
圖形標題的選擇性翻譯是一項尊重讀者現有語言技能的精確任務。僅翻譯需要翻譯的內容可以節省時間,並產生雙語讀者可以輕鬆瀏覽的文件。手動、基於樣式和基於匯出的方法可以從具有五個標題的單一文件擴展到具有數百個標題的文件庫。
字幕的選擇性翻譯是一項精確的任務,它產生可供雙語讀者使用的文檔,這些讀者可以理解正文,但需要其首選語言的字幕。工作流程從具有五個標題的單一文件擴展到具有數百個標題的庫,並且手動、基於樣式和導出方法各自服務於不同的規模。
選擇性字幕翻譯尊重讀者現有的語言技能,同時讓視覺內容易於理解。僅翻譯需要翻譯的內容(而不是整個文件)的精確性可以節省時間,並產生雙語讀者可以輕鬆瀏覽的結果。手動、基於樣式和基於導出的方法可以從單一文件擴展到整個庫。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
