用法語撰寫的研究論文包含英語審查者需要理解的帶有標題的圖表和帶有標題的表格。正文可以保留法語,因為審稿人正在與雙語同事合作。翻譯整個文件是不必要的,並且存在在技術內容中引入錯誤的風險。僅翻譯圖形標題和表格標題可為審閱者提供解釋視覺元素所需的信息,而無需接觸正文。
选择性翻译 PDF 的标题和标题是一项精确的任务,需要一个能够通过位置、格式或内容模式识别特定文本元素的工具。標題通常以較小的字體顯示在圖形下方。表格標題以粗體文字顯示在表格的第一行。這些格式提示允許選擇性提取和翻譯。

識別字幕和標題以進行選擇性翻譯
學術和技術 PDF 中的圖片標題遵循可預測的格式模式。它們出現在圖的正下方或旁邊。它們使用比正文更小的字體,通常為 8 到 10 號。它們通常以數字開頭,後面跟著數字。這些模式允許手動或自動識別標題文字。
表格標題出現在表格的第一行,通常會採用帶有陰影背景的粗體文字。標題行在結構上與資料行不同。 PDF 表格擷取工具可以透過標題行的位置和格式來識別標題行,提取標題文本,並保持資料行不變。
PDF 格式 將標題和標題儲存為定位文字對象,而不是語義標記元素。提取它們需要分析文字位置、字體屬性以及與圖像或表格結構的接近度。通用文字擷取工具無法區分標題和正文。理解文檔佈局的專門工具可以。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
選擇性翻譯工作流程
首先,從 PDF 中提取標題和標題文字。透過相對於圖像的位置及其字體特徵來識別每個標題。透過表結構中的位置來識別每個表頭。將提取的文字編譯到帶有位置引用的翻譯清單中。
其次,翻譯提取的文字。機器翻譯非常適合標題和標題中使用的簡單語言。對翻譯的人工審核可確保技術術語正確翻譯並保留特定領域的術語。
WukongPDF 提供PDF 到文本 提取功能,可以隔離特定文本元素。提取與翻譯相結合產生翻譯後的標題和標題,同時保留原始正文。
重新插入翻譯的標題和標題
翻譯後,將翻譯後的文字放回 PDF 中的原始位置。翻譯後的標題將替換每個圖下方的原始標題。翻譯後的標題將替換每個表中的原始標題。正文保持不變。
需要注意語言之間翻譯長度的差異。翻譯為較長英文文字的法文標題可能需要稍小的字體大小或更緊的行間距才能適應相同的空間。調整文字格式以適應翻譯而不破壞頁面佈局。
當選擇性翻譯是正確的方法時
當讀者需要理解視覺元素但不需要詳細閱讀正文時,選擇性翻譯是合適的。跨越語言障礙的科學合作、國際提交的技術審查以及多語言出版工作流程都受益於這種有針對性的方法。
與完整文件翻譯相比,選擇性翻譯節省的成本和時間與標題和標題與正文的比例成正比。如果僅翻譯標題,則由 80% 正文和 20% 標題組成的文件可節省 80% 的翻譯成本。
透過在特定文件或出版格式上訓練文件版面分析模型,可以部分自動化選擇性翻譯的標題和標題的識別。在期刊模板上訓練的模型可以在使用該模板的所有文章中高精度識別標題和標題。
翻譯記憶工具可以儲存來自同一領域的多個文件中重複出現的標題短語的翻譯。像圖 X 這樣的短語顯示了數十篇論文中出現的關係以及所有論文中一致翻譯的好處。
選擇性翻譯的品質保證流程應驗證是否翻譯了正確的文本以及未翻譯錯誤的文本(正文)。審閱者會根據原文檢查翻譯字幕的樣本,並檢查這些頁面上的正文是否仍採用原始語言。
標題包含對正文文本的數字引用的文檔,請參閱第 3.2 節以了解詳細信息,翻譯必須準確保留這些交叉引用。錯誤翻譯的交叉引用指向不存在的部分,會造成混亂。
當翻譯後的標題重新插入 PDF 時,新文字應該在視覺上與原始正文文字區分開來,可能是透過細微的色差或頁邊空白中的符號來區分,以便讀者知道他們正在查看經過選擇性翻譯的文檔。
選擇性翻譯方法可以擴展到受益於目標翻譯的其他文件元素:摘要翻譯、國際資料庫的關鍵字翻譯以及多語言出版物的圖形標籤翻譯。
對於以多種語言出版期刊的學術出版商來說,選擇性翻譯標題和標題在昂貴的完整翻譯和根本不翻譯之間提供了一種經濟有效的中間立場。
標題和標題的選擇性翻譯是滿足特定需求的精確工具,但當受眾需要理解完整內容時,不能取代完整文件翻譯。
選擇性翻譯的成本效益使其成為國際合作的一個有吸引力的選擇,因為完整翻譯的成本高昂。
選擇性翻譯為多語言文件協作提供了有針對性的解決方案。
科學論文中的圖形標題遵循自動擷取工具可以識別的可預測模式:它們出現在圖形下方,使用較小的字體,並以圖形開頭,後面跟著數字。
表標題在結構上與資料行不同,因為它們出現在表頂部,通常使用粗體文本,並且可能具有陰影背景,這些特徵是提取工具用於識別的特徵。
提取過程應保留原始格式訊息,以便翻譯後的文字可以以正確的字體屬性和間距放回正確的位置。
對於多語言出版物,可以系統地應用選擇性翻譯:提取標題和標題,翻譯為所有目標語言,並將每個版本作為單獨的 PDF 層插入。
科學字幕的機器翻譯品質已經提高到這樣的程度,即人工譯後編輯比這些結構化文字元素的從頭開始翻譯更快、更便宜。
正文和標題之間的字體大小差異是自動提取工具用來識別標題文字的主要訊號,標題通常比周圍的正文小 2 到 4 磅。
表頭行可以透過其作為每個表的第一行的位置、粗體文字格式以及通常將其與資料行區分開的陰影背景來識別。
提取的標題和標題應編譯成結構化列表,保留頁碼和位置座標,以便在翻譯後準確重新插入。
翻譯記憶工具可以儲存同一領域先前文件的翻譯標題,從而提高一致性並降低重複術語的翻譯成本。
重新插入翻譯後的字幕必須考慮到不同語言之間的文字長度差異,根據需要調整字體大小或行距以使翻譯後的文字適合原始字幕空間。
選擇性翻譯的品質保證包括驗證是否提取了正確的文本元素、翻譯是否準確以及正文沒有被意外修改。
對於以多種語言發表文章的學術期刊,標題和標題的選擇性翻譯可以作為標準步驟納入生產工作流程中。
與完整翻譯相比,選擇性翻譯可以節省成本,使得翻譯預算有限的專案和出版物可以進行國際合作。
科學說明中使用的結構化、公式化語言的機器翻譯品質通常高於敘述性文本,從而減輕了譯後編輯的負擔。
能夠僅翻譯特定的文件元素,同時保留正文的原始語言,從而為國際文件工作流程創造了靈活性。
對於跨越多個語言社群的研究合作,選擇性翻譯使每個合作者能夠以其首選語言存取視覺證據。
這種選擇性方法使翻譯資源有限的團隊和專案可以進行多語言文件協作。
圖形標題和表格標題的有針對性的翻譯為讀者提供了解釋視覺元素所需的基本上下文。
選擇性翻譯標題和標題使國際讀者能夠理解文件中的視覺證據,而無需完整翻譯正文。
這種有針對性的文件翻譯方法降低了成本,同時提高了跨越語言障礙的視覺訊息的可訪問性。
標題提取依賴於與周圍正文文字的字體大小和位置差異。
PDF 中的標題文字通常位於對應圖形的正下方或旁邊,使用的字體大小比正文文字小 2 到 4 磅,從而可以透過分析文字位置和格式特徵的自動擷取工具進行識別。
標題和標題的選擇性翻譯為國際讀者提供了獲取視覺資訊的途徑。
這種能力使國際研究合作變得更加容易和更具成本效益。
選擇性文件翻譯方法可以滿足特定需求,而無需花費完整翻譯的費用。
| 元素 | 識別提示 | 翻譯優先權 | 重新插入註意 |
|---|---|---|---|
| 圖片標題 | 下圖;較小的字體;圖N前綴 | 高的 | 位置相同;可能需要調整字體大小 |
| 表頭 | 第一排;大膽的;陰影背景 | 高的 | 相同的細胞;保持對齊 |
| 軸標籤 | 與圖表軸相鄰 | 中等的 | 可能需要旋轉調整 |
| 圖例條目 | 色樣+文字 | 低的 | 通常不單獨提取 |
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
