帶有標籤的 PDF 包含隱藏的輔助功能元數據,螢幕閱讀器使用這些元數據向視障用戶描述圖像、表格和文件結構。頁面上的可見文字可能是英文,而替代文字描述、表格摘要和結構標籤需要以多種語言提供給國際受眾。僅翻譯此隱藏層而不觸及可見文件內容需要直接使用 PDF 的標籤結構,這是大多數通用翻譯工具所缺乏的功能。
PDF/UA 標準(通用輔助功能,ISO 14289)要求標籤的 PDF 為所有非文字內容元素提供替代文字。在多語言組織中,以法語編寫的合約可能需要提供英語、德語和荷蘭語的替代文本,以便每個國家/地區的可訪問性審核人員可以驗證合規性。翻譯整個文件是不必要且昂貴的。只需要注意幾百字的替代文字和結構標籤。此任務屬於一個狹窄的類別,介於完整文件翻譯 PDF 和手動輔助功能編輯之間,並且很少有組織為其建立標準工作流程。
未翻譯的可訪問性元資料的後果比看起來更嚴重。螢幕閱讀器使用者在存取僅包含英文替代文字的法語合約時,會聽到中斷法語內容的英語描述,從而造成令人困惑和迷失方向的體驗。對於受無障礙法規約束的政府機構和公共資助組織來說,這代表了合規性差距,可能會產生法律後果。對於多語言組織來說,翻譯可訪問性層並不是一件好事。這是履行組織所服務的每種語言的無障礙義務的一部分。

了解 PDF 標籤結構和替代文本的位置
帶有標籤的 PDF 將其內容組織成邏輯結構樹,其中包含文件、部分、部分、P、表格、圖形和公式等元素。每個元素都可以有屬性,翻譯的關鍵是 /Alt 條目,它儲存替代文字描述。表示圖表的Figure元素可能具有包含「顯示從 2022 年第一季到 2024 年第四季的季度營收成長的長條圖,年成長 12%」的 /Alt 條目。該文字永遠不會顯示在可見頁面上。它僅存在於螢幕閱讀器消費的標籤結構中。
/Alt 條目是一個文字字串,在文件的標記內容中儲存為 PDF 字串物件或 XML 轉義字串。在不干擾周圍標籤結構的情況下提取、翻譯和寫回它需要一個可以在物件層級解析帶標籤的 PDF 內容的工具。大多數在輔助使用面板中顯示標籤樹的 PDF 編輯器都可以編輯單個 /Alt 條目,但手動翻譯數十或數百個條目速度很慢且容易出錯,每個條目都需要單獨的開啟-編輯-儲存週期。
除了 /Alt 條目之外,還有其他可翻譯的輔助功能元素。 Table 元素上的 /Summary 屬性提供表格結構和用途的文字概述。 Span 元素上的 /ActualText 條目可以覆蓋螢幕閱讀器的可視文本,當可視文本是應擴展的縮寫時非常有用。 /TU(工具提示)條目中儲存的表單欄位描述也需要翻譯。完整的無障礙翻譯涵蓋了所有這些元素。對於包含 30 個數字、15 個表格和 40 個表單字段的 50 頁合同,可翻譯的輔助文本總數可能為 2,000 到 3,000 個單詞,足以讓翻譯人員花費一天的時間,但遠遠少於翻譯完整的文檔文本。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
提取輔助文本進行翻譯
第一步是清點需要翻譯的內容。使用 PDF 輔助功能檢查器或標籤檢視器匯出文件中所有 /Alt、/Summary、/ActualText 和 /TU 條目的清單。大多數輔助功能驗證工具(包括 Adobe Acrobat Pro 中的內建輔助功能檢查器)都可以產生一份報告,顯示每個標籤元素的這些屬性及其目前文字值。將此清單匯出為結構化格式,例如 CSV,其中包含標籤類型、元素識別碼、原始文字和空白翻譯列。
將原始文字字串傳送給翻譯人員或機器翻譯服務。結構化格式確保每個翻譯的字串與其來源元素保持關聯,這對於將翻譯寫回正確的位置至關重要。為了符合PDF可訪問性規定,翻譯應符合與原始替代文本相同的品質標準。好的替代文字描述應該簡潔,通常少於 150 個字符,並且描述元素的內容和功能而不是其外觀。翻譯應保留這種簡潔性和功能重點。
WukongPDF 支援在單一元素層級編輯PDF 標籤 和輔助功能屬性,從而可以在不影響可見頁面內容的情況下更新替代文字翻譯。結構化標籤編輯器顯示包含所有可翻譯屬性的完整元素層次結構,批次更新功能可讓您從 CSV 檔案匯入翻譯,並在單一操作中將它們套用到正確的元素。
將翻譯寫回標籤結構
收到翻譯後,回寫步驟需要一個可以導覽 PDF 標籤樹並更新各個屬性值的工具。在顯示完整結構樹的標籤編輯器中開啟 PDF。對於每個已翻譯的元素,在樹中找到該元素,選擇其 /Alt 或其他屬性,然後貼上已翻譯的文字。更新所有條目後儲存檔案。使用螢幕閱讀器或輔助功能驗證工具驗證結果。在螢幕閱讀器處於活動狀態的情況下瀏覽文檔,並確認每個翻譯後的描述均以預期語言閱讀。
對於將以多種語言分發的文檔,請考慮 PDF 是否應在單一文件中包含替代文字的所有語言版本,或者是否應建立單獨的特定於語言的 PDF。 PDF 規範支援元素層級的語言標記,因此理論上,單一文件可以包含圖 1 上的英語替代文字和圖 2 上的法語替代文字。但是,螢幕閱讀器對每個元素語言切換的支援在不同的螢幕閱讀器應用程式中不一致。如果需要符合輔助功能要求,則單獨的每種語言 PDF 是更安全、更可靠的可測試選擇。
自動化大型文件集的工作流程
對於需要跨數百或數千個 PDF 本地化可存取性元資料的組織來說,手動寫回方法不可擴展。在這些情況下,提取、翻譯和寫回應該編寫腳本。使用支援標籤結構存取的 PDF 程式庫(例如適用於 Java 的 Apache PDFBox 或適用於 Python 的 pikepdf)以程式設計方式提取所有可翻譯屬性,將它們傳送到翻譯 API,然後寫回結果。
該腳本應記錄其修改的每個屬性並產生前後比較報告,以便人工審閱者可以抽查翻譯。自動化工作流程降低了每個文件的成本,但引入了系統錯誤的風險,例如出現在數十個替代文字描述中且僅在分發後才被發現的誤譯術語。對隨機樣本進行批量審核,再加上對翻譯 API 標記為低置信度的任何翻譯進行有針對性的審核,可以平衡效率與質量,並提供可靠的品質保證記錄。
嘗試翻譯 PDF
無需安裝。直接在您的瀏覽器中工作。
