Tips & Tricks

如何仅翻译带标签的 PDF 中的替代文本和辅助功能标签而不影响可见内容

带标签的 PDF 包含隐藏的辅助功能元数据,屏幕阅读器使用这些元数据向视障用户描述图像、表格和文档结构。页面上的可见文本可能是英文,而替代文本描述、表格摘要和结构标签需要以多种语言提供给国际受众。仅翻译此隐藏层而不触及可见文档内容需要直接使用 PDF 的标签结构,这是大多数通用翻译工具所缺乏的功能。

PDF/UA 标准(通用辅助功能,ISO 14289)要求带标签的 PDF 为所有非文本内容元素提供替代文本。在多语言组织中,用法语编写的合同可能需要提供英语、德语和荷兰语的替代文本,以便每个国家/地区的可访问性审核人员可以验证合规性。翻译整个文档是不必要且昂贵的。只需要注意几百字的替代文本和结构标签。此任务属于一个狭窄的类别,介于完整文档翻译 PDF 和手动辅助功能编辑之间,并且很少有组织为其建立标准工作流程。

未翻译的可访问性元数据的后果比看起来更严重。屏幕阅读器用户在访问仅包含英文替代文本的法语合同时,会听到中断法语内容的英语描述,从而造成令人困惑和迷失方向的体验。对于受无障碍法规约束的政府机构和公共资助组织来说,这代表了合规性差距,可能会产生法律后果。对于多语言组织来说,翻译可访问性层并不是一件好事。这是履行组织所服务的每种语言的无障碍义务的一部分。

How to Translate Only the Alt Text and Accessibility Labels in a Tagged PDF Without Affecting Visible Content

了解 PDF 标签结构和替代文本所在的位置

带标签的 PDF 将其内容组织成逻辑结构树,其中包含文档、部分、部分、P、表格、图形和公式等元素。每个元素都可以有属性,翻译的关键是 /Alt 条目,它存储替代文本描述。表示图表的Figure元素可能具有包含“显示从 2022 年第一季度到 2024 年第四季度的季度收入增长的条形图,同比增长 12%”的 /Alt 条目。该文本永远不会显示在可见页面上。它仅存在于屏幕阅读器消费的标签结构中。

/Alt 条目是一个文本字符串,在文档的标记内容中存储为 PDF 字符串对象或 XML 转义字符串。在不干扰周围标签结构的情况下提取、翻译和写回它需要一个可以在对象级别解析带标签的 PDF 内容的工具。大多数在辅助功能面板中显示标签树的 PDF 编辑器都可以编辑单个 /Alt 条目,但手动翻译数十或数百个条目速度很慢且容易出错,每个条目都需要单独的打开-编辑-保存周期。

除了 /Alt 条目之外,还有其他可翻译的辅助功能元素。 Table 元素上的 /Summary 属性提供表结构和用途的文本概述。 Span 元素上的 /ActualText 条目可以覆盖屏幕阅读器的可视文本,当可视文本是应扩展的缩写时非常有用。 /TU(工具提示)条目中存储的表单字段描述也需要翻译。完整的无障碍翻译涵盖了所有这些元素。对于包含 30 个数字、15 个表格和 40 个表单字段的 50 页合同,可翻译的辅助文本总数可能为 2,000 到 3,000 个单词,足以让翻译人员花费一天的时间,但远远少于翻译完整的文档文本。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

提取辅助文本进行翻译

第一步是清点需要翻译的内容。使用 PDF 辅助功能检查器或标签查看器导出文档中所有 /Alt、/Summary、/ActualText 和 /TU 条目的列表。大多数辅助功能验证工具(包括 Adobe Acrobat Pro 中的内置辅助功能检查器)都可以生成一份报告,显示每个标签元素的这些属性及其当前文本值。将此列表导出为结构化格式,例如 CSV,其中包含标签类型、元素标识符、原始文本和空白翻译列。

将原始文本字符串发送给翻译人员或机器翻译服务。结构化格式确保每个翻译的字符串与其源元素保持关联,这对于将翻译写回正确的位置至关重要。为了符合PDF可访问性规定,翻译应符合与原始替代文本相同的质量标准。好的替代文本描述应该简洁,通常少于 150 个字符,并且描述元素的内容和功能而不是其外观。翻译应保留这种简洁性和功能重点。

WukongPDF 支持在单个元素级别编辑PDF 标签 和辅助功能属性,从而可以在不影响可见页面内容的情况下更新替代文本翻译。结构化标签编辑器显示包含所有可翻译属性的完整元素层次结构,批量更新功能可让您从 CSV 文件导入翻译,并在单个操作中将它们应用到正确的元素。

将翻译写回标签结构

收到翻译后,回写步骤需要一个可以导航 PDF 标签树并更新各个属性值的工具。在显示完整结构树的标签编辑器中打开 PDF。对于每个已翻译的元素,在树中找到该元素,选择其 /Alt 或其他属性,然后粘贴已翻译的文本。更新所有条目后保存文件。使用屏幕阅读器或辅助功能验证工具验证结果。在屏幕阅读器处于活动状态的情况下浏览文档,并确认每个翻译后的描述均以预期语言阅读。

对于将以多种语言分发的文档,请考虑 PDF 是否应在单个文件中包含替代文本的所有语言版本,或者是否应创建单独的特定于语言的 PDF。 PDF 规范支持元素级别的语言标记,因此理论上,单个文件可以包含图 1 上的英语替代文本和图 2 上的法语替代文本。但是,屏幕阅读器对每个元素语言切换的支持在不同的屏幕阅读器应用程序中不一致。如果需要符合辅助功能要求,则单独的每种语言 PDF 是更安全、更可靠的可测试选择。

自动化大型文档集的工作流程

对于需要跨数百或数千个 PDF 本地化可访问性元数据的组织来说,手动写回方法不可扩展。在这些情况下,提取、翻译和写回应该编写脚本。使用支持标签结构访问的 PDF 库(例如适用于 Java 的 Apache PDFBox 或适用于 Python 的 pikepdf)以编程方式提取所有可翻译属性,将它们发送到翻译 API,然后写回结果。

该脚本应记录其修改的每个属性并生成前后比较报告,以便人工审阅者可以抽查翻译。自动化工作流程降低了每个文档的成本,但引入了系统错误的风险,例如出现在数十个替代文本描述中且仅在分发后才被发现的误译术语。对随机样本进行批量审核,再加上对翻译 API 标记为低置信度的任何翻译进行有针对性的审核,可以平衡效率与质量,并提供可靠的质量保证记录。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →