当您需要的只是文本时,翻译 PDF 文档非常简单。当您的 PDF 包含内部交叉引用、可点击的目录条目、脚注链接以及在各部分之间跳转的超链接时,就会出现挑战。标准翻译工作流程剥离了这些导航结构,给读者留下了一份失去了将其粘合在一起的结缔组织的平面文档。要保持这些内部链接跨越语言障碍,需要围绕文档的结构(而不仅仅是其文字)来规划翻译过程。翻译良好的文档不仅保留了文本的含义,还保留了读者浏览文本的路径。

了解如何在 PDF 中存储内部链接
PDF 中的内部链接不是可见文本层的一部分。它们作为覆盖在页面内容顶部的可点击注释对象而存在。每个链接都有一个目的地,可以是页码、命名目的地(如“chapter3”或“appendixA”)或页面上的特定坐标。当您通过仅处理文本流的翻译工具运行 PDF 时,这些注释对象要么被丢弃,要么指向原始未翻译的目标。结果是新文本和旧导航之间不匹配,这使得文档比根本没有链接更难使用。
PDF 中的目录由文本条目和指向相应部分的内部链接组成。如果翻译改变了页数(几乎总是会发生这种情况,因为语言相对于源语言会扩展或收缩),页码目标就会出错。例如,德语文本的长度往往比同等英语文本长 20% 到 30%,将内容推送到后面的页面并破坏文档中每个基于页面的链接(Common Sense Advisory,“按语言划分的字数扩展因素”,2024 年)。法语和西班牙语翻译通常会增加 15% 到 25%,而中文和日语翻译通常会减少 10% 到 20%。每个语言对都会引入不同幅度的页面移位。
除了页码之外,链接注释本身也具有可以被破坏的属性。每个注释都有一个定义其可单击区域的矩形边界,并且这些边界在 PDF 坐标空间中指定。当翻译的文本重排并更改换行符时,原始注释矩形不再与相应的文本对齐。出现在源代码行中间的交叉引用现在可能从行尾附近开始,只有一部分可单击区域覆盖可见文本。该链接仍然存在于文件中,但不再与读者在页面上看到的内容匹配。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
链接保存的翻译前准备
在翻译过程中保留内部链接的最可靠方法是采用将内容与表示分离的格式。翻译之前,将 PDF 导出为保留超链接结构的 HTML 或 DOCX 文件。现代 PDF 转换器可以将文本以及嵌入的链接和交叉引用提取为这些可编辑的格式。 WukongPDF 的翻译 PDF 工具可以在维护结构元数据的同时处理文档,但源 PDF 的初始导出质量决定了有多少链接数据能够进入翻译阶段。带有标记内容的干净、结构良好的 PDF 导出的内容比扫描或生成质量不佳的文档要完整得多。
在开始翻译之前创建所有内部链接的清单。请注意哪些链接指向指定目的地而不是页码。命名目的地更容易保留,因为它们是符号引用,只要目的地名称不更改,它们就保持有效。基于页码的链接必须在翻译后重新计算。如果您的 PDF 包含两者的混合,请优先保留指定的目的地,并计划在翻译文本布局后从头开始重建基于页面的链接。该清单还可作为最终验证期间的清单。
另请检查您的 PDF 是否包含在正文中拼出页码的交叉引用文本,例如“有关详细信息,请参阅第 42 页”。当翻译改变页数时,这些内联引用就会变得不正确。在准备过程中标记它们,以便您可以在最终布局完成后更新数字。更好的长期做法是用无论分页如何仍然有效的章节标题替换页码交叉引用。这使得将来的翻译和格式转换更加容易,因为引用保持正确而无需手动调整。
保持链接完整的翻译方法
在保留内部链接的同时翻译 PDF 存在三种主要方法。第一种方法使用明确支持链接保存的专用 PDF 翻译平台。这些平台在处理文本的同时保持文档的结构完整性,使其适合交叉引用很重要的报告、手册和文档集。优点是速度:您上传一个文件并收到带有完整链接的翻译版本。代价是您对如何处理各个链接的控制较少。
第二种方法是中间格式方法。将 PDF 导出为 HTML 或 DOCX,使用支持超链接的工具翻译该格式的内容,然后重新转换回 PDF。这使您可以最大程度地控制最终输出,因为您可以在生成翻译后的 PDF 之前检查和修复每个链接。对于法律合同、技术规范和学术论文来说,额外的步骤是合理的,因为交叉引用的破坏可能会导致真正的混乱。中间格式还允许您使用翻译记忆库工具来提高大型文档集的一致性。
第三种方法是覆盖方法,最适合结构简单的短文档。您可以将原始 PDF 作为基础,仅提取和翻译文本,然后将翻译后的文本放入位于原始 PDF 之上的文本框中。原始链接仍然有效,因为底层 PDF 未更改。此方法很难处理翻译文本长度与源文本显着不同的文档,因为重叠的文本框要么溢出,要么留下空白空间。它最适合文本最少的证书、表格和单页文档。
翻译后重建链接
即使做好了最好的准备,在生成翻译后的 PDF 后,某些链接仍需要手动处理。首先测试目录中的每个链接。单击每个条目并验证其位于翻译文档中的正确部分。然后处理正文中的交叉引用。使用 PDF 阅读器中的链接导航面板进行系统检查可以使此操作变得易于管理。该面板按文档顺序列出了每个内部链接,使您可以按顺序逐步浏览它们,并标记电子表格中的差异。
对于技术手册或教科书等具有大量内部链接的文档,具有批量链接编辑功能的PDF编辑工具可以批量更新链接。如果您的翻译文档已将所有内容移动了可预测的页数,则您可以在一次操作中将每个基于页面的链接偏移该数量。命名目标不需要这种处理,这是在创建原始文档时更喜欢它们而不是硬编码页码的另一个原因。
脚注和尾注链接值得特别注意,因为它们是双向的。文本中的上标数字链接到注释,注释通常链接回参考点。两个方向都必须起作用才能使阅读体验完整。在翻译的文档中,注释文本通常独立于主体而扩展或收缩,因此返回链接可能指向与预期不同的页面。作为最终质量检查的一部分,验证每个脚注往返。单个损坏的脚注链接可能看起来微不足道,但在法律或学术文件中,无法访问的引用会破坏文件的可信度。
测试和验证翻译后的 PDF
在分发带有内部链接的已翻译 PDF 之前,请运行结构化验证。至少在两个不同的 PDF 阅读器(例如 Adobe Acrobat 和基于浏览器的查看器)中打开文档,因为链接呈现行为可能因应用程序而异。由于注释坐标的解释方式不同,在一个阅读器中有效的链接可能在另一个阅读器中未对齐。 PDF 规范在坐标精度方面允许一定的灵活性,并且不同的阅读器以不同的方式处理舍入。
请特别注意翻译文本中跨越多行的链接。具有不同词序的语言可能会导致源代码中一行上出现的交叉引用在翻译中跨越两行。可点击区域可能仅覆盖文本的第一部分,而使部分链接文本不可点击。调整链接注释边界以包含最终布局中的全文范围。对于专业品质的输出来说,这是一个繁琐但必要的步骤。
快速验证清单涵盖了基本检查:确认目录链接全部正确解析,验证正文中的每个交叉引用都导航到正确的部分,检查脚注链接是否双向,测试任何索引条目,并确认外部 URL 保持功能并指向外部资源的正确语言版本(如果适用)。通过所有五项检查的文档已准备好供依赖这些PDF导航路径的读者使用。跳过此验证可能会导致分发的文档让读者感到沮丧并破坏翻译材料的专业外观。
额外的努力立即得到回报。
五次检查。完全有信心。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
