翻译 PDF 通常会用翻译版本替换原始文本。源语言文本从输出中消失。对于某些用例,将原始文本保留为翻译旁边的隐藏层是很有价值的。双语读者可以对照原文验证译文。未来的译者无需找到原始文档就可以看到源文本是什么。搜索引擎可以对两种语言进行索引,从而使文档可以用任何一种语言找到。问题是翻译 PDF工具是否可以在翻译过程中保留原始文本图层,以及在什么条件下可以这样做。
要点
大多数 PDF 翻译工具都会用翻译版本替换原始文本。将原始文本保留为隐藏层需要支持双语或并行输出的工具,其中原始文本作为翻译文本下方的不可见层存储。此功能在某些专业翻译工具中可用,但在消费级 PDF 翻译器中并非标准功能。另一种方法是翻译 PDF 的副本,并将原件保留为单独的参考文档。

PDF 文本图层在翻译过程中如何工作
文本提取步骤是最复杂的地方。翻译工具不仅必须提取可见文本,还必须记录其确切位置、字体属性和每个字符的编码。将翻译后的文本放回原位时,该工具需要原始文本的位置数据才能正确对齐新文本。将原始文本保留为隐藏层的工具必须存储两组完整的文本数据并管理它们的分层。这大约使文本处理工作量增加了一倍,这就是为什么许多工具不提供此功能的原因。技术能力存在于PDF规范中。限制在于工具实现,而不是格式。
PDF 将文本存储为内容流中的字符代码。当翻译工具处理 PDF 时,它会提取这些字符代码,将它们映射为可读文本,将文本发送到翻译引擎,然后将翻译后的文本放回到文档中。标准工作流程用翻译后的字符代码替换原始字符代码。原始文本已从文件中消失。无法撤消。为了保留原始文本,翻译工具必须创建包含源语言的第二个文本图层,将其标记为隐藏或非打印,并将翻译后的文本放置在可见图层中。这在技术上是可行的,但需要翻译工具在整个过程中管理双文本层。
PDF 规范支持可选内容组,通常称为PDF 图层,可以独立显示或隐藏。翻译工具可以将原始文本放置在一个图层中,将翻译后的文本放置在另一图层中,默认情况下将原始图层设置为隐藏。想要查看原始文本的读者可以在 PDF 查看器中切换图层可见性。这种方法将两种语言保留在一个文件中,并使读者能够控制哪种语言可见。技术能力以 PDF 格式存在。问题是给定的翻译工具是否实现了它。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
支持原文保存的翻译工具
本地化机构使用的专业翻译平台通常支持双语 PDF 输出。这些工具专为审阅者需要将翻译与源文本进行比较的工作流程而设计。输出的 PDF 包含两个语言层,审阅者可以在它们之间切换或在专门的审阅界面中并排查看它们。这些工具通常是基于订阅的,专为大批量商业翻译工作而不是偶尔的文档翻译而设计。
对于消费者和小型企业用户来说,选择更加有限。一些在线 PDF 翻译服务提供并排输出格式,其中原始文本和翻译文本以交替段落或两列布局出现。这可以明显地保留两种语言,而不是将一种语言隐藏为一层。该文档较长,但两种语言都可以访问,无需层切换。 WukongPDF 的翻译工具支持并排输出模式,将原始段落和翻译段落放在一起,将两种语言保留在单个可读文档中。
替代方案:保留原始 PDF 作为参考
对于需要在多个修订周期内维护文档双语版本的团队来说,文档管理方法比单文件方法效果更好。将原始 PDF 和翻译后的 PDF 存储在版本控制的存储库中,并使用链接它们的命名约定。当原始文档更新时,命名约定会明确需要更新哪个翻译以匹配。对于随时间变化的文档,此工作流程比单个双语 PDF 更可靠。
当翻译工具不支持双语言输出时,最简单的工作流程是翻译 PDF 副本并将原件保留为单独的参考文件。文件的命名保持一致,以便它们之间的关系清晰。像英文翻译版的report-2025-en.pdf 和法文原版的report-2025-fr-original.pdf 这样的命名约定使得任何浏览该文件夹的人都可以清楚地看到这种关系。将两个文件存储在同一位置,并在翻译文档的元数据或封面页注释中引用原始文件名。
出于存档目的,原始加翻译对通常是最可靠的方法。每个文件都是任何读者都可以打开的标准 PDF。不依赖于图层可见性设置或专门的查看工具。这对文件以几十年后仍可访问的格式记录了源文本和翻译。这种方法可能不如单个双语 PDF 那么优雅,但从长远来看它更可靠。
验证原始文本层是否完好
对双语 PDF 运行文本提取测试。从文档中提取所有文本,并从原始语言中搜索独特的单词或短语。如果它出现在提取的文本中,则表明原始图层存在并且编码正确。如果提取的文本仅包含翻译的语言,则原始图层丢失或未编码为可提取文本。该测试捕获了层面板的目视检查可能遗漏的编码故障。
如果您的翻译工具声称将原始文本保留为隐藏层,请在依赖它之前验证这一点。在支持图层可见性切换的查看器(例如 Adobe Acrobat Pro)中打开翻译后的 PDF。在导航窗格中查找图层面板。如果该工具正确创建了原始文本图层,它将显示为带有可见性切换的命名图层。打开和关闭图层以确认原始文本按预期出现和消失。运行文本搜索,查找您知道出现在原文中但在翻译中发生更改的单词。如果搜索找到原始单词,则该图层存在且可搜索。
还要根据标准翻译版本的大小检查双语 PDF 的文件大小。具有双文本层的 PDF 将比单语言版本大大约 10% 到 30%,具体取决于文本量。无论该工具的文档声明如何,与标准翻译大小相同的双语 PDF 可能不包含原始文本层。文件大小差异是一种快速可靠的检查。
常见问题
隐藏原文图层会不会大幅增加文件大小?该增加与文本量成正比,对于文本较多的文档,通常为 15% 到 30%。对于图像较多的文档(其中文本仅占总文件大小的一小部分),增加可以忽略不计。双层方法添加了文本数据和层管理元数据的第二个副本,但它不复制图像、字体或页面结构。对于档案使用,适度增加文件大小是双语可访问性的合理权衡。
保留原始文本图层是否会影响PDF的可搜索性?
是的,积极的。由于存在两种语言层,因此可以用两种语言搜索 PDF。用原始语言搜索术语的用户将在隐藏层中找到它,而用翻译语言搜索的用户将在可见层中找到它。这种双重可搜索性是保留原始文本的主要好处之一。
我可以从双语 PDF 中提取原始文本来恢复源文档吗?
如果原始文本层存在并且编码正确,则提取它可以高保真度地恢复源文本。提取质量取决于翻译工具如何存储原始文本。将其存储为完整、未损坏的文本流的工具会生成可提取的输出。将其存储为碎片文本对象的工具可能会生成可提取的输出,其中包含需要手动清理的破碎句子。
双语 PDF 比保留两个单独的文件大吗?
通常不会。具有两种语言层的双语 PDF 通常小于两个单独的单语言 PDF 的总大小,因为图像、字体和页面结构在各层之间共享。文本层仅添加少量数据。对于存储受限的环境,双语 PDF 比维护两个单独的文件更有效。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
