当您通过翻译工具运行 PDF 时,生成的文档通常会出现格式问题,而不仅仅是简单的布局转换。数学符号、货币符号和重音字母等特殊字符可能会被替换为空框、问号或完全错误的字符。嵌入字体可能会停止渲染,导致整个文本部分消失或以默认系统字体显示。了解翻译过程中符号和PDF 字体 发生的情况有助于您预测这些问题,并为符号准确性至关重要的文档选择正确的翻译方法。
要点
PDF 翻译工具的工作原理是从文档中提取文本层,通过机器翻译引擎运行它,然后将翻译后的文本放回到原始布局中。在此管道的每个阶段,符号和特殊字符都面临风险:提取可能会误解符号编码,翻译引擎可能会删除或损坏非字母字符,当目标语言使用原始文档嵌入字体中不存在的字符时,重新插入可能会遇到字体替换问题。

PDF 翻译如何处理文本提取阶段
在进行任何翻译之前,该工具必须从 PDF 中提取可读文本。对于带有嵌入文本的本机数字 PDF,此提取会从文档的内容流中读取字符代码,并使用嵌入字体的编码表将它们映射到 Unicode 值。当编码表不完整、损坏或使用不遵循 Unicode 约定的自定义映射时,符号和特殊字符在此阶段就会出现问题。由旧软件创建的 PDF 可能使用非标准编码,其中屏幕上看起来像欧元符号的内容在内部存储为字符代码,该字符代码映射到标准 Unicode 表中的任何内容。
当编码映射失败时,提取过程会生成替换字符,通常是 Unicode 替换字符或问号。这种失败悄无声息地发生。提取的文本乍一看很正常,因为符号周围的字母和数字都很好,但对文档含义至关重要的货币符号、数学运算符或重音字母在翻译开始之前就已经丢失了。无法解析财务 PDF 中欧元符号的提取阶段将“总计:2,500 欧元”变为“总计:2,500 欧元”。进入“总计:2,500”或“总计:2,500?”并且翻译后的输出将继承该错误。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
翻译引擎对符号和特殊字符的作用
机器翻译引擎针对自然语言文本进行了优化。当他们遇到包含单词和符号混合的句子(例如技术规范或财务报表)时,符号处理取决于特定的引擎和语言对。大多数现代神经机器翻译系统都会传递它们识别为非语言的符号,例如货币符号、百分号和常见的数学运算符。但是不太常见的符号,例如法律文档中使用的部分符号、科学文本中的学位符号或来自特定行业的专用符号,可能会被翻译引擎的文本规范化步骤删除或替换。
规范化步骤在实际翻译之前运行,将输入文本转换为标准化形式。它可能会小写文本,删除它认为不重要的标点符号,并将 Unicode 字符规范为其规范形式。对于大多数文档来说这很有帮助。它阻止翻译引擎处理“Hello”和“你好”作为不同的词。但对于特定符号具有含义的文档,规范化可能会造成损害。使用下标数字的化学式、一组带有度数和分钟符号的 GPS 坐标或带有部分标记的法律引文都可能通过标准化而改变,从而改变其含义或使其不可读。
字体替换:为什么翻译文本通常看起来不同
字体替换的视觉影响从微妙到严重不等。当拉丁字体替换另一种拉丁字体时,字符宽度会略有变化,但文本仍然可读。当拉丁字体替代非拉丁书写系统时,结果通常是一行空矩形或问号,因为拉丁字体不包含任何必需的字符。这就是为什么翻译成阿拉伯语、中文、日语、韩语或西里尔语需要在重新插入阶段特别注意字体可用性。
翻译后,新文本必须放回 PDF 中。原始文档的嵌入字体仅包含原始文本中存在的字符。当翻译后的文本包含原始文本中没有的字符时,例如英语文档的法语或西班牙语翻译中的重音字符,原始嵌入字体无法呈现它们。 PDF 查看器会使用替代字体,这种字体几乎肯定会与周围的文本看起来有所不同。结果是文档中大多数文本以原始字体显示,但偶尔翻译的单词或重音字符以明显不同的字体显示,使页面看起来不完整、不专业。
当翻译成使用完全不同的书写系统的语言时,这个问题最为严重。将英语 PDF 翻译成俄语、阿拉伯语、中文或日语需要拉丁文字字体不包含的字符。整个翻译文本必须使用替换字体呈现,并且文档的视觉特征完全改变。适用于原始文本的布局几何图形及其特定的字符宽度和行高将不适合翻译后的文本。换行符移动,段落增大或缩小,精心对齐的元素变得不对齐。
根据符号敏感性选择翻译方法
实用的预翻译检查是打开 PDF 并将包含特殊字符的段落复制到纯文本编辑器中。如果特殊字符在复制粘贴操作中完好无损,则 PDF 的文本编码是标准的,并且翻译的提取阶段不太可能损坏它们。如果粘贴时字符出现乱码或消失,则 PDF 使用非标准编码,会导致翻译过程中出现问题。从源头修复编码(例如通过启用字体嵌入重新创建 PDF)比翻译后尝试恢复损坏的字符更有效。
对于符号至关重要的文档,例如财务报告、科学论文、法律文件和技术手册,最安全的方法是使用
对于要翻译成不同书写系统的文档,请接受输出看起来与原始版本不同的事实,并相应地进行计划。不要期望像素完美的布局匹配,而是专注于用目标语言生成干净、可读的文档。翻译后,预算手动或半自动布局调整的时间。调整列宽,重新对齐表格,并检查所有特殊字符是否已正确呈现。在翻译后格式化上花费的额外时间是跨书写系统工作的成本,而那些承诺无缝跨脚本翻译而不需要任何布局工作的工具过于简单化了一个真正困难的问题。 WukongPDF 的翻译工具在整个转换过程中保留嵌入的字体数据,最大限度地减少在文本重新插入期间替换字体时发生的符号损坏。
常见问题
我应该直接翻译 PDF 还是先将其转换为可编辑格式,然后翻译,然后重新导出为 PDF?转换为 Word、翻译 Word 文档以及导出回 PDF 的两步方法通常会产生更好的符号保真度,因为 Word 比原始 PDF 文本提取更一致地处理 Unicode。代价是 Word 的往返过程会带来必须手动更正的布局更改。对于较短的文档,两步方法值得在布局上付出努力。对于很长的文档,使用保留编码的工具直接翻译 PDF 更为实用。
我可以通过提取文本、在外部翻译并手动将其放回 PDF 布局来翻译 PDF吗?是的,这个手动管道可以让您在每个阶段完全控制符号处理和字体选择,但它非常耗时且仅适用于短文档。对于50页的技术手册,手动重新插入是不可行的。自动翻译和手动翻译之间的决定最终取决于您需要对输出进行多少控制以及您可以投入多少时间。
翻译前将 PDF 转换为 Word 可以防止符号丢失吗?
首先转换为 Word 使翻译工具可以通过 Microsoft Word 的 Unicode 处理来访问文本,这通常比原始 PDF 文本提取更可靠。此额外步骤通常可以解决与编码相关的符号丢失问题,特别是对于已使用标准 Unicode 编码的现代软件创建的文档。代价是Word 转换本身可能会引入布局更改。对于符号较多的文档,字符准确性的提高通常证明布局工作是合理的。
为什么 PDF 翻译过程中数学方程经常出现错误?
PDF 中的数学方程通常存储为变量和数字的文本字符的混合,加上专用数学字体的特殊数学符号,加上矢量绘制的分数条、根号和其他符号元素。当翻译引擎处理文本层时,它将方程视为句子,并可能重新排列或规范化符号序列。矢量绘制的元素根本不是文本,并且在不被触及的情况下通过翻译,但它们相对于翻译文本的对齐几乎总是被破坏。对于数学内容较多的文档,最可靠的方法是从翻译中排除方程式,只翻译周围的散文。
是否有一种 PDF 格式可以比其他格式更好地处理PDF 格式 的翻译?
具有完全嵌入的 Unicode 字体的 PDF/A 比具有子集字体和自定义编码的标准 PDF 的翻译更加可靠。 PDF/A 中的完整嵌入和 Unicode 要求消除了翻译过程中符号损坏的两个最常见的来源:丢失字体字形和非标准字符映射。如果您知道文档将被翻译,那么在运行翻译之前将其保存为 PDF/A 是值得采取的步骤。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
