将相同的 PDF 上传到两个不同的在线翻译服务,结果会有所不同。同一个法语段落通过一种工具以一种方式呈现,通过另一种工具以另一种方式呈现。差异范围从单词选择和句子结构到工具处理格式、嵌入文本和包含单词的图像的方式。这些差异并不是传统意义上的错误。每个工具都根据其设计选择、翻译引擎和文档处理流程生成最佳翻译。了解存在这些差异的原因有助于您为给定文档选择正确的工具,并以适当的期望解释输出。

不同的翻译引擎产生不同的语言输出
在线 PDF 翻译工具构建在通用机器翻译引擎之上,最常见的是在大型多语言语料库上训练的神经机器翻译模型的变体。两种主要方法是 Google 的神经机器翻译系统(由 Google Translate 及其授权工具使用)以及 DeepL 的卷积神经网络方法。 Microsoft Translator 和 Amazon Translate 代表了额外的独立实现。每个系统都根据不同的训练数据进行训练,针对不同的质量指标进行优化,并针对流畅性与字面准确性进行不同的优先级调整。相同的输入语句将在这些系统中产生不同的输出语句。
差异在三个方面最为明显。首先,处理歧义:像“avocat”这样的法语单词根据上下文可以表示律师或鳄梨。不同的翻译引擎通过不同的统计模型来解决此类歧义,并且它们并不总是得出相同的结论。其次,语域和形式:一些引擎默认使用区分正式和非正式语言的正式地址,而其他引擎则默认使用中性。使用“Sie”与“du”的德语翻译改变了整个文档的社会基调。第三,惯用表达:在目标语言中具有直接等效项的短语可以由一个引擎进行字面翻译,并由另一个引擎进行惯用翻译,产生既正确但风格不同的文本。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
文档结构处理造成非语言差异
除了翻译单个单词和句子之外,在线 PDF 工具的不同之处在于处理文本周围的文档结构的方式。一些工具将所有文本提取到线性流中,翻译它,然后将其放回原始位置,丢失段落分隔符、标题层次结构以及正文和标题之间的关系。其他人尝试通过独立翻译每个布局块内的文本来保留文档结构。第二种方法产生更忠实的布局,但可能会翻译重复的文本,例如出现在每个页面上的运行标题,每次出现时都会有所不同,因为该工具将每个实例视为独立的翻译单元,而不了解先前的实例。
WukongPDF的翻译PDF工具处理文档的文本层,同时保留原始布局和格式。翻译引擎将每个文本元素呈现在适当的位置,从而保持文档的视觉结构。在比较不同工具的翻译时,输出的结构保真度通常与语言质量一样重要。读起来很漂亮但丢失了所有段落分隔符和标题样式的翻译需要重新格式化,这可能比改进保留原始布局的粗糙翻译需要更长的时间。
处理图像和扫描内容中的嵌入文本
翻译工具之间差异的一个主要来源是它们如何处理未存储为 PDF 中可选字符的文本。 PDF 可能包含带有嵌入文本的图像,例如带有标签的图表、标志照片或文本仅以像素形式存在的扫描页面。一些翻译工具完全忽略基于图像的文本,仅生成文本层的翻译,而图像不翻译。其他人首先尝试对图像进行 OCR,然后翻译识别的文本,但 OCR 步骤会引入自身的错误,并与翻译混合在一起。在翻译开始之前,由两种不同工具处理的同一图像可能会产生不同的 OCR 读数。
这对文档质量的影响是重大的。仅处理文本层的翻译后的 PDF 将包含翻译后的正文文本和未翻译的图像标题、图表标签和嵌入文本的混合。不会说源语言的读者会将这些未翻译内容的孤岛视为死胡同。在比较包含图像中嵌入文本的文档的翻译工具时,检查每个工具如何处理嵌入内容是一个关键的评估标准,它与文本翻译的语言质量一样重要。
特定于格式的保留:字体、颜色和页面布局
翻译会改变文本长度。德语和芬兰语翻译往往比英语源长 20% 到 30%。中文和日文翻译往往要短 10% 到 20%。这种长度变化会影响文档布局的各个方面。完全适合英语表格单元格的文本在德语中可能会溢出。平衡在一行上的标题可能会换行为两行。整齐对齐的项目符号点可能会变得参差不齐。每个翻译工具以不同的方式处理这些布局结果。
有些工具会向下调整字体大小,以使翻译后的文本适合原始空间。这保留了页面结构,但可能会生成各部分之间字体大小明显不同的页面,从而产生不一致的阅读体验。其他工具保留原始字体大小并允许文本重排,这可能会更改分页符并改变文本与相邻图像之间的关系。最佳方法取决于文档类型。一份法律合同,其中每个单词都必须保留在与原始字体大小调整相同的页面上。视觉一致性很重要的营销手册从保留字体大小和接受重排中获益更多。
如何为您的文档选择和评估翻译工具
考虑到工具之间的差异,最可靠的选择方法是使用两个或三个候选工具测试文档中的代表性页面,并并排比较结果。查看语言质量:翻译以目标语言读起来是否自然,或者听起来像机器翻译吗?查看完整性:是否遗漏了任何文本,尤其是页眉、页脚和图像标题中的文本?查看布局保真度:翻译后的文档是否看起来像原始文档,或者是否需要重新格式化?这些问题的答案将根据语言对、文档类型和文档的具体内容而有所不同。
对于翻译质量会带来法律或业务后果的文档,请考虑让人工审阅者比较输出并为每个部分选择最佳翻译。机器翻译工具速度很快且越来越准确,但它们并非绝对可靠,工具之间的差异意味着没有一个工具适合所有文档。并排评估翻译的PDF Compare流程是质量保证步骤,可将机器翻译从赌博转变为托管流程。
译后编辑在多工具翻译工作流程中的作用
专业翻译工作流程中不断增长的最佳实践是通过两个或三个翻译引擎运行源文档,比较输出,并让人工编辑选择和完善每个段落的最佳渲染。这种多引擎方法结合了不同翻译模型的优势。一个引擎可以更好地处理技术术语,而另一个引擎可以生成听起来更自然的散文。人类编辑成为机器输出的管理者,而不是从头开始工作的翻译。其结果是翻译超出了任何单个引擎可以产生的翻译,并且比完全手动翻译所需的时间更短。对于将要发布、广泛分发或在翻译质量直接影响可信度的情况下使用的文档,多引擎审阅工作流程可提供当前技术可用的最高质量输出。
翻译工具之间的差异不会消失。每个工具代表一组不同的工程决策、训练数据选择和优化优先级。了解这些差异并利用它们来发挥自己的优势,可以将不一致的根源转变为质量保证策略。文档的最佳翻译很少是单个工具的输出。它是多种工具所能产生的最佳结果,由人类对目标语言中听起来正确的内容的判断提供信息。
翻译工具之间的这种差异并不是该技术的弱点。它反映了真正的语言歧义,使翻译成为一个难题。面对这种模糊性时,不同的工具会做出不同的选择。了解这些选择的本质有助于您为每个文档选择正确的工具,并通过明智的判断而不是盲目信任来解释输出。我们的目标不是找到单一的最佳翻译工具(这种工具并不存在),而是建立判断力,了解哪种工具可以为每个特定文档和语言对产生最佳结果。技能不在于运行翻译,而在于评估输出并从不同工具提供的选项中选择最佳渲染。
翻译工具之间的差异是当前技术格局的一个特征,而不是缺陷。它们提供了单个通用翻译器无法提供的选项。了解差异存在原因的用户可以使用它们生成比任何单一工具单独提供的更高质量的翻译。这种理解将翻译从点击按钮转变为质量控制的过程。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
