将相同的 PDF 上传到通用翻译器(如 Google Translate)和文档专用翻译工具(如 WukongPDF 的内置翻译器),结果会有所不同。有时差异是微妙的:这里是单词选择,那里是句子结构。有时它们是戏剧性的:一个翻译读起来就像自然的人类写作,而另一种读起来就像一台机器在每个句子中挣扎。这些差异不是随机错误或错误。它们源于每个翻译系统做出的基本设计选择,即如何平衡速度与准确性、流畅性与字面保真度以及文档结构保留与纯语言翻译之间的平衡。了解存在这些差异的原因有助于您为每个文档选择正确的工具,并以适当的信任级别解释输出。

通用翻译器和文档专用翻译器之间的根本区别
Google Translate、DeepL 和 Microsoft Translator 等通用翻译引擎旨在翻译任何上下文中的文本:网页、聊天消息、电子邮件、社交媒体帖子,当然还有文档。他们的训练数据来自开放的互联网,涵盖广泛的写作风格、领域和质量水平。这种广度给了他们非凡的灵活性。他们几乎可以翻译出你交给他们的任何内容,从餐厅菜单到法律合同。但同样的广度也是它们的局限性。因为它们没有针对任何特定域进行优化,所以它们也没有针对任何特定域进行优化。通用翻译员对商业文件中预期的法律术语、医学术语、技术规范或正式语域没有特殊的理解。它对待合同的方式与对待博客评论的方式相同:使用相同的统计模型将文本从一种语言转换为另一种语言。
文档专用翻译工具采用了根本不同的方法。它们是专门为翻译文档而设计的,其整个处理流程都是围绕该工作流程构建的。他们知道 PDF 不仅仅是文本流,而且是包含标题、段落、表格、说明文字、页眉、页脚和页码的结构化文档。它们不仅保留单词,还保留文档结构:标题层次结构、段落分隔符、表格单元格中文本的位置以及正文和标题之间的关系。文档专业翻译人员将合同视为合同,保留赋予文档法律特征的条款编号、签名块和正式语气。 WukongPDF 的翻译 PDF 工具基于文档优先的理念构建,在文档上下文中处理文本,而不是将其提取到非结构化流中。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
训练数据如何以不同方式塑造翻译输出
教授翻译引擎如何翻译的训练数据对其输出的特征有着巨大的影响。通用引擎是在大量网络爬行语料库上进行训练的,其中包括从新闻文章和维基百科条目到论坛讨论和产品评论的所有内容。这种不拘一格的训练饮食产生了一个多功能的引擎,但有时产生的翻译对于正式文档来说过于随意,或者对于惯用表达来说过于直白。引擎已经看到了如此多不同类型的文本,以至于除非您明确告诉它,否则它无法可靠地检测到哪个语体适合您的特定文档,即使如此,它在长文档中保持一致的正式语气的能力也是有限的。
文档专用引擎通常使用特定领域的语料库来补充其一般培训:翻译的合同、技术手册、学术论文、政府文件和商业信函的集合。这种集中培训产生的引擎在其目标领域内更加可靠。它更有可能正确翻译法律术语,保留商业沟通中预期的正式语域,并在长文档中保持术语的一致性。代价是,文档专用引擎可能在远远超出其训练领域的内容上表现不佳,例如休闲对话或创意写作。但对于大多数人实际需要翻译的文档来说,专注领域是一个明显的优势。
文档结构保存作为差异化因素
也许通用翻译器和文档专用翻译器之间最明显的区别是它们如何处理翻译文本周围的文档结构。通用翻译器通常将 PDF 中的所有文本提取到线性流中,将其翻译为单个块,然后尝试将翻译后的文本放回到每个页面上的原始位置。这种方法通常会破坏文本与其上下文之间的关系:标题可能会失去粗体格式,表格单元格可能会溢出,因为翻译后的文本比原始文本长,标题可能会与其描述的图像分离。翻译可能在语言上准确,但结构受损,需要手动重新格式化,这可能比检查翻译质量本身花费更长的时间。
文档专用翻译器在其布局上下文中翻译文本。每个文本块都是独立翻译的,保留其在页面结构中的位置。标题样式保持不变,表格结构保持不变,文本和图像之间的空间关系保持不变。翻译后的文档看起来与原始文档相似,只是语言不同。这种结构保真度不仅仅是美学上的。结构被保留的文档可以立即被接收者使用。在翻译过程中结构被破坏的文档需要额外的工作才能达到其预期目的。并行评估翻译的PDF比较过程应该以与语言准确性相同的权重来评估结构保真度。
处理图像和扫描内容中的嵌入文本
不同类型的翻译器之间的一个特别显着的差异是它们如何处理仅以像素形式存在于 PDF 中的文本,例如图像中嵌入的文字、图表标签和扫描页面上的内容。通用翻译器通常完全忽略基于图像的文本,因为其文本提取管道仅处理可选的字符运行。翻译后的文档带有目标语言的正文,但所有图像标题、图表标签和嵌入的标注仍采用源语言。相比之下,文档专用翻译器通常包括 OCR 预处理步骤,在翻译开始之前从图像中提取文本,从而实现更完整的翻译,涵盖文档的文本层和图像层。
对于某些文档类型,完整性差异尤其显着。仅处理幻灯片文本但每个图表和嵌入插图仍保留源语言的翻译演示文稿是半成品翻译,会让不会说源语言的读者感到困惑。如果翻译后的技术手册的正文采用目标语言,但每个原理图标签仍采用源语言,则几乎无法使用。 翻译 PDF工具能否访问图像和文本层中的文本,决定了翻译的文档是完整的还是仅部分翻译。
为您的文档选择正确的翻译器
通用翻译器和文档专用翻译器之间的选择应由文档的内容类型、其预期用途以及结构保真度对最终结果的重要性决定。下表总结了需要考虑的关键因素。
| 系数 | 通用翻译器 | 文档专业翻译 |
|---|---|---|
| 常见文本的语言准确性 | 非常适合一般内容;可能难以掌握专业术语 | 整体不错;在训练有素的领域内更了解特定领域的术语 |
| 文档结构保存 | 有限的;文本通常被提取为扁平流并重新放置 | 强的;在布局上下文中进行翻译,保留标题、表格和间距 |
| 图像嵌入文本处理 | 通常被忽略;仅处理可选择的文本 | 通常包括 OCR 预处理以捕获图像和扫描中的文本 |
| 音域和音调的一致性 | 长文档中可能会在正式和休闲之间摇摆不定 | 在法律、商业和技术等训练有素的领域内更加一致 |
| 最适合 | 快速理解文档内容;非正式分享 | 专业配送;文件的外观和功能必须与原始文件相似 |
对于许多实际目的,最好的方法是将这两种工具结合起来。使用通用翻译器初步了解文档内容。然后使用文档专业翻译人员生成最终的、精美的翻译,保留原始文档的结构和专业外观。这两种工具在翻译工作流程中发挥着互补的作用,了解它们各自的优势可以让您在发挥最佳性能的地方使用它们。
工作流程的其他注意事项
本文中描述的技术解决了跨不同工具、平台和格式处理 PDF 时出现的特定挑战。每个挑战都有一个解决方案,植根于理解 PDF 格式如何处理特定类型的内容或所涉及的转换。持续应用这些技术可以将 PDF 任务从令人沮丧的障碍转变为管理良好的文档工作流程中的例行步骤。
更深入地了解 PDF 行为的价值超出了此处涵盖的特定场景。当您将来遇到新的 PDF 挑战时,询问 PDF 格式如何存储和处理相关内容的诊断方法将指导您找到解决方案。格式复杂但合乎逻辑,解释一种行为的原则通常可以解释其他行为。
文件准备是对您的作品如何被接受的投资。正确显示、干净转换并专业呈现其内容的 PDF 反映了您在创建它时所投入的精力。本文中描述的额外步骤,无论是配置导出设置、预处理页面还是验证输出质量,都不是负担。它们是有效的文档和产生的问题多于解决的问题的文档之间的区别。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
