您通过翻译工具运行 PDF,将文本从英语转换为德语。翻译是准确的,但输出是一团糟。德语文本通常比英语长百分之三十,但现在已经冲出文本框并溢出到邻近区域。在某些页面上,溢出的文本完全消失,被原始文本框架的边界剪掉。翻译捕捉到了文字,但失去了布局,一份格式乱码的文档几乎和翻译乱码的文档一样毫无用处。
翻译 PDF操作期间的文本溢出是 PDF 翻译中最常见的质量问题。出现这种情况是因为原始 PDF 是针对特定长度的文本设计的,而目标语言的翻译文本几乎从来没有完全相同的长度。当翻译工具用翻译文本替换原始文本而不调整周围布局时,文本长度和文本框架大小之间的不匹配会产生溢出、剪裁或两者兼而有之。

为什么翻译文本的长度几乎永远不会与原始文本相同
不同的语言使用不同数量的字符和单词来表达相同的想法。英语中需要十五个单词的句子在汉语中可能需要十二个单词,但在德语中可能需要二十个单词。字符数的变化甚至更加显着。一个五个字符的英文单词会变成一个汉字,但可能会变成一个十五个字符的德语复合名词。
语言扩展和收缩比率在翻译行业中有详细记录。英语到德语的翻译范围通常会扩大百分之二十到三十五。英语到西班牙语的比例扩大了百分之十五到百分之二十五。英语到法语的扩展百分之十到百分之二十。英文到中文的字符数减少了百分之三十到百分之五十。这些比率意味着为英语文本设计的文本框架对于德语文本来说太小,对于中文文本太大。
PDF 格式 使翻译过程变得复杂,因为文本存储为定位字符,而不是流动段落。每个字符在页面上都有特定的 x 和 y 坐标。具有不同字符宽度的翻译文本无法放置在同一坐标处而不重叠或产生间隙。翻译工具必须调整字符位置(这可能会破坏布局),或者保留位置并接受溢出。
语言之间的字体差异为长度不匹配增加了另一个维度。德语翻译可能需要原始英语字体中不存在的带变音符号的字符。法语翻译需要重音字符。波兰语翻译需要带有变音符号的字符。如果原始字体不包含这些字符,则翻译工具必须替换不同的字体,并且即使对于相同的磅值,替换的字体也可能具有不同的字符宽度。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
为什么文本会消失而不是溢出
PDF 文本框架有剪切边界。当文本超出框架尺寸时,超出部分将被隐藏。剪切是 PDF 渲染中的默认行为,因为它以牺牲内容可见性为代价保留视觉布局。为三行英文地址设计的文本框架会剪辑德语翻译的第四行,该翻译扩展到四行。
比剪切更糟糕的是翻译工具识别出溢出并截断文本以适应。被截断的文本在句子中间结束,读者永远看不到缺失的内容。没有警告的截断是数据丢失问题,而不仅仅是格式问题。读者假设他们拥有完整的翻译文档,但其中的部分内容被悄悄删除以保留布局。
一些翻译工具尝试通过减小字体大小来适应文本。翻译后的文本仍然存在且完整,但可能小得难以阅读。八点字体缩小为五点,以将德语翻译放入英语大小的文本框架中,这在技术上是完整的,但实际上难以辨认。此类翻译的PDF Export通过了完整性检查,但未通过可用性检查。
如何防止 PDF 翻译过程中出现布局问题
最有效的预防措施是在设计原始 PDF 时考虑到翻译。在文本框架中添加额外的空白以适应语言扩展。使用宽大的行距并避免紧凑的布局。专为翻译而设计的文档在其原始语言中看起来稍微松散,但可以容纳百分之三十的文本扩展而不会中断。
委托翻译 PDF 时,要求设计人员提供可编辑格式的源文件,而不仅仅是 PDF。翻译人员可以直接在源文件中工作,根据每种语言的需要调整文本框架。然后,翻译后的源文件将导出为具有该语言的正确布局的 PDF。此工作流程可产生专业的结果,但需要访问原始设计文件。
WukongPDF 通过浏览器提供翻译工具,可以处理 PDF 文本并生成翻译输出。该平台处理文本提取和重新插入,同时保留尽可能多的原始布局。
翻译后布局修复
翻译后,检查每个页面是否存在溢出、剪裁和字体替换问题。审核应由精通两种语言的人员进行,以识别翻译文本被切断的位置。只会说一种语言的审稿人可以发现视觉问题,但无法验证缺失的文本是否重要。
对于布局问题导致翻译无法使用的页面,请手动重建这些页面。使用 PDF 中的翻译文本并将其放入具有适当大小文本框架的新文档中。此手动步骤非常耗时,但对于布局完整性至关重要的文档可以产生最高质量的结果。
对于经常性的翻译需求,例如以多种语言发布的产品文档,请投资将内容与布局分开的翻译工作流程。以 XML 或 Markdown 等结构化格式创作内容。翻译内容文件。应用每种语言的布局模板。从翻译内容和布局模板生成特定于语言的 PDF。这种内容和布局的分离完全消除了溢出问题。
从右到左的语言,例如阿拉伯语和希伯来语,为文本长度挑战添加了方向挑战。整个文本流会反转方向,并且定位为从左到右阅读的 UI 元素可能需要移动到页面的另一侧。只替换文本而不调整方向的翻译工具生成的文档中,文本从右到左阅读,但布局却假定从左到右,从而产生一种令人迷惑的阅读体验。
使用非拉丁文字的语言(例如中文、日文、韩文、西里尔文和阿拉伯文)可能需要原始 PDF 中未嵌入的字体。翻译工具必须用适当的字体替换目标脚本。如果替换字体的规格与原始字体不同,则文本位置会发生变化。 SimSun 字体中的一行中文文本与 Microsoft YaHei 中的相同字符所占据的水平空间不同。
由于表单字段具有固定尺寸,因此 PDF 表单的翻译带来了额外的挑战。对于英文姓名大小的姓名字段可能对于德国或西班牙姓名来说太短,而德国或西班牙姓名往往较长。针对北美号码 (XXX) XXX-XXXX 格式化的电话号码字段无法容纳不同格式的国际号码。
对于出于监管或法律目的而翻译的文件,翻译必须经过认证是完整且准确的。溢出并被剪切的文本不完整。被截断以适合的文本不准确。译者或翻译服务必须验证源文本的每个字符是否都存在于翻译的输出中。
神经机器翻译的机器翻译质量得到了显着提高,但布局处理却没有以同样的速度提高。翻译可能很流畅、准确,但布局却被破坏了。机器翻译输出的人工后期编辑应包括布局审查,而不仅仅是语言审查。
对于必须以多种语言发布的文档,最可靠的方法是为每种语言维护单独的布局模板,并根据该语言的预期文本长度调整文本框架的大小。翻译会流入适当的模板,并且布局问题是通过模板设计而不是通过翻译后清理来捕获的。
专业翻译人员使用的翻译记忆工具存储以前翻译的片段。当 PDF 包含与之前翻译的内容相似的文本时,翻译人员会重复使用存储的翻译。重用的翻译可能已针对具有不同文本框架尺寸的不同文档进行了格式化。翻译人员必须根据当前文档上下文调整格式。
翻译后版式修复的费用应包含在翻译项目预算中。对于格式复杂的文档,布局修复通常会增加 20% 到 40% 的翻译成本。引用翻译而不修复布局会产生不切实际的预算,从而导致偷工减料。
最可靠的 PDF 翻译工作流程将文本提取、翻译和布局重建分为不同的步骤,并在每个转换点进行人工审核,生成翻译后的文档,源中的每个字符都存在且位置正确。
专门从事文档翻译的专业翻译服务了解每种语言对的文本扩展和收缩模式,并在生成翻译后的 PDF 输出之前相应地调整文本框架。
翻译后的 PDF 中的字体嵌入对于不同系统之间的一致显示至关重要,对于非拉丁文字尤其重要,因为接收系统可能没有任何支持目标语言字符的字体。
| 语言对 | 膨胀/收缩 | 布局影响 |
|---|---|---|
| 英语到德语 | +20-35% | 文本框溢出;需要减小字体大小 |
| 英语到西班牙语 | +15-25% | 适度溢出;丰厚的利润有帮助 |
| 英文转中文 | -30-50% 字符 | 多余的空白;文字显得稀疏 |
| 英语至阿拉伯语 | +15-25% + RTL | 文字方向反转; UI 元素发生变化 |
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
