用法语撰写的研究论文包含英语审稿人需要理解的带有标题的图表和带有标题的表格。正文可以保留法语,因为审稿人正在与双语同事合作。翻译整个文档是不必要的,并且存在在技术内容中引入错误的风险。仅翻译图形标题和表格标题可为审阅者提供解释视觉元素所需的信息,而无需接触正文。
选择性翻译 PDF 的标题和标题是一项精确的任务,需要一个能够通过位置、格式或内容模式识别特定文本元素的工具。标题通常以较小的字体显示在图形下方。表标题以粗体文本显示在表的第一行中。这些格式提示允许选择性提取和翻译。

识别字幕和标题以进行选择性翻译
学术和技术 PDF 中的图片标题遵循可预测的格式模式。它们出现在图的正下方或旁边。它们使用比正文更小的字体,通常为 8 到 10 号。它们通常以数字开头,后跟数字。这些模式允许手动或自动识别标题文本。
表格标题出现在表格的第一行,通常采用带有阴影背景的粗体文本。标题行在结构上与数据行不同。 PDF 表格提取工具可以通过标题行的位置和格式来识别标题行,提取标题文本,并保持数据行不变。
PDF 格式 将标题和标题存储为定位文本对象,而不是语义标记元素。提取它们需要分析文本位置、字体属性以及与图像或表格结构的接近度。通用文本提取工具无法区分标题和正文。理解文档布局的专门工具可以。
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
选择性翻译工作流程
首先,从 PDF 中提取标题和标题文本。通过相对于图像的位置及其字体特征来识别每个标题。通过表结构中的位置来识别每个表头。将提取的文本编译到带有位置引用的翻译列表中。
其次,翻译提取的文本。机器翻译非常适合标题和标题中使用的简单语言。对翻译的人工审核可确保技术术语得到正确翻译并保留特定领域的术语。
WukongPDF 提供PDF 到文本 提取功能,可以隔离特定文本元素。提取与翻译相结合产生翻译后的标题和标题,同时保留原始正文。
重新插入翻译的标题和标题
翻译后,将翻译后的文本放回 PDF 中的原始位置。翻译后的标题将替换每个图下方的原始标题。翻译后的标题将替换每个表中的原始标题。正文保持不变。
需要注意语言之间翻译长度的差异。翻译为较长英文文本的法语标题可能需要稍小的字体大小或更紧的行间距才能适应相同的空间。调整文本格式以适应翻译而不破坏页面布局。
当选择性翻译是正确的方法时
当读者需要理解视觉元素但不需要详细阅读正文时,选择性翻译是合适的。跨越语言障碍的科学合作、国际提交的技术审查以及多语言出版工作流程都受益于这种有针对性的方法。
与完整文档翻译相比,选择性翻译节省的成本和时间与标题和标题与正文的比例成正比。如果仅翻译标题,则由 80% 正文和 20% 标题组成的文档可节省 80% 的翻译成本。
通过在特定文档或出版物格式上训练文档布局分析模型,可以部分自动化选择性翻译的标题和标题的识别。在期刊模板上训练的模型可以在使用该模板的所有文章中高精度识别标题和标题。
翻译记忆工具可以存储来自同一领域的多个文档中重复出现的标题短语的翻译。像图 X 这样的短语显示了数十篇论文中出现的关系以及所有论文中一致翻译的好处。
选择性翻译的质量保证流程应验证是否翻译了正确的文本以及未翻译错误的文本(正文)。审阅者会根据原文检查翻译字幕的样本,并检查这些页面上的正文是否仍采用原始语言。
标题包含对正文文本的数字引用的文档,请参阅第 3.2 节了解详细信息,翻译必须准确保留这些交叉引用。错误翻译的交叉引用指向不存在的部分,会造成混乱。
当翻译后的标题重新插入到 PDF 中时,新文本应该在视觉上与原始正文文本区分开来,可能是通过细微的色差或页边空白中的符号来区分,以便读者知道他们正在查看经过选择性翻译的文档。
选择性翻译方法可以扩展到受益于目标翻译的其他文档元素:摘要翻译、国际数据库的关键字翻译以及多语言出版物的图形标签翻译。
对于以多种语言出版期刊的学术出版商来说,选择性翻译标题和标题在昂贵的完整翻译和根本不翻译之间提供了一种经济有效的中间立场。
标题和标题的选择性翻译是满足特定需求的精确工具,但当受众需要理解完整内容时,不能替代完整文档翻译。
选择性翻译的成本效益使其成为国际合作的一个有吸引力的选择,因为完整翻译的成本高昂。
选择性翻译为多语言文档协作提供了有针对性的解决方案。
科学论文中的图形标题遵循自动提取工具可以识别的可预测模式:它们出现在图形下方,使用较小的字体,并以图形开头,后跟数字。
表标题在结构上与数据行不同,因为它们出现在表顶部,通常使用粗体文本,并且可能具有阴影背景,这些特征是提取工具用于识别的特征。
提取过程应保留原始格式信息,以便翻译后的文本可以以正确的字体属性和间距放回到正确的位置。
对于多语言出版物,可以系统地应用选择性翻译:提取标题和标题,翻译为所有目标语言,并将每个版本作为单独的 PDF 层插入。
科学字幕的机器翻译质量已经提高到这样的程度,即人工译后编辑比这些结构化文本元素的从头开始翻译更快、更便宜。
正文和标题之间的字体大小差异是自动提取工具用来识别标题文本的主要信号,标题通常比周围的正文小 2 到 4 磅。
表头行可以通过其作为每个表的第一行的位置、粗体文本格式以及通常将其与数据行区分开的阴影背景来识别。
提取的标题和标题应编译成结构化列表,保留页码和位置坐标,以便在翻译后准确重新插入。
翻译记忆工具可以存储同一领域先前文档的翻译标题,从而提高一致性并降低重复术语的翻译成本。
重新插入翻译后的字幕必须考虑到不同语言之间的文本长度差异,根据需要调整字体大小或行距以使翻译后的文本适合原始字幕空间。
选择性翻译的质量保证包括验证是否提取了正确的文本元素、翻译是否准确以及正文没有被意外修改。
对于以多种语言发表文章的学术期刊,标题和标题的选择性翻译可以作为标准步骤纳入生产工作流程中。
与完整翻译相比,选择性翻译可以节省成本,使得翻译预算有限的项目和出版物可以进行国际合作。
科学说明中使用的结构化、公式化语言的机器翻译质量通常高于叙述性文本,从而减轻了译后编辑的负担。
能够仅翻译特定的文档元素,同时保留正文的原始语言,从而为国际文档工作流程创造了灵活性。
对于跨越多个语言社区的研究合作,选择性翻译使每个合作者能够以其首选语言访问视觉证据。
这种选择性方法使翻译资源有限的团队和项目可以进行多语言文档协作。
图形标题和表格标题的有针对性的翻译为读者提供了解释视觉元素所需的基本上下文。
选择性翻译标题和标题使国际读者能够理解文档中的视觉证据,而无需完整翻译正文。
这种有针对性的文档翻译方法降低了成本,同时提高了跨越语言障碍的视觉信息的可访问性。
标题提取依赖于与周围正文文本的字体大小和位置差异。
PDF 中的标题文本通常位于相应图形的正下方或旁边,使用的字体大小比正文文本小 2 到 4 磅,从而可以通过分析文本位置和格式特征的自动提取工具进行识别。
标题和标题的选择性翻译为国际读者提供了获取视觉信息的途径。
这种能力使国际研究合作变得更加容易和更具成本效益。
选择性文档翻译方法可以满足特定需求,而无需花费完整翻译的费用。
| 元素 | 识别提示 | 翻译优先级 | 重新插入注意 |
|---|---|---|---|
| 图标题 | 下图;较小的字体;图N前缀 | 高的 | 位置相同;可能需要调整字体大小 |
| 表头 | 第一排;大胆的;阴影背景 | 高的 | 相同的细胞;保持对齐 |
| 轴标签 | 与图表轴相邻 | 中等的 | 可能需要旋转调整 |
| 图例条目 | 色样+文字 | 低的 | 通常不单独提取 |
尝试翻译 PDF
无需安装。直接在您的浏览器中工作。
