Tips & Tricks

如何仅翻译 PDF 中的图形标题

科学论文、技术报告和插图文档包含图形标题,用于解释每个图像、图表或图表所显示的内容。当此类文档的正文已经是读者可以理解的语言,但图形标题不是时,仅翻译标题可以避免翻译读者已经可以理解的内容的不必要的工作。挑战是将标题文本与周围的正文文本隔离,以便只有标题通过翻译引擎。

PDF 中的标题通常设置为与正文略有不同的字体大小或样式。它们位于图像下方或旁边,通常以图或表开头,后跟数字。这些视觉和位置提示可以帮助人类读者一目了然地识别标题。仅针对标题的翻译 PDF工作流程使用这些提示来选择正确的文本,无论是通过手动选择、基于样式的过滤还是导出和提取方法。

WukongPDF 的PDF Export 和翻译工具处理文档范围内的语言转换。对于选择性的仅字幕翻译,以下手动和半自动工作流程将字幕文本与周围内容隔离。

How to Translate Only Figure Captions in a PDF

方法 1:手动复制-翻译-粘贴字幕

对于标题数量可管理(通常少于 20 个)的文档,最可靠的方法是手动。在任何支持文本选择的编辑器中打开 PDF。对于每个标题,选择文本,复制它,将其粘贴到翻译工具(例如 Google Translate 或 DeepL)中,复制翻译的输出,然后将其粘贴回 PDF 中的同一位置,替换原始标题文本。

手动方法是精确的。您可以准确控制翻译哪些文本以及翻译的位置。它避免了意外翻译正文或丢失自动检测可能会跳过的标题的风险。精确度是以时间为代价的。每个字幕大约需要 30 到 60 秒来选择、翻译和替换。包含 15 个标题的文档大约需要 10 到 15 分钟。对于单个文档的一次性翻译,手动方法就足够了。对于重复翻译或具有数百个标题的文档,下面的自动化方法更实用。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

方法 2:PDF 编辑器中基于样式的选择

Adobe Acrobat Pro 的编辑 PDF 工具包含一项功能,可以选择与特定字体、大小或颜色匹配的所有文本。如果 PDF 中的标题使用一致的样式(例如 9 号斜体),您可以通过一次操作选择所有标题文本。在 Acrobat Pro 中打开 PDF,转到“编辑 PDF”,单击标题文本区域,然后右键单击并选择“选择全部使用此字体”。 Acrobat 选择页面上使用相同字体和大小的每个文本块。复制选定的文本并将其粘贴到文本文档中。

检查粘贴的文本。意外使用与标题相同字体的正文将与实际标题一起被选中。手动删除所有非标题文本。文本文档现在仅包含标题内容。将其粘贴到翻译工具中进行翻译,然后将每个翻译后的标题粘贴回 PDF 中的原始位置。与单独选择每个标题相比,基于样式的选择显着加快了提取步骤。

方法 3:导出到 Word 并按样式过滤

使用 Acrobat Pro 的导出到 Word 功能或在线 PDF 到 Word 转换器将 PDF 转换为 Word 格式。在 Microsoft Word 中打开生成的 DOCX。 Word 保留 PDF 中的字体样式,因此标题的字体和大小与原始标题相同。使用 Word 的“选择具有相似格式的所有文本”功能来选择整个文档中的所有标题文本。右键单击标题段落,转到样式,然后选择全部。 Word 会选择具有匹配格式的每个段落。

将选定的文本复制到新文档的表格中。每个标题占一行。为翻译后的文本添加第二列。使用翻译工具翻译每个标题,将翻译粘贴到相邻的列中。翻译完所有标题后,使用两列表作为参考,将 PDF 中的每个标题替换为其翻译。基于 Word 的方法提供了比基于 PDF 的方法更容易跟踪的结构化工作流程,因为翻译进度在表格中可见。

方法工作原理最适合
选择性复制粘贴仅复制 PDF 中的标题文本、翻译、粘贴回来带有 5-10 个标题的简短文档
PDF编辑器按样式查找-替换选择所有与字幕字体匹配的文本,复制到翻译器带有样式标题的文档
将字幕导出到文本文件将 PDF 导出到 Word,通过格式隔离标题具有多个标题的文档、重复的工作流程

处理跨多行的标题

PDF 中的多行标题可以分为单独的文本块,每行一个。当您选择并复制标题时,您会得到三个单独的文本选择,而不是一个连续的段落。通过用空格将它们连接起来,将所有三个作为一个块粘贴到翻译工具中。翻译将是一个段落。将译文粘贴回 PDF 时,将其拆分为与原始文本相同数量的文本块,以保持布局。

当涉及到文档工作流程时,对于包含技术术语、缩写或测量单位的标题,请通过在翻译工具支持的情况下将它们标记为不翻译来保护这些术语免于翻译,或者用占位符标记替换它们,运行翻译并恢复原始内容。图 3:TiO2 纳米粒子在 50kx 放大倍数下的 SEM 图像的说明文字应与文字完全一致,保留 TiO2 和 50kx。

仅翻译图形标题会使正文保留原始语言,同时使目标语言的读者可以理解视觉内容。与完整文档翻译相比,选择性方法可以节省时间,并生成可供双语读者(部分翻译的技术内容的最常见受众)高效导航的文档。

跨多个 PDF 批量翻译字幕

对于管理带有外语标题的文档库的研究人员或技术作家来说,跨多个 PDF 的批量翻译遵循相同的扩展工作流程。使用批处理转换器将所有 PDF 导出为 Word 格式。使用 Word 的查找和替换以及格式过滤器来查找与特定字体和大小匹配的所有文本,这应该捕获所有导出文档中的标题。将所有找到的文本复制到单个翻译批次中。

通过 DeepL 或 Google Translate 在一次操作中翻译整个批次。这两种服务都接受大文本块并保留与各个标题边界相对应的段落分隔符。翻译后,通过段落分隔符将翻译后的文本拆分回单独的标题,并将每个标题粘贴到相应的 PDF 中。批处理方法将每个标题的翻译开销从 30 秒减少到大约 5 秒,这对于具有数百个标题的文档集合来说非常实用。

替换翻译字幕时保留布局

翻译后的字幕通常比原文更长或更短。德语翻译比英语长 20% 到 30%。中文翻译通常较短。将翻译后的标题的字体大小调整半个磅,以吸收长度变化,而不改变文本框尺寸。小字体调整可保留布局,同时适应翻译长度差异。

在整个文档工作流程中,如果长度发生重大变化,请手动将翻译后的标题拆分为多行。将换行符与原始标题的视觉宽度大致匹配。目标是翻译后的标题占据与原始标题大致相同的视觉空间,保留标题与其描述的图形之间的关系。

图形标题的选择性翻译是一项尊重读者现有语言技能的精确任务。仅翻译需要翻译的内容可以节省时间,并生成双语读者可以轻松浏览的文档。手动、基于样式和基于导出的方法可以从具有五个标题的单个文档扩展到具有数百个标题的文档库。

字幕的选择性翻译是一项精确的任务,它生成可供双语读者使用的文档,这些读者可以理解正文,但需要其首选语言的字幕。工作流程从具有五个标题的单个文档扩展到具有数百个标题的库,并且手动、基于样式和导出方法各自服务于不同的规模。

选择性字幕翻译尊重读者现有的语言技能,同时使视觉内容易于理解。仅翻译需要翻译的内容(而不是整个文档)的精确性可以节省时间,并产生双语读者可以轻松浏览的结果。手动、基于样式和基于导出的方法可以从单个文档扩展到整个库。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →