Tips & Tricks

如何翻译 PDF 中嵌入图像内的文本

PDF 翻译工具处理文档中的文本流,将单词从一种语言转换为另一种语言。它读取段落、标题和说明文字。但它不会读取图像内的文本。标志的照片、不同语言的用户界面的屏幕截图、带有作为图像一部分呈现的轴标签的图表,所有这些都包含标准翻译工具忽略的文本,因为这些文本不在 PDF 文本流中。它嵌入在图像像素中。翻译嵌入图像内的文本需要提取图像,对其运行 OCR,翻译识别的文本,然后重新嵌入翻译后的图像或将翻译添加为叠加层。图像嵌入文本的翻译 PDF工作流程比标准文本翻译更复杂,但它涵盖了原本无法翻译的内容。

How to Translate Text Inside Embedded Images in a PDF

识别包含可翻译文本的图像

并非 PDF 中的每个图像都包含值得翻译的文本。装饰照片、背景纹理和公司徽标可能不包含可翻译的内容。软件应用程序的屏幕截图、带有标记组件的图表、文档或标志的照片以及带有嵌入轴标签的图表都包含目标语言读者需要理解的文本。扫描 PDF 并识别每张包含文本的图像。为翻译工作流程标记这些图像。

PDF 中包含文本的图像分为两类:一类是文本故意成为图像一部分的图像,例如屏幕截图或带标签的图表,另一类是文本出现在图像中,因为文档是扫描的而不是数字创建的。扫描的 PDF 是每页一张大图像。扫描页面上的所有文本都嵌入到页面图像中。数字创建的 PDF 可能在基于文本的页面上有一个屏幕截图。需要翻译的PDF图像是文本出现在图像像素中而不是PDF文本流中的图像。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

提取图像并识别文本

以可用的最高分辨率从 PDF 中提取图像。使用保留原始分辨率的 PDF 图像提取工具。将每个提取的图像保存为 PNG 文件,以避免在提取步骤中引入压缩伪影。打开每个提取的图像并确认文本清晰可辨。如果图像分辨率太低而无法清晰读取文本,请尽可能以更高的分辨率重新提取,否则请注意该图像可能会产生不可靠的 OCR 结果。

对每个提取的图像运行 OCR 以识别文本。 OCR 引擎识别图像中的文本区域并输出识别的字符及其位置。保存每个图像的 OCR 输出,包括识别的文本和每个文本区域的边界框坐标。稍后需要此信息才能将翻译后的文本放置在图像上的正确位置。 WukongPDF 处理OCR PDF 处理,可以识别嵌入图像中的文本,作为文档转换工作流程的一部分。

在保留上下文的同时翻译识别的文本

从图像中识别出的文本通常是碎片化的。图表可能包含单字标签。屏幕截图可能包含没有句子上下文的菜单项和按钮标签。这种碎片化的文本对于机器翻译引擎来说是一个挑战,因为消除单词含义歧义的周围语言上下文不存在。提供尽可能多的背景信息。如果标签显示“文件”并出现在软件菜单的屏幕截图上,请在翻译输入中注意这是一个菜单项,而不是物理对象。

对于具有多个文本区域的图像,维护每个区域及其翻译之间的映射。具有十个标签的图表会生成十个单独的文本字符串,每个文本字符串都需要翻译。将原始文本、翻译文本和边界框坐标以结构化格式(例如电子表格)保存在一起。该映射用于最后一步,将翻译后的文本放置到图像上。为了使翻译 PDF输出有用,翻译文本必须出现在图像上的正确位置,替换或伴随原始文本。

将翻译后的文本放回到图像上

存在两种将翻译后的文本放置到图像上的方法。第一种方法用译文替换原文。在图像编辑器中打开图像。对于每个文本区域,通过用背景颜色填充该区域来擦除原始文本。使用尽可能与原文风格相匹配的字体将翻译后的文本放置在同一区域中。这种方法可以生成干净的翻译图像,看起来与原始图像相似,但语言不同。

第二种方法将翻译添加到原文旁边。将翻译后的文本以对比色放置在原始文本下方或旁边。这种方法为了解两种语言并希望将翻译与源代码进行比较的读者保留了原文。它比擦除和替换更快,但生成的图像在视觉上更繁忙。根据受众需求选择方法。针对仅阅读目标语言的操作员的培训手册可以从替换中受益。双语参考文档受益于并排演示。

将翻译后的图像重新嵌入 PDF 中

使用翻译文本处理图像后,必须将它们放回 PDF 中。将每个原始图像替换为其翻译后的对应图像。替换图像必须与原始图像放置在页面上相同的空间中。如果翻译后的图像的像素尺寸与原始图像不同,请将其缩放以匹配 PDF 中的原始边界框。 PDF 页面布局不应更改。唯一可见的区别应该是图像中文本的语言。

将包含翻译图像的 PDF 保存为新版本,保留原始未翻译的 PDF 作为参考。打开 PDF 并检查每个图像来验证翻译后的 PDF。确认翻译的文本清晰、位置正确且没有 OCR 或翻译错误。当目标语言的读者可以访问文档、文本流和图像中的每个文本元素时,带有嵌入图像翻译的翻译 PDF 就完成了。

何时选择手动翻译而不是自动翻译

对于包含关键文本(例如安全警告、法律声明或技术规范)的图像,请考虑由人工翻译人员进行手动翻译,而不是机器翻译。 OCR 错误与机器翻译错误相结合可能会改变安全指令的含义,从而产生实际后果。与错误翻译的成本相比,少量关键图像的人工翻译成本很小。

对于手动翻译不可行的大批量图像,请实施审核步骤。机器翻译和重新嵌入后,请一位阅读目标语言的人工审阅者检查翻译图像的样本以确保准确性。如果样本显示系统错误,请调整 OCR 设置或翻译引擎参数并重新处理批次。

嵌入图像中的文本翻译通常是使 PDF 完全可供国际受众访问的最后一步。正文、标题和说明文字已翻译。图像保留为最终未翻译的内容。完成此步骤会生成一个文档,其中每种媒体中的每段文本都可以以目标语言提供。

对于经常更新且嵌入图像的文档,请考虑是否可以在文档创建过程中将图像文本移动到 PDF 文本流中。可以使用标准文本翻译工具来翻译带有存储为文本覆盖而不是图像一部分的标签的图表,从而完全避免了提取-OCR-翻译-重新嵌入的工作流程。

最终翻译图像的质量取决于管道中每个步骤的质量。高分辨率图像提取可产生清晰的 OCR 输入。准确的 OCR 可以生成正确的翻译文本。一个好的翻译引擎可以保留意义。仔细的重新嵌入可以保持视觉质量。每一步都取决于前一步。

用于图像嵌入文本的翻译 PDF 工作流程是劳动力最密集的翻译场景,因为它将图像处理、OCR、翻译和重新嵌入结合到单个管道中。尽可能多的自动化步骤减少了手动工作量。

对于在多个 PDF 中显示相同的图像,例如带有标语或标准图表的公司徽标,只需翻译一次图像即可重复使用。翻译后的图像可以替换到原始图像出现的每个 PDF 中。

本文介绍了在此特定场景中处理 PDF 的关键技术和注意事项。这里描述的方法适用于不同的工具和平台,使读者可以灵活地选择最适合其工作流程和技术环境的方法。

概述的实际步骤提供了从最初的挑战到可行的解决方案的清晰路径。每种技术都因其可靠性和可访问性而被选择,以确保读者无论以前使用 PDF 工具的经验如何,都可以获得一致的结果。

WukongPDF 和类似平台提供 OCR 和文档处理工具,支持本文中描述的图像文本翻译工作流程。这些工具的组合可实现全面的翻译覆盖。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →