Tips & Tricks

如何仅翻译 PDF 表格单元格中的文本,同时保持数字不变

翻译 PDF 表格提出了常规文档翻译所没有的独特挑战。表格混合了两种根本不同的数据类型:需要翻译的文本和必须保持原样的数字。欧元价目表需要将产品描述从法语翻译成英语,但价格、数量和 SKU 代码必须绝对不变。财务报告需要翻译评论,同时收入数字和百分比值保持锁定。标准翻译 PDF工具通常统一处理所有内容,这存在因格式更改、小数点分隔符转换或意外字符替换而改变数字的风险。

问题不在于翻译工具无法区分文本和数字。大多数现代翻译引擎都能识别数字模式并保持它们独立不变。当数字嵌入到混合内容字符串中、PDF 提取过程错误识别单元格边界以及重新插入翻译文本破坏表格布局时,就会出现问题。在翻译之前将文本和数字内容分开的有条不紊的方法可产生始终如一的准确结果。

WukongPDF 的PDF Export 和翻译工具在语言转换期间保留表结构。对于表格较多的文档,在运行翻译引擎之前对表格进行预处理以隔离数字单元格,从而以最少的翻译后更正产生最准确的输出。

How to Translate Only the Text in PDF Table Cells While Keeping Numbers Untouched

为什么翻译工具有时会改变数字

翻译引擎将文本字符串作为语言单位进行处理。当表格单元格包含 1,500 个单位时,引擎会将其视为混合字符串,并且必须决定 1,500 是单独保留的数字还是要翻译的短语的一部分。大多数在 2024 年及以后的模型上训练的引擎都能正确处理常见数字格式的问题。仍然会导致问题的边缘情况包括小数分隔符(其中欧洲 1.500,00 表示法可能会不必要地转换为美国 1,500.00)和货币符号(其中引擎可能会根据目标语言的约定移动或复制符号)。

日期格式是另一个常见的受害者。美国英语源文档中写为 03/07/2025 的日期表示 2025 年 3 月 7 日。如果翻译引擎还针对英国英语受众本地化日期格式,则可能会将显示转换为 07/03/2025,这会完全改变含义。最安全的方法是将日期与数字一起视为受保护的内容,仅翻译周围的文本。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

方法1:在Excel中预处理表格

最可控的工作流程是在翻译之前将 PDF 表格提取到 Excel 中。使用保留表格结构的工具将 PDF 转换为 Excel。在生成的电子表格中,扫描列并确定哪些列包含可翻译文本与数字数据。插入翻译内容的新工作表。仅将文本列复制为适合翻译的格式:将它们直接粘贴到翻译工具中或将它们导出为单独的文件。

翻译文本列后,将翻译后的文本粘贴回电子表格中的相应位置,保持数字列完全不变。检查组合表中的单元格对齐问题,然后将完成的电子表格导出为 PDF。此方法保证零数字更改,因为数字永远不会通过翻译引擎。代价是它需要手动逐列工作流程,这对于具有 10 到 50 行的表来说很实用,但对于具有数百行的文档来说却是劳动密集型的。

方法 2:使用基于正则表达式的内容屏蔽方法

一些专业翻译工具和 CAT(计算机辅助翻译)平台支持将特定文本标记为不可翻译的正则表达式模式。在运行翻译之前,定义与您的数字格式匹配的正则表达式模式:带逗号的数字、带小数点的数字、货币前缀数字、百分比值和日期模式。将这些模式应用为受保护的内容规则。然后,翻译引擎会跳过与受保护模式匹配的任何文本段,仅翻译剩余的文本。

此方法适用于大多数数字数据遵循可预测格式的文档。例如,所有条目价格格式一致的产品目录可以使用 \$\d{1,3}(,\d{3})*\.\d{2} 等美元金额模式进行保护。对于不同部分具有不同数字格式的文档,正则表达式方法需要更多模式和更多测试。翻译后,抽查文档不同部分的至少 10 个数值,以确认没有发生格式偏差。

方法 3:复制-翻译-粘贴工作流程

对于 PDF 中的单个表格,最简单的方法是一次复制一列文本单元格,通过翻译工具运行它们,然后将结果粘贴回原始表格的副本中。使用 PDF 编辑器,您可以从各个表格单元格中选择和复制文本。将每列的文本粘贴到翻译文本框中,复制翻译的输出,然后将其粘贴到 Word、Google 文档或支持表格编辑的 PDF 编辑器中重建表格的相应列中。

对于大型表格来说,该方法很乏味,但可以让您对翻译的内容和保持原始的内容进行像素级控制。粘贴步骤是出现布局问题的地方。翻译文本通常比源文本长,对于德语或西班牙语等语言,有时要长 20% 到 30%。在最终确定表格之前,调整列宽以适应较长的翻译文本,而不会破坏表格网格。如果翻译的内容不适合原始单元格尺寸,请考虑将字体大小减小 0.5 到 1 磅,而不是让文本溢出或被剪切。

处理混合内容单元

一些表格单元格真正将文本和数字混合在一个字符串中:订购 15 个单位的替换零件 BP-4402 是一个示例,其中数字 15 和零件代码 BP-4402 必须在翻译后保持不变,而它们周围的文本则转换为目标语言。对于这些单元格,在翻译之前将数字段和标识符包装在占位符标记中。将 15 替换为 NUM1,将 BP-4402 替换为 CODE1。运行翻译。然后将占位符替换为翻译输出中的原始值。

这种占位符技术工作可靠,因为翻译引擎将占位符视为不可翻译的标记并逐字保留它们。翻译后,简单的查找和替换会将占位符交换回原始值。对于具有许多混合内容单元格的表格,使用简短的脚本自动插入和替换占位符,而不是手动执行。

方法工作原理限制
完整翻译翻译所有内容,然后手动修复数字耗时的校正步骤
选择性复制翻译仅复制文本单元格,从外部翻译,粘贴回脆弱的布局保存
正则表达式模式保护在翻译工具中将数字模式标记为受保护文本需要支持正则表达式或受保护范围的工具
两层 PDF 方法分别提取数字、翻译文本、重新组合复杂的工作流程,最适合高价值文档

仅翻译 PDF 表格单元格中的文本,同时保持数字不变,这是一项精确的任务。对于复杂的表格,Excel 预处理方法是最可靠的。基于正则表达式的保护适用于具有可预测数字格式的文档。手动复制-翻译-粘贴方法可以满足快速、一次性的需求。无论您选择哪种方法,在文档到达受众之前,通过比较翻译前后的数值样本进行五分钟的验证即可发现任何问题。

翻译后质量验证检查表

翻译 PDF 表格中的文本后,在共享文档之前进行系统的质量检查。首先,比较原始表和翻译表中的总行数。如果计数不同,则在提取或插入步骤期间删除或重复了一行。其次,根据原始文档抽查不同列中的五个数值。确认小数点、逗号、货币符号和负号不变。第三,验证所有行的列对齐方式是否一致。单个未对齐的列会相对于标题移动该列中的所有数据。

当翻译后的表格用于专业或法律用途时,请让目标语言的母语人士检查翻译后的单元格示例。表格内容的机器翻译有时会为行业特定术语生成技术上正确但上下文不合适的翻译。五分钟的人工审核可以发现自动质量检查遗漏的术语问题。 翻译 PDF包含人工验证步骤的工作流程可为关键业务文档生成一致可靠的结果。

在翻译之前花费额外的时间隔离数字内容会在准确性方面得到回报。一份翻译后的价格表,其中每个数字都是正确的,但产品名称有点尴尬,是一个可用的文件。具有完美产品名称但移动了小数点的翻译价格表是一种负担。优先考虑数字准确性并通过抽查进行验证。

重复翻译工作流程中的自动化数字保护

对于定期翻译类似表格文档的组织来说,构建自动识别和保护数字单元格的预处理脚本可以从工作流程中删除手动检查步骤。使用正则表达式的 Python 脚本可以扫描从 PDF 中提取的 CSV,将包含超过 80% 数值的列标记为受保护,并输出一个标记文件,翻译工具可以在其中查看要跳过哪些内容。对于具有数千行的表,该脚本的运行时间不到一秒,其一致性消除了人工审阅者意外错过本应受到翻译引擎保护的数字的风险。实施数字保护工作流程后,每季度对源 PDF 表格和翻译后的 PDF 表格进行一次比较,以确认保护规则仍能捕获不断发展的文档集中的每个数字模式。

WukongPDF

尝试翻译 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →