Others

为什么将 PDF 表格转换为 Excel 有时会将相邻的数字列合并到单个单元格中

您将格式清晰的 PDF 表格转换为 Excel,打开输出,发现 PDF 中两列独立的数字已变成一列,其中包含“1,2503,780”等值。在每个单元格中。相邻列中的两个数值已连接成一个文本字符串,并且该数据现在无法用于计算。这是有关PDF 到 Excel 转换的最常见投诉,发生这种情况是因为转换器错误判断了一列结束位置和下一列开始位置。

PDF 表中的列边界检测是一个根本性的难题,因为 PDF 不包含表结构。 PDF 表格只是位于特定坐标处的文本,并在文本附近绘制了水平线和垂直线。转换器必须根据文本块之间的间距、行间文本的对齐方式或绘制线条的位置来推断列边界。当数字列很窄并且相邻列中的数字靠得很近时,转换器可能会将它们合并为一个更宽的列,将两个数字作为一个文本字符串读取。转换器看到连续的水平运行的数字,但无法判断原始布局中分栏符的位置。

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

为什么相邻的数字列特别容易合并

PDF 表格中的数字列往往很窄,因为数字很短。货币值列可能包含诸如“1,250.00”之类的条目。或“42.50”,很少超过 12 个字符。并排的两个窄数字列,例如“单价”和“扩展价格”,它们之间通常只有几个空白点。如果转换器的列分割算法使用大于列之间实际间隙的最小间隙阈值,则它将两列视为一列并连接它们的值。

右对齐数字使问题变得更加复杂。在格式良好的 PDF 表格中,数字列右对齐,因此每行中的数字在相同的水平位置处结束。 A 列中右对齐数字的末尾与 B 列中左对齐数字的开头之间的间距可以小至几个点。 PDF 的目视检查显示出明显的间隙,但转换器的算法可能需要更大的间隙才能自信地识别列边界,将狭窄的空间视为正常的字间距而不是列分隔符。

负数和括号表示法会出现相关问题。显示为“(1,250.00)”的值可以被显示为“(1,250.00)”。包括括号和逗号,转换器可以将其解释为多个单独的标记。左括号与前一列关联,数字部分放置在当前列中,右括号被删除或附加到下一列。结果是一个包含部分数据的单元格,需要大量的手动清理。使用欧洲数字格式的表格(其中逗号是小数分隔符,句点是千位分隔符)进一步混淆了采用美国数字格式的转换器。

WukongPDF

尝试 PDF 转 Excel

无需安装。直接在您的浏览器中工作。

立即开始 →

如何在转换前识别问题表

转换之前,打开 PDF 并放大表格区域。查找一列最右边的字符与下一列最左边的字符之间的间距在视觉上很小(大约小于一个字符宽度)的列。这些是在转换过程中最有可能合并的列。如果您看到列间距如此紧密的表格,请计划在转换后进行手动更正或考虑替代提取方法。

还要检查使用前导点的表格,即连接左对齐项目名称和右对齐价格的句点行。引导点位于列之间的空间中,经常被误读为数据而不是视觉格式。将前导点视为内容的转换器将生成只包含句点的列,或者会错误地拆分表,因为它无法区分前导点和数据。具有跨越多列的合并标题单元格的表格是另一个麻烦点。转换器在标题行中看到较宽的文本块,可能无法将其正确映射到下面较窄的数据列。

对于准确性至关重要的关键数据,使用专用表格识别软件提取 PDF 数据提取比通用 PDF 到 Excel 转换更可靠。专为表格设计的数据提取软件使用多个信号、文本位置、字体规格、行位置和行间对齐一致性,来构建更准确的列模型。当替代方案是对每个转换后的表进行数小时的手动 Excel 清理时,专用提取软件的额外成本是合理的。

合并列的手动更正策略

当合并列不可避免时,Excel 的文本到列功能是最快的更正工具。选择合并的列,打开“数据”、“文本到列”,然后选择“分隔”。如果合并的值始终由空格分隔,请选择空格作为分隔符。如果它们由可变数量的空格分隔,请选择“固定宽度”并手动将分栏线放置在两个值之间。 Excel 在应用拆分之前会对其进行预览,因此您可以调整分隔位置,直到所有行的拆分都正确。

对于没有任何分隔符的合并值,例如“12503780”其中分割应在“1250”和“1250”之间。和“3780”,文本到列无济于事,因为没有分隔符可以分割。您需要知道每列的预期宽度。如果第一列始终包含四位数字,第二列始终包含四位数字,请使用 Excel 的 LEFT 和 RIGHT 函数以及已知的字符计数将值提取到单独的列中。此方法仅在列宽固定且一致时才有效,这在从具有固定字段宽度的数据库系统导出的表中很常见。

WukongPDF 通过列检测将 PDF 表格转换为 Excel,分析文本对齐方式、间距和行位置,以识别列边界,即使在间距紧密的数字表格中也是如此。转换保留数字格式,以便提取的值可立即用于计算,无需手动清理。对于无法自动列检测的复杂表,请考虑使用基于 OCR 的方法作为替代路径。捕获 PDF 表格的屏幕截图,通过具有表格识别功能的 OCR 工具运行它,并将识别的表格导出到 Excel。包含表格结构检测的现代 OCR 引擎在列分离方面通常比传统的 PDF 到 Excel 转换器更可靠,因为它们直接分析视觉布局。

WukongPDF

尝试 PDF 转 Excel

无需安装。直接在您的浏览器中工作。

立即开始 →