Others

为什么将 PDF 转换为 Excel 有时会在数据应在的位置产生空白单元格

您将 PDF 表格转换为 Excel,打开结果,然后盯着电子表格,其中应该包含数字的空单元格。原始 PDF 显然在这些位置有数据。您可以在屏幕上看到它。但 Excel 文件存在间隙、缺失值或整行缩减为空白。这是 PDF 到 Excel 转换过程中最令人沮丧的结果之一,因为问题出在哪里或如何修复并不明显。

根本原因通常不是转换工具本身。 PDF 存储表格数据的方式与转换引擎期望找到的内容不匹配。了解空白单元格的具体原因可以使问题变得可解决而不是神秘。

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

PDF 包含表格图像,而不是实际表格数据

这是 PDF 到 Excel 转换后出现空白单元格的最常见原因。如果 PDF 是通过扫描、屏幕截图或从光栅化其输出的应用程序打印到 PDF 来创建的,则您在页面上看到的表格是平面图像。没有底层数据单元,没有行和列结构,也没有转换工具可以解析的文本流。

当转换工具遇到基于图像的表格时,它有两种选择:运行 OCR 来尝试识别文本并重建表格结构,或者完全跳过图像,因为它无法解析图像。许多基本的PDF 到 Excel 转换器都采用第二条路径。他们提取他们能找到的真实数据,并留下基于图像的内容。结果是一个电子表格,表格图像所在的位置有空白单元格。解决方法是使用包含 OCR 的PDF 转换器,如WukongPDF,它可以识别图像中的文本并重建表格网格。转换不会是像素完美的,但数据将出现在单元格中,而不是消失在空白区域中。

WukongPDF

尝试 PDF 转 Excel

无需安装。直接在您的浏览器中工作。

立即开始 →

表格布局使用复杂的合并或嵌套单元格

即使表格由真实的文本数据组成,原始应用程序的结构方式也可能击败转换引擎。 Microsoft Excel、Google Sheets 和报告软件等应用程序通常创建具有合并单元格的表格(其中单个标题跨越多个列)、嵌套表格(其中一个单元格内部包含另一个迷你表格)或具有父子列分组的多级标题。

PDF 并不是为表示表格结构而设计的。它旨在将字符放置在页面上特定的 x,y 坐标处。 PDF 将表格存储为数千个独立的字符定位命令。转换引擎必须通过分析这些字符的空间排列来对表结构进行逆向工程。合并的单元使这种分析变得非常复杂。对于人类读者来说看起来像一个逻辑单元的内容在转换引擎看来就像跨越一个模糊区域的文本,该区域可能是一个宽单元或几个窄单元。当引擎猜测错误时,数据最终会出现在错误的列中、跨单元格拆分或由于引擎无法解决歧义而被省略。

对此没有完美的通用修复方法,因为当文档转换为 PDF 时,原始表格结构丢失了。如果您有权访问原始文件,直接从 Excel 或 Google Sheets 导出为 .xlsx 格式,而不是 PDF 到 Excel 转换,可以完美保留表格结构。如果 PDF 是您唯一的副本,那么具有高级表格检测功能的转换工具(可让您手动定义列边界或调整检测到的表格区域)为您提供干净恢复数据的最佳机会。

分隔符信息不一致或缺失

转换引擎通过分析字符组之间的水平间隙来检测列边界。如果两列非常接近,引擎可能会将它们合并为一列。如果列包含文本量差异很大的单元格,则引擎可能会在窄点处将该列拆分为多个列。这两个错误都会产生空白单元格,要么是因为本应填充两个单独列的数据被塞进了一列,使另一列为空,要么是因为虚拟列中断创建了不存在数据的单元格。

原始文档中带有空白单元格的表格会导致此问题的一个特别棘手的变体。如果原始表故意包含空单元格,则转换引擎会看到更大的间隙,并可能会移动其列边界检测,从而使间隙下方的每一行错位。第 3 行中的单个空白单元格可能会破坏第 4 行到第 50 行的整个列映射,从而产生一系列未对齐的数据,这些数据看起来像是转换失败,但实际上是源文档中的结构模糊。

如何在下次转换时最大限度地减少空白单元

一些实际的调整可以显着提高您的转换成功率。首先,始终使用支持表结构检测的工具,而不是通用的 PDF 到文本转换器。专为提取 PDF 数据设计的工具使用在表格布局上训练的算法,并产生比通用文本提取更好的结果。 WukongPDF 的 PDF 到 Excel 转换包括表格结构检测,可处理常见布局,包括合并单元格、多级标题和具有混合数据类型的表格。

其次,在转换之前检查 PDF。如果您可以使用 PDF 查看器从表格中选择并复制单个单元格或文本列,则该表格由真实文本数据组成,并且转换效果相当好。如果单击表格,整个内容突出显示为单个块,或者文本选择根本不起作用,则表格是图像,需要基于 OCR 的转换。

第三,准备好清理输出。即使是最好的转换工具也会生成需要一些手动调整的电子表格。检查每列的前几行以验证值是否位于正确的列中。当您可以在原始 PDF 中的该位置看到数据时,查找完全空白的列。这些迹象表明该工具错误识别了列边界。修复前几行中的列映射通常会在电子表格的其余部分中进行级联更正。

当转换持续产生空白单元格时该怎么办

如果您尝试了多种工具,并且转换过程始终在特定位置产生空白单元格,则问题可能出在 PDF 本身,而不是工具。表数据可以存储为矢量图形,其中数字被绘制为形状而不是编码为文本字符。这种情况最常发生在由较旧的 CAD 软件、专用报告工具或某些通过图形绘制命令而不是文本放置将输出呈现为 PDF 的企业资源规划系统生成的 PDF 中。在这些情况下,OCR 是唯一的选择,您应该手动检查和更正输出,因为矢量绘制表格数据的 OCR 本质上容易出错。

当自动转换反复失败时,最有效的后备方法是以高分辨率截取表格的屏幕截图,通过专门用于表格识别的专用 OCR 工具运行它,然后导出到 Excel。这个两步过程(屏幕截图然后 OCR)完全绕过 PDF 的内部数据表示,并将表格视为纯图像,具有讽刺意味的是,对于某些类型的格式错误的 PDF,这比尝试解析损坏或非标准的文本数据更可靠。

WukongPDF

尝试 PDF 转 Excel

无需安装。直接在您的浏览器中工作。

立即开始 →