当您将 PDF 中的表格数据提取到 Excel 中时,行按照它们在页面上出现的顺序到达。如果您需要将这些行按类别分类到单独的工作表中,例如按地区分组的销售记录或按供应商分组的发票,则手动剪切和粘贴方法适用于十行,但对于数百行则变得不切实际。问题是PDF到Excel转换工具是否可以在提取过程中自动对数据进行排序和分类,或者是否需要在数据到达Excel后处理排序。
要点
标准 PDF 到 Excel 转换不会对数据进行排序或分类。它按页面顺序提取行并将它们放置在单个工作表中。按类别值自动分类为单独的工作表需要转换后 Excel 宏、Power Query 转换或具有内置分类逻辑的高级提取工具。最佳方法取决于分类是一次性任务还是重复工作流程。

标准 PDF 到 Excel 转换可以做什么和不能做什么
标准转换工具读取 PDF 页面的视觉布局,通过检测网格线和对齐的文本块来识别表格结构,并将检测到的单元格映射到 Excel 单元格。输出保留原始表的行顺序和列结构。这是PDF的忠实复制,但不是数据处理。该工具不会读取单元格的内容来理解数据的含义。包含“West”的行是在“地区”列和包含“东部”的行中被相同地提取。该工具没有机制来检测这些行是否属于不同的类别。
一些高级提取 PDF 数据工具不仅限于视觉提取,还应用模式识别来识别表中的类别字段。这些工具可以配置有这样的规则:实际上,“扫描提取的数据的C列,识别该列中的唯一值,并为每个唯一值创建单独的输出。”这不是标准的 PDF 转换。它是一种专门的数据提取功能,位于 OCR、表格识别和数据转换的交叉点。如果您的工作流程需要这样做,请寻找在其功能列表中明确宣传数据分类或数据分组的工具。
尝试 PDF 转 Excel
无需安装。直接在您的浏览器中工作。
使用 Excel 宏和 Power Query 进行转换后排序
对于喜欢完全避免宏和 Power Query 的用户来说,Excel 的内置筛选和排序功能与手动工作表创建相结合是处理中等大小数据集的有效方法。将筛选器应用于类别列,一次选择一个类别值,复制筛选后的行,然后将其粘贴到新工作表中。对于具有 5 个类别和 200 行的数据集,此手动方法大约需要 5 分钟,并且除了基本的 Excel 导航之外不需要任何设置或技术知识。
应用最广泛的方法是将整个 PDF 表格转换为单个 Excel 工作表,然后使用 Excel 的内置工具对数据进行排序和拆分。一个简单的 VBA 宏可以读取指定列中的唯一值,为每个唯一值创建一个新工作表,并将匹配的行复制到相应的工作表中。该宏只需不到一分钟的时间即可在具有数千行的数据集上运行,并完全按照指定执行分类,而不会出现自动模式识别的歧义。
Power Query 为熟悉 Excel 数据转换工具的用户提供了一种无宏的替代方案。通过“数据”选项卡将转换后的数据加载到 Power Query 中。使用分组依据功能按类别聚合行,或筛选每个类别值的数据并将每个筛选结果加载到单独的工作表中。 Power Query 转换是可重复的:保存查询,下次转换类似结构的 PDF 时,刷新查询以将相同的排序逻辑应用于新数据。对于重复工作流,Power Query 比 VBA 宏更易于维护,因为转换步骤在查询编辑器中可见,并且无需阅读代码即可进行调整。
设置重复 PDF 导入的自动分类
在为定期 PDF 导入构建 Power Query 转换时,请使用 PDF 文件名作为查询参数,以便相同的查询适用于新文件而无需修改。在 Power Query 编辑器中,创建一个名为 FilePath 的参数并在数据源步骤中引用它。每次收到新的 PDF 时,请更新 FilePath 参数以指向新文件并刷新。整个转换(包括基于类别的排序和工作表拆分)会在新数据上自动运行。
如果您定期收到类似结构的 PDF 表格,例如每周销售报告或每月发票批次,请投入时间设置可重复的工作流程。首先将一份代表性 PDF 转换为 Excel。打开 Power Query 并记录一个转换,该转换可根据您的需要精确筛选、排序和拆分数据。保存查询。对于后续 PDF,请转换为 Excel、打开工作簿并刷新查询。查询到位后,从 PDF 到达到分类 Excel 数据的整个过程只需不到两分钟。
对于每天涉及数十个 PDF 的大容量工作流程,请考虑使用专用的数据提取平台,通过 API 将 PDF 转换连接到电子表格输出。这些平台允许您定义提取模板,指定哪些列包含类别数据以及如何拆分输出。该模板配置一次并自动应用于每个传入的 PDF。具有此功能的平台包括企业文档处理服务和一些基于云的 PDF API 提供商。 WukongPDF 的 PDF 到 Excel 转换可生成干净、结构化的表格输出,可用于 Power Query 转换,并具有一致的列映射,使跨批次的相似文档的自动分类变得可靠。
当手动分类仍然是最佳选择
当自动化处理常规情况而手动审核处理边缘情况时,混合工作流程会非常有效。设置 Power Query 以自动将类别列包含标准值的行排序到指定的工作表中。任何具有非标准或空白类别值的行都会路由到“审核”工作表,人们可以在其中确定正确的分类。这种方法可以最大限度地提高自动化覆盖范围,而无需强迫系统对不明确的数据进行猜测。
自动化并不总是正确的答案。如果您收到少量 PDF,其表格的结构各不相同,则配置宏或 Power Query 所花费的时间可能会超过手动对数据进行排序所需的时间。对于少于 50 行的一次性任务,选择每个类别的行并将其剪切并粘贴到新工作表中需要几分钟,并且不需要任何设置。盈亏平衡点通常是同一文档结构出现三次左右。如果您将对同一类型的 PDF 执行相同的分类三次或多次,那么自动化就会带来回报。
当类别逻辑需要人类判断时,手动分类也有意义。具有诸如“West”之类的值的“Region”列“东方”,和“中央”对于自动分割来说很简单。注释列的类别是由文本描述的内容暗示的,例如根据措辞而不是标准化代码区分紧急和非紧急项目,需要人类读者。没有任何自动化工具可以根据细致入微的非结构化文本可靠地对数据进行分类。在这些情况下,请将所有数据提取到一张表中并手动对其进行分类。
常见问题
如果 PDF 表格跨越多个页面且标题行重复,该怎么办?当标题行在每页上重复时,大多数 PDF 到 Excel 转换器都会将其视为数据。转换后,您会发现标题文本在每个分页符处散布着数据行。使用 Excel 的筛选器选择并删除第一列包含标题文本的所有行。在运行任何排序或分类之前,必须执行此清理步骤,因为标题行可能会被错误分类为数据。
我可以将 PDF 表格数据拆分为单独的 Excel 文件而不是单独的工作表吗?
是的。 VBA 宏和 Power Query 都可以将每个类别的数据保存到单独的 Excel 工作簿,而不是同一工作簿中的单独工作表。在 VBA 中,使用 Workbooks.Add 和 SaveAs 方法。在 Power Query 中,将每个筛选结果加载到单独的连接,并将每个连接导出到其自己的文件。工作表和工作簿之间的选择取决于数据的分布方式。如果每个类别的数据交给不同的人,则单独的工作簿会更干净。
如果 PDF 表格合并了跨多个类别的单元格怎么办?
合并单元格是自动分类的一个已知问题。一个 PDF 表格,其中 Region 列使用合并单元格将多行标记为“West”将提取仅出现在组的第一行中的标签。排序之前,请填写类别列,以便每一行都有一个类别值。在 Excel 中,选择列,按 Ctrl+G,单击特殊,选择空白,键入 = 并按向上箭头,然后按 Ctrl+Enter。这将使用上面单元格中的值填充所有空白单元格。
OCR 准确性是否会影响基于类别的排序?
是的,显着。如果 OCR 误读“West”作为“西”或“VVest”,这些值在排序输出中成为单独的类别。转换后和排序前,请务必检查类别列中的唯一值。快速扫描类别列的数据透视表会立即发现 OCR 错误。在运行分类之前,手动或使用查找和替换过程更正错误。
尝试 PDF 转 Excel
无需安装。直接在您的浏览器中工作。
