Tips & Tricks

如何拆分扫描的批量 PDF,使每个物理文档成为其自己的单独文件

您将一叠五十张发票放在带有自动文档进纸器的文档扫描仪上。扫描仪生成一个 PDF,其中按顺序包含所有 50 页。现在,您需要将每张发票作为单独的 PDF 文件,并按发票编号命名。手动将 50 页的 PDF 拆分为 50 个单独的文件,打开每个文件,并使用正确的名称保存,需要一个小时的繁琐工作。批量分割工具可以自动检测文档边界并命名输出文件,并在几秒钟内完成相同的工作。

扫描批次的分割 PDF 挑战是扫描仪看到的是单独的页面,而不是单独的文档。对于扫描仪来说,一张十页发票看起来就像十张单独的单页发票。拆分工具必须分析页面内容以确定一个文档的结束位置和下一个文档的开始位置。此分析使用页面内容模式、空白分隔页、条形码或一致的页数来识别文档边界。

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

批量扫描仪如何生成多文档 PDF

自动文档进纸器按顺序处理页面。每个页面都会通过扫描仪并附加到单个输出 PDF 中。扫描仪不知道也不关心第一页到第三页是发票 A,第四页到第五页是发票 B,第六页到第八页是发票 C。它只在单个文件中生成第一页到第八页。

某些扫描仪支持分隔页,即在文档之间插入空白页,以指示扫描仪开始创建新的 PDF。但大多数扫描工作流程都会跳过分隔页,因为它们会减慢扫描过程。结果是一个包含多个串联在一起的文档的PDF Batch文件。

这种方法将数小时的手动工作变成了数秒的自动化处理。

双面扫描会使问题变得更加复杂。十页文档扫描双面打印会生成二十个 PDF 页,每个物理页变成两个 PDF 页。拆分工具必须了解第一页和第二页属于同一文档,即使它们显示为单独的 PDF 页面。

WukongPDF

尝试拆分 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

检测扫描批次中的文档边界的方法

页数一致性是最简单的检测方法。如果批次中的每个文档都具有相同的页数,则拆分工具会将总页数除以文档页数,并在这些边界处进行拆分。来自同一供应商的发票通常具有一致的页数。该方法不需要内容分析。

空白页检测可识别有意插入文档之间的分隔页。扫描批次中的空白页表示文档边界。拆分工具会删除空白分隔页,并在空白页位置将剩余页面拆分为单独的文档。

内容模式检测是最复杂的方法。拆分工具会查找指示新文档开始的重复模式。发票通常以供应商徽标、地址和发票号码开头。表单以标题和日期字段开始。报告以封面页开始。该工具可识别这些模式并将每次出现的情况标记为文档边界。

条形码检测可识别带有打印条形码的分隔页。每个文档第一页顶部的条形码对文档 ID 进行编码。拆分工具读取条形码,使用编码值命名输出文件,并在每个条形码出现时进行拆分。这种方法在医疗保健、法律和财务文档处理中很流行。

使用具有文档检测功能的拆分工具

WukongPDF 通过浏览器提供扫描的 PDF 处理,包括将多文档扫描批次拆分为单个文件的功能。拆分工具可以使用内容模式或指定的页数来检测文档边界。

分割之前,预览批次以验证页面顺序和方向。颠倒或无序扫描的页面将产生顺序不正确的输出文件。大多数拆分工具都包含页面预览和重新排序功能,用于在拆分之前纠正扫描错误。

根据检测到的内容配置输出文件命名。如果拆分工具可以从每个文档的第一页读取发票编号或文档 ID,请使用该值作为输出文件名。如果基于内容的命名不可用,请使用带有描述性前缀的顺序编号。

验证分割精度

分割后,验证前几个和后几个输出文件。打开第一个输出文件并确认它包含正确的页面。打开最后一个输出文件并确认它包含该批次的最后几页。从批次中间抽查文件。这些检查在分发文件之前捕获边界检测错误。

将所有输出文件的总页数与原始批处理页数进行比较。如果总和匹配,则每个页面都被分配给一个输出文件。如果总和较低,则在拆分过程中页面会丢失。如果总和较高,则页面被重复。

对于文档边界不明确的批次,使用需要更强边界证据的保守设置运行拆分。保守的拆分可能会将某些文档合并在一起,而不是将单个文档错误地拆分为多个文件。合并后的文档可以手动拆分,其风险比单个文档的碎片要低。

自动化拆分和命名工作流程

对于重复的批量扫描和分割,自动化工作流程。将分割设置、边界检测方法和输出命名约定保存为配置文件。每个后续批次均使用相同的配置文件进行处理,从而产生一致的输出。第二批后恢复初始设置时间。

通过配置输出命名以匹配系统预期格式,将拆分输出与文档管理系统集成。拆分期间提取的与文档管理系统命名约定相匹配的文档 ID 允许自动摄取,无需手动重命名。

扫描批次中的文档分离是大量处理纸质文档的行业的常见需求:医疗保健处理患者记录、法律流程案例文件、会计流程发票和政府流程应用程序。每个行业都有自己的文档类型、页数和边界模式。

条形码分隔纸是大批量扫描操作最可靠的方法。从文档管理系统打印条形码表,在扫描前将其放在每个文档的顶部,分割工具读取条形码以识别文档边界并命名输出文件。条形码消除了文档开始和结束位置的歧义。

光学标记识别可以识别每个文档首页上指示文档类型或优先级的复选框或实心圆圈。拆分工具读取这些标记,并根据识别的类型将文档路由到不同的输出文件夹。

应测量和监控自动文档分离的准确性。一批 500 个文档,分离精度为 99%,但仍然会产生 5 个错误分割的文档,需要手动更正。跟踪一段时间内的错误率,以确定产生较高错误率的文档类型或扫描条件。

对于文档边界不一致的批次,扫描和分割之间的人工审核步骤可以捕获自动检测遗漏的边界错误。审阅者在页面查看器中扫描批次,确认或调整检测到的边界,然后触发自动拆分。

分割后的输出文件格式可以包括用于存档的 PDF/A、用于分发的压缩 PDF 或用于进一步图像处理的 TIFF。根据下游使用的分离文档配置输出格式。

将分割工作流程与文档管理系统集成,创建从纸张到可搜索存档的无缝管道。扫描仪生成批量 PDF,拆分器将其分成单独的文档,OCR 使它们可搜索,文档管理系统对它们进行索引以供检索。

基于云的拆分服务提供与桌面工具相同的功能,并具有可从任何设备访问的优势。扫描的批量 PDF 将被上传、处理,并且各个文档将作为单独的文件返回。使用云服务处理敏感文档时,需要考虑数据隐私问题。

分割输出文件的命名约定应该一致且可排序。像 YYYY-MM-DD_DocumentType_SequentialNumber 这样的格式会生成按时间顺序排序并按文档类型分组的文件名。一致的命名可以实现下游系统的自动化处理。

拆分包含混合文档类型的批次时,拆分工具可以根据内容识别将不同的文档类型路由到不同的输出文件夹。发票转到会计文件夹,合同转到法律文件夹,信件转到记录文件夹。

如果对分割文档运行 OCR,则扫描页面的分辨率会影响 OCR 准确性。以至少 300 DPI 扫描拆分后将进行 OCR 处理的文档。

一些拆分工具可以在拆分输出旁边生成清单文件。清单列出了每个输出文件名、源页面范围以及拆分期间提取的任何元数据。清单支持质量保证和文档跟踪。

与手动拆分相比,自动批量拆分节省的时间与批量大小成正比。手动拆分一批 50 个文档需要大约 50 分钟的重复工作。同一批的自动拆分需要大约 30 秒的配置和处理时间。

扫描分辨率会影响分割精度和输出文档质量。更高分辨率的扫描可生成更清晰的文本,从而改进基于内容的边界检测。代价是处理过程中文件大小较大。出于分割目的,200 DPI 通常足以进行精确的边界检测。

检测方法工作原理最适合准确度
页数一致性将总页数除以已知文档长度同一来源的统一文件已知页数较高
空白页检测识别空分隔页带分隔符的扫描批次如果空白页确实是空的则高
内容模式识别重复出现的标题模式发票、表格、报告中高;取决于模式一致性
条码识别读取每个文档首页上的条形码医疗保健、法律、财务文件非常高;条形码明确
WukongPDF

尝试拆分 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →