Tips & Tricks

如何通过检测条形码分隔页来分割 PDF

批量文档扫描会生成一个包含数百个单独文档的大型 PDF,每个文档与下一个文档之间仅通过条形码页面分隔开。条形码(通常是打印在空白纸上的 Code 39 或 Code 128 符号)充当机器可读的分隔符,告诉自动化系统一个文档的结束位置和下一个文档的开始位置。通过检测这些条形码分隔页来拆分 PDF 需要具有条形码识别功能的Split PDF工具,该工具可读取每个页面,识别哪些页面包含条形码,并使用这些页面作为分割点将文档分隔为其组成文件。

How to Split a PDF by Detecting Barcode Separator Pages

条形码分隔页在文档扫描中的工作原理

在扫描大量纸质文档之前,会将条形码分隔页放置在堆栈中每个单独文档的顶部。扫描仪将整个堆栈作为一项连续作业送入,生成一个可能长达数千页的 PDF。条形码表分布在整个 PDF 中每对原始文档之间的边界处。每个条形码都编码可识别其后内容的信息:文档类型代码、案例编号、员工 ID 或文件参考。

条形码不需要对人类具有视觉意义。它是一种机器可读的数据载体,以不同宽度的垂直条图案印刷。 PDF Batch处理工具读取条形码值并使用它来确定分割点以及(可选)提取文档的文件名。编码值 INV-2026-0047 的分隔页条形码告诉拆分器在此页面开始一个新文档并将输出文件命名为 INV-2026-0047.pdf。

WukongPDF

尝试拆分 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

准备 PDF 以进行基于条形码的分割

在运行拆分之前,请验证 PDF 中的每个分隔页都包含打印清晰、未损坏的条形码。弄脏、被订书钉孔部分遮挡或以一定角度打印的条形码可能无法正确识别,从而导致分割器错过分割点或读取错误的值。快速滚动 PDF 并检查分隔页的随机样本。条形码应使用深黑色墨水打印在干净的白纸上,四面至少留有四分之一英寸的空白。

确认条形码页面是每个文档的第一页,而不是前一个文档的最后一页。这种约定在文档扫描中几乎是通用的,因为它意味着条形码值描述了后面的文档。如果 PDF 中的条形码页面被放置为每个文档的最后一页,则大多数条形码分割工具都有一个设置可以对此进行调整,但默认假设是条形码位于每个新文档的第一页上。

选择支持条形码识别的工具

按页数或书签划分的标准 PDF 分割器无法检测条形码,因为条形码识别需要对页面图像进行光学分析。寻找明确将基于条形码的分离列为一项功能的文档捕获或企业内容管理工具。 Adobe Acrobat Pro 在其用于文档处理的操作向导中包含条形码识别。具有条形码检测功能的基于浏览器的Split PDF平台处理识别服务器端并将分割文件作为可下载的存档返回。

对于定期处理条形码分隔 PDF 的组织来说,Kofax、Ephesoft 或 Abbyy FlexiCapture 等专用文档捕获软件可提供最可靠的条形码识别。这些工具专为大容量文档分离而设计,包括条形码验证规则、不可读条形码的异常处理以及与文档管理系统集成等功能。 WukongPDF 和类似平台提供基于浏览器的拆分,无需安装企业软件即可访问。

配置条形码识别设置

大多数条形码分割工具要求您在处理之前指定条形码类型。文档扫描中最常见的两种类型是 Code 39,它对字母数字字符进行编码,广泛用于法律和医疗记录;Code 128,它对完整的 ASCII 字符集进行编码,并为相同的数据生成更紧凑的条形码。在工具设置中选择正确的条形码类型。选择错误的类型会导致所有条形码无法识别,并且该工具将报告未找到分割点。

有些工具提供条形码方向设置。分隔页上的条形码通常水平打印,但如果页面以横向方向送入扫描仪,或者条形码沿页面边缘垂直打印,则识别引擎需要知道扫描哪个方向。如果可用,请将方向设置为“自动”,这会告诉引擎检查每个页面的所有四种可能的旋转。

使用条形码值命名输出文件

每个分隔页上的条形码值可以充当分割触发器和输出文件名的双重职责。配置拆分工具以使用条形码值作为分隔符后面的文档的文件名。条形码值为 CASE-0042-HARRIS 的分隔符会生成一个名为 CASE-0042-HARRIS.pdf 的输出文件,其中包含从该分隔符到(但不包括)下一个分隔符页的所有页面。

如果条形码值不遵循文件命名安全格式,例如包含空格、特殊字符或文件名中的非法字符,请配置该工具以清理这些值。大多数工具会自动用下划线或连字符替换空格,并删除 Windows 或 macOS 文件系统不允许的字符。检查第一个分割作业后的输出文件名,以确认清理产生了可读、有用的名称,而不是不再传达原始含义的剥离字符串。

处理无法读取和丢失的条形码

没有一个条形码识别过程是完美的。弄脏的条形码、倾斜送入的页面以及扫描过程中意外遗漏的分隔页都会产生分割错误。配置工具异常处理以标记无法识别的页面,而不是默默地合并错过的分割点两侧的文档。该工具应生成一份异常报告,列出预期有条形码但未找到的每个页面,以及页码,如果可能的话,还包括页面图像的缩略图。

自动拆分完成后,查看异常报告并手动拆分该工具无法自动拆分的所有文档。打开原始 PDF,导航到标记的页码,确定应在何处进行拆分,然后使用 PDF 页面提取工具手动提取页面。对于少数错过的拆分,手动异常处理步骤需要几分钟的时间,而手动拆分批次中的每个文档则需要数小时。

对于未来的扫描项目,可以通过使用更高对比度的条码打印、将条码放置在远离扫描仪阴影可能遮挡的页面边缘的位置以及在将分隔页插入文档叠之前对分隔页运行预扫描质量检查来提高条码的可读性。

根据原始文档清单验证分割结果

自动条形码分割完成后,将输出文件的数量与预期文档计数进行比较。如果原始扫描项目记录了 247 个正在扫描的文档,则拆分应恰好生成 247 个输出文件。不匹配表示丢失分割点(其中两个文档合并为一个输出文件)或错误分割点(其中单个文档因其中一页上的某些内容被误认为是条形码而被分割)。

对于法律发现或医疗记录迁移等高风险拆分项目,请执行页数核对。所有输出文件的总页数应等于原始 PDF 的页数减去分隔页。即使一页的差异也意味着分割不完美,需要手动检查输出。

将分隔页另存为单独的 PDF,而不是丢弃它们。这些页面上的条形码值提供审核跟踪,将每个输出文件连接到其在扫描批次中的原始位置。如果几个月后出现有关特定文档的问题,分隔页存档会准确确认该文档的来源。

对于按计划运行的PDF批量分割操作,例如夜间处理多功能打印机扫描的文档,可自动执行从扫描到分割再到存档的整个工作流程。监视文件夹监视新的 PDF。当 PDF 到达时,条形码分割器会自动对其进行处理,并根据条形码值将分割后的文件存放到分类文件夹中。自动化将手动拆分任务转变为不需要人工关注的后台进程。

为新文档扫描项目选择条形码类型时,如果条形码值同时包含字母和数字,请选择 Code 128 而不是 Code 39。 Code 128 为字母数字数据生成更紧凑的条形码,这意味着可以在分隔页上将条形码符号打印得更小,而不会失去可扫描性。

对于长期PDF Batch项目,将条码规格和分割配置记录在与扫描文档一起存储的项目文件中。当几个月或几年后重新访问该项目时,文档会回答使用哪种条形码类型、条形码值代表什么以及如何配置拆分等问题。

当由于条码质量问题而需要用手动分离替换基于条码的PDF Batch分割时,所需的时间会急剧增加。在几分钟内自动拆分的批次可能需要数小时才能手动拆分。

WukongPDF

尝试拆分 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →