当每个文件以空白页或编号的章节标题开头时,将大型 PDF 拆分为单独的文档非常简单。当 PDF 中的文档仅通过视觉提示分隔时,挑战就完全改变了:带有公司徽标的封面、较大字体的标题表或人类可以立即发现但自动化工具难以检测的独特标题块。本文介绍了通过识别封面页和标题页来分割 PDF 的实用方法,从适合少量文档的手动方法到可扩展到数百页的半自动技术。

为什么文档批次的标准页数分割失败
答案在于文档的不同。
大多数 PDF 分割工具都遵循一个简单的原理:每隔 N 页或按您输入的特定页码分割文件。当批次中的每个文档具有相同的页数时,此方法有效。一叠单页发票在每个页面边界处都清晰地分开。三页合同的集合每隔三页均匀分割一次。但是,当文档长度不同时(几乎所有现实世界中的一批报告、应用程序或信件都是这种情况),页数拆分要么将文档切成两半,要么将一个文档的尾部与下一个文档的头部合并。
封面页和标题页是合并 PDF 中文档之间的自然边界,但它们是视觉边界,而不是结构边界。 PDF 将它们存储为与任何其他页面相同类型的页面对象。没有元数据标志表明此页面是封面或此段落是标题。必须告诉分割软件要查找什么,并且指令需要足够具体,以便软件能够将封面页与恰好包含大标题或徽标的常规内容页区分开来。
错误分割的后果不仅仅是不方便。将多页文档切成两半的拆分会产生两个不完整的文件,这两个文件本身都没有意义。合并两个文档的拆分会生成一个文件,其中读者在预期内容结束后立即看到其他人的信息。对于法律、医疗或财务文件,第二种情况是违反保密规定。正确分割对于可用性和合规性都很重要。
尝试拆分 PDF
无需安装。直接在您的浏览器中工作。
手动方法:用眼睛发现封面
对于最多大约二十个文档的批次,手动拆分通常比配置自动化解决方案更快。打开合并的 PDF 并滚动侧边栏中的页面缩略图。封面页和标题页在视觉上很突出,因为它们通常比其后面的内容页有更多的空白、更大的文本、徽标或不同的布局密度。单击每个文档的第一页,按住 Shift 键单击最后一页,然后将所选内容提取为新文件。
WukongPDF 的分割 PDF 工具提供了可视化页面选择器,使手动分割变得高效。您可以将所有页面视为缩略图,单击以标记每个封面页上的分割点,然后该工具会将每个片段提取为单独的、正确命名的 PDF。对于包含 15 个不同长度文档的 100 页文件,整个过程需要不到两分钟。可视化界面消除了对页码的猜测,并允许您在进行提取之前验证每个分割点。
手动拆分的一个有用习惯是:当您确定每个文档的页面范围时,请记下封面上的标题或参考号。使用它作为输出文件名。充满名为 split-1.pdf、split-2.pdf 的文件的文件夹仅比原始合并文件稍微有用一些。名为 Smith-Application.pdf、Jones-Contract.pdf 的文件可立即使用。
半自动分割:文本模式检测
自动化可扩展手动工作无法实现的范围。
当批次太大而无法手动拆分时,下一步是基于文本的检测。大多数具有批量分割功能的 PDF 工具都可以搜索特定的文本字符串,并在该文本出现时分割文件。如果每个封面页都包含一致的短语,例如“申请表”、“机密”、“第 1 页”或可预测格式的帐号,则该短语将成为拆分触发器。该工具扫描每个页面的文本层,当找到目标字符串时,它会在该页面之前插入一个分割点。
基于文本的分割的可靠性取决于两个因素。首先,触发文本必须出现在每个封面页上,并且永远不会出现在内容页上。像“第 1 页”这样的短语似乎是一个很好的触发器,直到文档的第 6 页也包含文本“请参阅第 1 页了解详细信息”。其次,PDF必须有文本层。没有 OCR 的扫描 PDF 将完全击败基于文本的分割,因为封面文本仅以像素形式存在,而不是以可搜索字符的形式存在。在拆分之前对合并文件运行 OCR 可以解决此问题,添加一个步骤但保留自动化。
结构检测:使用字体大小和页面密度
更先进的方法分析每个页面的视觉结构,而不是搜索特定文本。封面页和标题页往往具有与内容页明显不同的特征。由于标题周围有空白,文本密度较低。由于标题的原因,平均字体较大。该页面可以包含图像,例如徽标,其中内容页面仅为文本。可以测量这些属性的软件可以标记可能的封面页,而无需知道其中出现的单词。
此方法处理封面页措辞不同但布局一致的情况。一批客户报告,每个封面都写着“为[客户姓名]做好准备”,每个封面上都有不同的文字。基于文本的拆分失败,因为没有可搜索的公共字符串。基于结构的分割之所以成功,是因为每个封面都使用相同的模板、相同的字体大小和相同的徽标位置。一致性在于设计,而不是单词,结构检测可以捕获文本搜索遗漏的内容。
分割前准备文件以获得最佳结果
分裂前的一些准备步骤可以显着提高任何方法的成功率。首先,如果合并的 PDF 来自扫描仪,请运行 OCR 以创建可搜索的文本图层。即使您计划手动拆分,使用可搜索文本也可以让您通过搜索名称或参考号跳到特定页面,而不是滚动缩略图。其次,检查合并的文件是否包含任何不应拆分为单独文档的页面。传真封面、传送单和文档之间的空白分隔页应在拆分前删除,而不是变成自己的一页输出文件。
第三,以低变焦扫描文档,检查每个封面页是否使用相同的方向。一批纵向文档中的单个横向封面可能会导致拆分工具未对齐,特别是如果它使用基于页面尺寸的结构检测。在分割之前规范页面方向。这些步骤会在该过程的前面增加几分钟的时间,但可以防止在分割完成并且原始合并文件已被删除后发现误切文档的挫败感。 PDF 页面 的准备工作会带来干净、准确的输出文件,无需手动清理。
分割期间系统地命名输出文件
拆分合并的 PDF 的价值不仅在于分离页面,还在于生成可立即识别的输出文件。在拆分过程中应用精心策划的命名约定可以使接收者无需打开每个文件来发现其内容。如果封面包含一致的元素(例如发票编号、客户名称或文档参考代码),请在拆分过程中提取该数据并将其用作文件名。大多数支持基于文本的检测的拆分工具还支持使用检测到的文本作为输出文件名,将一批通用拆分文件转换为正确标记的文档集。
对于封面页不共享通用文本模式的批次,请在开始拆分之前建立命名约定。像 ClientName-DocumentType-Date.pdf 这样的格式在所有输出文件中一致应用,可以从以前不透明的合并文件创建一个可排序、可搜索的文档库。每个文件的命名步骤只需几秒钟,并增加了持久的组织价值。包含名称良好的各个 PDF 的文件夹是一个可用的文档存档。一个包含按顺序编号的分割文件的文件夹是一个稍后必须解决的难题。仅当每个输出文件都正确命名和组织时,PDF Batch 分割过程才算完成。
学习通过封面检测分割 PDF 所花费的时间在超出初始用例的许多文档类型上都得到了回报。法律文件包、发票批次、学生记录集、医疗记录汇编和合同集都遵循相同的混合文档模式,由可识别的首页分隔。一旦您为一种文档类型建立了可靠的拆分工作流程,只需识别新封面的独特特征即可将其适应另一种文档类型。技能可以快速从一种文档类型转移到另一种文档类型,并且成功处理每个新批次都会提高效率。
尝试拆分 PDF
无需安装。直接在您的浏览器中工作。
