将五个单独的 PDF 合并为一个组合文档会生成一个文件,该文件通常比各个文件的总和大得多。 2 MB 的报告、3 MB 的附录和 1 MB 的求职信合并为 12 MB 的组合文件,而不是预期的 6 MB。合并操作增加了开销:在源文件中多次嵌入重复的字体、每个源中出现的冗余图像数据(例如公司徽标)、从每个源文件的编辑历史记录中遗留下来的未使用对象,以及针对单个文件而不是针对统一组合文档进行优化的文件结构。
默认情况下,合并会使文件膨胀,因为合并工具优先考虑忠实保留每个源文件的每个字节,而不是生成有效的结构化输出。合并后的压缩会消除膨胀,而不会降低内部内容的质量,针对合并操作引入的特定类型的冗余。
在PDF压缩合并后减小文件大小需要进行合并后优化,针对合并操作期间引入的特定类型的膨胀:字体重复、图像冗余、孤立对象和结构效率低下。 WukongPDF 的减小 PDF 大小 工具通过针对这些冗余模式进行调整的设置来处理合并后压缩,并且以下步骤分别解决合并后膨胀的每个来源。

为什么合并会增加文件大小超过源的总和
当 PDF 合并工具合并文件时,它会处理每个源文件的内部结构并创建一个新的合并文档。膨胀的最重要来源是重复的字体数据。如果五个源文件中的三个是使用相同的企业字体(Arial、Times New Roman、Calibri)从同一 Word 模板创建的,则每个源文件独立嵌入这些字体文件的自己的完整副本。合并工具通常会保留所有嵌入的副本,而不是将它们合并到单个共享字体资源中。合并的 PDF 可能包含相同 Arial 字体数据的三个或四个完整副本,每个副本独立消耗 50-200 KB 文件空间,具体取决于字体的字形覆盖范围。
冗余图像数据是造成膨胀的第二个主要来源,其规模通常比字体重复更大。共享相同图像的源文件、每个信笺上的公司徽标、重复的页眉图形、标准页脚、每个证书上的认证徽章都带有这些图像的单独副本。合并工具不会跨源文件对图像进行重复数据删除,除非专门设计了合并算法中内置的图像级重复数据删除逻辑。组合文件将相同的徽标存储三到四次,每个实例独立地使用其完整图像数据。合并过程本身的结构开销增加了第三个膨胀源,因为新的文档目录、页面树、交叉引用表和组织对象在所有源文件的组合内容之上添加了元数据。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
运行合并后压缩阶段
Adobe Acrobat 的 PDF 优化器提供最彻底的合并后清理,无需编写脚本。打开合并的 PDF 并导航至“文件”、“另存为优化的 PDF”。在“图像”面板下,将彩色和灰度图像采样率降低至 150 DPI,这足以满足屏幕查看和大多数办公室打印的需要,同时可大幅减小嵌入照片和图形的数据大小,对于高分辨率图像,通常可减小 60-80%。在“字体”面板下,启用字体子集化以从嵌入字体中删除未使用的字形,仅保留文档中实际出现的字符,并丢弃完整字体文件包含的数千个未使用的字形。在“放弃对象”下,启用删除合并操作在新文件结构中留下的未使用对象、重复资源和冗余页面内容。
基于浏览器的压缩工具也可以有效地减少合并后的膨胀,尽管其控制粒度不如桌面工具。将合并的 PDF 上传到WukongPDF的压缩工具并选择中或高压缩设置。该工具通过比较内容哈希来识别和整合重复资源,将图像下采样到平衡的分辨率,并通过重写交叉引用表和删除孤立对象来简化文件结构。对于合并文档,基于浏览器的压缩过程后的大小减小范围通常为 30% 到 50%,具体减小量取决于合并引入的重复数据量以及压缩设置针对冗余的积极程度。
自动工具失效时手动删除重复字体和图像
当自动压缩由于工具缺乏字体或图像重复数据删除功能而无法完全解决合并后膨胀问题时,或者因为重复项不是完全匹配而是接近重复项而逃脱了基于哈希的检测时,手动干预可以恢复额外的空间。使用 Acrobat 的导出所有图像功能从合并的 PDF 中提取所有图像。通过比较文件大小、像素尺寸和视觉内容来识别重复图像。重新插入每个唯一图像的单个副本,并将 PDF 配置为在需要它的所有页面上引用该单个副本。
对于字体膨胀,最有效的手动方法是使用 PDF 打印机驱动程序将合并的 PDF 打印为新的 PDF,该驱动程序从可视输出创建新文件。打印到 PDF 过程会呈现屏幕上显示的所有页面,并使用一组字体资源创建新的 PDF,从而有效地将原始合并中的重复字体合并为一个统一的字体集。代价是打印的 PDF 可能会丢失原始合并文档中存在的交互元素、超链接、表单字段和书签,因此只有当视觉内容很重要且交互功能可消耗时,这种方法才适用。
| 膨胀源 | 合并如何创造 | 压缩修复 |
|---|---|---|
| 重复字体 | 多个源文件中嵌入相同的字体 | 字体子集化,或打印到 PDF 进行合并 |
| 冗余图像 | 多个来源中的相同徽标或图形 | 图像重复数据删除,或替换为单个共享实例 |
| 孤立对象 | 合并过程在文件结构中留下未使用的对象 | 丢弃 PDF Optimizer 中未使用的对象 |
| 文件结构未优化 | 合并文档缺乏结构优化 | 另存为优化 PDF 以重建交叉引用表 |
合并后压缩后验证质量
打开压缩的合并文件并滚动浏览每个页面以确认整个文档的视觉质量。检查源自不同源文件的页面是否具有一致的图像质量、字体渲染和颜色再现。请特别注意源文件加入的合并边界附近的页面,因为这些是最有可能出现压缩伪影的位置,因为每个源文件的内容可能对统一压缩设置有不同的响应。
将压缩版本的页数与原始合并版本进行比较,并确认压缩过程中没有页面丢失、重新排序或损坏。对合并文档中每个原始源文件的第一页、中间页和最后一页进行快速并排比较,可以发现最常见的压缩失败。确认文件大小的减少与所识别的膨胀成正比,对于具有中等冗余的合并文档,通常会减少 30-60%。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
