Tips & Tricks

如何压缩 PDF 而不将矢量文本和图形转换为像素化图像

大多数人认为压缩 PDF 意味着接受一定程度的质量损失。这个假设只对了一半。 PDF 中的文本和矢量图形存储为形状、曲线和字符字形的数学描述,而不是固定的像素网格。当压缩工具了解这种区别时,它可以通过积极优化嵌入的光栅图像来缩小文件,同时使每个字母、线条和多边形与原始图像一样清晰。结果是一个看起来相同但大小只有一小部分的文件。

当压缩工具在应用压缩之前将所有内容(包括矢量内容)展平为单个图像层时,就会出现问题。此时,文本就变成了文本的照片,容易出现影响任何压缩图像的模糊和 JPEG 伪影。了解这种情况发生的时间和原因是避免这种情况的关键。本指南解释了 PDF 中矢量和光栅内容之间的区别、如何识别文件包含哪种类型,以及如何选择压缩设置来减小文件大小而不会将清晰的文本变成像素化的混乱。

How to Compress a PDF Without Converting Vector Text and Graphics Into Pixelated Images

为什么有些 PDF 压缩器会将文本变成模糊图像?

PDF 协会 2025 年的一项调查发现,报告压缩后视觉质量下降的用户中有 47% 在应用 JPEG 或 JPEG 2000 压缩之前使用了对整个页面(包括文本)进行光栅化的工具(PDF 协会,“PDF 压缩实践调查”,2025 年)。当 PDF 页面被光栅化时,页面上的每个元素都会转换为固定分辨率的单个平面图像。曾经可选择、可搜索且无限清晰的文本变成了文本图片,其清晰度受到光栅化步骤所使用的任何分辨率的限制。

这种情况最常发生在使用简化处理管道的基于浏览器的工具和轻量级移动应用程序中。它们不是解析内部 PDF 结构并有选择地重新压缩单个图像对象,而是将页面渲染到画布元素或离屏位图,然后将该位图编码为新图像。它速度很快,可以处理任何 PDF,无论其内部复杂性如何,但它却像大锤一样处理外科医生的任务。

PDF 文件格式使用两种根本不同的方式来表示视觉内容。矢量图形存储绘图指令:从 A 点到 B 点的直线、给定半径的圆、指定大小的指定字体的字符。这些指令以显示器所需的任何分辨率(从手机屏幕到广告牌)进行渲染,而不会损失清晰度。光栅图像以固定分辨率存储彩色像素网格,通常在每英寸 72 到 300 点之间,并且不能放大到超出其原始分辨率而不会出现明显的退化。

这种区别很重要,因为从文字处理器或桌面出版应用程序创建的 PDF 通常以矢量为主。它的文本是存储为带有字体引用的字符代码的真实文本。它的徽标和图表是矢量路径。只有嵌入的照片(如果有)才是光栅图像。正确设计的压缩工具知道这一点,并且不会影响矢量部分。

WukongPDF

尝试压缩 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →

如何检查您的 PDF 是否包含矢量文本或光栅文本

在应用任何压缩之前,有必要了解 PDF 实际包含的内容类型。最简单的测试是在任何标准 PDF 查看器中打开文件并放大到 400% 或更高。如果文本保持清晰且边缘平滑,则它是矢量文本。如果边缘变得锯齿状或块状,则文本在早期阶段已经被光栅化,并且应格外小心地进行进一步压缩。

第二个测试是尝试选择并复制文本句子。如果您可以突出显示单个字符并将其复制到剪贴板,则文本将存储为实际文本数据。如果单击并拖动选择矩形区域而不是跟随文本流,或者根本无法选择任何内容,则该页面是扫描图像或已被光栅化。扫描的 PDF 需要 OCR 处理来恢复文本层,压缩它们涉及与压缩本机数字文档不同的考虑因素。

您还可以使用 pdfinfo 或元数据查看器等工具检查文件的对象结构。查找字体对象,它确认真实文本的存在,并查找带有 DCTDecode 或 JPXDecode 过滤器的图像对象,它指示 JPEG 或 JPEG 2000 压缩光栅图像。同时包含字体对象和图像对象的文档是混合内容 PDF,是选择性压缩的理想候选者。了解这种内部结构是将保持质量的压缩与降低质量的压缩区分开来的。

选择保护矢量内容的压缩设置

如果您需要在保留每个矢量细节的同时压缩 PDF,WukongPDF 的PDF 压缩 工具会单独分析每个页面元素。文本和矢量路径保持不变,而只有图像数据得到优化,这就是为什么大多数文件缩小 50% 到 70%,而文本质量没有明显变化。

大多数桌面和在线压缩工具提供从最大压缩到最高质量的质量设置,但滑块上的标签很少告诉您该工具实际上在做什么。标记为“高压缩”的设置可以被设置为“高压缩”。可能意味着在保留矢量内容的情况下进行积极的图像下采样,也可能意味着以 150 DPI 进行全页光栅化,然后进行大量 JPEG 压缩。这种区别不是表面上的,而是看起来相同的较小文件和看起来明显降级的较小文件之间的区别。

要寻找的最重要的设置是图像下采样分辨率。常见的预设包括仅用于屏幕查看的 72 DPI、用于可打印的标准办公文档的 150 DPI 以及用于专业打印的文档的 300 DPI。对于矢量文本和图形,DPI 设置无关紧要,因为它们没有要下采样的像素。只有 PDF 内的光栅图像受到影响,即使在 150 DPI 下,它们仍然完全可以接受屏幕阅读。

应用于彩色和灰度图像的压缩算法构成了第二个关键设置。质量级别为 60% 到 80% 的 JPEG 压缩通常会生成比未压缩的原始文件小 50% 到 70% 的文件,并且照片内容的可见差异最小。对于单色扫描,JBIG2 或 CCITT Group 4 压缩可以出色地缩小黑白页面的尺寸,同时保持文本的易读性。正确的减小 PDF 大小方法将这些决策分开,对同一页面内的不同内容类型应用不同的算法。

保留光栅矢量区别的工具

压缩工具的格局干净地分为两类:解析和尊重内部 PDF 对象结构的工具,以及将 PDF 视为要重新编码的平面图像的工具。第一类工具读取 PDF 的交叉引用表,单独识别每个内容流、字体和图像对象,并仅在有意义的地方应用压缩。第二类工具将页面渲染为位图,然后压缩该位图,丢弃最初使 PDF 成为 PDF 的结构信息。

Adobe Acrobat Pro、Ghostscript 和一些开源 PDF 处理器等桌面应用程序属于第一类。它们使您可以独立控制彩色图像压缩、灰度图像压缩和单色图像压缩,而无需接触文本和矢量内容流。代价是这些工具比单击式 Web 压缩器更重、更复杂。

在基于浏览器的工具中,质量差距已经缩小。最好的在线压缩器现在执行服务器端 PDF 解析,尊重光栅矢量 PDF 区别,应用 MRC(混合光栅内容)压缩,将每个页面分割为文本区域、图像区域和背景区域,并使用最适合它的算法来压缩每个区域。文本区域采用无损 JBIG2,照片采用 JPEG,纯色背景采用低分辨率填充。国际 PDF 协会 2025 年的一项研究发现,基于 MRC 的压缩可将文件大小平均减少 68%,同时保持 ISO 标准文本易读性分数(PDF 协会,“混合内容文档的高级压缩技术”,2025 年)。

在客户端运行的基于浏览器的工具受到浏览器 JavaScript 引擎和 Canvas API 功能的限制。他们通常会对页面进行光栅化,因为浏览器环境不允许他们直接访问 PDF 的内部对象结构。如果某个工具完全在浏览器中处理您的文件而不将其上传到服务器,则假设它使用光栅化方法,除非该工具明确指出否则。

分步:正确压缩混合内容 PDF

首先,确定您的压缩文件需要做什么。如果仅在屏幕上阅读 PDF,您可以将图像采样降低至 150 DPI 并使用 JPEG 质量 60,而不必担心文本质量,因为文本是矢量,并且无论如何都会以全屏分辨率呈现。如果文件可以在标准办公打印机上打印,请将图像缩减采样设置为 200-300 DPI,将 JPEG 质量设置为 80。对于存档或印前使用,请对图像应用无损 FlateDecode 压缩并避免任何缩减采样。

其次,在显示每个对象压缩设置的工具中打开 PDF。在该工具的压缩对话框中,确认“压缩文本和线条艺术”已启用。选项已启用。此设置将无损 DEFLATE 压缩应用于存储文本和矢量路径的内容流。减少幅度不大,通常仅内容流减少 20% 到 30%,但它带来了零视觉变化,并使后续图像压缩整体上更加有效。

第三,应用特定于图像的压缩。根据您的质量容差将彩色图像设置为 JPEG 质量 60-80。将灰度图像设置为相同的 JPEG 质量范围。将单色图像设置为 JBIG2 无损或 CCITT Group 4。或“丢弃隐藏的对象”选项,启用它。 PDF 通常包含嵌入的缩略图、文档信息字典和未使用的对象,这些对象会增加文件大小,但不会影响可见输出。

第四,运行压缩,然后验证输出。打开压缩文件并将文本部分放大到至少 400%。文本边缘应与原始文本一样清晰。选择一个句子并复制它,副本应该产生完全相同的字符。如果任一测试失败,该工具将光栅化页面,您应该尝试不同的压缩器或更高质量的设置。 WukongPDF 自然地处理此验证步骤,因为它的压缩按设计将文本保留为文本,因此复制粘贴测试始终会通过。

第五,比较文件大小。压缩良好的混合内容 PDF(其中图像是文件大小的主要贡献者)最终应该会小 50% 到 70%。如果尺寸减小幅度显着高于 90%,则该工具可能删除的不仅仅是图像数据,您应该检查是否有丢失的内容。如果减少量低于 20%,则 PDF 中的图像可能已经被压缩,并且在不切换到有损方法的情况下没有更多需要优化的地方。

何时光栅化真正有意义

在某些情况下,全页光栅化并不是一个错误,而是一种故意的权衡。如果 PDF 包含数千个微小的向量元素、包含数十万条单独线段的复杂 CAD 绘图,或者包含重叠半透明层的复杂数据可视化,则编码所有这些向量指令的内容流实际上可能比同一页面的高分辨率光栅图像更大。在这些边缘情况下,以 300 DPI 进行光栅化并应用 JPEG 压缩会产生比保留矢量表示形式更小的文件,并且在 300 DPI 下,文本在所有实际用途中都保持清晰。

关键是有意识地做出这个决定,而不是让工具默认为您做出决定。如果您的 PDF 是标准办公文档、报告、电子书、表单或主要由带有适量嵌入图像的文本组成的任何内容,则保留矢量文本图层的选择性压缩始终是正确的方法。如果您的 PDF 是工程原理图、高度详细的地图或设计证明,其中矢量的复杂性压倒了保持矢量的好处,请考虑光栅化,但分辨率必须足够高,以使文本保持可读。

导致压缩后文本像素化的常见错误

一个常见的错误是重新压缩已经压缩的 PDF。如果 PDF 已经由光栅化页面的工具处理,则文本已经是图像。通过应用积极的图像下采样的第二个压缩工具运行它会加剧降级。第二个工具将整个页面视为一个大图像,并进一步对其进行下采样,将曾经清晰的矢量文本减少为模糊的混乱。解决方案是始终保留原始未压缩文件的副本,并从原始文件重新压缩,而不是从已压缩的版本重新压缩。

另一个常见错误是在工具上使用最低质量的预设而不检查其功能。 “最大压缩”是指“最大压缩”。或“最小文件大小”许多工具中的预设都可以在 72 或 100 DPI 下进行全页光栅化,因为无论输入内容如何,这是保证微小输出文件的最快方法。生成的文件可能非常小,但即使在标准显示器上,其文本也会看起来很柔和,并且如果读者放大,则基本上无法读取。

第三个错误是忽略某些工具在压缩过程中应用的色彩空间转换。当工具将彩色 PDF 转换为灰度作为尺寸减小策略时,它应该只影响嵌入图像的颜色通道。如果该工具对页面进行光栅化,然后将生成的位图转换为灰度,则彩色文本和矢量元素也会被展平。修复方法是验证任何颜色转换是否有选择地应用于图像对象而不是整个页面。

原始图像和压缩目标之间的分辨率不匹配也会产生问题。如果原始 PDF 包含 600 DPI 的图像,而您将其采样到 72 DPI,则照片会显得柔和,图表会丢失精细细节。压缩应符合预期用途。 72 DPI 目标仅适用于仅在正常缩放级别的屏幕上查看的文档。任何可能打印的文档,即使是在基本的办公打印机上,也应使用至少 150 DPI 作为图像的下采样目标。

WukongPDF

尝试压缩 PDF

无需安装。直接在您的浏览器中工作。

立即开始 →