压缩扫描的 PDF 后,文件大小从 15 MB 降至 2 MB。数字看起来很棒。然后你打开压缩文件,原来清晰锐利的文本现在看起来柔和、模糊,而且有点失焦。压缩有效,但对文本的影响太大,文档比以前更难阅读。
这是最常见的压缩问题,发生这种情况是因为大多数压缩工具将整个页面视为单个图像。他们无法区分需要保持清晰的文本和可以承受更重压缩的背景或照片。在压缩过程中保持文本清晰度需要了解哪些设置会影响文本的易读性,并选择一种压缩方法来优先考虑人们实际需要阅读的文档部分。

为什么压缩首先会模糊文本
PDF 压缩的工作原理是降低文件中嵌入的图像的分辨率。对于扫描的 PDF,每一页都是图像,包括文本。当压缩引擎将该页面图像从 300 DPI 重新采样到 150 DPI 时,它会丢弃每个维度的一半像素,每四个像素中仅保留一个像素。字母形状的精细边缘、小写“t”的细水平笔画、区分“c”和“c”的微妙曲线来自“e”所有这些都依赖于那些被丢弃的像素来看起来清晰。在 150 DPI 下,原始扫描中 50 像素高的 12 点字符现在为 25 像素高。在 100 DPI 时,其高度约为 17 像素。在 72 DPI 下,它的高度约为 12 像素,勉强够渲染一个可识别的字母。
下采样算法的类型也很重要。双三次下采样通过平均周围像素来计算新的像素值,保留照片中的平滑渐变,但柔化字母形式的硬边缘。二次采样从每个块中选取一个像素并丢弃其余像素,可以更好地保留边缘清晰度,但会引入锯齿状伪影。对于文本较多的文档,分辨率太低的双三次下采样会产生人们抱怨的软弱、模糊的文本。更好的方法是选择更高的目标分辨率,文本最小为 150 DPI,或者使用可以区别对待文本和图像的压缩方法。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
为文本较多的文档选择正确的压缩设置
对于优先考虑文本易读性的扫描文档的PDF 压缩,一些特定设置可产生一致的良好结果。将目标分辨率设置为 150 DPI。这样可以保留足够的像素密度,使 10 点文本保持清晰,同时仍可减少 50% 到 70% 的文件大小。对于将在屏幕上阅读的文档,请勿将 DPI 降至 150 以下。在 100 DPI 下,10 点文本变得明显柔和。在 72 DPI 下,即使是 12 点文本也开始质量下降。
为黑白文本页面选择 JBIG2 压缩。 JBIG2 专为单色文档图像而设计,在文本上实现比 JPEG 更好的压缩比,同时保持字符清晰度。它的工作原理是识别重复出现的模式,即字母“e”的每个实例。看起来几乎相同,并且将每个模式存储一次。这对于打字文档来说是理想的选择。对于混合文本与照片或颜色元素的页面,请使用具有中等到高质量设置的 JPEG2000。 JPEG2000 比标准 JPEG 能更好地处理混合内容,并且在相同压缩比下引入的可见伪影更少。
如果您的工具支持,请启用 MRC(混合光栅内容)压缩。 MRC 将每个页面分为多个层:保持高分辨率以提高清晰度的文本层、更积极压缩的图像层和背景层。压缩引擎使用的这种基于图层的方法可以保留文本清晰度,同时仍然实现显着的总体尺寸减小。文本保持清晰,因为它是采用无损或接近无损的方法压缩的,而背景和图像吸收了大部分压缩。
提交前测试压缩结果
压缩后,打开压缩文件并与原始文件进行并排比较。缩放至 100% 并比较同一段落的文本。看一下小写字母“e”, “一”,“一”。和“s”。它们具有最精细的细节,也是最先退化的。如果这些字母看起来很清晰并且内部形状清晰,则压缩设置是合适的。如果计数器(字母内的封闭空间)开始填充或字母边缘看起来很软,则压缩过于激进。
如果要打印文档,请打印测试页。在屏幕上不可见的压缩伪影在纸张上可能会变得明显,因为打印机的渲染分辨率为 300 至 600 DPI,高于大多数屏幕。在 150 DPI 的显示器上看起来可以接受的文档在以 300 DPI 打印时可能会显得很软,因为打印机会显示缺失的细节。 WukongPDF 的减小 PDF 大小工具提供了一种预览模式,可模拟不同压缩级别的打印输出,让您在最终确定压缩设置之前验证文本的易读性。
当压缩已经使文本变得模糊时该怎么办
如果您压缩了 PDF 并且文本现在变得模糊,并且您不再拥有原始的未压缩文件,情况会很困难,但并非总是无望。如果压缩应用于最初具有单独文本层的 PDF,则对压缩文件运行 OCR 可以恢复可搜索性,但无法恢复原始文本的视觉清晰度。 OCR 在模糊图像后面添加文本层。图像仍然模糊。对于没有单独文本层的扫描 PDF,唯一的恢复途径是找到原始扫描件或以更高的分辨率重新扫描物理文档,并避免重复相同的压缩错误。
这就是为什么保留原始未压缩文件是最重要的压缩习惯。压缩应该始终产生一个副本,而不是覆盖原始文件。存储成本低廉。删除原始文件所节省的几兆字节的价值远远低于从模糊的压缩副本重新创建文档所需的时间。压缩工具总是生成一个新文件,而上传的原始文件保持不变。这种设计选择可以防止只有在原始文件消失后才意识到压缩设置错误的常见情况。
压缩彩色文档而不洗掉图像
将文本与彩色图像混合的文档面临双重挑战:文本需要高分辨率以确保易读,而图像需要色彩保真度。解决方案是使用压缩工具,将不同的设置应用于同一页面上的不同内容类型。 WukongPDF 自动检测每个页面内的文本区域和图像区域,并对每个区域应用适当的压缩。文本区域以更高的有效分辨率接收无损或接近无损的压缩。图像区域以较低的分辨率接受 JPEG 或 JPEG2000 压缩。结果是PDF质量输出,其中文本和图像看起来都很好,并且文件大小比未压缩的原始文件小得多。
关键要点是压缩后的文本模糊并不是不可避免的权衡。这是未针对文档内容优化压缩设置的结果。文本较多的扫描需要与相册不同的设置。为您面前的文档选择正确的设置,并始终保留原始文件,可确保压缩实现较小文件的承诺,而不会牺牲使文档首先有用的可读性。
许多人忽视的最后一个考虑因素是压缩格式对未来编辑的影响。如果压缩后的 PDF 稍后需要 OCR、额外压缩或格式转换,则采用无损文本编码的 150 DPI 的中等压缩文件在后续操作中的生存能力远远优于采用有损 JPEG 的 72 DPI 的重度压缩文件。有损文件的每次重新压缩都会加剧质量损失。第一次压缩可能几乎察觉不到。第二种应用于已经压缩的文件,将文本降级到难以辨认的程度。当您压缩 PDF 时,您不仅要决定当前文件的大小,还要决定为文件将来可能进行的任何操作保留多少质量空间。今天的适度压缩为明天留出了空间。强力压缩一步即可耗尽该空间。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
