包含高分辨率照片、图表、徽标和装饰图像的 PDF 对于以文本为中心的工作流程来说可能不切实际。当您只需要文字时,剥离所有PDF图像并导出纯文本版本会产生一个小得多的文件,仅包含文档文本内容。问题是生成的纯文本输出是否完整且可用于预期目的。
对于基于文本的 PDF,简短的回答是肯定的,其中文本以可选字符的形式存在。对于文本是图像一部分的扫描 PDF,剥离图像会删除包括文本在内的所有内容。主要区别在于本机文本 PDF(其中文本和图像是单独的层)和基于图像的 PDF(其中整个页面是没有文本层的图片)。
PDF 到文本 提取会删除图像,同时保留文本内容。对于文本具有主要含义而图像是补充的文档,纯文本输出是完全可用的。对于图像传达重要信息的文档(例如医学扫描或建筑图纸),纯文本输出会丢失关键内容。
WukongPDF 的 PDF 处理工具包括图像剥离和文本提取功能。

原生文本和基于图像的 PDF 之间的区别
本机文本 PDF 将文本存储为位于页面上的字符代码。图像是覆盖或放置在文本块之间的单独对象。当您从本机文本 PDF 中删除图像时,文本保持完整且完全可读。保留标题、段落和分页符等文档结构。只有装饰性和说明性图像消失。
基于图像的 PDF 将整个页面存储为光栅图像,通常来自扫描仪或屏幕截图。没有要保留的文本字符。从基于图像的 PDF 中剥离图像会删除所有内容,从而生成空白文档。对于经过 OCR 处理的扫描 PDF,图像后面有一个不可见的文本层。图像剥离会删除可见的扫描页面,但保留 OCR 文本,其中可能包含识别错误。
要确定您拥有哪种类型的 PDF,请在任何 PDF 阅读器中打开它并尝试选择一个文本单词。如果您可以选择单个字符,则 PDF 是本机文本,并且图像剥离将保留文本。如果单击选择整个页面作为一个大图像块,则 PDF 是基于图像的,剥离图像将不留下任何内容或仅留下 OCR 文本层。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
方法 1:使用 Acrobat Pro PDF Optimizer 剥离图像
在 Acrobat Pro 中打开 PDF,然后转到“文件”、“另存为其他”、“优化 PDF”。在“PDF 优化器”对话框中,单击左侧面板中的“放弃对象”。选中标有“放弃所有图像”的框。在清理下,选中删除未使用的对象。单击“确定”并以新名称保存优化后的文件。 Acrobat 处理该文件并删除每个光栅图像对象。
实际上,最终的文件大小可能会显着减小。如果文档主要是带有嵌入图像的文本,则带有高分辨率照片的 20 MB PDF 可能会缩小到 100 KB 以下。打开优化的文件并滚动浏览每个页面以确认所有文本内容均存在且可读。检查图像被删除的页面区域。布局可能会略有变化,因为之前图像占用的空间现在是空的。
如果任何重要内容与图像一起被删除,例如存储为图像而不是矢量图形的图表,请撤消操作并使用更具选择性的方法。不要丢弃所有图像,而是对其进行大量压缩或用描述删除内容的占位符文本替换它们。
方法 2:程序化文本提取
PyMuPDF 和 pdfplumber 等 Python 库提取文本,同时本机忽略图像。提取仅读取文本层,产生没有任何图像数据的干净文本流。提取的文本可以保存为 .txt 文件以进行编辑或输入到新的纯文本 PDF 中。编程方法是可编写脚本、可重复的,并且可以处理多个文件的批处理。
对于具有 OCR 文本层的扫描 PDF,程序化提取会读取 OCR 文本。质量完全取决于 OCR 的准确性。使用现代 OCR 扫描干净的文档可以生成准确率高达 99% 的文本。使用旧 OCR 扫描的质量较差的文档可能会生成需要大量手动更正的文本。提取将包括文本层中存在的任何 OCR 错误。
提取后质量验证
剥离图像或提取文本后,请在使用前验证输出质量。将提取的文本的字数与原始文档的手动估计进行比较。显着差异表明内容丢失。搜索原文中出现的已知术语,以确认它们出现在输出中。检查每个主要部分的第一段和最后一段以验证完整性。
在文档工作流程中,对于文本准确性至关重要的文档(例如法律文件或财务报告),请让第二位审阅者根据原始 PDF 抽查提取的文本。即使 99% 的准确率提取也意味着每百个单词有一个错误,这对于精确文档来说可能是不可接受的。验证过程可以捕获自动质量检查遗漏的提取错误。
| 文档类型 | 可安全剥离? | 替代 |
|---|---|---|
| 法律简介 | 是的,文字是首要的 | 不需要 |
| 带图表的报告 | 不,图表包含数据 | 压缩而不是剥离 |
| 扫描文件 | 不,扫描就是内容 | 先OCR,再提取文本 |
当文本内容是主要值并且图像是偶然的时,从 PDF 中剥离图像是合适的。生成的纯文本文件明显更小,完全可搜索,并可用于文本分析、翻译或内容重新利用。应在确认文本本身传达了文档的本质含义后才做出剥离图像的决定。
当涉及文档工作流程时,对于图像和文本协同工作的文档,请保留完整的 PDF 并通过压缩而不是删除来优化它。压缩的 PDF 保留了文本和图像之间的视觉关系,同时减小了分发文件的大小。
图像剥离后 PDF 布局会发生什么
在典型的工作流程中,当图像被删除时,它们在页面上占据的空间就会变空。环绕图像的文本可能会回流到空白区域。包含图像单元格的表格将具有空白单元格。围绕特定图像位置设计的页面布局可能看起来很尴尬。剥离后的 PDF 针对内容进行了优化,而不是针对视觉设计。
对于布局完整性很重要的文档,请考虑用占位符文本替换图像,而不是完全删除它们。可以在每张图像的位置插入诸如图像已删除:产品照片之类的标题。占位符保留布局结构,同时确认视觉内容已被有意删除。
在图像剥离之前使用 OCR 创建文本图层
对于文档处理,对于缺少文本层的扫描 PDF,在图像剥离之前运行 OCR 会创建剥离过程保留的文本数据。 OCRmyPDF 可以通过单个命令向扫描的 PDF 添加文本图层。经过 OCR 处理后,PDF 包含可见的扫描图像和不可见的文本图层。然后剥离图像会删除扫描的页面,同时保留已识别的文本。
在实践中,OCR 质量直接决定剥离输出的可用性。 OCR 准确率达到 99% 的文档会生成可用文本,但偶尔会出现错误。准确度为 80% 的文档生成的文本需要大量手动更正。在对扫描文档进行图像剥离之前,请运行 OCR 并评估示例页面上的文本质量。
压缩图像作为剥离的替代
对于完全删除图像会丢失有价值内容的文档,积极的图像压缩提供了一个中间立场。通过高 JPEG 压缩将图像尺寸缩小到 72 DPI 可以将 20 MB PDF 缩小到 2 到 3 MB,同时保持图像可识别。压缩后的图像质量较低,但仍传达视觉信息。
将压缩与选择性图像删除相结合可提供最大的灵活性。将图像保留在重要的页面上,例如内容中心的图表和照片,并从没有信息用途的页面上删除装饰性图像。混合方法需要更多的手工工作,但可以实现质量和尺寸的最佳平衡。
纯文本 PDF 导出适用于特定用例:将内容输入文本分析管道、创建用于移动阅读的轻量级版本以及准备翻译文档(其中图像会增加成本而不增加价值)。对于每个用例,文本是产品,图像是可以丢弃的包装。
应记录删除图像的决定,以便未来纯文本版本的读者了解视觉内容被有意删除。当有人将纯文本版本与原始版本进行比较时,文档属性或封面上的简短注释可以防止混淆。
在大多数工具中,纯文本 PDF 导出是满足特定需求的专用工具。它不是通用优化。对于大多数文档,压缩是比图像删除更好的第一步。在文本是唯一有价值的内容并且仅由文本来满足文档目的的情况下,保留图像剥离。
了解图像剥离的功能和限制可确保以正确的理由将其应用于正确的文档,从而生成满足其预期目的的输出,而不会造成意外的内容丢失。纯文本 PDF 可以很好地满足特定目的,应根据文档类型和预期用途有选择地应用。
尝试压缩 PDF
无需安装。直接在您的浏览器中工作。
