Tips & Tricks

如何以原始分辨率从 PDF 中提取图像

从 PDF 中提取图像听起来很简单。单击“导出”,选择图像格式,然后就会出现图片。但出现的图像通常比放入文档中的原始图像更小、更柔和或更压缩。发生这种情况是因为许多 PDF 工具在提取过程中对图像进行下采样并重新压缩,在首次嵌入图像时应用的任何压缩之上应用第二轮质量损失。以原始分辨率提取图像会保留最初放入 PDF 中的每个像素,生成与源图像相同的输出文件。以原始分辨率从PDF 到图像 的提取需要一个尊重嵌入图像数据的工具,而不是以固定的 DPI 重新渲染页面。

How to Extract Images From a PDF at Their Original Resolution

为什么标准图像提取会降低质量

大多数 PDF 查看器和基本提取工具实际上并不从 PDF 中提取原始图像文件。它们以指定的分辨率(通常为 150 或 300 DPI)渲染每个页面,然后根据工具检测图像内容的位置将渲染的页面分割成图像矩形。此重新渲染过程对嵌入时已压缩的图像应用第二轮 JPEG 压缩。结果是生成丢失,类似于保存 JPEG 文件、重新打开它并再次保存。每个周期都会丢弃更多的视觉数据。

原始分辨率提取完全绕过重新渲染步骤。该工具不是渲染页面并从渲染中切片图像,而是直接从 PDF 文件结构读取嵌入的图像流。每个图像流都包含创建文档时插入 PDF 的确切字节。提取这些流会生成与原始图像逐位相同的文件。嵌入 PDF 中的 3000 x 2000 像素照片将显示为 3000 x 2000 像素文件。 PDF 图像 提取过程保留每个像素。

WukongPDF

尝试 PDF 转图像

无需安装。直接在您的浏览器中工作。

立即开始 →

支持原始分辨率提取的工具

Adobe Acrobat Pro 包含导出所有图像功能,可以以原始分辨率导出。打开 PDF,转到“工具”面板,然后选择“导出 PDF”。选择图像作为输出格式,然后在设置中选择 JPEG 或 PNG 格式,然后查找标有“以原始分辨率导出所有图像”或类似措辞的选项。提取的图像以其原始像素尺寸出现在输出文件夹中。

命令行工具提供对嵌入式图像流的最直接访问。 pdfimages 工具是开源 poppler-utils 包的一部分,可以从 PDF 中提取图像,而无需重新压缩它们。运行 pdfimages -j input.pdf outputprefix 会使用原始压缩方式提取所有 JPEG 图像。运行 pdfimages -png input.pdf outputprefix 会在提取过程中将所有图像转换为无损 PNG 格式,同时保留原始像素尺寸。 WukongPDF 和基于浏览器的PDF 到图像 平台在服务器端处理原始分辨率提取并以可下载的存档形式返回图像。

处理嵌入多种格式的图像

单个 PDF 可以包含多种不同格式的图像。 JPEG 图像在照片中很常见。 JPEG 2000 图像出现在一些档案和工程 PDF 中。 PNG 图像用于具有透明度的屏幕截图和图形。 TIFF 图像出现在扫描文档中。原始位图数据可以在不进行任何压缩的情况下被存储。提取工具必须正确处理每种格式。假定所有图像均为 JPEG 的工具在遇到 PNG 或 TIFF 时将产生损坏的输出。

下表总结了提取过程中应如何处理不同的嵌入图像格式:

嵌入格式最佳导出格式注释
JPEG(DCT解码)JPEG(原始)已经压缩;进一步 JPEG 压缩两次
JPEG 2000(JPX解码)PNG 或 JPEG 2000并非所有查看器都支持 JPEG 2000
PNG 或原始位图PNG(无损)准确保留所有像素数据
TIFF 或扫描数据TIFF 或 PNGTIFF 保存多页扫描数据

识别嵌入图像的原始分辨率

在提取之前,了解嵌入图像的实际分辨率会有所帮助。在可以显示图像属性的查看器中打开 PDF。单击图像并查找显示像素尺寸的属性面板。将像素尺寸除以页面上图像的物理尺寸即可计算有效 DPI。在页面上 5 x 4 英寸区域中显示的 1500 x 1200 像素图像的有效分辨率为 300 DPI。无论页面上的显示尺寸如何,原始分辨率均为 1500 x 1200 像素。

如果有效 DPI 较低,则图像以低分辨率嵌入,并且任何提取方法都无法恢复嵌入数据中未包含的细节。原始分辨率提取保留了现有内容。它不会创建从未嵌入的细节。以原始分辨率提取的 72 DPI 图像仍然是 72 DPI 图像。原始分辨率提取的好处是避免进一步的质量损失,而不是神奇地提高分辨率。

组织和命名提取的图像

包含数十张图像的 PDF 提取后会生成一堆通用名称的文件,例如 img-001.jpg、img-002.jpg。使用前对文件进行描述性重命名。如果图像来自产品目录,请使用产品 SKU 或名称对其进行命名。如果它们来自报告,请用数字编号命名。对于一批图像,重命名步骤需要几分钟的时间,但当您需要在几天或几周后查找特定图像时,可以节省更多时间。

将提取的图像保存在以源 PDF 命名的文件夹中,以便清楚出处。如果图像将在新文档中使用或上传到网站,请在图像元数据或随附文本文件中包含源 PDF 名称。了解图像的来源可以在以后需要时返回源以获得更高分辨率的版本。 WukongPDF 支持PDF 导出 以及原始分辨率图像提取,生成有组织的输出,保留源文档和提取的资源之间的连接。

验证提取质量

以原始分辨率提取图像后,通过打开提取文件的示例并将它们与 PDF 中以高缩放级别显示的相同图像并排进行比较来验证输出质量。提取的图像应显示与缩放的 PDF 视图相同的细节级别。如果提取的图像显示在 PDF 中不可见的 JPEG 块伪影,则提取可能应用了额外的压缩。如果提取的图像像素尺寸小于预期,则该工具可能在提取过程中进行了下采样,而不是按原始分辨率进行提取。

当提取的图像将用于印刷出版物时,请在最终确定之前与打印机确认分辨率要求。原始像素尺寸的 300 DPI 图像可能足以用于半页打印布局,但不足以用于全出血封面图像。原始分辨率提取保留了现有内容。它不会创建原始嵌入中不存在的分辨率。

对于无法再从任何其他来源获得原始图像的存档 PDF,以原始分辨率提取的图像将成为最佳可用副本。将他们视为档案大师。将它们保存为无损格式,例如 PNG 或 TIFF,并从这些母版创建任何工作副本或 Web 版本,而不是每次都从 PDF 中重新提取。

对于以异常高分辨率嵌入的PDF图像,提取的文件可能比预期大。以原始分辨率提取的 600 DPI 照片会生成适合高质量打印的文件,但对于 Web 使用或电子邮件附件而言,文件过大。提取后,创建调整大小的版本以供分发,并将原始分辨率提取的文件保留为存档主文件。

从并非您创建的 PDF 中提取图像时,请注意嵌入图像的版权状态。原始分辨率提取生成适合重复使用的副本,这意味着重复使用会产生版权影响。如果 PDF 是公开文档,则在合理使用或文档发布条款的情况下可以使用图像。如果 PDF 是专有或许可文档,则嵌入的图像具有与文档本身相同的使用限制。

以原始分辨率从PDF 到图像 的提取对于摄影师和图形设计师来说特别有价值,他们以 PDF 格式收到自己的作品,并且需要恢复在布局期间放入文档中的原始图像文件。

对于收到 PDF 作品校样的设计师和内容创作者来说,原始分辨率提取提供了一种恢复工作文件中可能丢失的图像的方法

嵌入 PDF 中的PDF 图像 通常是这些图像的最高质量的现存版本

以原始分辨率提取图像是一项一次性设置决策,会影响从 PDF 中生成的每张图像。在运行批处理之前花时间正确配置提取工具可确保每个图像都以其完整的质量出现,为接下来的任何使用做好准备。

原始分辨率提取保留了嵌入图像数据的完整性。当提取的图像是这些照片、徽标或图形唯一幸存的副本时,完整性就很重要。

以原始分辨率而不是默认 DPI 提取图像的决定是优先考虑质量而非便利性的选择。文件会更大。该过程可能需要稍长的时间。但图像将与放入 PDF 时完全相同。

WukongPDF

尝试 PDF 转图像

无需安装。直接在您的浏览器中工作。

立即开始 →