
什么是扫描 PDF 以及它与原生 PDF 有何不同
扫描的 PDF 是通过使用扫描仪或手机摄像头捕获物理纸质页面的图像来创建的。 PDF 的每一页都是原始文档的照片。您在页面上看到的文本仅以图像中的像素形式存在。 PDF 文件中没有存储实际的文本字符。扫描的 PDF 本质上是一个相册,其中每张照片都包含文本。
识别扫描 PDF 的最快方法是尝试用光标选择页面上的文本。
OCR 技术通过添加可搜索文本层弥合了扫描 PDF 和原生 PDF 之间的差距。
原生 PDF,也称为数字 PDF 或原生数字 PDF,是直接从软件应用程序创建的。当您将 Word 文档导出为 PDF、将电子表格另存为 PDF 或从设计应用程序创建 PDF 时,生成的文件包含可选择和可搜索的实际文本字符以及矢量图形和嵌入字体。
文本作为数据存在,而不仅仅是像素。本机 PDF 是结构化文档,而不是页面图像的集合。
PDF 格式 支持同一文件中的两种类型的内容。 PDF 可能有一些页面是扫描图像,而其他页面是本机数字文本。当文档由多个来源组装而成时,这种混合内容的情况很常见,例如将数字创建的文本页面与来自印刷来源的扫描附录相结合的报告。
扫描 PDF 和原生 PDF 之间的实际差异会影响您可以对文档执行的所有操作。您可以在本机 PDF 中搜索单词,因为文本以可搜索字符数据的形式存在。您无法搜索扫描的 PDF,除非它已使用 OCR PDF 技术进行处理,该技术可识别图像中的文本并添加不可见的可搜索文本层。您可以从本机 PDF 中选择并复制文本。您无法从扫描的 PDF 中选择文本。您可以使用 PDF 编辑器编辑本机 PDF 中的文本。您无法编辑扫描 PDF 中的文本,因为没有可编辑的文本字符。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
如何判断 PDF 是扫描版还是原生版
最快的测试是尝试选择 PDF 中的文本。打开 PDF,然后用鼠标或手指单击并拖动单词。如果文本在您拖动时突出显示,则 PDF 包含本机可选择文本。如果您尝试选择文本时没有任何反应,则该页面可能是扫描图像。如果某些单词突出显示,而其他单词则不突出显示,则 PDF 的文本层可能不完整或损坏。
缩放测试提供了另一种快速检查。将一段文本放大至 300% 或 400%。如果文本在高放大倍数下仍然清晰锐利,则很可能是可以平滑缩放到任何尺寸的原生矢量文本。如果文本变得像素化并在高放大倍率下显示锯齿状边缘,则它是扫描图像。此视觉测试之所以有效,是因为矢量文本在任何缩放级别都能平滑渲染,而基于图像的文本在放大时会显示其像素结构。
PDF 查看器工具还可以报告文档是否包含文本。在 Adobe Acrobat 中,文档属性面板显示页数以及文件是否包含可搜索文本。一些查看器显示文本层指示器。文档分析工具可以扫描 PDF 并报告包含本机文本与仅图像内容的页面的百分比。
文件大小可以提供线索,尽管它不是确定的。由页面图像组成的扫描 PDF 通常比相同页数的本机文本 PDF 更大,因为图像比文本需要更多的存储空间。 10 页的本机文本 PDF 可能有 100 到 500 KB。 10 页的扫描 PDF 可能有 2 到 10 兆字节。然而,具有高分辨率嵌入图像的本机 PDF 也可能很大,因此文件大小本身并不是一个可靠的指标。
为什么这种区别对于日常 PDF 任务很重要
搜索是受扫描与本机区别影响的最常见任务。如果您收到一份 50 页的 PDF,并且需要查找某个特定术语的所有提及,原生 PDF 会通过搜索功能在几秒钟内为您提供答案。扫描的 PDF 迫使您手动直观地扫描每一页,这需要几分钟的时间,并且可能会漏掉一些内容。搜索文档的能力改变了您与其交互的方式。
文本提取以便在其他文档中重用需要本机文本。如果您需要在自己的报告中引用 PDF 中的段落,原生 PDF 可让您直接复制并粘贴文本。扫描的 PDF 需要您重新输入文本或运行 OCR 才能将其提取。对于您经常引用的文档,即时复制粘贴和手动重新键入之间的差异很大。
辅助工具(包括视障人士使用的屏幕阅读器)需要本机文本。屏幕阅读器可以朗读本机 PDF,因为它可以访问文本字符。屏幕阅读器无法阅读扫描的 PDF,因为没有可供访问的文本字符。要使扫描的 PDF 易于访问,需要进行 OCR 处理以添加屏幕阅读器可以解释的文本层。
扫描 PDF 格式完全适合归档目的,其中文档仅需要作为原始图像查看。已签署合同的扫描件可作为已签署文件的可视记录。对于任何需要与文本交互、搜索、复制、编辑或可访问性的目的,需要使用 OCR 的本机 PDF 或扫描 PDF。
如何将扫描的 PDF 转换为可搜索的类似本机的 PDF
光学字符识别是将扫描的页面图像转换为带有文本层的可搜索文档的技术。使用支持 OCR 处理的 PDF 工具对扫描的 PDF 运行 OCR。该工具分析每个页面图像,识别文本字符,并在页面图像后面添加不可见的文本层。 OCR 后,PDF 在视觉上看起来相同,但现在可以搜索,并且可以选择和复制识别的文本。
OCR 准确性取决于原始扫描的质量。在 300 DPI 下进行干净的扫描、均匀的照明、平坦的页面和清晰的焦点可产生 99% 以上的 OCR 准确度。
以 150 DPI 进行低分辨率扫描,如果有阴影、弯曲的页面或模糊的文本,可能会产生低于 95% 的准确度,需要手动校正。扫描的质量决定了 OCR 输出的质量。
运行 OCR 后,通过搜索页面上可以看到的几个单词来验证结果。如果搜索找到它们,则 OCR 成功。如果搜索遗漏了明显的单词,OCR 可能会对该页面的特定字体、布局或图像质量产生困难。使用调整后的设置或更高质量的扫描(如果可用)重新运行 OCR。
WukongPDF 的OCR PDF 工具在浏览器中处理扫描文档并返回带有可搜索文本层的 PDF。上传扫描的 PDF,运行 OCR,然后下载支持搜索、文本选择和屏幕阅读器访问的文档。 OCR 过程保留了原始的视觉外观,同时添加了使文档具有交互性的文本层。
在处理大型文档集合时,扫描 PDF 和原生 PDF 之间的文件大小差异变得尤为重要。扫描为 PDF 的纸质文档文件柜可能会生成数以万计的扫描 PDF 页面,每页都是完整图像。对于典型的 300 DPI 灰度扫描,每页 500 KB,10,000 页消耗 5 GB 的存储空间。对这些扫描的 PDF 运行 OCR 不会减小文件大小,因为页面图像仍然存在,但它确实添加了可搜索的文本层,使该集合实际上可用。
对于需要长期归档的文档,PDF/A格式是归档标准。扫描 PDF 和原生 PDF 都可以转换为 PDF/A。转换为 PDF/A 的扫描 PDF 仍然是基于图像的文档,并添加了档案元数据。转换为 PDF/A 的本机 PDF 保留其文本和结构属性。 PDF/A 不会改变文档的扫描与原始性质。它添加了标准化元数据并强制执行可提高长期保存性的结构要求。
对于混合扫描页面和本机页面的 PDF,请将 OCR 应用于扫描页面,同时保持本机页面不变。大多数 OCR 工具可以处理特定的页面范围,因此您可以仅在需要它的页面上运行 OCR。处理后,PDF 保留原始页面上的本机文本,并在以前仅包含图像的页面上具有可搜索的文本层,从而在整个文档中提供一致的可搜索性。
对于需要打印和手工填写的文档,原始表格的扫描 PDF 就足够了。收件人打印 PDF,用笔填写空白,然后返回实体副本或将其扫描回数字版本。对于应该以数字方式填写的文档,带有表单字段的原生 PDF 更加优越,因为收件人可以直接在字段中键入内容。
在将文档扫描为 PDF 和从原始源文件创建本机 PDF 之间进行选择时,应考虑文档的整个生命周期,而不仅仅是即时需求。合同的扫描 PDF 可以通过电子邮件发送给另一方进行审阅。如果随后需要在争议期间搜索该合同中的特定条款,则扫描的 PDF 缺乏可搜索性将成为重大责任。在创建文档时创建本机 PDF 会保留扫描所不保留的选项。
现代扫描软件通常包括自动 OCR 处理,在实际使用中模糊了扫描 PDF 和原生 PDF 之间的区别。使用手机应用程序扫描的文档在捕获后立即执行 OCR,生成的 PDF 从技术上讲是扫描图像,但在功能上可像本机 PDF 一样进行搜索。这种混合方法结合了扫描的便利性和原生文本的可搜索性。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
