PDF 通过电子邮件发送。打开它会看到看起来像打印文档的内容。文本在那里,格式正确。但是您可以用光标选择文本吗?或者光标是否像照片一样掠过文本?答案决定了 PDF 是通过扫描纸张创建的还是从数字源生成的,并且它决定了有关如何使用该文件的一切。
单击文本并观察光标是选择它还是忽略它,一秒钟即可回答问题。
确定 PDF 是否是扫描的或以数字方式创建的,涉及检查可选择的文本、检查文件结构以及寻找明显的扫描视觉痕迹。 WukongPDF 的OCR PDF 工具可以使扫描文档变得可搜索,下面的扫描 PDF 识别步骤首先会告诉您是否需要 OCR。

文本选择测试
打开 PDF 并尝试使用文本选择工具选择一个文本单词。如果光标逐个字符地突出显示单词,则 PDF 包含可选择的文本并且是数字创建的或已经经过 OCR 处理。如果光标在整个区域上绘制选择矩形而不突出显示单个字符,则该页面是图像并且 PDF 是通过扫描创建的。
文本选择测试对于单页检查来说是快速且明确的。对于多页文档,从开头、中间和结尾测试几页。一些 PDF 混合了数字页面和扫描页面,通常是数字创建的求职信,后跟扫描附件。每个页面上的文本选择测试揭示了哪些页面是哪些页面。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
检查文件大小和页数以获取线索
扫描的 PDF 通常比具有相同页数的数字 PDF 更大,因为每页都是整页图像。 300 DPI 下的 10 页扫描 PDF 通常为 5-15 MB。相同内容的 10 页数字 PDF 可能为 100-500 KB。在打开文件之前,文件大小差异是一个快速线索。
扫描的 PDF 的内部功能也往往较少。没有书签,没有超链接,没有嵌入字体,除了基本文件属性之外没有元数据。打开文档属性并检查字体选项卡。扫描的 PDF 没有列出字体,因为所有内容都是图像。数字 PDF 列出了文档中使用的字体。
检查创建方法的文件属性
文档属性通常包括创建 PDF 的应用程序。 Adobe Acrobat 从 Microsoft Word 创建的 PDF 很可能是数字的。扫描了由 Canon 扫描仪驱动程序或 HP Scan 创建的 PDF。由 OCR 应用程序创建的 PDF 可能是经过可搜索处理的扫描文档。
文档属性中的生产者字段由创建应用程序设置,并且并不总是可靠,因为它可以更改或欺骗。将生产者信息与文本选择测试和字体检查相结合,以获得可靠的确定。得出相同结论的三个独立测试是可靠的。
| 测试 | 数字 PDF 结果 | 扫描的 PDF 结果 |
|---|---|---|
| 文本选择 | 光标突出显示单个字符 | 光标在图像上绘制选择矩形 |
| 文件大小(10页) | 100-500KB | 5-15MB |
| 属性中的字体选项卡 | 列出嵌入字体 | 空的,没有字体 |
| 生产者领域 | Word、Acrobat、Chrome | 扫描仪驱动程序、成像软件 |
寻找扫描的视觉伪影
将文本区域放大至 400%。扫描的 PDF 显示图像捕获的特征伪影:字符边缘轻微模糊、扫描仪照明导致页面上的暗度不均匀、扫描仪玻璃上显示为微弱线条或斑点的灰尘斑点或发丝痕迹。数字 PDF 在任何缩放级别都显示清晰的字符边缘。
双面页面的扫描 PDF 可能会显示纸张另一面的重影、微弱的反转文本。这是扫描的明确标志,因为数字 PDF 没有纸张不透明度的概念。重影显示为主要文本后面文本的灰色阴影,在主要文本稀疏的区域中最明显。
使用 PDF 元数据字段获取其他线索
可通过文档属性访问的 PDF 元数据字段可以揭示文档的来源。包含原始文档文件名的“标题”字段(如 Annual-Report-2025-Final.docx)表示 PDF 是从该 Word 文件创建的。空标题字段或与 PDF 文件名匹配的标题是中性的。列出 Microsoft Word 或 Google Docs 的创建者字段表示数字来源。
创建日期和修改日期字段可以提供时间线线索。在同一日期创建和修改的 PDF 彼此相隔几分钟,建议直接数字导出。修改日期晚于创建日期数年的 PDF 可能已被 OCR 或处理过。元数据讲述了文档的历史记录,而该历史记录揭示了是否涉及扫描。
知道 PDF 类型后该怎么办
对于需要可搜索的扫描 PDF,请运行 OCR 添加文本图层。 OCR 过程可识别页面图像中的文本,并在其后面添加可选择、可搜索的文本。视觉外观不会改变。 PDF 获得了可搜索性和复制粘贴功能。
对于需要看起来像是扫描的数字 PDF(通常是具有官方外观的文档复制品),无需进行图像转换和转换,而且会降低质量。数字 PDF 已经处于最佳状态。任何将文本转换为图像的处理都会降低质量,而不会增加价值。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
