Others

PDF 中的 OCR 文本和嵌入文本有什么区别

打开扫描的 PDF,您可以选择、复制和搜索文本,就像原始数字文档一样。该文本并非来自原始扫描。扫描仪生成页面图像,这是一个完全没有文本数据的像素网格。 The text you are selecting and searching is OCR text, generated by optical character recognition software that analyzed the page image and converted pixel patterns into characters.但并非 PDF 中的所有可选文本都是 OCR 文本。有些 PDF 包含以数字方式创建的嵌入文本,从未经过扫描仪或识别引擎。了解 OCR 文本和嵌入文本之间的差异可以解释为什么有些 PDF 可以完美搜索,而另一些 PDF 会产生乱码结果。

What Is the Difference Between OCR Text and Embedded Text in a PDF

什么是 OCR 文本以及它如何进入 PDF

OCR 文本是机器生成的。 OCR PDF引擎检查扫描页面图像中的每个字符形状,将其与已知字符模式的数据库进行比较,并输出最可能匹配的字符及其在页面上的位置。然后,识别出的文本将作为精确定位在原始图像字符上方的不可见层嵌入到 PDF 中。当您从扫描的 PDF 中选择并复制文本时,您是从这个不可见的 OCR 图层进行复制,而不是从可见的图像进行复制。如果 OCR 引擎误读了某个字符,即使可见图像看起来正确,复制的文本也会包含该错误。

OCR 文本的质量取决于多个因素:原始扫描件的分辨率和清晰度、原始文档中使用的字体、文本语言以及 OCR 引擎的复杂程度。对经过现代 OCR 引擎处理的激光打印英文文档进行干净的 300 DPI 扫描,可生成近乎完美的文本。对采用基本 OCR 引擎处理的具有复杂字符形状的语言的点阵打印文档进行 150 DPI 扫描,会产生充满错误的文本。 OCR 文本仅在识别引擎和扫描质量允许的情况下准确。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

什么是嵌入文本以及它如何进入 PDF

嵌入文本是创作的,而不是识别的。当文字处理器、桌面出版应用程序或 PDF 创建库生成 PDF 时,它会将文本直接写入 PDF 内容流。每个字符都存储为映射到字体中的字形的特定代码。没有识别步骤,因为文本从来都不是图像。创建 PDF 的应用程序确切地知道正在写入的字符并精确记录它们。当您从数字创建的 PDF 中选择并复制文本时,您将复制作者键入的确切字符。

嵌入文本携带 OCR 文本通常缺乏的格式信息。字体名称、粗体和斜体样式以及字符间距保留在嵌入文本中,因为它们是由作者在源文档中指定的。 OCR 文本可以重建部分格式,但它是根据字符的视觉外观推断的,而不是存储为显式元数据。扫描后的 ORed 页面与本机数字页面之间的PDF 格式 比较揭示了这种差异。 OCR 版本可能允许文本选择,但将每个字符报告为具有相同粗细的相同字体。数字版本保留了作者想要的字体区别。

如何判断 PDF 中的文本是 OCR 还是嵌入的

确定 PDF 中的文本是 OCR 生成的还是嵌入的最可靠的方法是检查文档属性,特别是字体列表。在可以显示字体信息的查看器中打开 PDF。 Adobe Acrobat 在“文件”、“文档属性”、“字体”下显示字体列表。如果字体列表显示名称包含 OCR 的字体,或者字体被列为未知或没有特定名称的通用类型,则文本可能是 OCR 生成的。如果字体列表显示特定的命名字体,例如 Arial、Times New Roman 或 Calibri 以及粗体或斜体等子类型,则几乎可以肯定文本是从数字源嵌入的。

另一个实际测试是搜索常见的 OCR 错误模式。在 PDF 中搜索常见的 OCR 替换错误,例如字母组合 rn,OCR 引擎经常将其误读为单个字母 m。如果搜索发现 barn 变成 bam 或 corn 变成 com 的实例,则文本是 OCR 生成的。嵌入文本不包含这些替换错误,因为这些字符在视觉上绝不会含糊不清。文档的PDF可搜索质量取决于底层文本(OCR 或嵌入文本)是否准确地表示可见内容。

当 OCR 文本和嵌入文本共存于同一个 PDF 中时

单个 PDF 可以在不同页面甚至同一页面上同时包含 OCR 文本和嵌入文本。合同包可能包括以数字方式编写的合同正文(其中包含嵌入文本)以及经过扫描和 OCR 处理的签名页(其中包含 OCR 文本)。研究报告可能会将数字创建的文本页面与扫描并经过 OCR 处理的历史剪报照片结合起来。第三页上的文本是像素完美的嵌入文本。第七页上的文本是 OCR 文本,可能包含识别错误。

这种混合内容的场景为任何从 PDF 中搜索或提取文本的人造成了微妙的陷阱。嵌入文本页面的搜索结果将是准确的。 OCR 文本页面的搜索结果可能会漏掉 OCR 引擎误读单词的情况,或者可能会返回 OCR 引擎替换相似单词的错误匹配。处理混合内容 PDF 时,请先验证从 OCR 页面提取的任何文本,然后再依赖它。最安全的方法是每当从 OCR 页面提取的文本用于关键目的时,目视检查相应的页面图像。

事后提高 OCR 文本质量

当 PDF 包含质量较差的 OCR 文本时,由于原始扫描和 OCR 过程已经完成,因此改进文本的选项受到限制。您无法追溯性地提高扫描质量。您可以做的是使用更好的引擎重新 OCR PDF。以可用的最高分辨率从 PDF 中提取页面图像,并通过现代 OCR 引擎运行它们,该引擎可能会产生比原始 OCR 通道更准确的结果。用新的 OCR 文本层替换旧的 OCR 文本层。

某些 PDF 编辑器允许您直接在文本层中手动更正 OCR 错误。在编辑模式下打开 PDF,显示不可见的 OCR 文本。单击错误识别的单词并输入更正。对于几页上的少量错误,此手动更正过程非常实用。对于每个段落都包含识别错误的 200 页文档来说,这是不切实际的。对于大规模的 OCR 质量问题,使用更好的引擎对整个文档进行重新 OCR 是更有效的方法。

在 OCR 和嵌入文本之间进行选择以创建文档

创建要搜索、索引或存档的 PDF 时,在扫描和 OCR 与生成本机数字 PDF 之间进行选择会产生长期影响。带有嵌入文本的本机数字 PDF 更小,搜索速度更快,并且完美地保留了文本准确性。扫描并经过 OCR 处理的 PDF 保留了原始纸质文档的外观,但随着 PDF 的复制、引用和引用,可能会出现识别错误。

对于档案项目,最佳实践是保留两种格式。保留高分辨率扫描作为视觉保真度的存档主文件。通过重新输入或应用高精度 OCR 并进行手动更正,生成本机数字版本,用于文本搜索和分析。这种双格式方法提供了原始扫描的真实性和可搜索文本的可用性。 WukongPDF 支持OCR PDF 处理,将扫描文档转换为可搜索的 PDF,生成的 OCR 文本层提供搜索和复制功能,使扫描文档可在数字工作流程中使用。

OCR 和嵌入文本之间的长期可靠性差距

ORed PDF 的老化时间与数字创作的 PDF 不同。数字创作的 PDF 在创建二十年后打开时可以完美地显示其文本,因为字符代码是明确的并且字体是嵌入的。创建 20 年后打开的 ORed PDF 取决于原始扫描的质量和当时可用的 OCR 引擎的准确性。当原始纸质文档不再可用于验证时,在文档新鲜时几乎不明显的识别错误就会成为重大障碍。

对于打算长期保存的文档,来自数字源的嵌入文本始终优于 OCR 文本。如果文档仅存在于纸张上并且必须进行扫描,请投资当时可用的最高质量的扫描和 OCR 处理,并尽可能长时间地保存原始纸质文档。纸质原件是针对 OCR 错误的最终备份,这些错误可能要在几年后才会显现出来。

用于区分OCR PDF文本与嵌入文本的实际测试:将段落放大到 300% 或更高,然后查看字符边缘。 OCR 文本通常会在可见字符图像和不可见文本层之间显示轻微的错位。嵌入文本呈现完美对齐,因为字符形状和位置来自相同的字体程序。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →