拼合 PDF 会将所有注释、表单字段和分层内容合并到单个静态图像层中。拼合后,拼合前存在的原始文本图层就消失了。曾经可选择、可搜索和可提取的文本字符变成了扁平化图像中的像素。对于拼合文档的PDF 修复 询问是否可以从拼合输出中恢复原始文本图层。
简而言之,答案取决于 PDF 是否被展平并保留了文本层。一些拼合操作将拼合图像后面的原始文本保留为隐藏内容。其他展平操作会完全丢弃文本,并将其替换为渲染的图像。在第一种情况下可以恢复,而在第二种情况下则不可能恢复。
WukongPDF 的PDF 格式 恢复工具可以检测并从拼合的 PDF 文档中提取保留的文本图层。

PDF 拼合的工作原理以及它删除的内容
拼合将 PDF 页面的所有可见层合并为单个渲染图像。注释(包括突出显示、便签和绘图标记)与页面内容合并。表单字段从交互式元素转换为其填充值的静态视觉表示。透明效果被解析为不透明像素。结果是一个看起来与原始页面相同的页面,但没有交互或分层结构。
实际上,拼合过程可能会也可能不会保留拼合图像后面的原始文本层。当通过 Acrobat Pro 的拼合器预览或通过具有某些设置的印前检查工具执行拼合时,原始文本可能会保留为不可见图层。当通过打印到 PDF 或通过第三方工具执行拼合时,文本图层通常会被完全丢弃。
快速测试可确定文本是否被保留。打开拼合的 PDF 并尝试选择页面上的文本。如果可以选择并复制文本,则文本图层不会被展平。如果单击文本未选择任何内容或选择整个页面作为图像,则文本层将被丢弃,仅保留视觉外观。
尝试修复 PDF
无需安装。直接在您的浏览器中工作。
方法 1:检查拼合图像后面的隐藏文本层
在 Acrobat Pro 中,打开拼合的 PDF,然后转到“工具”、“内容编辑”、“编辑文本和图像”。单击可见的文本区域。如果 Acrobat 在文本周围显示边框并允许编辑,则拼合图像后面会存在文本图层。该文本存在于文件数据中,尽管在正常查看期间它可能不可见作为可选文本。
如果文本存在,请使用 Acrobat Pro 的“将 PDF 导出为文本”功能将其提取。即使视觉页面看起来扁平化,提取的文本也可能包含原始内容。复制提取的文本并将其与原始内容的样本进行比较。如果文本匹配,则已成功从拼合文件中恢复原始文本图层。
从广义上看,在实际场景中,如果 Acrobat 找不到可编辑文本,则文本图层在拼合过程中会被丢弃。页面上的可视文本由扁平图像中的像素组成,而不是字符代码。无法通过文本提取进行恢复,因为没有要提取的文本数据。
方法2:使用OCR重新创建丢失的文本图层
当原始文本图层在拼合过程中被丢弃时,OCR 提供了重新创建它的路径。使用 Acrobat Pro 的识别文本功能对拼合的 PDF 运行 OCR。 OCR 引擎分析每个页面的像素图像,识别字符形状,并使用识别的字符创建新的文本图层。
从广义上考虑,实际上,OCR 重新创建的文本层并不是原始文本。 OCR 会引入识别错误,特别是对于小文本、不常见的字体或复杂背景上的文本。对于干净、标准的文档,重新创建的文本的准确度约为 95% 至 99%,而对于具有挑战性的排版或布局的文档,则准确度较低。
OCR 后,将识别的文本与原始内容的已知样本(如果有)进行比较。手动更正 OCR 错误或接受重新创建的文本图层作为原始文本图层的近似值。 OCR 输出可用于搜索和文本提取,但可能包含错误,需要在依赖文本用于法律、财务或监管目的之前进行验证。
检查 PDF 文件结构中的文本
要明确检查拼合 PDF 中是否存在文本数据,请检查原始文件结构。在可以处理二进制文件的文本编辑器(例如 VS Code 或 Notepad++)中打开 PDF。从原始文档内容中搜索可识别的文本字符串。如果在文件数据中找到文本字符串,则即使无法通过 PDF 阅读器界面访问,文本层也存在。
此方法需要对 PDF 内部结构有一定的了解。 PDF 中的文本存储在 BT 和 ET 标记中,它们表示文本对象的开头和结尾。在这些标记之间,字符代码与定位命令一起列出。找到包含可识别文本的 BT 和 ET 标记表明文本数据在扁平化过程中幸存下来。
从实际角度来看,在实际场景中,如果在文件数据中找不到文本字符串,则拼合操作将内容完全光栅化。这些页面是图像,不包含可恢复的文本信息。 OCR 是创建文本图层的唯一可用途径。
防止未来拼合操作中文本层丢失
当拼合需要保留其文本图层的 PDF 时,请使用保留隐藏文本的设置。在 Acrobat Pro 中,拼合预览工具包含一个用于保留叠印和专色信息的复选框,这间接有助于保留文本数据。印前检查工具提供显式保留文本的展平修复。
最安全的方法是在拼合之前保存 PDF 的未拼合副本。未展平的副本保留所有交互元素、注释和文本层。分发扁平版本。将未拼合的原件存档。如果需要恢复,原始数据会提供完整的源数据。
从更广泛的角度来看,在文档工作流程中,对于关键文档,请先在副本上测试拼合设置,然后再将其应用到原始文档。验证文本在展平后是否仍可恢复。如果恢复失败,请调整设置。测试步骤会增加工作流程的时间并防止永久性文本丢失。
使用印前检查来检测和提取隐藏文本层
Acrobat Pro 印前检查工具包含专门用于分析 PDF 内容结构的配置文件。库存报告列出了文件中存在的所有文本对象,包括在正常查看期间不可见的文本对象。在展平的 PDF 上运行此报告可以揭示文本数据是否在展平过程中幸存下来。
如果预检报告标识文本对象,请使用导出所有文本修复将它们提取到单独的文件中。然后可以将提取的文本与可见页面内容进行比较,以确定保留了多少原始文本以及它是否准确和完整。
从部分拼合的 PDF 中恢复文本
某些扁平化操作仅影响特定的页面元素,而使其他元素保持不变。表单字段可能会被展平,而正文文本仍保留为可选字符。注释可能会被展平,而底层页面文本仍然存在。独立检查每种元素类型,以确定哪些元素被展平,哪些元素被保留。
从广角来看,在文档工作流程中,对于部分扁平化的文档,从未扁平化的部分中提取幸存文本,并将其与扁平化部分的 OCR 输出相结合。混合方法通过使用可用的原始文本和原始丢失的 OCR 重建文本来最大限度地恢复文本。
何时接受不可能恢复
如果出现这种情况,如果文件结构中不存在文本数据,如果 Acrobat 找不到可编辑文本,并且 OCR 产生不可接受的不准确结果,则无法恢复原始文本图层。接受这个结论,并采取行动保护剩下的东西,而不是投入更多时间进行恢复尝试。
记录恢复尝试及其结果。注意使用的工具、尝试的方法以及得出的结论。该文档为未来的文档保管人提供服务,他们可能可以获得更好的恢复工具,并且应该了解之前尝试过的内容。
扁平化文档的长期归档策略
扁平化 PDF 通常是专门为存档目的而创建的,因为它们消除了交互依赖性。归档拼合文档时,请尽可能将未拼合的原件与拼合版本一起存储。原件保留了完整的文档结构。扁平化版本提供稳定的归档格式。
对于仅存在拼合版本的文档,运行 OCR 以创建文本图层并将其嵌入 PDF 中。 OCR 文本可能并不完美,但它可以实现未来不可能实现的搜索和文本提取。 OCR 层是扁平化图像和未来文档分析需求之间的桥梁。
文档集合的自动扁平化检测
管理大型文档集合的组织可以从扁平化 PDF 的自动检测中受益。打开每个 PDF、检查是否存在可选文本并标记不存在文本的文件的脚本可识别需要 OCR 处理的文档。自动扫描可防止扁平化文档在没有可搜索文本层的情况下悄悄进入存档。
将扁平化检测集成到文档摄取工作流程中。当新的 PDF 进入系统时,检查文本是否存在。如果文本不存在,则在文档到达存档之前将其路由到 OCR 处理队列。自动检测和更正确保每个存档文档都可搜索。
尝试修复 PDF
无需安装。直接在您的浏览器中工作。
