桌子上有两个版本的扫描合同。一份是客户审阅的草稿。另一个是他们签名并返回的内容。他们之间发生了一些变化,一个数字,一个条款,一个日期,但是通过来回翻页,在记忆中保留一页,同时看着另一页来找到它,是对注意力的考验,而人类的大脑并不是为此而设计的。差异隐藏在显而易见的地方。
眼睛会跳过它期望看到的东西。比较工具显示了实际的不同之处,而不是记忆所认为的不同之处。
比较两个扫描文档需要 OCR 来使文本可选择和比较,或者需要视觉覆盖比较来突出显示页面图像之间的像素级差异。 WukongPDF 的PDF 编辑器 和PDF 比较 工作流程支持这两种方法,并且以下方法适用于任何一对扫描的 PDF。

使扫描文档与 OCR 相媲美
扫描的文档是图像。要比较它们的文本,必须首先提取文本。对两个 PDF 运行 OCR 以创建可搜索的文本图层。 OCR 输出并不完美,尤其是在低质量扫描时,但它足以进行比较,因为该工具会标记差异,并且您可以根据原始内容直观地验证每个标记的差异。
Adobe Acrobat Pro 的比较文件工具适用于 OCR 后的扫描 PDF。它会比较已识别的文本并突出显示页面图像上下文中的差异。比较与 OCR 一样准确,可以捕获大多数实质性变化,同时有时会将识别伪影标记为差异。手动检查每个标记的项目,以将实际更改与 OCR 噪声区分开。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
使用视觉叠加比较来获得像素级精度
视觉叠加将两个扫描页面相互对齐并突出显示不同的像素。该方法与 OCR 准确性无关,可以捕获每个视觉差异、更改的数字、移动的逗号、移动的边距、添加的签名。输出是一个差异图,以突出显示颜色显示更改的区域。
局限性:视觉比较会标记每个像素差异,包括扫描伪影、轻微的定位变化以及扫描之间的亮度差异。这些误报必须与真正的差异一起进行审查。视觉比较提供了完整性,发现了每一个真正的变化,但以精度为代价,并不是每一个标记的差异都是有意义的。
使用桌面和基于浏览器的比较工具
Adobe Acrobat Pro 的比较文件工具是桌面标准。它会比较文本和视觉外观,突出显示差异,并生成并排报告。上传两个 PDF,运行比较,然后在比较视图中查看结果。该工具适用于 OCR 后的扫描文档。
基于浏览器的比较工具提供类似的功能,无需安装软件。上传两个 PDF,该工具会对齐页面并突出显示差异。质量因工具而异,扫描文档是最难的情况,因为工具必须处理图像对齐和变化。在依靠基于浏览器的工具进行重要比较之前,先在一对已知相似的扫描页面上测试该工具。
| 比较方法 | 优势 | 弱点 | 最适合 |
|---|---|---|---|
| OCR+文字比对 | 识别实质性文本更改 | 错过格式更改、OCR 错误标记误报 | 合同、法律文件、报告 |
| 视觉叠加(像素级) | 捕捉每一个视觉差异 | 将扫描工件标记为差异,没有语义理解 | 签署的文件、手写更改的表格 |
| 手动并排审查 | 人为判断,工具不会误报 | 缓慢、疲劳、错过细微差别 | 简短的文件,最终验证通过 |
| 混合(OCR + 视觉) | 结合了两种方法的优点 | 需要两次单独的比较 | 不容错过任何更改的高风险文件 |
处理手写更改和注释
扫描的合同通常包含手写标记、页边空白处的首字母缩写、圈出的术语、钢笔删除线、打印后添加的注释。 OCR 可以处理印刷文本,但无法处理手写文本,尤其是草书。视觉叠加比较可以捕获这些标记,因为两次扫描之间的像素不同,但它无法解释这些标记的含义。
对扫描文档的手写更改需要人工审核,就这样。没有任何自动化工具能够可靠地解释扫描合同上金额金额的手写删除线的法律意义。比较工具标记更改的位置。人类可以确定更改是协商的修订、杂散的笔标记还是扫描伪影。该工具发现。人类法官。
审查和解释比较结果
比较工具会生成一份报告,列出所有差异。从上到下浏览列表。对于每个差异,将两个 PDF 打开到相关页面,并直观地验证标记的差异是否真实,而不是伪影。接受或拒绝每一项。可接受的差异是版本之间的更改。
按类型对可接受的差异进行分类:文本更改、数字更改、格式更改、添加、删除。数字变化、金额、日期、百分比通常比格式调整更重要。首先查看号码更改。它们会带来格式更改所没有的财务和法律后果。
为利益相关者创建变更摘要
将已接受的差异编译成变更摘要。列出每项更改的页码、原始文本和更改的文本。该摘要使利益相关者可以清楚地了解版本之间的变化,而无需他们进行比较或查看完整的差异报告。
保留原始对比报告作为备份。总结沟通。报告文件。如果利益相关者对特定变更提出疑问,报告会提供页面参考和视觉证据来明确回答问题。
尝试编辑 PDF
无需安装。直接在您的浏览器中工作。
