您扫描某人手工填写的纸质表格。表格上的印刷文字清晰。框中的手写回复虽然混乱,但对人类来说是清晰易读的。您对扫描件运行 OCR,希望能够搜索表单并将手写答案提取为文本。打印文本的 OCR 结果近乎完美。手写体的 OCR 结果是乱码。经过印刷字体训练的识别引擎无法理解人类手写体的可变、不规则形状。
包含打字和手写文本的文档对OCR PDF引擎提出了双重挑战。打印的文本需要标准 OCR,效果很好。手写需要专门的手写识别,准确度较低,需要不同的设置。在单个文档中处理这两种内容需要一种适当处理每种内容类型的策略。

为什么手写对于 OCR 引擎来说如此困难
印刷文本 OCR 的工作原理是将字符形状与已知字体模式进行匹配。字母“a”是指字母“a”。在 12 点的 Times New Roman 中,每次出现时看起来都几乎相同。 OCR 引擎存储 Times New Roman 字母的模型,并与该模型进行匹配。手写体没有这样的模型。每个人都是“一个”看起来不一样。即使是同一个人的“a”也可能是同一个人。每次出现的情况都会有所不同,具体取决于周围的字母、书写速度、笔角度和疲劳程度。没有固定的模式可以匹配。
手写识别使用经过数千或数百万手写样本训练的机器学习模型。这些模型学习手写字母如何变化的统计模式,并且即使在明显偏离任何单个模板的情况下也可以识别字符。通过深度学习,手写识别的准确性得到了显着提高,但仍然远远落后于印刷文本识别。 PDF 协会的 2025 年基准发现,干净扫描的打印文本 OCR 准确率高于 97%。同一基准上的手写识别准确度约为 80% 至 85%,这意味着大约每五到六个手写单词中就有一个包含错误(PDF 协会,“OCR 准确度基准报告”,2025 年)。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
混合打字和手写文档的 OCR 策略
最有效的策略是将文档分为打字区域和手写区域,并使用适当的识别引擎处理每个区域。这种分离可以通过将文档裁剪或屏蔽成多个部分来手动完成,也可以通过检测每个区域的内容类型的识别引擎自动完成。
WukongPDF 的 OCR 工具可检测页面上的每个文本区域是打印的还是手写的,并应用适当的识别模型。在带有打印标签和手写答案的表单上,可以使用打印文本模型高精度地识别标签。手写答案将通过手写模型以手写质量允许的任何精度进行处理。输出是结合了两个识别结果的单个文本层。
通过更好的扫描提高手写 OCR 准确性
扫描质量对手写识别的影响比对印刷文本识别的影响更大。最低扫描分辨率为 300 DPI。更高的分辨率使识别引擎可以分析每个字符更多的像素。使用灰度或彩色模式而不是纯黑白。手写笔画中微妙的灰色变化携带着纯黑白阈值处理丢弃的字母形状信息。手写的“e”部分填充的循环可以在灰度中识别,但在阈值设置为黑白时变成难以区分的斑点。
确保笔迹尽可能深色且一致。铅笔笔迹比钢笔更难识别,因为石墨会产生更微弱、变化更大的线条。白纸上的蓝色或黑色墨水可产生最佳对比度。红色墨水、绿色墨水或彩色纸张会降低对比度和准确性。如果您控制表单填写过程,请指定应使用黑色墨水填写表单以获得最佳 OCR 结果。表单本身的这条小指令可以将下游数据提取的准确性提高 10 到 15 个百分点。
检查和更正手写 OCR 输出
OCR 后,扫描的 PDF文本层的错误集中在手写区域。打印的文本将接近完美。将您的复习重点放在手写答案上。打开 PDF 并搜索常见的手写 OCR 错误。数字 1 通常被认为是字母 l。数字0通常被识别为字母O。字母组合“th”是指数字0。通常被识别为“+h”。因为 t 的横杠融入到了 h 中。
对于需要提取到数据库或电子表格中的表单数据,手动检查手写字段至关重要。识别引擎提供最佳猜测。人类必须根据原始笔迹验证该猜测。在该验证步骤中,OCR 节省的时间被人工质量控制的需要部分抵消。净节省取决于数量。对于 10 个表格,手动数据输入可能比 OCR 加审核更快。对于 500 个表单,OCR 加审核速度显着加快,因为审核步骤仅限于 OCR 置信度较低的字段。 WukongPDF 的 OCR 输出包括每个已识别文本块的置信度分数,允许您按置信度排序并仅查看低置信度结果。
对于需要大量处理的表格,例如医疗表格、保险索赔或政府申请,表格设计本身可以提高手写 OCR 准确性。设计表单时使用单独的字符框,每个字母一个框,而不是用一长行来表示姓名或地址。单独的字符框迫使作者将字母分开,这极大地提高了识别准确性,因为 OCR 引擎可以在尝试识别之前隔离每个字符。这与世界各地的纳税表格和移民文件所使用的原则相同。这些盒子对于填写表格的人来说有点不方便,但它们可以实现大规模的自动数据提取,这是大批量表格处理所需的权衡。
对混合文档进行 OCR 后的实用质量检查点:搜索常见的 OCR 错误模式,这些错误模式表明引擎将手写内容与打印文本混淆了。搜索“cl”并验证它不应该是“d”。搜索“0”并验证每个实例实际上是零而不是大写 O。搜索“1”并验证它是 1,而不是小写 L 或大写 I。这三个搜索可捕获打印和手写识别中的大多数字符级 OCR 错误。修复发现的错误,然后再次搜索对文档用途至关重要的特定名称、数字或日期。打印说明中有拼写错误的表格很烦人。手写药物剂量错误的表格是危险的。
尝试 PDF OCR
无需安装。直接在您的浏览器中工作。
