Tips & Tricks

如何将扫描 PDF 中的手写笔记转换为可编辑的键入文本

一页手写在笔记本上、用手机拍照并保存为扫描 PDF 的会议记录包含了搜索、复制粘贴和屏幕阅读器完全无法访问的有价值的信息。这些文字对人眼来说是可见的,但对计算机来说只是图像中的形状。将这些手写笔记转换为可编辑的键入文本,使其可在任何文档或应用程序中搜索、复制和使用。

手写识别比印刷文本识别更难,因为每个人的笔迹都是独一无二的。字母形状在个体之间的差异远大于印刷字体的差异,识别引擎必须处理这种差异。

将扫描的OCR PDF文档中的手写笔记转换为可编辑的打字文本需要一个支持手写的 OCR 引擎,该引擎可以识别草书和打印手写内容,并且需要一个工作流程来处理与打印文本 OCR 相比更高的手写识别错误率。 WukongPDF 的扫描 PDF 和 OCR 工具支持文本识别,下面的指南涵盖了最大限度地提高手写识别准确性。

How to Convert Handwritten Notes in a Scanned PDF Into Editable Typed Text

为什么手写识别比印刷文本 OCR 难得多

印刷文本 OCR 的工作原理是将字符形状与已知的字体模式进行匹配。无论是我打字、你打字还是机器打印,Times New Roman 中的字母 A 看起来都是一样的。识别引擎对于每种常见字体中的每个字符都有一个清晰、一致的模板。手写识别没有这样的模板,因为每个人的字母 A 看起来都不一样。该引擎必须识别手写字符的统计模式,这些字符在形状、大小、倾斜和字母之间的连接方面存在巨大差异。

草书手写体将单词中的字母连接起来,增加了额外的复杂性。识别引擎必须在识别每个字母之前将连接的字母分割成单独的字符。不正确的分割,将字母 m 拆分为 r 和 n,或将两个字母合并为一个,是手写识别错误的一个主要来源。印刷体手写体中的每个字母都是单独书写的,因此识别引擎更容易处理并产生更准确的结果。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

准备用于手写识别的扫描图像

源图像的质量是影响手写识别准确性的最大因素,比识别引擎的选择更重要。以至少 300 DPI 扫描或拍摄手写页面,对于小字迹或密集字迹,建议使用 600 DPI。确保整个页面的照明均匀、无阴影。将相机或手机与页面平行放置,以尽量减少透视失真。源图像越好,识别越准确。

在运行识别之前增强扫描图像。增加对比度以使墨水变暗并使纸张背景变亮。应用锐化滤镜使手写笔画的边缘更加清晰。使用自适应阈值将图像转换为灰度或纯黑白,这比全局阈值更好地处理不均匀的照明。增强的图像向识别引擎呈现更清晰、更清晰的字符形状。

使用支持手写的 OCR 引擎

Tesseract 等通用 OCR 引擎包含可通过配置设置启用的手写识别模式。在 Tesseract 中,指定包含手写支持的语言模型,并设置页面分割模式以将图像视为单个文本块。 Google Cloud Vision API 和 Microsoft Azure 计算机视觉在其基于云的 OCR 服务中包含手写识别功能。

专用手写识别应用程序(例如 Nebo、GoodNotes 或 Microsoft OneNote 的墨迹到文本功能)专门针对手写进行了优化,并且通常比强加到手写服务中的通用 OCR 引擎产生更好的结果。从手写应用程序导出识别的文本,并根据需要将其与原始扫描的 PDF 重新集成。

系数对精度的影响建议
扫描分辨率更高的分辨率为每个角色提供更多细节最低 300 DPI,小字迹 600 DPI
灯光阴影和不均匀的照明模糊了角色边缘漫射、均匀的照明;避免相机闪光灯
手写风格印刷体手写比草书更容易如果您控制来源,请以印刷形式书写以获得更好的结果
图像增强更清晰的输入产生更清晰的识别增加对比度、锐化、应用自适应阈值

检查和更正识别的文本

手写识别总是会产生错误,根据手写质量和图像条件,字符错误率通常为 5-20%。对照原始手写页面检查已识别的文本并纠正错误识别的单词。纠正步骤需要时间,但对于输出可用于搜索、复制粘贴或进一步编辑至关重要。

对于需要完美准确性的文档(例如法律记录或医疗笔记),请将识别的文本视为搜索索引,而不是原始笔迹的替换。保留原始扫描图像作为权威记录。使用识别的文本启用关键字搜索,在原始扫描中查找相关页面。可搜索的识别文本和原始图像的组合提供了两者的最佳效果:文本的可查找性和图像的保真度。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →