Tips & Tricks

如何使用 OCR 将打印页面的照片转换为可编辑、可搜索的文本

您用手机拍摄打印文档的照片。也许它是图书馆书中的一页、会议的讲义、费用报告所需的收据,或者您看到的包含重要信息的标志。照片很清晰,可以看懂,但它只是一张照片。您无法在其中搜索单词。您无法从中复制和粘贴文本。您无法编辑它。这是一张文字照片,而不是文字本身。

光学字符识别可以将该照片转换为可编辑、可搜索的文本,并且您的手机和浏览器上提供了执行此操作的工具。该过程拍摄打印页面的照片并生成一个文档,您可以在其中搜索、选择、复制和编辑每个单词,就像您自己键入一样。

How to Turn a Photo of a Printed Page Into Editable, Searchable Text Using OCR

为 OCR 获取最佳照片

OCR 准确性在很大程度上取决于输入图像的质量。一张光线充足、聚焦清晰的平面照片的 OCR 准确率可达 95% 至 99%。光线不佳、模糊、倾斜的弯曲页面照片的 OCR 准确率可能为 70%,这意味着大约每三到四个单词中就有一个包含错误。花在拍摄一张好照片上的时间会在减少校正工作量的情况下得到数倍的回报。

将文档放在平坦且光线充足的表面上。自然光是理想的选择,因为它是漫射的且无阴影。如果您调整自己的位置,使阴影不会落在页面上,那么头顶办公室的照明就会发挥作用。将手机直接放在页面上方,与页面平行,而不是倾斜。使用双手或将肘部放在表面上以保持手机稳定。用页面填充框架,在边缘周围留下小边距。点击屏幕以聚焦于文本。如果您的手机有文档扫描模式,请使用它。在 iPhone 上,Notes 应用程序包含扫描文档功能,可自动检测页面边缘、校正透视并增强对比度。在 Android 上,Google Drive 的扫描功能也具有相同的功能。

如果页面来自装订书并且无法平放,请轻轻按压书脊以减少弯曲,并接受靠近页面远离相机弯曲的装订线处 OCR 准确度会较低的事实。对于书脊附近的关键文本,请专门针对该区域拍摄第二张照片,并将手机靠近页面,以最大限度地提高弯曲文本的分辨率。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

使用手机的内置工具对照片运行 OCR

iPhone 包括实时文本,这是一种内置 OCR 功能,可直接在相机应用程序、照片应用程序和 Safari 中使用。将相机对准文本,实时文本图标会出现在取景器的一角。点击它,手机就会实时识别文字。您可以立即选择、复制并粘贴它。对于图库中已有的照片,请在“照片”应用程序中将其打开,然后查找“实时文本”图标。点击它可突出显示所有已识别的文本。您可以复制选定的部分或全部。实时文本完全在设备上运行,无需互联网连接。

Android 手机的 Google Photos 和 Google 应用程序中内置有 Google Lens。在 Google 相册中打开照片,然后点击镜头图标。 Google Lens 可以识别图像中的文本,并允许您选择、复制、翻译或搜索它。与 Apple 的 Live Text 一样,Google Lens 可以在最新设备上离线进行文本识别。对于这两个平台,内置 OCR 都是为短文、几句话或一个段落而设计的,而不是为多页文档设计的。它提取文本但不生成格式化文档。

使用OCR PDF工具将照片转换为可搜索的 PDF

对于需要成为适当文档的照片(具有可搜索文本层的 PDF),基于浏览器的 OCR 工具可以处理整个管道。 WukongPDF 接受 JPEG、PNG、HEIC 和其他常见格式的照片上传。上传照片。该工具对其进行处理,识别文本,并输出 PDF,其中原始照片作为可见页面,识别的文本作为其后面的不可见可搜索层。输出看起来与照片一模一样,但您现在可以搜索单词、选择和复制文本,并且文件的行为与任何其他 PDF 一样。

如果您有多张连续页面的照片,请将它们一起上传。该工具会处理每一个,然后您可以将它们组合成一个多页可搜索 PDF。这是使用手机对简短文档进行数字化的工作流程:拍摄每个页面、上传批次、运行 OCR,然后下载整个文档的单个可搜索 PDF。对于 10 页文档,该过程需要几分钟,生成的结果在功能上与平板扫描仪扫描的 PDF 相同。

清理照片中的 OCR 输出

用手机拍摄的照片,即使是好的照片,在 300 DPI 下产生的 OCR 准确度也低于平板扫描。打印页面的手机照片的 OCR 准确率通常为 90% 到 95%,这意味着大约 20 个单词中就有一个会出现错误。错误集中在可预测的位置:相机镜头造成失真的页面边缘附近、低于 10 磅的小字体以及有阴影或照明不均匀的区域。

从照片转换扫描的 PDF 后,打开 PDF 并搜索常见的 OCR 错误。搜索“cl”通常被认为是“d”, “rn”通常被认为是“m”,和“1”通常被认为是“l”。通读文本并纠正您发现的任何错误。清理所需的时间取决于文档的长度和照片质量。单页文档需要 5 到 10 分钟进行校对。一份 20 页的文档需要一个小时或更长时间。清理步骤是将草率的 OCR 结果与精美、专业的文档区分开来的。

当照片胜过扫描仪

当质量是重中之重时,手机照片并不能替代平板扫描仪。但手机照片比您需要时不在身边的扫描仪要好得多。最好的相机就是您拥有的相机。为了从图书馆书籍、会议讲义、白板笔记、收据、标牌、菜单以及您在办公桌之外遇到的任何印刷材料中捕获文本,手机照片和 OCR 将短暂的视觉体验转换为永久的、可搜索的、可编辑的文本。 WukongPDF 的图像到 PDF 管道可在一分钟内将手机照片连接到完成的 PDF,从而缩小在现实世界中查看文本与将其作为文档使用之间的差距。

值得理解的一个限制是:文本文档的手机照片通常会生成比同等平板扫描文件更大的文件大小,因为手机摄像头甚至可以捕获黑白文档的颜色信息。单个文本页面的手机照片(JPEG 格式)可能为 3 到 5 MB,而同一页面的黑白模式平板扫描可能为 200 KB。如果您要使用手机对许多页面进行数字化,请在运行 OCR 之前将照片转换为灰度。这可以将文件大小减少 60% 到 80%,并且通常可以提高 OCR 准确性,因为灰度转换消除了混淆识别引擎的颜色噪声和阴影。大多数照片编辑应用程序(包括 iPhone 和 Android 上的内置照片应用程序)都包含灰度或单色滤镜,只需轻按每张照片即可完成此操作。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →