Tips & Tricks

如何 OCR PDF 收据或发票并将行项目直接导出到电子表格

鞋盒里装着收据。发票 PDF 的文件夹。需要输入电子表格以进行税务准备、费用报告或预算分析的一年的业务费用。将每张收据中的每个行项目手动输入到 Excel 中不仅速度慢、容易出错而且令人头脑麻木。更好的工作流程使用 OCR 读取收据文本并将识别的行项目直接导出到结构化电子表格。

OCR PDF 到电子表格的管道已经显着成熟。现代 OCR 引擎可以识别收据布局,根据行项目的位置和格式模式识别行项目,并导出需要最少清理的结构化数据。以前需要花费数小时的手动数据输入,现在只需几分钟的自动处理和简短的验证步骤。

How to OCR a PDF Receipt or Invoice and Export the Line Items Directly to a Spreadsheet

准备 OCR 收据和发票

源图像的图像质量决定了 OCR 输出的准确性,这决定了您需要执行的清理量。在光线均匀的平坦、黑暗的表面上扫描或拍摄收据。确保收据平整,没有弄皱或折叠。捕获整个收据,包括顶部的商店名称和底部的总计。缺少商店名称意味着 OCR 输出没有供应商标识。

对于褪色的热敏纸收据,请在运行 OCR 之前增强对比度。人眼几乎看不到文本的褪色收据对于 OCR 来说基本上是不可见的。使用图像编辑器或具有对比度增强功能的扫描应用程序使文本变暗并使背景变亮。增强的图像对于人眼来说可能看起来不自然,但会产生更好的 OCR 结果。

处理前按类型对收据进行分组。来自同一商店的收据通常具有相似的布局,将它们一起处理可以让 OCR 引擎了解布局模式并提高整个批次的准确性。混合来自不同商店的收据会迫使 OCR 引擎将每张收据视为唯一的布局。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

配置 OCR 以提取收据数据

选择针对收据优化的 OCR 设置。收据通常使用小字体、窄纸和热敏打印,产生墨水密度不一致的字符。收据优化的 OCR 设置包括更高分辨率的扫描、至少 300 DPI 以及灰度输出(而非黑白输出),以保留字符密度的细微变化。

WukongPDF 通过浏览器提供 OCR 处理,允许您扫描或上传收据并提取文本。基于浏览器的 OCR 在本地处理文件,将您的财务文档保存在您的设备上。

对于从收据中提取 PDF 数据,OCR 引擎必须区分项目描述、数量、单价和行总计。引擎使用位置提示来进行区分。项目通常位于左侧,数量和价格位于右侧,行总计位于最右侧的列中。收据布局越一致,字段识别越准确。

将 OCR 数据导出为电子表格格式

OCR完成后,将识别的数据导出为CSV或Excel格式。导出应保留 OCR 期间识别的字段分隔:供应商名称在一列中,日期在另一列中,每个行项目描述、数量、单价和行总计在各自的列中。大多数 OCR 工具都包含收据到电子表格的导出选项。

扫描 PDF 到电子表格的转换并不完美。每张收据预计需要花费五到十分钟进行验证和清理。将电子表格输出与原始收据图像进行比较。检查行项目加起来是否等于收据总额。验证税费是否已正确识别并与商品价格分开。验证步骤会在 OCR 错误传播到您的费用报告之前捕获这些错误。

对于定期收据处理,请将 OCR 设置和导出配置保存为预设。后续的每批收据均使用相同的设置进行处理,从而产生一致的输出。对于处理来自同一组供应商的每月费用报告的企业主来说,预设方法特别有价值。

处理多页发票和复杂收据

多页发票需要特殊处理,因为行项目可能会跨页边界继续。 OCR 引擎必须认识到第二页上的项目是第一页上项目的延续,而不是一组新项目。当发票页作为单个文档处理时,大多数 OCR 工具都能正确处理此问题。

带有手写小费金额的餐厅收据增加了手动验证步骤。 OCR 可以读取打印的金额,但难以识别手写内容,尤其是在打印收据后添加的手写内容(当笔可能与打印文本交叉时)。如果 OCR 无法读取小费金额和调整后的总额,则必须对其进行验证并手动输入。

导出到电子表格后,使用电子表格工具对费用进行分类。添加类别列,并根据供应商或项目描述将每个行项目分配到费用类别。在 OCR 审核过程中进行分类比处理所有收据后进行分类更有效。

对于因环境原因越来越常见的双面打印收据,请扫描双面并将其作为单个文档进行处理。 OCR 引擎将正面和背面作为连续页面读取。如果商店在正面打印延续通知,则从收据正面延续到背面的行项目应被视为单笔交易。

货币符号和小数点分隔符因地区而异。欧洲商店的收据使用欧元符号和逗号作为小数点分隔符。在处理之前为正确的区域设置配置 OCR 引擎。对电子表格进行后处理以标准化来自不同国家/地区的收据的货币格式,确保财务报告的一致性。

收据上的日期格式差异很大。美国为 MM/DD/YYYY,欧洲为 DD/MM/YYYY,亚洲部分地区为 YYYY/MM/DD。 OCR 将日期导出为可识别文本。电子表格必须根据收据来源正确解释日期。添加收据国家/地区列有助于清理阶段的日期解释。

对于费用报告,OCR 电子表格输出可以直接导入到会计软件或费用管理平台中。大多数平台接受带有标准列的 CSV 导入:日期、供应商、描述、金额、类别和付款方式。将 OCR 输出列映射到平台预期列是收据到报告管道中的最后一步。

将原始收据 PDF 与 OCR 电子表格输出一起存储。 PDF作为权威记录。电子表格用作工作数据。如果对特定交易出现疑问,可以查阅原始收据 PDF 以验证 OCR 解释。

对于具有一致收据格式的经常性供应商,随着引擎学习布局,OCR 准确性会随着时间的推移而提高。来自新供应商的第一张收据可能比第十张收据需要更多的手动清理。将校正后的输出保存为 OCR 引擎的训练示例可加速此学习过程。

收据的税率因地点和产品类型而异。 OCR 可能会识别税额,但无法识别税率。根据税额和小计计算税率有助于验证 OCR 准确性。如果计算的税率与购买地点的任何已知税率不匹配,则 OCR 会误读金额或收据同时包含应税项目和非应税项目。

对于由个人和企业资金共同支付的业务费用,例如一人支付整张桌子的商务午餐,收据必须注明业务部分。注释应在 OCR 之后添加到电子表格中,而不是添加到收据 PDF 中,以保留原始收据以供审计之用。

与手动数据输入相比,收据 OCR 的投资回报在大约 50 个收据后变为正值。对于每月处理数百张收据的企业来说,节省的时间意味着可衡量的劳动力成本降低和更快的费用报告周期。

基于云的收据管理平台将 OCR 与移动应用程序相结合,在收据点捕获收据照片。收据数据直接流入费用报告,无需保存和稍后处理 PDF 文件的中间步骤,进一步简化了工作流程。

美国国税局和其他税务机关接受收据的数字副本,前提是数字图像清晰且准确地代表原件。 OCR 电子表格输出与原始收据 PDF 相结合,满足记录保存要求,同时使数据对于税务准备更加有用。

对于处理来自多个国家/地区的收据的企业,OCR 系统必须处理不同的语言、货币、日期格式和税收结构。来自法国的收据看起来与来自日本的收据不同,并且必须针对每个区域格式配置 OCR 系统。

数字化收据的长期价值超出了直接的费用报告需求。可以分析历史收据数据以了解支出模式、供应商谈判和预算预测,当收据仍为纸质形式或不可搜索的 PDF 时,这些见解是无法访问的。

OCR 技术与电子表格导出相结合,将收据从静态记录转换为支持财务管理、税务合规和商业智能的可分析数据。

从纸质收据到 OCR 处理的数字数据的转变是小型企业和个人财务管理的文档自动化最实际的应用之一。

OCR 收据处理将繁琐且容易出错的手动数据输入任务转换为快速、自动化的工作流程,在收到前几十张收据后,可以节省时间并收回成本。

收据字段OCR识别技巧导出栏
店铺名称通常在顶部;最大字体小贩
日期寻找顶部附近的日期模式日期
行项目左对齐文本块描述、数量、单价
小计税前;经常被贴上标签小计
小计后;百分比或固定
全部的最大金额;经常大胆全部的
WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →