Tips & Tricks

如何 OCR PDF 收據或發票並將行項目直接匯出到電子表格

鞋盒裡裝著收據。發票 PDF 的資料夾。需要輸入電子表格以進行稅務準備、費用報告或預算分析的一年的業務費用。將每張收據中的每個行項目手動輸入到 Excel 中不僅速度慢、容易出錯而且令人頭腦麻木。更好的工作流程使用 OCR 讀取收據文字並將識別的行項目直接匯出到結構化電子表格。

OCR PDF 到電子表格的管道已經顯著成熟。現代 OCR 引擎可以識別收據佈局,根據行項目的位置和格式模式識別行項目,並匯出需要最少清理的結構化資料。以前需要花費數小時的手動資料輸入,現在只需幾分鐘的自動處理和簡短的驗證步驟。

How to OCR a PDF Receipt or Invoice and Export the Line Items Directly to a Spreadsheet

準備 OCR 收據和發票

來源影像的影像品質決定了 OCR 輸出的準確性,這決定了您需要執行的清理量。在光線均勻的平坦、黑暗的表面上掃描或拍攝收據。确保收据平整,没有弄皱或折叠。捕獲整個收據,包括頂部的商店名稱和底部的總計。缺少商店名稱意味著 OCR 輸出沒有供應商識別。

對於褪色的熱感紙收據,請在運行 OCR 之前增強對比度。人眼幾乎看不到文字的褪色收據對於 OCR 來說基本上是不可見的。使用影像編輯器或具有對比度增強功能的掃描應用程式可使文字變暗並使背景變亮。增強的影像對於人眼來說可能看起來不自然,但會產生更好的 OCR 結果。

處理前按類型將收據分組。來自同一家商店的收據通常具有相似的佈局,將它們一起處理可以讓 OCR 引擎了解佈局模式並提高整個批次的準確性。混合來自不同商店的收據會迫使 OCR 引擎將每張收據視為唯一的佈局。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

配置 OCR 以提取收據數據

選擇針對收據最佳化的 OCR 設定。收據通常使用小字體、窄紙和熱敏列印,產生墨水密度不一致的字元。收據優化的 OCR 設定包括更高解析度的掃描、至少 300 DPI 以及灰階輸出(而非黑白輸出),以保留字元密度的細微變化。

WukongPDF 透過瀏覽器提供 OCR 處理,讓您可以掃描或上傳收據並提取文字。基於瀏覽器的 OCR 在本機處理文件,將您的財務文件保存在您的裝置上。

對於從收據中提取 PDF 資料,OCR 引擎必須區分項目描述、數量、單價和行總計。引擎使用位置提示來進行區分。項目通常位於左側,數量和價格位於右側,行總計位於最右側的列。收據佈局越一致,欄位辨識越準確。

將 OCR 資料匯出為電子表格格式

OCR完成後,將識別的資料匯出為CSV或Excel格式。匯出應保留 OCR 期間識別的欄位分隔:供應商名稱在一列中,日期在另一列中,每個行項目描述、數量、單價和行總計在各自的列中。大多數 OCR 工具都包含收據到電子表格的匯出選項。

掃描 PDF 到電子表格的轉換並不完美。每張收據預計需要花費五到十分鐘進行驗證和清理。將電子表格輸出與原始收據影像進行比較。檢查行項目加起來是否等於收據總額。驗證稅費是否已正確識別並與商品價格分開。驗證步驟會在 OCR 錯誤傳播到您的費用報告之前捕獲這些錯誤。

對於定期收據處理,請將 OCR 設定和匯出配置儲存為預設。後續的每批收據均使用相同的設定進行處理,從而產生一致的輸出。對於處理來自同一組供應商的每月費用報告的企業主來說,預設方法特別有價值。

處理多頁發票和複雜收據

多頁發票需要特殊處理,因為行項目可能會跨頁邊界繼續。 OCR 引擎必須認識到第二頁上的項目是第一頁上項目的延續,而不是一組新項目。當發票頁作為單一文件處理時,大多數 OCR 工具都能正確處理此問題。

帶有手寫小費金額的餐廳收據增加了手動驗證步驟。 OCR 可以讀取列印的金額,但難以辨識手寫內容,尤其是在列印收據後添加的手寫內容(當筆可能與列印文字交叉時)。如果 OCR 無法讀取小費金額和調整後的總額,則必須對其進行驗證並手動輸入。

匯出到電子表格後,使用電子表格工具對費用進行分類。新增類別列,並根據供應商或項目描述將每個行項目指派到費用類別。在 OCR 審核過程中進行分類比處理所有收據後進行分類更有效。

對於因環境原因越來越常見的雙面列印收據,請掃描雙面並將其作為單一文件進行處理。 OCR 引擎將正面和背面作為連續頁面讀取。如果商店在正面列印延續通知,則從收據正面延續到背面的行項目應被視為單筆交易。

貨幣符號和小數點分隔符號因地區而異。歐洲商店的收據使用歐元符號和逗號作為小數點分隔符號。在處理之前為正確的區域設定配置 OCR 引擎。對電子表格進行後處理以標準化來自不同國家/地區的收據的貨幣格式,確保財務報告的一致性。

收據上的日期格式差異很大。美國為 MM/DD/YYYY,歐洲為 DD/MM/YYYY,亞洲部分地區為 YYYY/MM/DD。 OCR 將日期匯出為可識別文字。電子表格必須根據收據來源正確解釋日期。新增收據國家/地區列有助於清理階段的日期解釋。

對於費用報告,OCR 電子表格輸出可以直接匯入會計軟體或費用管理平台。大多數平台接受具有標準列的 CSV 匯入:日期、供應商、描述、金額、類別和付款方式。將 OCR 輸出列對應到平台預期列是收據到報表管道中的最後一步。

將原始收據 PDF 與 OCR 電子表格輸出一起儲存。 PDF作為權威記錄。電子表格用作工作資料。如果對特定交易出現疑問,可以查閱原始收據 PDF 以驗證 OCR 解釋。

對於具有一致收據格式的經常性供應商,隨著引擎學習佈局,OCR 準確性會隨著時間的推移而提高。來自新供應商的第一張收據可能比第十張收據需要更多的手動清理。將校正後的輸出儲存為 OCR 引擎的訓練範例可加速此學習過程。

收據的稅率因地點和產品類型而異。 OCR 可能會辨識稅額,但無法辨識稅率。根據稅額和小計計算稅率有助於驗證 OCR 準確性。如果計算的稅率與購買地點的任何已知稅率不匹配,則 OCR 會誤讀金額或收據同時包含應稅項目和非應稅項目。

對於由個人和企業資金共同支付的業務費用,例如一人支付整張桌子的商務午餐,收據必須註明業務部分。註釋應在 OCR 之後添加到電子表格中,而不是添加到收據 PDF 中,以保留原始收據以供審計之用。

與手動資料輸入相比,收據 OCR 的投資回報在大約 50 個收據後變為正值。對於每月處理數百張收據的企業來說,節省的時間意味著可衡量的勞動成本降低和更快的費用報告週期。

基於雲端的收據管理平台將 OCR 與行動應用程式結合,在收據點擷取收據照片。收據資料直接流入費用報告,無需保存和稍後處理 PDF 文件的中間步驟,進一步簡化了工作流程。

美國國稅局和其他稅務機關接受收據的數位副本,前提是數位影像清晰且準確地代表原件。 OCR 電子表格輸出與原始收據 PDF 結合,滿足記錄保存要求,同時使資料對於稅務準備更加有用。

對於處理來自多個國家的收據的企業,OCR 系統必須處理不同的語言、貨幣、日期格式和稅收結構。來自法國的收據看起來與來自日本的收據不同,並且必須針對每個區域格式配置 OCR 系統。

數位化收據的長期價值超出了直接的費用報告需求。可以分析歷史收據資料以了解支出模式、供應商談判和預算預測,當收據仍為紙本形式或不可搜尋的 PDF 時,這些見解是無法存取的。

OCR 技術與電子表格匯出相結合,將收據從靜態記錄轉換為支援財務管理、稅務合規和商業智慧的可分析資料。

從紙本收據到 OCR 處理的數位資料的轉變是小型企業和個人財務管理的文件自動化最實際的應用之一。

OCR 收據處理將繁瑣且容易出錯的手動資料輸入任務轉換為快速、自動化的工作流程,在收到前數十張收據後,可以節省時間並收回成本。

收據欄位OCR識別技巧導出欄
店家名稱通常在頂部;最大字體小販
日期尋找頂部附近的日期模式日期
行項目左對齊文字區塊描述、數量、單價
小計稅前;常被貼上標籤小計
小計後;百分比或固定
全部的最大金額;經常大膽全部的
WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →