Tips & Tricks

如何 OCR PDF 進行資料庫匯入和索引

在掃描文件上執行OCR PDF 會產生識別的文字。對於大多數用戶來說,目標是可搜尋的 PDF。但是,當識別的文字需要匯入資料庫、由搜尋引擎索引或由應用程式查詢時,標準 OCR 輸出格式並不理想。以針對資料庫匯入和索引最佳化的結構化格式匯出 OCR 結果,將掃描的文件存檔轉換為與業務系統整合的可查詢資料。

要點

資料庫就緒的 OCR 輸出格式包括用於表格資料的 CSV、用於結構化文件內容的 JSON 以及用於需要保留層次結構的文件的 XML。與標準 OCR 輸出的主要區別在於,面向資料庫的格式包括一致的欄位對應、資料類型指示符以及低置信度識別結果的錯誤處理。在 OCR 之前準備 PDF(包括糾偏、對比度增強和解析度調整)可顯著提高匯出資料的品質。

How to OCR a PDF for Database Import and Indexing

為您的資料庫選擇正確的輸出格式

CSV 輸出非常適合掃描的表單和表格,其中每個文件對應於資料庫中的一行。每個表單欄位變成一列,每個掃描文件變成一行。 CSV 無需轉換即可直接匯入電子表格應用程式和關聯式資料庫。限制在於 CSV 無法表示分層資料。如果掃描的文件具有巢狀結構,例如包含多個行項目的發票,則 CSV 會強制您展平結構或將輸出分割為多個文件。

JSON 輸出自然地處理巢狀和變數結構。具有標題部分和多個行項目的發票表示為具有標題陣列和行項目陣列的 JSON 物件。 JSON 匯入到 MongoDB 等文件資料庫、Elasticsearch 等搜尋索引以及大多數現代應用程式平台中。從 OCR 到 JSON 再到資料庫的提取 PDF 資料管道是 2025 年文件理解應用程式最常見的架構。 JSON 結構還保留 OCR 置信度分數,這使資料庫查詢可以自動過濾掉低置信度結果。

當掃描的文件需要符合業界標準架構時,首選 XML 輸出。法律、醫療和政府文件處理通常需要根據特定文件類型定義進行驗證的 XML 輸出。 XML 格式支援單一文件中的結構和元數據,並且是許多企業內容管理系統所需的輸入格式。 WukongPDF 的 OCR 工具支援 CSV、JSON 和 XML 輸出格式,因此您可以選擇與資料庫匯入管道相符的格式,而無需進行後處理。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

預處理掃描的 PDF 以提高 OCR 準確性

對於原本印在彩紙上或因年代久遠而泛黃的文檔,在 OCR 之前將掃描件轉換為純黑白可以顯著提高識別準確率。 OCR 引擎很難將文字與彩色或紋理背景分開。使用保留文字同時刪除背景的閾值轉換為黑白,為 OCR 引擎提供乾淨的輸入。大多數掃描軟體和影像編輯器都包含具有可調節閾值的黑白轉換功能。在不同的閾值下測試幾頁,找到產生最乾淨文字的設定。

資料庫匯入會放大 OCR 錯誤。可搜尋 PDF 中的誤讀字元會帶來一些小不便。資料庫欄位中的相同錯誤可能會導致記錄無法找到、分類錯誤或與錯誤的實體相符。在 OCR 之前投入時間對掃描文件進行預處理可顯著降低錯誤率。三個最有影響力的預處理步驟是對頁面進行傾斜校正(即使旋轉幾度)、增加對比度以使文字在背景中清晰突出,並確保掃描解析度至少為 300 DPI。

傾斜校正可修正以微小角度掃描的頁面。即使旋轉兩度也會導致 OCR 引擎誤讀線條邊緣的字元。大多數 OCR 工具都包含自動糾偏功能,但值得驗證它是否在文件上正確啟動。開啟幾個經過 OCR 處理的頁面,檢查識別的文字方塊是否與可見文字對齊。未對齊的框表示糾偏失敗,這將在資料庫中產生垃圾資料。對比度增強對於用老化或發黃的紙張掃描的文件尤其重要。在 OCR 之前增加文字和背景之間的對比度可以將具有挑戰性的掃描的識別準確度提高 10% 到 20%。

將 OCR 輸出欄位對應到資料庫列

對於字段位置因頁面而異的文檔,關鍵字錨點比固定座標更可靠。根據目標資料之前或之後的文字(而不是其位置)定義提取規則。無論標籤出現在頁面上的什麼位置,「提取標籤發票總計後的數字」之類的規則都有效。基於關鍵字的提取要求 OCR 輸出包含完整識別的文字及其原始空間順序,JSON 輸出會保留這一點,而 CSV 輸出通常不會。

OCR 輸出和資料庫導入之間的差距是字段映射。 OCR 產生按頁面位置組織的文字。資料庫需要按欄位名稱組織的文字。彌合這一差距需要定義一個映射,該映射實際上表示第一頁右上角的文字是發票編號,並且位於invoice_number 列中。對於佈局在所有文件中保持一致的結構化表單,請使用位置座標或關鍵字錨定義一次映射。

對於佈局不同的半結構化文檔,請使用基於關鍵字的映射而不是位置映射。定義諸如「文字發票號碼後面的數字是發票編號,無論其在頁面上的位置如何。」之類的規則。基於關鍵字的映射在佈局變更中更可靠,但要求 OCR 輸出包含已識別的文字和位置元資料。這是為可變佈局文件選擇 JSON 或 XML 輸出而不是 CSV 的另一個原因。 JSON 和 XML 中的位置元資料使基於關鍵字的欄位提取成為可能。對於大型資料庫導入項目,WukongPDF的掃描的PDFOCR管道包括可設定的欄位映射,可輸出結構一致的CSV或JSON文件,以供直接資料庫攝取。

處理資料庫導入中的 OCR 置信度分數

對於準確性至關重要的資料庫應用程序,請實施兩次通過的 OCR 工作流程。第一遍以標準設定處理所有文件。置信度分數低於閾值的文件將被標記並使用增強設定(例如更高分辨率、糾偏和對比度調整)進行重新處理。兩次方法將額外的處理時間集中在需要它的文件上,而不是減慢整個批次的速度。

每個 OCR 結果都帶有一個置信度分數,通常是 0 到 100 之間的數字,表示引擎確定識別的文字與頁面上的內容相符。將 OCR 結果匯入資料庫時,確定置信度閾值。高於閾值的結果會自動導入。低於閾值的結果將被標記以供人工審核。此閾值取決於應用程式中錯誤的成本。搜尋索引可以容忍較低的閾值,因為使用者可以瀏覽結果並忽略不良匹配。數字直接輸入計算的金融資料庫需要很高的閾值,通常為 95 或更高。

將置信度分數與識別的文字一起儲存在資料庫中。像invoice_total 這樣的字段,其值為 250.00,置信度為 98,是值得信賴的。置信度為 62 的相同值應視為臨時值。查詢資料庫的應用程式可以使用置信度分數透過視覺指示器(例如黃色突出顯示或警告圖示)顯示低置信度值,提醒使用者在依賴資料之前驗證資料。置信度分數增加了平面文字輸出無法提供的資料品質維度。

常見問題

在準備資料庫匯入時,我應該如何處理將掃描頁面與本機數位頁面混合的 PDF?分別透過 OCR 處理掃描頁面和透過文字擷取處理數位頁面,然後合併結果。數位頁面不需要 OCR,在其上運行 OCR 實際上會降低文字質量,因為在原始數位文字完全準確的情況下引入識別錯誤。大多數批次工具可以偵測哪些頁面被掃描,哪些頁面是數位的,並自動將它們路由到適當的處理路徑。

批次匯入資料庫時可以處理多少掃描頁?

現代 OCR 引擎可以在標準硬體上每小時處理數千頁。實際限制不是 OCR 速度,而是驗證時間。在將整個批次匯入生產資料庫之前,安排時間檢查輸出樣本。 5% 的隨機樣本審查發現了可能影響整個批次的系統 OCR 錯誤。

我應該將原始掃描 PDF 與提取的資料一起儲存在資料庫中嗎?

是的,只要資料庫支援即可。儲存連結到提取資料的來源 PDF 可以提供審計追蹤。當出現資料品質問題時,使用者可以開啟原始掃描並根據來源文件驗證提取的值。許多受監管行業的合規性都需要提取資料和來源文件之間的這種連結。

OCR 可以處理資料庫匯入的手寫文字嗎?

手寫辨識已顯著改進,但仍不如印刷文字辨識準確。對於資料庫匯入,手寫欄位應路由至人工審閱,而不是自動匯入,除非手寫受到限制,例如在表單上的各個方塊中寫入數字。在大多數應用程式中,非結構化文件上的自由格式手寫對於自動資料庫匯入來說不夠可靠。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →