Tips & Tricks

如何對混合橫向和縱向頁面的 PDF 進行 OCR

由混合來源組裝而成的掃描 PDF 通常包含縱向和橫向頁面。財務電子表格顯示為橫向頁面。隨附的文字文件顯示為縱向頁面。在不考慮混合方向的情況下對此類文件運行 OCR 會產生可識別的文本,其中橫向頁面上的文字會被打亂、旋轉或完全丟失,因為 OCR 引擎以錯誤的方向處理這些頁面。

OCR PDF引擎分析文字行以決定字元位置和閱讀順序。當頁面相對於引擎期望旋轉 90 度時,文字行垂直而不是水平運行。引擎要么無法完全識別文本,要么嘗試垂直閱讀,產生無意義的輸出。混合方向文件需要在 OCR 處理之前進行每頁方向檢測。

WukongPDF 的掃描 PDF OCR 工具可處理混合頁面方向,並在識別過程中自動偵測每個頁面的旋轉。

為什麼頁面方向對於 OCR 準確性很重要

OCR 引擎的工作原理是偵測字元行並分析每行內的形狀。縱向頁面的文字行水平運行,引擎會自然處理。在沒有旋轉校正的情況下查看橫向頁面時,從 OCR 引擎的角度來看,文字行是垂直延伸的。引擎需要水平文本,無法讀取垂直文本。

解決方案是在 OCR 之前檢測每個頁面的方向,並在處理之前將橫向頁面旋轉為縱向方向。 OCR 後,頁面可以旋轉回其原始方向,並且識別的文字層位置正確。處理過程中的旋轉不會永久改變文件;它只會改變 OCR 引擎查看頁面的方式。

大多數自動化 OCR 工具假定所有頁面都具有相同的方向,因為這是單一掃描器在單一會話中產生文件的常見情況。混合方向文件通常是透過組合不同來源的掃描創建的,需要明確配置才能正確處理每頁的變化。

方法 1:具有每頁旋轉偵測功能的 Acrobat Pro

如果配置適當,Acrobat Pro 的 OCR 功能可以處理混合方向的文件。在 Acrobat Pro 中開啟掃描的 PDF,然後前往「工具」、「掃描和 OCR」、「識別此文件中的文字」。在「識別文字」設定對話方塊中,確保為文件的主要語言選擇正確的 OCR 語言。在「設定」部分下,啟用「傾斜校正和拉直」選項,這有助於 Acrobat 偵測頁面旋轉。

Acrobat 單獨處理每個頁面並嘗試偵測主要文字方向。對於偵測正確的頁面,OCR 輸出準確且可讀。對於偵測失敗的頁面,例如文字最少或視覺背景複雜的頁面,OCR 輸出可能會混亂或完全不存在。 OCR 處理後,專門檢查橫向頁面。搜尋您可以在這些頁面上直觀看到的文字。如果搜尋未找到任何結果,則 Acrobat 可能錯誤識別了方向。

對於錯誤識別的頁面,請在組織頁面工具中手動旋轉它們,然後僅在這些頁面上重新執行 OCR。每個受影響的頁面的手動幹預只需要一點時間,並確保每個頁面都為可搜尋文件輸出提供準確的識別文字。

方法 2:使用 OCRmyPDF 進行預處理

OCRmyPDF 是一個基於 Tesseract OCR 建構的開源命令列工具,透過其內建的歪斜校正功能處理混合方向的頁面。指令 ocrmypdf --deskew input.pdf output.pdf 偵測每個頁面上的文字方向,根據需要旋轉頁面,使用 Tesseract 執行 OCR,並輸出可搜尋的 PDF。糾偏標誌是混合方向文檔處理的基本參數。

OCRmyPDF 依序處理頁面並自動套用每頁方向校正。對於極度旋轉的文件或同時包含水平和垂直文字的頁面,傾斜校正演算法會根據主要文字方向確定頁面方向,從而為大部分頁面內容提供最佳 OCR 結果。少數文字方向的準確性可能會略有降低,但通常仍然可以識別。

在文件工作流程中,對於混合方向文件的大批量批次處理,OCRmyPDF 與處理資料夾中所有 PDF 的 shell 腳本相結合,提供完全自動化的 OCR,而無需手動進行每個文件配置。自動化處理日常處理,只有例外情況才需要手動審查。

專門驗證橫向頁面上的 OCR 輸出

OCR 處理後,驗證橫向頁面上的輸出作為單獨的重點檢查。選擇輸出 PDF 中橫向頁面上的文字並將其複製到純文字編輯器。複製的文字應按正確的順序閱讀,從上到下、從左到右匹配視覺頁面內容。如果單字混亂、無序或以無意義的順序出現,則該頁面的方向會偵測失敗。

搜尋橫向頁面上出現的特定已知術語。橫向頁面上的財務表可能包含您可以在 OCR 輸出中搜尋的特定帳戶代碼、部門名稱或數值。如果搜尋在橫向頁面上找不到匹配項,但在同一文件的縱向頁面上找到匹配項,則 OCR 引擎可能完全錯過了橫向內容。這些頁面需要重新處理並指定手動方向。

在文件工作流程中,對於將用作可搜尋檔案的文檔,驗證步驟是一個品質關卡,可在文檔進入永久館藏之前捕獲與方向相關的 OCR 問題。未經驗證的 OCR 輸出會默默地錯過整個內容頁面,這破壞了創建可搜尋檔案的目的。

批量處理混合方向掃描集合

對於大量具有混合方向的掃描文檔,手動逐頁驗證是不切實際的。使用 OCRmyPDF 和去歪斜標誌自動執行該過程,然後執行驗證腳本來檢查每個輸出頁面是否存在可搜尋文字。識別文字字元為零或字元很少的頁面將被標記為進行手動審查和可能的重新處理。

驗證腳本讀取每個經過 OCR 處理的 PDF,逐頁提取文字層,並計算每頁上已識別字元的數量。任何低於最小字元閾值(例如十個字元)的頁面都被標記為可能未處理或方向錯誤。標記的頁面被編譯成一份報告,指導人工審核工作僅針對實際需要人工關注的頁面,而不是要求審核每個頁面。

關於工作流程,對於正在進行的數位化項目,新的掃描文件定期到達,批次和驗證工作流程成為標準作業程序。新文件進入管道,透過帶有方向檢測的 OCR 自動處理,只有例外情況才需要人工幹預。自動化處理日常事務。人工審核員處理例外情況。

透過內部旋轉改進頁面上的 OCR

某些掃描文件包含的頁面的內容在頁面內旋轉,而不是頁面本身旋轉。透過將表格內容旋轉 90 度,同時保持頁面尺寸縱向,可以將橫向財務表格插入縱向文件中。這些頁面對於方向檢測來說是最具挑戰性的,因為頁面尺寸沒有提供需要旋轉的指示。

對於文件處理,對於內部旋轉的頁面,手動預處理是最可靠的方法。在 Acrobat Pro 中,使用編輯 PDF 工具選擇旋轉的內容區域,將其旋轉到正確的水平方向,並將其正確放置在頁面上。校正內旋後,在校正後的頁面上執行 OCR。每個受影響的頁面的手動預處理步驟大約需要一分鐘,但會產生乾淨且準確的 OCR 輸出。

識別內旋轉的頁面需要目視檢查。掃描文件並尋找文字相對於頁面邊緣以意外方向延伸的頁面。內旋轉頁面在大多數文件集中相對較少,但一旦出現就會嚴重影響 OCR 品質。

為混合方向文檔選擇正確的 OCR 引擎

不同的 OCR 引擎以不同的精度處理方向檢測。具有糾偏預處理器的 Tesseract 可以很好地處理中等旋轉,但可能會難以處理精確旋轉 90 或 180 度的頁面。 Google Cloud Vision OCR 包含內建方向偵測,可可靠地處理所有旋轉角度。對於準確性至關重要的關鍵混合方向文檔,基於雲端的 OCR 服務在方向處理方面通常優於本地引擎。

在提交大批量之前,在一小部分混合方向頁面樣本上測試所選的 OCR 引擎。使用已知方向模式進行的十頁測試揭示了引擎如何處理文件中的特定旋轉類型。如果引擎方向檢測證明不足以滿足您的特定文件類型,則測試需要幾分鐘的時間,並且可以避免數小時的重新處理。

從混合方向文件匯出 OCR 文本以進行驗證

OCR 處理後,匯出識別的文字以驗證所有頁面的完整性。在 Acrobat Pro 中,前往“工具”、“匯出 PDF”,然後選擇“文字”作為輸出格式。匯出的文字檔案應包含按正確閱讀順序的每個頁面的內容。開啟文字檔案並蒐索您知道出現在特定橫向頁面上的術語。如果匯出時缺少這些術語,則這些頁面可能在 OCR 流程中方向錯誤,需要重新處理。

關於文檔處理,對於用於可搜尋檔案的文檔,導出的文字可作為每個頁面將其內容貢獻給可搜尋層的獨立驗證。存在間隙或缺失部分的文字匯出表示 OCR 失敗,在文件進入永久存檔之前需要注意。匯出步驟充當品質關卡,在與方向相關的 OCR 問題成為永久性存檔缺陷之前捕獲它們。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →