Others

您可以對在帶有圖案、紋理或浮水印的紙張背景上列印文字的 PDF 進行 OCR 嗎

光學字元辨識的工作原理是檢測淺色背景上的深色形狀並將這些形狀與已知的字母圖案進行匹配。當背景不是均勻的淺色而是包含圖案、紋理或浮水印時,識別引擎面臨著根本上更困難的問題。頁面上的每個圖案元素都是潛在的誤報,OCR 必須將其與實際文字區分開來。帶有浮水印的紙張、有紋理的信紙、方格安全印刷品和裝飾性邊框都會增加視覺噪音,從而降低 OCR 準確性。問題不在於 OCR 是否能夠處理這些背景,而是它在什麼條件下能夠成功,以及何時準確度降至有用點以下。

Can You OCR a PDF Where the Text Is Printed Over a Patterned, Textured, or Watermarked Paper Background

背景圖案如何干擾字元辨識

OCR 引擎首先透過稱為閾值處理的過程將其轉換為二進位黑白影像來處理頁面。每個比截止值暗的像素都會變成黑色。每個變亮的像素都會變成白色。在帶有深色文字的乾淨白色頁面上,閾值處理會產生清晰的圖像,每個字母都清晰可見。在圖案背景上,比閾值暗的圖案元素變成與文字混合的黑色像素。然後,OCR 引擎嘗試將這些模式片段解釋為字母的一部分。穿過“e”中間的水印線可能會導致引擎看到帶有雜散標記的“c”。帶有小點的紋理背景可能會導致引擎看到不存在的時間段。

背景圖案的具體類型決定了 OCR 錯誤的性質。精細的點圖案(例如安全紙或老式打字紙上的點圖案)會產生斑點噪聲,OCR 引擎可能會將其解釋為字元上的標點符號或重音符號。線條圖案(例如直紋筆記本紙或方格紙)會產生連續的干擾,可以與字元筆畫合併,如果線條與上升部分對齊,則將“l”變成“b”。具有大文字或標誌的浮水印會創建背景暗度變化的區域,導致閾值處理丟失深色水印區域中的文字或將浮水印片段引入淺色區域中的文字。

圖案的密度相對於文字的密度非常重要。正如大多數專業浮水印的設計那樣,比文字明顯淺的水印可以通過閾值處理而不會留下可見的偽影。 OCR 引擎的預設閾值通常設定為將黑色文字與白紙分開,僅記錄 10% 到 15% 灰階的浮水印可能完全低於該閾值。對於接近文字暗度 40% 到 60% 的圖案,問題最為嚴重,其中閾值處理無法將圖案與文字清楚地分開,因為它們的強度範圍重疊。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

提高圖案背景 OCR 準確性的預處理技術

多種影像預處理技術可以在 OCR 引擎處理頁面之前減少或消除背景圖案。最廣泛有效的技術是自適應閾值處理,它為頁面的每個區域計算不同的亮度截止值,而不是使用單一全域截止值。在背景有圖案的區域中,自適應閾值會進行調整,將平均圖案亮度視為背景級別,從而在抑制圖案的同時保留文字。大多數現代 OCR 軟體都包含自適應閾值選項,但預設可能未啟用它。

第二種技巧是使用傅立葉變換或類似數學工具的頻率濾波。背景圖案往往是規則的和週期性的,這意味著它們在圖像中佔據特定的頻率。相比之下,文字是不規則的,並且佔據的頻率範圍很廣。頻域濾波器可以識別並抑制與背景圖案相關的窄頻帶,同時保留文字的寬頻訊號。該技術功能強大,但需要專門的影像處理軟體,通常用於大規模數位化專案而不是單一文件。

WukongPDF 的OCR PDF 工具包括處理常見背景變化的影像預處理。對於具有輕度至中度背景圖案的文檔,內建預處理可能足以產生可用的文字識別,而無需額外的手動步驟。關鍵是在處理整個文件之前在代表性頁面上測試識別。如果測試頁的準確度可以接受,則繼續進行該批次。如果測試頁顯示明顯錯誤,則影像可能需要在 OCR 之前進行外部預處理。

當手動轉錄在大量模式文件上擊敗 OCR 時

有一個質量閾值,低於該閾值 OCR 輸出需要大量手動校正,因此從頭開始輸入文字會更快。對於具有厚重背景圖案、密集浮水印或覆蓋整個頁面的安全列印的文檔,OCR 可能會產生其中 20% 或更多字元錯誤的文字。在多頁文件中修正五分之一的字元比重新輸入內容需要更長的時間,尤其是當錯誤不明顯時,例如在誤讀背景點的地方插入句號,這會改變句子的含義,而在校對過程中不易發現。

經濟決策取決於文件的長度和所需的準確性。帶有浮水印的信紙上的單頁信件可以在幾分鐘內手動轉錄。一本印在紋理紙上的 200 頁書需要數週的手工工作,即使是不完美的 OCR(正確捕獲 85% 的文本)也能提供實質性的領先優勢。對於大型項目,最佳工作流程通常是 OCR 和積極的預處理,然後對輸出進行人工審核,並接受審核步驟將識別並糾正模式引起的錯誤。當根據來源資料的難度校準準確度預期時,掃描 PDF 到可搜尋文字管道的效果最佳。

選擇正確的掃描設定以最大限度地減少背景幹擾

當您控制掃描過程時,一些設定可以在影像到達 OCR 引擎之前降低背景圖案的可見度。以灰階而不是彩色掃描可以消除基於顏色的圖案,例如有色浮水印或彩色安全線,否則會產生對比變化。將掃描器亮度設定為略高於正常亮度可將淺色背景圖案推至偵測閾值以下,同時保留深色文字。亮度增加 10% 到 15% 通常足以消除浮水印而不影響文字的可讀性。

某些掃描器具有專門為彩色或有圖案紙張上的文件設計的背景去除或背景平滑功能。此功能分析頁面並識別主要背景顏色或圖案,然後將其標準化為白色,同時保留前景內容。如果可用,應為任何將進行 OCR 的文件啟用此設定。乾淨來源影像的辨識精度的提高遠遠超過透過後掃描影像處理所能實現的。

評估圖案化文件的 OCR 準確性:接受哪些內容以及重新輸入哪些內容

可接受的 OCR 準確性的實際閾值取決於如何使用提取的文字。對於整個文檔檔案的全文搜索,80% 的準確度可能就足夠了。即使周圍文字的 20% 包含錯誤,搜尋特定名稱或帳號仍會找到該文件。對於提取將重新發布、引用或用於進一步分析的文本,95% 的準確度是更合適的最小值。低於該水平,糾正 OCR 錯誤所花費的時間接近手動轉錄文件所需的時間。是否接受 OCR 輸出或從頭開始重新輸入的決定應基於測量的準確性評估,而不是瀏覽幾頁形成的印象。

測量 OCR 準確性需要將已識別文字的樣本與原始文件進行比較。選擇三到五個代表性的頁面,統計原稿的字元總數,統計 OCR 輸出中的字元錯誤(包括替換、插入和刪除),併計算錯誤率。此測量需要十到十五分鐘,並為決定是否進行自動更正、手動審核或完全重新輸入提供了客觀基礎。此測量還可以識別最常見的錯誤類型,指導糾正策略的選擇。如果錯誤集中在特定模式類型中,有針對性的預處理也許能夠解決它們。如果錯誤是隨機分佈的,則 OCR 準確性將受到來源影像基本品質的限制,而不是任何特定的可糾正問題。

紙張上的背景圖案在設計時從未考慮到 OCR。它們的用途從品牌識別到防偽安全再到簡單的裝飾吸引力。從這些文件中捕獲的PDF影像將這些模式帶入數位領域,在那裡它們成為文字擷取的障礙。了解哪些模式可以透過預處理來緩解以及哪些需要手動工作,可以讓您對每個文件做出明智的決策,而不是對每次掃描應用相同的 OCR 工作流程並希望得到最好的結果。在了解文件的特定背景挑戰方面投入的時間會帶來更高的準確性、更少的手動校正以及忠實代表原始內容的數位文字輸出。

圖案背景上的 OCR 位於掃描技術、影像處理和文件工作流程設計的交叉點。沒有一種技術可以解決所有圖案背景挑戰,但適當的掃描設定、自適應預處理和現實的準確性期望的結合可以為絕大多數文件產生可用的結果。工具已經存在,技術也很成熟。有系統地應用它們可以將令人沮喪的 OCR 失敗轉變為可管理的品質控制流程。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →