Others

為什麼 OCR 在彩色背景文件上產生不可讀的輸出

您可以掃描具有淡藍色背景的文件、彩色表格或有色紙上的列印證書。掃描結果看起來不錯。文字明顯比背景暗。您對其運行 OCR,期望有可搜尋的文本,但輸出是亂碼。隨機字元、黏在一起的單字、不形成任何可辨識語言的字母。您的眼睛很容易濾除的背景顏色會混淆 OCR 引擎,但從掃描結果來看並不明顯。

OCR 引擎透過偵測前景和背景之間的對比度來運作。當背景有顏色時,即使是淺色調,也會降低有效對比度,並在二值化過程中引入噪聲,這是 OCR 引擎決定哪些像素是文字、哪些像素是背景的關鍵第一步。內華達大學的 2025 年基準發現,與白皮書上的同一文件相比,彩色背景文件的 OCR 準確度平均下降了 23 個百分點(UNLV,“ISRI OCR 準確度指標”,2025 年)。這種準確性的下降直接導致更多的手動更正、更多錯過的搜尋字詞以及更少可用的數位文字。

Why Does OCR Produce Unreadable Output on Documents With Colored Backgrounds

二值化問題:OCR 首先出錯的地方

在任何OCR PDF引擎可以識別字元之前,它必須透過稱為二值化的過程將彩色或灰階影像轉換為純黑白表示。掃描影像中的每個像素都被分類為前景(文本,設定為黑色)或背景(設定為白色)。然後,引擎查看黑白像素的圖案來識別單個字元。如果二值化步驟出錯,那麼接下來的一切都建立在這些錯誤的基礎上,並且任何聰明的字元辨識都無法從根本上損壞的輸入中恢復。

當文件具有彩色背景時,二值化演算法面臨困難的閾值決策。在白頁上,文字像素在 0-255 暗度範圍內的值可能為 0-80,而背景像素為 200-255。文字和背景之間的間隙較寬,閾值易於設定且置信度高。在藍色頁面上,文字像素可能為 0-100,背景像素為 140-180。差距更窄,演算法必須做出更精細的區分。在背景顏色略有變化的區域中,就像在幾乎所有列印的彩色背景中一樣,閾值可以交叉並開始將背景像素分類為文本,創建虛擬字元並合併真實字元。

全域閾值方法將單一截止值應用於整個影像,特別容易受到彩色背景的影響。這些方法的工作原理是分析影像的整體亮度直方圖,並選擇一個閾值來分隔代表文字和背景的兩個主峰值。彩色背景會在直方圖中引入第三個峰值,使演算法混亂,並且通常會導致閾值要么過於激進,擦除襯線和橫線等字符的細小部分,要么過於保守,留下背景噪聲,然後識別階段會嘗試將其解釋為文本。

二值化失敗的實際後果是 OCR 引擎收到損壞的輸入。原本應該是白色背景上乾淨的黑色形狀的字元卻被破壞、合併或被噪音包圍。識別階段盡最大努力處理這種降級的輸入,將部分形狀與其字元模型進行匹配,但隨著二值化品質的下降,錯誤率迅速攀升。使用者所看到的亂碼輸出是第一個處理步驟中引入的錯誤的累積效應,並透過每個後續階段放大。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

特定的背景顏色以及為什麼它們會造成最大的麻煩

並非所有背景顏色都會同等影響 OCR。黃色背景引起的問題最多,特別是對於較舊或較簡單的 OCR 引擎。原因是黃色具有高亮度,這意味著它對於相機或掃描器來說顯得明亮,但在灰階轉換中,它比您想像的更接近白色。黃色背景上的文字顏色看起來清晰,但在灰階轉換後幾乎看不見,這是大多數 OCR 引擎首先處理圖像的方式。人類視覺系統在濾除黃色方面表現出色,但電腦視覺演算法不具備這種生物優勢。

人眼可以毫不費力地過濾掉背景顏色,但軟體卻不能。

藍色和綠色背景造成了一個相關但獨特的問題。這些顏色在亮度上與黑色文字很好地分離,但在掃描器和相機使用的單獨的紅色、綠色和藍色感測器通道中則不然。掃描器的藍色通道強烈捕捉藍色背景,降低了該通道中黑色文字的對比度。 OCR 引擎通常在單一通道或特定加權通道組合下工作,可能會得到比預期對比度更低的影像。

對於需要 OCR 的掃描 PDF 文檔,預處理品質決定最終結果。 WukongPDF在OCR處理過程中應用自適應二值化,它根據頁面每個小區域的特徵局部調整閾值,而不是使用單一全域閾值。這種方法比傳統的固定閾值方法更可靠地處理彩色背景。

紅色和粉紅色背景帶來了另一個挑戰。紅色的亮度比黃色低,因此它會在灰度中轉換為較深的灰色。結果是紅色背景在灰階圖像中減少了文字和背景之間的分離。處理紅色文件的 OCR 引擎可能會將背景視為較暗區域中的前景,從而在二值化輸出中創建深色斑點,然後文字辨識階段會嘗試將其解釋為扭曲的字元。政府表格、醫療登記文件和教育證書經常使用彩色紙張或有色背景,這使得這成為醫療保健、教育和公共管理領域的實際問題。

漸層背景和圖案紙

漸層背景(顏色強度在整個頁面上變化)比純色背景更具挑戰性。從頂部深色到底部淺色的收據、帶有逐漸向內淡出的裝飾邊框的證書,或者帶有過渡到白色的彩色標題的表格,都會創建最佳二值化閾值不同的區域。使用單一全域閾值的 OCR 引擎將正確二值化頁面的一個部分,而在另一部分上失敗,從而在同一頁上產生在乾淨文字和亂碼之間交替的輸出。

有圖案的背景,例如支票上的安全圖案、帶有浮水印的紙張紋理或某些政府表格上的點陣圖案,是 OCR 的最壞情況。此圖案會創造規則的重複紋理,OCR 引擎可能會將其誤認為文字元素。引擎可能會嘗試將圖案點識別為句點或將圖案線識別為字母。輸出將實際文字與模式偽影混合在一起,產生這樣的輸出:真實單字散佈著隨機標點符號和短字元序列,看起來可能是單詞,但實際上不是單字。

背景模式也以陰險的方式與文字交互,如果不對特定文件進行測試,則很難預測這些方式。文字後面的對角線圖案可能會連接二值化圖像中的相鄰字符,導致 OCR 引擎將兩個或三個字母視為單個字形。點圖案可能會填滿 o、e 和 a 等字母的計數器,使它們與實心斑點無法區分。這些互動取決於模式頻率、文字大小和字體設計的特定組合,這就是為什麼兩個具有相似背景的文件可能會產生截然不同的 OCR 結果。

修復彩色背景 OCR 的預處理技術

多個預處理步驟可以顯著提高彩色背景上 OCR 的PDF 品質。最有效的是自適應閾值處理,它為每個小像素鄰域計算不同的二值化閾值,而不是將一個閾值應用於整個頁面。自適應方法可以保留深色背景區域中的文字對比度,同時正確消除淺色區域中的背景,所有這些都在同一圖像內。

顏色通道選擇是另一種強大的技術。透過檢查掃描影像的各個紅色、綠色和藍色通道,您通常可以找到其中文字和背景之間的對比度明顯高於全色影像或灰階轉換的通道。對於藍色背景,紅色通道通常顯示最佳對比度,因為藍色背景在紅色通道中顯得較暗,從而增加了與黑色文字的分離度。這項技術無需花費任何成本即可嘗試,並且可以帶來顯著的改進。

第三種技術是背景減法,嘗試估計沒有文字的背景是什麼樣子,然後從圖像中減去它,只留下均勻的白色背景上的文字。此方法適用於背景顏色僅逐漸變化的統一顏色的文檔,例如有色紙或淺色表格。對於具有複雜或快速變化背景的文檔,背景扣除的效果較差,並且可能會引入其自身的偽影。

基於現代人工智慧的預處理代表了 OCR 品質改進的前沿。經過數百萬文件圖像訓練的神經網路可以學習以演算法方法無法比擬的方式將文字從複雜的背景中分離出來。這些人工智慧預處理器可以處理各種背景顏色、圖案和漸變,甚至可以從無法擊敗傳統方法的文件中產生乾淨的二值化輸出。截至 2025 年,人工智慧預處理可在多個商業 OCR 平台中使用,並且正在成為標準功能而不是高級附加功能。

何時放棄 OCR 並使用替代方法

無論您應用多少預處理,某些帶有彩色背景的文件都無法很好地進行 OCR。在深色紙張上列印淺色文字的文件、使用金屬或反光墨水的文件以及文字本身使用彩色墨水而不是黑色的文件特別難以自動文字識別。在這些情況下,手動轉錄或混合方法(對您能識別的內容進行 OCR 並鍵入其餘內容)通常比繼續優化 OCR 管道更省時。

對於必須準確數位化的關鍵文檔,請考慮原始數位原始檔案是否存在於某處。即使視覺渲染具有彩色背景,從 Word 文件建立的 PDF 也會保留原始文字資料。如果您可以獲得原始檔案而不是列印版本的掃描件,則可以完全繞過 OCR 問題。這並不總是可行,尤其是對於遺留文檔,但在投入大量時間進行 OCR 優化之前值得進行調查。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →