Tips & Tricks

如何 OCR 從新聞紙或低品質紙張掃描的 PDF,並從反面顯示

掃描新聞紙、薄字典紙或低品質的辦公用紙生成的 PDF 存在一個令人抓狂的問題:頁面背面的文本在您真正想要閱讀的文本後面滲出,形成微弱的重影。這種現象稱為“透顯”或“透色”,它會令 OCR 引擎感到困惑,因為它們無法區分前景文字和背景噪音。 OCR 輸出變成了預期文字和頁面另一側反向文字片段的混合體,導致輸出出現亂碼、無法使用。

透視與黑暗或不均勻的背景有根本的不同。它不是可以透過簡單的閾值調整來消除的均勻噪音。它是結構化文本,向後打印並且顏色變暗,但仍然是結構化的。標準 OCR 引擎將頁面上的任何深色標記視為潛在文本,並且背面的鬼字符具有足夠的對比度以觸發錯誤的字符識別。要解決此問題,需要對掃描影像進行預處理,以在 OCR 引擎發現滲色之前抑制滲色。對於新聞紙來說,預處理步驟不是可選的。這是可搜尋文件和數位文件之間的區別,數位文件僅比原始照片有用一點。

數位保護聯盟 2025 年的一項研究發現,未經預處理的新聞紙掃描的 OCR 準確度平均為 67%,而乾淨的雷射列印頁面的 OCR 準確度為 98%。透過優化的預處理,相同的新聞紙掃描達到了 94% 的準確率(數位保護聯盟,“降解紙質媒體上的 OCR 性能”,2025 年)。原始新聞紙 OCR 與預處理新聞紙 OCR 之間 27 個百分點的差距代表了可搜尋文件與實際上不可用於文字查詢的文件之間的差異。

How to OCR a PDF Scanned From Newsprint or Low-Quality Paper With Show-Through From the Reverse Side

為何標準 OCR 在新聞紙和薄紙上失敗

OCR PDF 流程的工作原理是偵測影像中像素值與背景相差超過門檻的區域。在帶有深色文本的乾淨白紙上,閾值很容易設定:任何比 50% 灰色暗的東西都是文本,任何淺色的東西都是背景。在新聞紙上,紙張本身是灰色的,反面的透顯也是灰色的,通常只比正面的前景文本稍淺。單一的全域閾值無法將兩者分開。如果將閾值設定得足夠高以排除顯示,則前景文字中的細筆劃和襯線也會遺失。如果您將其設置得足夠低以捕獲所有前景文本,則顯示也會被捕獲。

報紙帶來了超出展示範圍的額外挑戰。隨著時間的推移,紙張通常會泛黃,形成不均勻的背景,在一頁上從米色變成棕色。文字以小字體列印在窄列中,通常為 6 到 8 磅。墨水擴散數十年會導致字母彼此模糊,從而縮小“e”等字符中的間隙。和“a”。紙張表面本身可能具有製造過程中產生的紋理,在高解析度掃描中顯示為細顆粒,OCR 引擎將其誤讀為標點符號。這些問題中的每一個都使其他問題複雜化,而僅處理其中一個問題的預處理管道會使其餘問題降低 OCR 準確性。

WukongPDF 使用自適應預處理來處理掃描的 PDF,在執行 OCR 之前自動偵測透顯並應用適當的背景抑制。這種方法透過掃描產生可搜尋的文本,這會使標準 OCR 引擎感到困惑,並且它適用於從乾淨的辦公紙到發黃的新聞紙的各種紙張類型。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

抑制透顯的預處理技術

對於透視來說,最有效的單一預處理步驟是背景估計和扣除。此技術掃描頁面影像,基於背景在整個頁面上緩慢變化而文字變化劇烈的假設,建立每個像素的局部背景顏色的模型。然後從原始影像中減去背景模型,有效地消除透顯,同時保留前景文字。 ScanTailor 等工具和開源 Tesseract OCR 引擎及其內建預處理模組實現了此技術的變體。

一種相關的方法是使用雙邊濾波器,它可以在保留邊緣的同時平滑影像。濾鏡透過將其與周圍背景進行平均來減少微弱的透光,但它保留了前景文字的銳利邊緣。結果是圖像更清晰,OCR 引擎可以在統一的背景下看到清晰的文字。雙邊過濾在計算上比簡單的閾值處理更昂貴,通常每頁需要幾秒鐘,但新聞紙掃描的品質改進值得任何具有持久價值的文件的處理時間。

對於透顯特別嚴重的掃描,一種稱為小波分解的技術可以將影像分成不同的頻帶。透光是微弱且低對比的,通常佔據高頻帶的低幅度分量。透過抑制這些成分並從剩餘波段重建影像,您可以消除透顯,同時保留大部分文字細節。這項技術需要專門的影像處理軟體,但產生的結果是簡單方法無法比擬的,特別是在反面文字幾乎與前景文字一樣暗的頁面上。

逐步:掃描設定以最大限度地減少透顯

處理透顯的最佳方法是在掃描時減少透顯。將一張黑紙放在正在掃描的頁面後面。黑色背襯吸收原本會穿過薄紙、從掃描器蓋上反射並照亮反面文字的光線。這個簡單的步驟可以將透印率減少 50% 至 80%,具體取決於紙張厚度。對於非常薄的紙張,例如航空信紙或聖經紙,黑色底紙對於可用的掃描基本上是必要的。

以掃描器支援的最高光學解析度進行掃描,文件掃描器通常為 300 至 600 DPI。更高的解析度可以捕捉相對於顯示的前景文字的更多細節,並且額外的像素為預處理演算法提供了更多的資料可供使用。以彩色或灰階掃描,而不是黑白掃描。黑白掃描在掃描時會套用無法撤銷的硬閾值,如果該閾值對於頁面的任何部分來說是錯誤的,則資訊將永遠遺失。彩色或灰階掃描保留完整的色調範圍,並允許您在掃描後嘗試不同的預處理設置,這對於最佳閾值在整個頁面上變化的頁面至關重要。

對於大型PDF Archive項目,在適當的掃描技術上的投資可以在減少後處理工作量方面獲得數倍的回報。需要大量預處理才能用於 OCR 的掃描也需要對文件的每次使用進行大量處理,包括顯示、列印以及未來使用更好的 OCR 技術進行重新處理。第一次正確掃描是任何數位化專案中最具成本效益的步驟。

OCR 後糾正和驗證

在預處理掃描上執行 OCR 後,輸出中仍會包含有挑戰性的頁面上的錯誤。針對識別的文字執行拼字檢查器以標記可能的 OCR 錯誤。拼字檢查器標記為拼字錯誤的單字是手動更正的候選單字。對於重要文檔,請人工檢查隨機的頁面樣本,並將 OCR 文字與原始掃描進行比較,以估計錯誤率。 95% 的準確率意味著大約二十分之一的單字是錯誤的,這對於搜尋目的來說可能是可以接受的,但對於創建忠實的數位轉錄來說卻是不可接受的。

對於重要的PDF可搜尋項目,請考慮在同一預處理掃描上使用兩個不同的OCR引擎並比較它們的輸出。當兩個引擎對某個詞達成一致時,幾乎可以肯定它是正確的。當他們不同意時,兩個版本都可以手動審核。這種雙引擎方法僅顯示真正模糊的文本,而不是要求審閱者閱讀可能長達數百頁的文件的每一頁,從而減少了手動更正工作量。

當掃描的文件具有長期價值時,適當的預處理和驗證的努力是合理的。 1950 年的一篇新聞紙文章經過一次數位化、仔細預處理並驗證準確性後,將在幾十年內保持可搜尋和引用。使用預設設定進行數位化且未進行預處理的同一篇文章可能會產生非常混亂的 OCR 輸出,以致於在搜尋時實際上會遺失,即使人類仍然可以很好地讀取原始掃描影像。

對於管理大型歷史報紙館藏的機構來說,開發標準化預處理管道是一項投資,可以為未來的每個數位化項目以及研究人員針對館藏運行的每個未來搜尋查詢帶來紅利。应记录管道中每种扫描仪型号和纸张类型的特定设置,以便新员工无需反复试验即可重现结果。記錄完善的管道還可以在 OCR 技術改進時重新處理集合,透過更新的識別引擎應用相同的預處理,從相同的原始掃描中提取更好的文本,而無需返回原始物理文檔。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →