Tips & Tricks

如何對腳註文字和頁邊引用與正文文字欄物理重疊的掃描學術論文進行 OCR

How to OCR a Scanned Academic Paper Where Footnote Text and Margin Citations Physically Overlap With the Main Body Text Column

為何 OCR 難以應付重疊的註腳文本和邊距內容

當文字位於乾淨、可預測的區塊中、行距一致且內容區域之間清晰分隔時,光學字元辨識引擎效果最佳。對標準商業信函或新穎頁面進行OCR PDF操作通常會產生準確的結果,因為文本以有序的段落排列,各邊都有較寬的邊距。學術論文提出了一個根本上更難的問題,因為它們的佈局故意將多個不同的文本流打包成物理上非常接近的位置,腳註、頁邊引用和正文文本經常在其邊界處接觸或重疊。

核心挑戰是分割,即 OCR 引擎在嘗試字元辨識之前將頁面圖像劃分為文字區域的步驟。當正文中的上標腳註參考編號位於腳註分隔線的正上方,且該線位於腳註文字本身的正上方(字體大小較小)時,分段演算法必須決定一個文字區域的結束位置和下一個文字區域的開始位置。這裡錯誤的分割決策會導致識別錯誤,因為來自兩個不同文字流的字元被輸入到識別引擎中,就好像它們是一條連續的線一樣。輸出讀起來就像亂碼,混合了正文文字和腳註片段。

邊緣引用為問題添加了第三個文字流。在遵循芝加哥風格的人文論文或使用藍皮書格式的法律文件中,頁邊註釋、行號或平行引文沿著主文本欄垂直或水平排列。這些邊距元素通常以較小的磅值列印,有時為 7 或 8 磅,並且可能使用 OCR 引擎在正常尺寸下已經難以處理的斜體或壓縮字體。當邊距文字與正文接觸時(這種情況經常發生在格式緊湊、裝訂線狹窄的期刊中),分段挑戰就變成了三向而不是雙向。

掃描 PDF來源的紙張品質也增加了 OCR 難度。許多學術論文都是從裝訂本掃描而來,書脊附近的頁面彎曲會導致文字彎曲和扭曲。頁面底部的腳註是受書脊彎曲影響最大的部分,因為它們距離裝訂最近。彎曲頁面的物理變形、小字體以及與上方正文的緊密結合,為 OCR 準確性帶來了不利條件的完美風暴。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

預處理掃描頁面以分離重疊的文本區域

提高具有重疊文字元素的學術頁面 OCR 準確性的最有效方法是在頁面影像到達 OCR 引擎之前對其進行預處理。這種預處理將不同的文字流分開,因此引擎永遠不必做出不明確的分段決策。

首先對掃描頁面進行傾斜校正,以確保所有文字行完全水平運作。即使原始掃描件傾斜一度,也可能導致腳註文字漂移到頁面邊緣的正文區域,從而產生正確對齊的頁面上不會存在的錯誤重疊。大多數文件掃描軟體都包含自動糾偏功能,但對於從裝訂卷掃描的學術論文,沿著正文基線繪製參考線的手動糾偏可以比自動校正產生更準確的結果。

去偏後,下一步是區域遮蔽。使用影像編輯器或專用 OCR 預處理工具,在正文區域和腳註區域之間繪製水平分隔線。這一行告訴下游 OCR 引擎將其上方的所有內容視為一個文字區域,將其下方的所有內容視為單獨的文字區域。在存在腳註的頁面上,分隔符號應位於腳註規則的正上方,腳註規則是傳統上將印刷學術作品中的正文與腳註分隔開的短水平線。在沒有腳註的頁面上,不需要分隔符號。

對於邊距引用和行號,垂直屏蔽是等效的方法。在邊距文字和主文本列之間繪製垂直分隔符號。在同時具有左邊距行號和右邊距引文的頁面上,兩側都需要垂直分隔符號。目標是將頁面劃分為矩形區域,其中每個區域恰好包含一個文字流。然後,OCR 引擎獨立處理每個區域並產生單獨的識別文字輸出,您可以在識別完成後以正確的閱讀順序重新組合這些文字輸出。

配置多流學術頁面的 OCR 設定

大多數專業 OCR 引擎都提供有助於多列和多流頁面佈局的設定。啟用自動佈局分析是起點,但對於具有近距離文字流的學術頁面,手動區域配置比全自動分析產生更好的結果。

為正文、腳註區域和每個頁邊距文字區域定義單獨的識別區域。在每個區域中,設定適當的語言、預期字體大小範圍和文字方向。正文文字區域應為水平從左到右方向的 10 到 12 點文字。腳註區域應該有 8 到 10 點的文本,仍然是水平的,但要注意腳註文本通常包括 URL、DOI 和引文字符串,這些可能會混淆期望自然散文的語言模型。

特別是對於正文文字區域,啟用忽略上標和下標文字的設定以進行行分割。上標腳註參考數字和數學指數通常較小且高於基線,如果引擎將它們視為正常文字行的一部分,則會導致行高計算錯誤。出於分段目的而忽略上標定位可以保持正文行的完整性,而腳註標記則被識別為不影響行邊界的單獨小元素。

當每個區域的識別結果保存到單獨的文本文件或組合輸出中的單獨標記部分時,PDF 到文本 輸出品質顯著提高。這種區域分隔的輸出可以輕鬆驗證正文文本沒有滲入腳註文本,並且頁邊引用出現在其自己明確標記的輸出部分中,而不是與主要內容交錯。

學術 OCR 輸出的識別後清理

即使進行了仔細的預處理和區域配置,在緊密排列的學術頁面上,一些識別錯誤也是不可避免的。結構化的識別後清理過程會在文字進入最終文件之前捕獲並修正這些殘留錯誤。

僅對正文輸出執行拼字檢查,並將拼字檢查字典設定為文件的主要語言。正文中被標記為拼字錯誤的單字實際上是拼寫正確的腳註內容,這是一個明顯的跡象,表明正文文字區域邊界過於寬鬆並捕獲了腳註文字。調整這些頁面的區域邊界並重新運行識別,而不是手動編輯腳註片段。

對於腳註文字輸出,請驗證每個腳註是否以其預期的參考編號開頭,並且腳註文字連續流動,而沒有散佈正文文字片段。常見的辨識後錯誤模式是正文文字行出現在腳註文字的中間,其中正文文字列在頁面上的延伸位置低於預期的區域邊界。在識別的腳註文字旁邊查看原始頁面圖像可以快速捕獲這些入侵,因為句子主題突然從學術主題轉移到不相關的正文段落主題。

WukongPDF 的 OCR 工具支援對複雜頁面佈局進行基於區域的識別,包括帶有腳註和頁邊內容的多欄學術論文。在開始識別過程之前定義每個區域的語言、字體大小範圍和文字方向設置,可產生比同一頁面上的單區域處理更準確的OCR PDF輸出,並且分離的輸出格式使識別後驗證變得簡單。

處理特殊情況:數學符號、非拉丁文字和混合語言

STEM 領域的學術論文為重疊文字挑戰添加了數學符號。散佈在正文中的方程式和公式會產生額外的分段複雜性,因為數學符號使用符號、希臘字母和二維格式(例如分數和上標),這些格式不遵循與散文文本相同的佈局規則。為文件文字設計的 OCR 引擎在數學符號上表現不佳,而為數學設計的引擎在文件文字上表現不佳。

對於混合數學和散文的頁面,最實用的方法是兩次通過 OCR 策略。第一遍使用文件優化引擎來識別所有散文文字區域,包括正文、腳註和頁邊引用。第二遍在包含方程式的特定頁面區域上使用數學感知辨識引擎。將兩個產出合併到一個組合文件中,同時保留文件引擎的散文準確性和數學引擎的公式準確性,從而產生最可靠的整體結果。

對於混合拉丁文和非拉丁文的論文,例如腳註中帶有阿拉伯文、中文或西里爾文引文的英文論文,請使用正確的主要腳本配置每個識別區域。正文區域使用文件的主要語言。包含非拉丁腳本段落的腳註區域可能需要多腳本識別配置,該配置可以在單一文字區域內的腳本之間進行切換。

下表總結了學術論文中不同頁面區域的建議 OCR 區域配置。

頁面區域預期字體大小方向特殊設定
正文10-12分水平的忽略上標進行線分割
註腳8-10分水平的如果引文包含非拉丁文本,則為多腳本
左邊距(行號)7-9分水平或垂直提取為單獨的輸出;不與身體融合
右邊距(引文)7-9分水平的提取為單獨的輸出
方程式/公式多變的水平二維佈局在第二遍中使用數學感知引擎
WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →