Tips & Tricks

如何 OCR PDF 並保持原始頁面佈局完整

在掃描文件上執行OCR PDF會提取文本,但輸出通常會剝奪原始可讀的視覺結構。標題變成簡單的段落,列折疊成單一文字流,表格分解成混亂的片段。 OCR 後保持原始頁面佈局完整意味著識別的文本保持在其所屬位置,保留賦予文檔含義的閱讀順序、列結構和空間關係。這需要在處理之前而不是之後選擇正確的 OCR 設定和輸出格式。

How to OCR a PDF and Keep the Original Page Layout Intact

OCR 佈局保留的工作原理

OCR 引擎分成兩個不同的階段來處理掃描頁面。第一階段分析頁面圖像以識別區域、內容區塊,例如文字列、圖像、表格和標題。第二階段在每個區域內運行字元辨識。保留佈局的 OCR 方法保留每個識別單字的空間座標,不僅記錄文字內容,還記錄文字在頁面上出現的位置。這些座標定義了文件的閱讀順序和視覺層次結構。

啟用版面保留後,OCR 輸出會將不可見的文字圖層直接嵌入到 PDF 中的原始掃描影像之上。每個識別的單字位於掃描中其來源字元的精確像素位置。這意味著文件在查看時看起來與原始文件相同,但螢幕閱讀器可以選擇、搜尋和存取下面的文字。 掃描的 PDF 成為一種混合文檔,具有原始掃描的視覺保真度和數位創建文件的文字功能。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

選擇正確的 OCR 輸出模式

大多數 OCR 工具至少提供三種輸出模式,它們之間的選擇決定了佈局是否有效。可搜尋影像模式將原始掃描頁面保留為可見圖層,並在其下方新增不可見文字圖層。這可以完美地保留佈局,因為視覺頁面不會改變。文字和圖像模式會建立一個新頁面,其中包含已識別的文字和重新定位的提取圖像以近似原始佈局。此模式會部分保留佈局,並且適用於簡單的單列文檔,但複雜的多列頁面可能會略有變化。

僅文字模式會丟棄所有圖像和格式,產生沒有佈局資訊的純文字流。當佈局很重要時,應該完全避免這種模式。對於PDF品質和佈局保真度都很重要的文檔,可搜尋影像模式提供了最佳平衡。文件大小將比純文字導出更大,因為原始圖像資料仍然存在,但對於將以原始視覺形式讀取、共享或存檔的任何文件來說,這種權衡是值得的。

處理多列和複雜佈局

多列文件對 OCR 佈局保留提出了最艱鉅的挑戰,因為閱讀順序在頁面上呈現鋸齒狀。兩欄的學術論文需要 OCR 引擎從左欄一直讀取,然後再跳回到右邊欄的頂部。如果沒有正確的區域檢測,OCR 輸出可能會交錯兩列中的行,從而產生無意義的文本,其中每隔一行屬於不同的列。

現代 OCR 引擎使用區域偵測演算法,透過分析文字區塊之間的間隙來識別列邊界。在對多列文件執行 OCR 之前,請檢查工具是否提供列偵測或自動區域設定。如果該工具錯誤識別列邊界,大多數桌面 OCR 應用程式都允許您在頁面上手動繪製區域矩形以指導識別順序。繪製區域需要更多的時間,但可以確保輸出中正確的讀取順序。

保留表格和數值數據

表格以通用 OCR 難以解釋的方式組合佈局和資料。使表格易於人眼讀取的網格結構,以一致的列寬和對齊方式交替行,需要 OCR 引擎識別單元格邊界以及同一行或列中的單元格之間的關係。當佈局保留正常運作時,原始文件中的表格會在 OCR 輸出中產生一個表格,其中每個值都位於其正確的儲存格中。

下表比較了不同 OCR 輸出模式如何處理表保存:

OCR輸出模式表結構單元對齊
可搜尋圖像保留原始影像準確,內建於原始碼中
文字與圖像重建為文字表近似值,可能會漂移
僅文本徹底迷失了未保留對齊方式

影響佈局品質的 OCR 設置

輸出模式以外的幾個設定會影響原始佈局的辨識效果。輸入影像的 DPI 設定是最關鍵的。 300 DPI 的掃描為 OCR 引擎提供足夠的像素密度,以區分字元形狀並準確檢測佈局區域。以 150 DPI 或更低的解析度進行掃描會產生模糊的字元邊緣,從而使識別引擎和區域檢測演算法感到困惑。以 600 DPI 掃描可稍微提高準確性,但會增加處理時間和文件大小,但對於大多數文件而言並沒有相應的好處。

糾偏校正可以校直以微小角度掃描的頁面。即使兩度傾斜也會導致區域偵測將列邊界誤解為對角線分隔線。在 OCR 之前啟用自動糾偏可以改善幾乎所有情況下的佈局保留。同樣,去斑濾光片可去除雜散點和掃描儀噪聲,區域檢測器可能將其解釋為微小的文本塊,從而使識別的區域破碎並破壞讀取順序。 WukongPDF 等工具會自動套用這些預處理校正,產生更清晰的區域地圖,並在不同文件類型中保留更準確的佈局。

OCR 後驗證佈局準確性

在啟用佈局保留的情況下執行 OCR 後,請在存檔或分發文件之前驗證結果。開啟輸出 PDF 並啟用文字選取工具。將遊標拖曳到每列中的段落上,並確認選擇遵循正確的閱讀順序,而不會跳到相鄰列。搜尋表格中出現的單字並驗證搜尋結果是否突出顯示了正確的儲存格位置。從中間列複製一個段落並將其貼上到文字編輯器中,以檢查各行是否以正確的順序顯示。

對於佈局錯誤會導致混亂的重要文檔,原始掃描件和 OCR 輸出之間的逐頁比較是最可靠的驗證方法。並排開啟兩個文件,抽查每個段落的第一句話、每個表格標題以及頁首或頁尾中出現的任何文字。在此階段捕獲區域檢測錯誤每頁需要幾秒鐘的時間。幾個月後,當有人嘗試搜尋文件並得到亂碼結果時發現它,代價要高得多。

為佈局繁重的文件選擇正確的 OCR 引擎

不同的 OCR 引擎以不同的複雜程度處理佈局保留。 Tesseract 是由 Google 維護的開源引擎,在簡單的單列文件上表現良好,但在不進行額外預處理的情況下,在處理多列學術論文或雜誌佈局時可能會遇到困難。 ABBYY FineReader 是一款商業引擎,在佈局保留的獨立基準中始終排名最高,因為它在運行字元辨識之前分析整個頁面結構,建立保留文字區塊之間空間關係的區域圖。

對於佈局保留至關重要的文檔,請在處理整個文檔之前花時間在代表性範例頁面上測試兩個不同的 OCR 引擎。使用每個引擎對單一複雜頁面進行 OCR,並並排比較輸出。查看兩個結果中的讀取順序、列分隔和表格結構。處理文件中最具挑戰性的頁面的引擎可能會很好地處理其餘頁面。十五分鐘的測試投入可以避免以後數小時的手動佈局校正。

WukongPDF 包括可保留頁面佈局和閱讀順序的 OCR 功能,對於需要準確可搜尋 PDF 且無需安裝桌面 OCR 軟體的使用者來說,它是一個實用的選擇。基於雲端的處理可有效處理多頁文檔,傳回原始視覺外觀完好無損的可搜尋 PDF。

佈局保存中經常被忽略的一個因素是原始掃描的品質和狀況。傾斜、起皺或低對比度的原始頁面迫使 OCR 引擎將其分析資源用於糾正影像缺陷,而不是映射佈局結構。在執行 OCR 之前,目視檢查每個頁面。如果掃描顯示傾斜的文字區塊、裝訂書沿書脊的深色陰影或與背景合併的褪色文本,請對影像進行預處理。

保留佈局和剝離佈局的 OCR 輸出之間的檔案大小差異可能很大。可搜尋的圖像 PDF 將原始掃描頁面保留為全解析度圖像層,並覆蓋不可見的文本,從而導致文件大小比純文本輸出大幾倍。對於儲存不受限制的歸檔目的,較大的檔案是佈局保真度的值得權衡。

對於涉及歷史文獻的檔案項目,佈局保存顯得尤為重要,因為原始文獻的外觀具有歷史和證據價值。正確識別每個單字但將它們重新排列成單列文字區塊的 OCR 輸出破壞了原始內容的視覺上下文。在這些項目中,可搜尋圖像方法是強制性的,任何純文字輸出都應被視為查找輔助工具,而不是原始文件的替代品。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →