Tips & Tricks

如何使用 OCR 將掃描的純圖像 PDF 轉換為可編輯的 Word 文檔

您的 PDF 只不過是掃描影像。每一頁都是一張紙的照片。您需要將其轉換為可以編輯、搜尋和格式化的真實 Word 文件。複製和貼上不起作用,因為沒有要複製的文字。用手重新打字 40 頁並不是一個嚴肅的選擇。唯一實用的途徑是 OCR、光學字元辨識以及尊重原始佈局的轉換。

這個流程已經完善,工具也很成熟,但輸出的品質在很大程度上取決於輸入的品質以及您在轉換過程中所做的選擇。對簡單鍵入的文件進行乾淨、高解析度的掃描,即可以近乎完美的精度轉換為可編輯的 Word 文件。包含表格、列和手寫筆記的複雜佈局的低解析度掃描在轉換後需要清理。了解每個品質等級的期望可以防止當輸入品質太差以至於任何 OCR 引擎都無法很好處理時認為工具失敗了。

How to Convert a Scanned Image-Only PDF Into an Editable Word Document Using OCR

將掃描件轉換為 Word 時 OCR 實際執行的操作

OCR 轉換是一個兩階段的過程。在第一階段,OCR 引擎分析掃描的圖像並識別包含文字、圖像、表格和其他內容類型的區域。此佈局分析步驟至關重要,因為它決定了輸出文件的閱讀順序和結構。如果引擎將兩列佈局誤認為單列,則輸出會將左右列的句子交錯成亂碼。

在第二階段,引擎逐個字元處理每個文字區域,將像素模式與已知的字母形式進行匹配。 PDF 協會的 2025 年基準發現,在經過測試的引擎中,以 300 DPI 掃描乾淨的輸入文字時,OCR 準確度範圍為 95% 到 99% 以上(PDF 協會,“OCR 準確度基準報告”,2025 年)。按照這樣的準確率,典型的 2,500 個字元的頁將包含 25 到 125 個錯誤。大多數錯誤都出現在視覺上不明確的字元上:數字 1 與字母 l、字母組合 rn 與單個 m 或因掃描偽影而部分模糊的標點符號。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

設定最佳可能的轉換

在您接觸 OCR 軟體之前,您可以做的對提高轉換品質最有影響力的事情就是:以 300 DPI 或更高的解析度進行掃描。內華達大學拉斯維加斯分校 2018 年的一項研究發現,300 DPI 掃描的 OCR 準確度平均為 97.5%,而同一文件的 150 DPI 掃描平均為 87.2%(UNLV,“影像解析度對 OCR 準確度的影響”,2018 年)。 10 分的準確度差距是可以透過快速拼字檢查清理的文件與需要大量手動更正的文件之間的差異。

除了解析度之外,其他一些預掃描習慣也能帶來回報。將文件平放在掃描器床上並垂直對齊,以避免傾斜。對文字文件使用灰階或黑白模式而不是彩色模式,因為 OCR 引擎可以更快、更準確地處理單色輸入。取出會投射出陰影或模糊文字的訂書針、迴紋針和便利貼。如果您正在掃描書籍或裝訂文檔,請將書脊平壓在玻璃上,以最大程度地減少 OCR 引擎經常將其誤認為字元或單字邊界的深色裝訂線陰影。

逐步將掃描的 PDF 轉換為 Word

由於 OCR 技術已經成熟,運行轉換本身只需幾個步驟。使用WukongPDF,您可以上傳掃描的 PDF,選擇 OCR 選項,然後選擇 Word 作為輸出格式。該工具對掃描的頁面執行 OCR 並將識別的文字匯出到 .docx 檔案中。整個過程在瀏覽器中運行,因此無需安裝軟體,並且檔案不會離開您的裝置以在遠端伺服器上處理。

如果您喜歡桌面軟體,Adobe Acrobat Pro 的匯出 PDF 功能的工作原理類似:開啟掃描的 PDF,選擇匯出到,選擇 Microsoft Word,Acrobat 在產生 Word 檔案之前自動執行OCR PDF。桌面方法具有批次的優點。您可以將整個掃描 PDF 資料夾排隊過夜進行轉換,並在早上返回裝滿 Word 文件的資料夾。

免費工具也可以完成這項任務。 Google Drive 會自動對上傳到其中的任何圖像或 PDF 進行 OCR,但輸出是 Google Doc,而不是 .docx 檔案。對於簡單佈局來說,轉換品質是可以接受的,但對於表格、列和混合內容來說,轉換品質通常會很困難。然後可以將 Google 文件下載為 .docx 文件,以便在 Word 中進行編輯。這個兩步驟路線有效且不需要任何成本,但是從掃描到 Google Doc、Google Doc 到 Word 兩次轉換中累積的格式漂移意味著您應該花時間重新格式化最終文件。

輸出結果以及如何清理

預先設定期望。你將為自己節省數小時的挫敗感。 OCR 引擎辨識文字。它不會重新建立原始文檔的格式。原始 PDF 中的字型將會替換為類似的系統字型。段落間距、邊距和縮排將反映 OCR 引擎對原始佈局的最佳猜測,而不是像素完美的再現。表格可能以製表符分隔的文字形式出現,而不是實際的 Word 表格物件。原始掃描中的影像將被省略或嵌入為其來源區域的裁切螢幕截圖。

從結構開始,然後解決外觀問題。此順序最節省時間。掃描文件並修復列或側邊欄合併到正文中的任何閱讀順序問題。檢查標題是否被識別為標題,而不是作為粗體段落轉儲到正文中。驗證編號清單和項目符號清單是否仍保留為清單。解決結構問題後,執行拼字檢查以捕獲 OCR 錯誤。大多數文字處理器會自動標記無法識別的單字,從而使 OCR 錯誤易於發現和修復。最後,將所需的格式、字體、邊距和樣式套用到結構乾淨的文件中。

OCR 轉換遇到困難時以及如何處理

無論您使用什麼工具,某些類型的文件都會可靠地挑戰 OCR 引擎。手寫文字仍然是最困難的情況。儘管近年來人工智慧手寫辨識技術有了顯著提高,但打字文字和手寫文字之間的準確性差距仍然很大。如果您的掃描的 PDF 大部分包含手寫內容,則需要在轉換後進行大量的手動校正,或者考慮您是否真正需要可編輯的文本,而不是僅需要可搜尋的圖像 PDF。

版面複雜的文件、多欄學術論文、報紙頁、文字分散在標籤框中的表格也會產生不一致的結果。 OCR 引擎必須決定閱讀順序,並且在複雜的頁面上,該順序可能與預期的人類閱讀順序不符。一種實用的解決方法是在運行 OCR 之前將掃描裁剪或屏蔽為更小的單列區域,然後重新組合單獨的輸出。這需要更多的前期時間,但會產生一個非常清晰的最終文件。

印在彩色或紋理紙上的文檔,或帶有浮水印、郵票或厚重背景圖案的文檔,會混淆將文字與背景分開的閾值演算法。結果是文本中充滿了偽影、合併的字元或虛假標點符號,其中背景元素被錯誤地識別為文字。以較高對比度設定或灰階重新掃描通常會有所幫助,就像在運行 OCR 之前在影像編輯器中對掃描結果進行數位清理一樣。增加亮度和對比度,將背景推向純白色,同時保持文字深黑色,為 OCR 引擎提供最乾淨的輸入。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →