一頁手寫在筆記本上、用手機拍照並保存為掃描 PDF 的會議記錄包含了搜尋、複製貼上和螢幕閱讀器完全無法存取的有價值的資訊。這些文字對人眼來說是可見的,但對電腦來說只是圖像中的形狀。將這些手寫筆記轉換為可編輯的鍵入文本,使其可在任何文件或應用程式中搜尋、複製和使用。
手寫辨識比印刷文字辨識更難,因為每個人的筆跡都是獨一無二的。字母形狀在個體之間的差異遠大於印刷字體的差異,而辨識引擎必須處理這種差異。
將掃描的OCR PDF文件中的手寫筆記轉換為可編輯的打字文字需要一個支援手寫的 OCR 引擎,該引擎可以識別草書和列印手寫內容,並且需要一個工作流程來處理與列印文字 OCR 相比更高的手寫識別錯誤率。 WukongPDF 的掃描 PDF 和 OCR 工具支援文字識別,以下的指南涵蓋了最大限度地提高手寫識別準確性。

為什麼手寫辨識比印刷文本 OCR 難得多
印刷文字 OCR 的工作原理是將字元形狀與已知的字體模式進行匹配。無論是我打字、你打字還是機器列印,Times New Roman 中的字母 A 看起來都是一樣的。識別引擎對於每種常見字體中的每個字元都有一個清晰、一致的模板。手寫辨識沒有這樣的模板,因為每個人的字母 A 看起來都不一樣。該引擎必須識別手寫字元的統計模式,這些字元在形狀、大小、傾斜和字母之間的連接方面存在巨大差異。
草書手寫體將單字中的字母連接起來,增加了額外的複雜性。識別引擎必須在識別每個字母之前將連接的字母分割成單獨的字元。不正確的分割,將字母 m 拆分為 r 和 n,或將兩個字母合併為一個,是手寫辨識錯誤的一個主要來源。印刷體手寫體中的每個字母都是單獨書寫的,因此識別引擎更容易處理並產生更準確的結果。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
準備用於手寫辨識的掃描影像
來源影像的品質是影響手寫辨識準確性的最大因素,比辨識引擎的選擇更重要。以至少 300 DPI 掃描或拍攝手寫頁面,對於小字跡或密集字跡,建議使用 600 DPI。確保整個頁面的照明均勻、無陰影。將相機或手機與頁面平行放置,盡量減少透視失真。來源影像越好,辨識越準確。
在運行識別之前增強掃描影像。增加對比度以使墨水變暗並使紙張背景變亮。應用銳利化濾鏡使手寫筆畫的邊緣更加清晰。使用自適應閾值將影像轉換為灰階或純黑白,這比全局閾值更好地處理不均勻的照明。增強的影像向辨識引擎呈現更清晰、更清晰的字元形狀。
使用支援手寫的 OCR 引擎
Tesseract 等通用 OCR 引擎包含可透過設定設定啟用的手寫辨識模式。在 Tesseract 中,指定包含手寫支援的語言模型,並設定頁面分割模式以將圖像視為單一文字區塊。 Google Cloud Vision API 和 Microsoft Azure 電腦視覺在其基於雲端的 OCR 服務中包含手寫辨識功能。
專用手寫識別應用程式(例如 Nebo、GoodNotes 或 Microsoft OneNote 的墨跡到文字功能)專門針對手寫進行了最佳化,並且通常比強加到手寫服務中的通用 OCR 引擎產生更好的結果。從手寫應用程式匯出識別的文本,並根據需要將其與原始掃描的 PDF 重新整合。
| 係數 | 對精度的影響 | 建議 |
|---|---|---|
| 掃描解析度 | 更高的解析度為每個角色提供更多細節 | 最低 300 DPI,小字跡 600 DPI |
| 燈光 | 陰影和不均勻的照明模糊了角色邊緣 | 漫射、均勻的照明;避免相機閃光燈 |
| 手寫風格 | 印刷體手寫比草寫容易 | 如果您控制來源,請以印刷形式書寫以獲得更好的結果 |
| 影像增強 | 更清晰的輸入產生更清晰的識別 | 增加對比、銳利化、應用自適應閾值 |
檢查和更正識別的文本
手寫辨識總是會產生錯誤,根據手寫品質和影像零件,字元錯誤率通常為 5-20%。對照原始手寫頁面檢查已識別的文字並糾正錯誤識別的單字。修正步驟需要時間,但對於輸出可用於搜尋、複製貼上或進一步編輯至關重要。
對於需要完美準確性的文件(例如法律記錄或醫療筆記),請將識別的文字視為搜尋索引,而不是原始筆蹟的替換。保留原始掃描影像作為權威記錄。使用識別的文字啟用關鍵字搜索,在原始掃描中尋找相關頁面。可搜尋的識別文字和原始圖像的組合提供了兩者的最佳效果:文字的可尋找性和圖像的保真度。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
