
OCR 對掃描的 PDF 有何作用
光學字元辨識將掃描的PDF(頁面影像的集合)轉換為可搜尋文件。
OCR PDF流程分析每個頁面影像,辨識字元的形狀,並在頁面影像後面建立不可見的文字圖層。 OCR 後,您可以搜尋文件中的單字、選擇和複製文本,以及使用螢幕閱讀器朗讀文件。
OCR 將被動的文字圖像轉換為支援文字選擇和螢幕閱讀器的主動、可搜尋文件。
OCR 的準確性直接取決於原始掃描的質量,乾淨的 300 DPI 掃描可產生最佳結果。
沒有 OCR 的掃描 PDF 就像一本文字相簿。您可以查看這些文字,但無法與它們互動。您無法搜尋特定術語。您不能複製段落來引用它。您無法使用螢幕閱讀器。 OCR 增加了互動功能,使數位文件的用途超越了簡單的檢視。
OCR 的準確性取決於原始掃描的品質。在 300 DPI 下進行乾淨、高解析度的掃描,加上均勻的照明和清晰的焦點,可為標準列印文字提供 99% 以上的 OCR 準確度。低解析度掃描、以一定角度拍攝的文件照片或褶皺或污漬原稿的掃描會產生較低的精確度。掃描品質直接決定OCR輸出的品質。
OCR 新增的PDF 可搜尋 文字圖層與頁面影像是分開的。 OCR 後 PDF 的視覺外觀不會改變。該頁面看起來仍然像掃描圖像。在該圖像的背後,已識別的文本作為搜尋引擎、螢幕閱讀器和文字選擇工具可以存取的不可見字元資料存在。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
如何在不同裝置上對掃描的 PDF 執行 OCR
在 Windows 上,Adobe Acrobat Pro 可以對掃描的 PDF 執行 OCR。開啟 PDF,選擇掃描和 OCR 工具,然後選擇識別文字。 Acrobat 處理每個頁面、識別文字並新增可搜尋文字圖層。儲存文件。 PDF 現在支援搜尋和文字選擇。 Acrobat Pro 提供 Windows 上最精確的 OCR。
在 Mac 上,內建預覽應用程式不包含 OCR。多個第三方 Mac PDF 工具提供 OCR 功能。 PDF Expert 和 PDFpen 都包含 OCR 引擎,可處理掃描的 PDF 並新增可搜尋的文字層。 OCR 品質可與標準文件的 Windows 工具相媲美。
WukongPDF 的基於瀏覽器的 OCR 工具適用於任何作業系統。上傳掃描的 PDF,選擇 OCR 引擎的文件語言,然後執行識別。處理完成後下載可搜尋的 PDF。基於瀏覽器的方法使 OCR 無需安裝軟體即可存取。
對於 iPhone 和 Android,包含 OCR 的掃描器應用程式會在擷取期間處理掃描。 Adobe Scan、Microsoft Lens 和 iPhone Notes 應用程式中的內建掃描器都會在掃描文件時自動執行 OCR。掃描後產生的 PDF 可立即搜索,無需單獨的 OCR 處理步驟。
提高有挑戰性文檔的 OCR 準確性
執行 OCR 之前選擇正確的文檔語言。 OCR 引擎使用特定於語言的字典和字元頻率資料來解析不明確的字元。使用法語設定對法語文件運行 OCR 比使用英語設定產生更好的結果。對於多語言文檔,選擇主要語言並手動修正次要語言段落中的錯誤。
在 OCR 之前對掃描頁面進行歪斜校正。稍微旋轉的掃描頁面,即使是一兩度,也會降低 OCR 準確性,因為 OCR 引擎期望文字行是水平的。大多數掃描軟體都具有自動糾偏功能。如果掃描在擷取過程中未進行歪斜校正,請在執行 OCR 之前對 PDF 頁面進行歪斜校正。
提高文字較小或佈局複雜的文件的掃描解析度。低於 10 點的文字需要更高的掃描解析度才能實現準確的 OCR。對於大多數文件來說,300 DPI 的掃描速度就足夠了。對於包含 8 點或更小的文字的文檔,請以 400 或 600 DPI 掃描,以便為 OCR 引擎提供足夠的像素資料來區分各個字元。
對於具有混合內容類型的文檔,例如將文字與照片或插圖結合的頁面,OCR 引擎應配置為僅識別文字區域。嘗試從圖像區域識別文字會產生垃圾字元。大多數 OCR 工具都包含區域選擇功能,可讓您指定哪些頁面區域包含文字。
驗證並修正 OCR 輸出
OCR 完成後,透過搜尋頁面上可以看到的幾個單字來驗證輸出。如果搜尋找到它們,則 OCR 成功。如果搜尋遺漏了明顯的單詞,則 OCR 準確性可能不足以滿足該頁面的特定字體、佈局或圖像品質。
對於 OCR 準確性至關重要的文件(例如必須完全可搜尋的法律或醫療記錄),請手動檢查已識別的文字。某些 PDF 工具可讓您檢視和編輯隱藏文字圖層。糾正識別錯誤,特別是 OCR 引擎更可能誤識別的專有名稱、數字和技術術語。
最常見的 OCR 錯誤涉及字元混淆。字母 l 和數字 1 在許多字體中看起來都很相似。字母 rn 在一起看起來像字母 m。
字母 cl 看起來像字母 d。這些字符混淆產生的單字在視覺上與原始單字相似但在文字上是錯誤的。手動檢查關鍵部分可以發現這些錯誤。
驗證 OCR 輸出後,使用表示已使用 OCR 處理的檔案名稱儲存文件。像 Report-OCR.pdf 或 Report-Searchable.pdf 這樣的檔案名稱將可搜尋版本與原始的純影像掃描區分開來。
當您第一次需要在大型文件中尋找特定資訊時,可搜尋掃描 PDF 的實際好處就變得顯而易見。沒有 OCR 的 200 頁掃描合約需要手動閱讀每一頁以查找特定條款。可搜尋版本可在幾秒鐘內找到該子句。對於任何您希望多次參考的文檔,OCR 投資都是值得的。
經過 OCR 處理的 PDF 也可供螢幕閱讀器訪問,使依賴輔助技術閱讀文件的視障人士也可以使用它們。螢幕閱讀器完全無法存取沒有 OCR 的掃描 PDF,因為沒有文字可供朗讀。添加 OCR 使文件易於訪問,這是包括第 508 條和 WCAG 在內的可訪問性標準所要求的。
對於英語以外語言的文檔,請在處理前選擇正確的 OCR 語言。 OCR 引擎使用特定於語言的字元辨識模型。使用日語模型識別的日文文件比使用英語模型識別的相同文件產生更好的結果。
OCR 還可以提取文字以便在其他文件中重複使用。當您需要在自己的報告中引用掃描文件中的段落時,OCR 可以使文字可複製。如果沒有 OCR,您將需要手動重新輸入該段落。透過 OCR 處理的文件進行複製和貼上,可以顯著節省時間。
對於要存檔的掃描文檔,OCR 是必不可少的保存步驟。目前存檔的純影像掃描 PDF 並未為未來的研究人員提供搜尋功能。可搜尋的 PDF 允許透過文字搜尋存取文件內容,從而顯著提高文件對未來使用者的實用性。
OCR 後 PDF 的檔案大小不會有明顯變化。 OCR 數據為每頁添加少量文字數據,通常每頁數千位元組。原始頁面圖像保持不變。對於可搜尋文字層提供的功能改進來說,檔案大小的增加可以忽略不計。
OCR 新增的可搜尋文字圖層與視覺頁面影像是分開的。當您在 OCR 處理的 PDF 中搜尋單字時,搜尋會匹配文字圖層,而不是圖像。搜尋結果會突出顯示頁面圖像上找到文字的區域。
經過 OCR 處理的 PDF 支援文字轉語音閱讀,使有視覺障礙的人以及任何喜歡聽文件而不是閱讀文件的人都可以閱讀它們。除了簡單的可搜尋性之外,這種輔助功能是 OCR 的一個顯著優勢。
對於涉及數百或數千個掃描頁面的大型 OCR 項目,批量 OCR 處理可節省大量時間。配置 OCR 設定一次並將其套用到整個文件批次。檢查頁面樣本的準確性,而不是檢查每個頁面。
OCR 文字圖層可以匯出為純文字文件,從而允許文件內容在其他應用程式中使用。匯出已識別的文本,在文本編輯器或文字處理程序中開啟它,並將其用作新文件的基礎。
每次您需要在文件中尋找資訊時,OCR 處理的 PDF 的長期價值都會反映出來。合約、手冊或參考文件的可搜尋 PDF 成為您可以查詢的資源,而不是必須手動閱讀的靜態文件。
將 OCR 實施作為文件掃描工作流程中的標準步驟可確保您數位化的每個文件從進入數位圖書館的那一刻起就可以搜尋。每次您需要在掃描過的任何文件中尋找資訊時,掃描過程中額外幾秒鐘的 OCR 處理都會帶來好處。
對於管理數位文件庫的任何人來說,OCR 是可應用於掃描 PDF 的最有影響力的處理步驟。它將被動圖像檔案轉換為主動、可搜尋、可存取的文件。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
