打開掃描的 PDF,您可以選擇、複製和搜尋文本,就像原始數位文件一樣。該文字並非來自原始掃描。掃描器產生頁面圖像,這是一個完全沒有文字資料的像素網格。您選擇和搜尋的文本是 OCR 文本,由光學字元辨識軟體生成,該軟體分析頁面圖像並將像素模式轉換為字元。但並非 PDF 中的所有可選文字都是 OCR 文字。有些 PDF 包含以數位方式建立的嵌入文本,從未經過掃描器或識別引擎。了解 OCR 文字和嵌入文字之間的差異可以解釋為什麼有些 PDF 可以完美搜索,而有些 PDF 會產生亂碼結果。

什麼是 OCR 文字以及它如何進入 PDF
OCR 文字是機器生成的。 OCR PDF引擎檢查掃描頁面影像中的每個字元形狀,將其與已知字元模式的資料庫進行比較,並輸出最可能匹配的字元及其在頁面上的位置。然後,辨識出的文字將作為精確定位在原始影像字元上方的不可見層嵌入到 PDF 中。當您從掃描的 PDF 中選擇並複製文字時,您是從這個不可見的 OCR 圖層複製,而不是從可見的影像複製。如果 OCR 引擎誤讀了某個字符,即使可見圖像看起來正確,複製的文本也會包含該錯誤。
OCR 文字的品質取決於多個因素:原始掃描件的解析度和清晰度、原始文件中使用的字體、文字語言以及 OCR 引擎的複雜程度。對經過現代 OCR 引擎處理的雷射列印英文文件進行乾淨的 300 DPI 掃描,可產生近乎完美的文字。對採用基本 OCR 引擎處理的具有複雜字元形狀的語言的點陣列印文件進行 150 DPI 掃描,會產生充滿錯誤的文字。 OCR 文字僅在識別引擎和掃描品質允許的情況下準確。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
什麼是嵌入文字以及它如何進入 PDF
嵌入文本是創作的,而不是辨識的。當文字處理器、桌面出版應用程式或 PDF 建立庫產生 PDF 時,它會將文字直接寫入 PDF 內容流。每個字元都儲存為映射到字體中的字形的特定代碼。沒有識別步驟,因為文字從來都不是圖像。創建 PDF 的應用程式確切地知道正在寫入的字元並精確記錄它們。當您從數位建立的 PDF 中選擇並複製文字時,您將複製作者鍵入的確切字元。
嵌入文字攜帶 OCR 文字通常缺乏的格式資訊。字體名稱、粗體和斜體樣式以及字元間距保留在嵌入文字中,因為它們是由作者在來源文件中指定的。 OCR 文字可以重建部分格式,但它是根據字元的視覺外觀推斷的,而不是儲存為明確元資料。掃描後的 ORed 頁面與本機數位頁面之間的PDF 格式 比較揭示了這種差異。 OCR 版本可能允許文字選擇,但將每個字元報告為具有相同粗細的相同字體。數位版本保留了作者想要的字體差異。
如何判斷 PDF 中的文字是 OCR 還是嵌入的
確定 PDF 中的文字是 OCR 產生的還是嵌入的最可靠的方法是檢查文件屬性,特別是字體清單。在可以顯示字型資訊的檢視器中開啟 PDF。 Adobe Acrobat 在「檔案」、「文件屬性」、「字型」下顯示字型清單。如果字體清單顯示名稱包含 OCR 的字體,或字體被列為未知或沒有特定名稱的通用類型,則文字可能是 OCR 產生的。如果字體清單顯示特定的命名字體,例如 Arial、Times New Roman 或 Calibri 以及粗體或斜體等子類型,則幾乎可以肯定文字是從數位來源嵌入的。
另一個實際測試是搜尋常見的 OCR 錯誤模式。在 PDF 中搜尋常見的 OCR 替換錯誤,例如字母組合 rn,OCR 引擎經常將其誤讀為單個字母 m。如果搜尋發現 barn 變成 bam 或 corn 變成 com 的實例,則文字是 OCR 產生的。嵌入文字不包含這些替換錯誤,因為這些字元在視覺上絕對不會含糊不清。文件的PDF可搜尋品質取決於底層文字(OCR 或嵌入文字)是否準確地表示可見內容。
當 OCR 文字和嵌入文字共存於同一個 PDF 時
單一 PDF 可以在不同頁面甚至同一頁面上同時包含 OCR 文字和嵌入文字。合約包可能包括以數位方式編寫的合約正文(其中包含嵌入文字)以及經過掃描和 OCR 處理的簽名頁(其中包含 OCR 文字)。研究報告可能會將數字創建的文字頁面與掃描並經過 OCR 處理的歷史剪報照片結合。第三頁上的文字是像素完美的嵌入文字。第七頁上的文本是 OCR 文本,可能包含識別錯誤。
這種混合內容的場景為任何從 PDF 中搜尋或提取文字的人造成了微妙的陷阱。嵌入文字頁面的搜尋結果將是準確的。 OCR 文字頁面的搜尋結果可能會漏掉 OCR 引擎誤讀單字的情況,或者可能會傳回 OCR 引擎取代相似單字的錯誤匹配。處理混合內容 PDF 時,請先驗證從 OCR 頁面提取的任何文本,然後再依賴它。最安全的方法是每當從 OCR 頁面提取的文字用於關鍵目的時,目視檢查相應的頁面圖像。
事後提高 OCR 文字質量
当 PDF 包含质量较差的 OCR 文本时,由于原始扫描和 OCR 过程已经完成,因此改进文本的选项受到限制。您無法追溯性地提高掃描品質。您可以做的是使用更好的引擎重新 OCR PDF。以可用的最高解析度從 PDF 中提取頁面影像,並透過現代 OCR 引擎運行它們,該引擎可能會產生比原始 OCR 通道更準確的結果。用新的 OCR 文本层替换旧的 OCR 文本层。
某些 PDF 編輯器可讓您直接在文字圖層中手動更正 OCR 錯誤。在編輯模式下開啟 PDF,顯示不可見的 OCR 文字。點擊錯誤識別的單字並輸入更正。對於幾頁上的少量錯誤,此手動更正過程非常實用。對於每個段落都包含識別錯誤的 200 頁文件來說,這是不切實際的。對於大規模的 OCR 品質問題,使用更好的引擎對整個文件進行重新 OCR 是更有效的方法。
在 OCR 和嵌入文字之間進行選擇以建立文檔
在建立要搜尋、索引或存檔的 PDF 時,在掃描和 OCR 與生成本機數位 PDF 之間進行選擇會產生長期影響。帶有嵌入文字的本機數位 PDF 更小,搜尋速度更快,並且完美地保留了文字準確性。掃描並經過 OCR 處理的 PDF 保留了原始紙本文件的外觀,但隨著 PDF 的複製、引用和引用,可能會出現識別錯誤。
對於檔案項目,最佳實踐是保留兩種格式。保留高解析度掃描作為視覺保真度的存檔主檔案。透過重新輸入或應用高精度 OCR 並進行手動更正,生成本機數位版本,用於文字搜尋和分析。這種雙格式方法提供了原始掃描的真實性和可搜尋文字的可用性。 WukongPDF 支援OCR PDF 處理,將掃描文件轉換為可搜尋的 PDF,產生的 OCR 文字層提供搜尋和複製功能,使掃描文件可在數位工作流程中使用。
OCR 與嵌入文本之間的長期可靠性差距
ORed PDF 的老化時間與數位創作的 PDF 不同。數位創作的 PDF 在創建二十年後打開時可以完美地顯示其文本,因為字元代碼是明確的並且字體是嵌入的。創建 20 年後打開的 ORed PDF 取決於原始掃描的品質和當時可用的 OCR 引擎的準確性。當原始紙本文件不再可用於驗證時,在文件新鮮時幾乎不明顯的識別錯誤就會成為重大障礙。
對於打算長期保存的文檔,來自數位來源的嵌入文字始終優於 OCR 文字。如果文件僅存在於紙張上並且必須進行掃描,請投資當時可用的最高品質的掃描和 OCR 處理,並儘可能長時間地保存原始紙本文件。紙本原件是針對 OCR 錯誤的最終備份,這些錯誤可能要在幾年後才會顯現出來。
用於區分OCR PDF文本與嵌入文本的實際測試:將段落放大到 300% 或更高,然後查看字元邊緣。 OCR 文字通常會在可見字元影像和不可見文字圖層之間顯示輕微的錯位。嵌入文字呈現完美對齊,因為字元形狀和位置來自相同的字體程式。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
