Others

掃描 PDF 和原生 PDF 有什麼區別

What Is the Difference Between a Scanned PDF and a Native PDF

什麼是掃描 PDF 以及它與原生 PDF 有何不同

掃描的 PDF 是透過使用掃描器或手機相機捕捉實體紙本頁面的影像來建立的。 PDF 的每一頁都是原始文件的照片。您在頁面上看到的文字僅以圖像中的像素形式存在。 PDF 檔案中沒有儲存實際的文字字元。掃描的 PDF 本質上是一個相冊,其中每張照片都包含文字。

識別掃描 PDF 的最快方法是嘗試用遊標選擇頁面上的文字。

OCR 技術透過添加可搜尋文字層彌合了掃描 PDF 和原生 PDF 之間的差距。

原生 PDF,也稱為數位 PDF 或原生數位 PDF,是直接從軟體應用程式建立的。當您將 Word 文件匯出為 PDF、將電子表格另存為 PDF 或從設計應用程式建立 PDF 時,產生的文件包含可選擇和可搜尋的實際文字字元以及向量圖形和嵌入字型。

文字作為數據存在,而不僅僅是像素。本機 PDF 是結構化文檔,而不是頁面影像的集合。

PDF 格式 支援同一文件中的兩種類型的內容。 PDF 可能有一些頁面是掃描圖像,而其他頁面是本機數位文字。當文件由多個來源組裝而成時,這種混合內容的情況很常見,例如將數位創建的文本頁面與來自印刷來源的掃描附錄相結合的報告。

掃描 PDF 和原生 PDF 之間的實際差異會影響您可以對文件執行的所有操作。您可以在本機 PDF 中搜尋單字,因為文字以可搜尋字元資料的形式存在。您無法搜尋掃描的 PDF,除非它已使用 OCR PDF 技術進行處理,該技術可識別圖像中的文字並添加不可見的可搜尋文字層。您可以從本機 PDF 中選擇並複製文字。您無法從掃描的 PDF 中選擇文字。您可以使用 PDF 編輯器編輯本機 PDF 中的文字。您無法編輯掃描 PDF 中的文本,因為沒有可編輯的文字字元。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

如何判斷 PDF 是掃描版還是原生版

最快的測試是嘗試選擇 PDF 中的文字。打開 PDF,然後用滑鼠或手指點擊並拖曳單字。如果文字在您拖曳時反白顯示,則 PDF 包含本機可選取文字。如果您嘗試選擇文字時沒有任何反應,則該頁面可能是掃描圖像。如果某些單字突出顯示,而其他單字則不突出顯示,則 PDF 的文字圖層可能不完整或損壞。

縮放測試提供了另一種快速檢查。將一段文字放大至 300% 或 400%。如果文字在高放大倍率下仍然清晰銳利,則很可能是可以平滑縮放到任何尺寸的原生向量文字。如果文字變得像素化並在高放大倍率下顯示鋸齒狀邊緣,則它是掃描影像。此視覺測試之所以有效,是因為向量文字在任何縮放層級都能平滑渲染,而基於圖像的文字在放大時會顯示其像素結構。

PDF 檢視器工具還可以報告文件是否包含文字。在 Adobe Acrobat 中,文件屬性面板顯示頁數以及文件是否包含可搜尋文字。一些檢視器顯示文字圖層指示器。文件分析工具可以掃描 PDF 並報告包含本機文字與僅影像內容的頁面的百分比。

文件大小可以提供線索,儘管它不是確定的。由頁面影像組成的掃描 PDF 通常比相同頁數的本機文字 PDF 更大,因為影像比文字需要更多的儲存空間。 10 頁的本機文字 PDF 可能有 100 到 500 KB。 10 頁的掃描 PDF 可能有 2 到 10 兆位元組。然而,具有高解析度嵌入圖像的本機 PDF 也可能很大,因此檔案大小本身並不是一個可靠的指標。

為什麼這種區別對於日常 PDF 任務很重要

搜尋是受掃描與本機差異影響的最常見任務。如果您收到一份 50 頁的 PDF,並且需要查找某個特定術語的所有提及,原生 PDF 會透過搜尋功能在幾秒鐘內為您提供答案。掃描的 PDF 迫使您手動直觀地掃描每一頁,這需要幾分鐘的時間,並且可能會遺漏一些內容。搜尋文件的能力改變了您與其互動的方式。

文字擷取以便在其他文件中重複使用需要本機文字。如果您需要在自己的報告中引用 PDF 中的段落,原生 PDF 可讓您直接複製並貼上文字。掃描的 PDF 需要您重新輸入文字或執行 OCR 才能將其提取。對於您經常引用的文檔,即時複製貼上和手動重新鍵入之間的差異很大。

輔助工具(包括視障人士使用的螢幕閱讀器)需要本機文字。螢幕閱讀器可以朗讀本機 PDF,因為它可以存取文字字元。螢幕閱讀器無法閱讀掃描的 PDF,因為沒有可供存取的文字字元。要使掃描的 PDF 易於訪問,需要進行 OCR 處理以添加螢幕閱讀器可以解釋的文字層。

掃描 PDF 格式完全適合歸檔目的,其中文件僅需要作為原始影像檢視。已簽署合約的掃描件可作為已簽署文件的可視記錄。對於任何需要與文字互動、搜尋、複製、編輯或可訪問性的目的,需要使用 OCR 的本機 PDF 或掃描 PDF。

如何將掃描的 PDF 轉換為可搜尋的類似本機的 PDF

光學字元辨識是將掃描的頁面影像轉換為具有文字圖層的可搜尋文件的技術。使用支援 OCR 處理的 PDF 工具對掃描的 PDF 執行 OCR。該工具分析每個頁面圖像,識別文字字符,並在頁面圖像後面添加不可見的文字圖層。 OCR 後,PDF 在視覺上看起來相同,但現在可以搜索,並且可以選擇和複製識別的文字。

OCR 準確性取決於原始掃描的品質。在 300 DPI 下進行乾淨的掃描、均勻的照明、平坦的頁面和清晰的焦點可產生 99% 以上的 OCR 準確度。

以 150 DPI 進行低解析度掃描,如果有陰影、彎曲的頁面或模糊的文本,可能會產生低於 95% 的準確度,需要手動校正。掃描的品質決定了 OCR 輸出的品質。

運行 OCR 後,透過搜尋頁面上可以看到的幾個單字來驗證結果。如果搜尋找到它們,則 OCR 成功。如果搜尋遺漏了明顯的單詞,OCR 可能會對該頁面的特定字體、佈局或圖像品質產生困難。使用調整後的設定或更高品質的掃描(如果可用)重新執行 OCR。

WukongPDF 的OCR PDF 工具在瀏覽器中處理掃描文件並傳回具有可搜尋文本層的 PDF。上傳掃描的 PDF,執行 OCR,然後下載支援搜尋、文字選擇和螢幕閱讀器存取的文件。 OCR 過程保留了原始的視覺外觀,同時添加了使文件具有互動性的文字層。

在處理大型文件集合時,掃描 PDF 和原生 PDF 之間的文件大小差異變得尤為重要。掃描為 PDF 的紙本文件櫃可能會產生數以萬計的掃描 PDF 頁面,每頁都是完整影像。對於典型的 300 DPI 灰階掃描,每頁 500 KB,10,000 頁消耗 5 GB 的儲存空間。對這些掃描的 PDF 運行 OCR 不會減小文件大小,因為頁面圖像仍然存在,但它確實添加了可搜尋的文字層,使該集合實際上可用。

對於需要長期歸檔的文檔,PDF/A格式是歸檔標準。掃描 PDF 和原生 PDF 都可以轉換為 PDF/A。轉換為 PDF/A 的掃描 PDF 仍然是基於圖像的文檔,並添加了檔案元資料。轉換為 PDF/A 的本機 PDF 保留其文字和結構屬性。 PDF/A 不會改變文件的掃描與原始性質。它添加了標準化元資料並強制執行可提高長期保存性的結構要求。

對於混合掃描頁面和本機頁面的 PDF,請將 OCR 套用至掃描頁面,同時保持本機頁面不變。大多數 OCR 工具可以處理特定的頁面範圍,因此您可以只在需要它的頁面上執行 OCR。處理後,PDF 保留原始頁面上的本機文本,並在以前僅包含圖像的頁面上具有可搜尋的文本層,從而在整個文件中提供一致的可搜尋性。

對於需要列印和手動填寫的文檔,原始表格的掃描 PDF 就足夠了。收件者列印 PDF,用筆填寫空白,然後返回實體副本或將其掃描回數位版本。對於應該以數位方式填寫的文檔,帶有表單欄位的原生 PDF 更加優越,因為收件人可以直接在欄位中鍵入內容。

在將文件掃描為 PDF 和從原始來源文件建立本機 PDF 之間進行選擇時,應考慮文件的整個生命週期,而不僅僅是即時需求。合約的掃描 PDF 可以透過電子郵件發送給另一方進行審查。如果隨後需要在爭議期間搜尋該合約中的特定條款,則掃描的 PDF 缺乏可搜尋性將成為重大責任。在建立文件時建立本機 PDF 會保留掃描所不保留的選項。

現代掃描軟體通常包括自動 OCR 處理,在實際使用中模糊了掃描 PDF 和原生 PDF 之間的差異。使用手機應用程式掃描的文件在捕獲後立即執行 OCR,生成的 PDF 從技術上講是掃描圖像,但在功能上可像本機 PDF 一樣進行搜尋。這種混合方法結合了掃描的便利性和原生文字的可搜尋性。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →