PDF 透過電子郵件發送。打開它會看到看起來像列印文件的內容。文字在那裡,格式正確。但是您可以用遊標選擇文字嗎?或者遊標是否像照片一樣掠過文字?答案決定了 PDF 是透過掃描紙張創建的還是從數位來源產生的,並且它決定了有關如何使用該文件的一切。
點擊文字並觀察遊標是選擇它還是忽略它,一秒鐘即可回答問題。
確定 PDF 是否是掃描的或以數位方式建立的,涉及檢查可選擇的文字、檢查文件結構以及尋找明顯的掃描視覺痕跡。 WukongPDF 的OCR PDF 工具可以使掃描文件可搜索,下面的掃描 PDF 識別步驟首先會告訴您是否需要 OCR。

文本選擇測試
開啟 PDF 並嘗試使用文字選取工具選擇一個文字單字。如果遊標逐個字元地突出顯示單字,則 PDF 包含可選擇的文字並且是數字創建的或已經經過 OCR 處理。如果遊標在整個區域上繪製選擇矩形而不突出顯示單個字符,則該頁面是圖像並且 PDF 是透過掃描建立的。
文字選擇測試對於單頁檢查來說是快速且明確的。對於多頁文檔,從開頭、中間和結尾測試幾頁。一些 PDF 混合了數位頁面和掃描頁面,通常是數位創建的求職信,後面跟著掃描附件。每個頁面上的文字選擇測試揭示了哪些頁面是哪些頁面。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
檢查文件大小和頁數以取得線索
掃描的 PDF 通常比具有相同頁數的數位 PDF 更大,因為每頁都是整頁影像。 300 DPI 下的 10 頁掃描 PDF 通常為 5-15 MB。相同內容的 10 頁數位 PDF 可能為 100-500 KB。在打開文件之前,文件大小差異是一個快速線索。
掃描的 PDF 的內部功能也往往較少。沒有書籤,沒有超鏈接,沒有嵌入字體,除了基本文件屬性之外沒有元資料。開啟文件屬性並檢查字型標籤。掃描的 PDF 沒有列出字體,因為所有內容都是圖像。數位 PDF 列出了文件中使用的字體。
檢查創建方法的文件屬性
文件屬性通常包括建立 PDF 的應用程式。 Adobe Acrobat 從 Microsoft Word 建立的 PDF 很可能是數位的。掃描了由 Canon 掃描器驅動程式或 HP Scan 建立的 PDF。由 OCR 應用程式建立的 PDF 可能是經過可搜尋處理的掃描文件。
文件屬性中的生產者欄位由建立應用程式設置,並且並不總是可靠,因為它可以更改或欺騙。將生產者資訊與文字選擇測試和字體檢查相結合,以獲得可靠的確定。得出相同結論的三個獨立測試是可靠的。
| 測試 | 數字 PDF 結果 | 掃描的 PDF 結果 |
|---|---|---|
| 文字選擇 | 遊標突出顯示單一字符 | 遊標在影像上繪製選擇矩形 |
| 文件大小(10頁) | 100-500KB | 5-15MB |
| 屬性中的字型選項卡 | 列出嵌入字體 | 空的,沒有字體 |
| 生產者領域 | Word、Acrobat、Chrome | 掃描器驅動程式、影像軟體 |
尋找掃描的視覺偽影
將文字區域放大至 400%。掃描的 PDF 顯示影像擷取的特徵偽影:字元邊緣輕微模糊、掃描器照明導致頁面上的暗度不均勻、掃描器玻璃上顯示為微弱線條或斑點的灰塵斑點或髮絲痕跡。數位 PDF 在任何縮放等級都顯示清晰的字元邊緣。
雙面頁面的掃描 PDF 可能會顯示紙張另一面的重影、微弱的反轉文字。這是掃描的明確標誌,因為數位 PDF 沒有紙張不透明度的概念。重影顯示為主要文字後面文字的灰色陰影,在主要文字稀疏的區域中最明顯。
使用 PDF 元資料欄位取得其他線索
可透過文件屬性存取的 PDF 元資料欄位可以揭示文件的來源。包含原始文件檔案名稱的「標題」欄位(如 Annual-Report-2025-Final.docx)表示 PDF 是從該 Word 文件建立的。空標題欄位或與 PDF 檔案名稱相符的標題是中性的。列出 Microsoft Word 或 Google Docs 的創建者欄位表示數字來源。
建立日期和修改日期欄位可以提供時間軸線索。在同一日期建立和修改的 PDF 彼此相隔幾分鐘,建議直接數位匯出。修改日期晚於建立日期數年的 PDF 可能已被 OCR 或處理過。元資料講述了文件的歷史記錄,而該歷史記錄揭示了是否涉及掃描。
知道 PDF 類型後該怎麼辦
對於需要可搜尋的掃描 PDF,請執行 OCR 新增文字圖層。 OCR 過程可識別頁面圖像中的文本,並在其後面添加可選擇、可搜尋的文本。視覺外觀不會改變。 PDF 獲得了可搜尋性和複製貼上功能。
對於需要看起來像是掃描的數位 PDF(通常是具有官方外觀的文件複製品),無需進行影像轉換和轉換,而且會降低品質。數位 PDF 已經處於最佳狀態。任何將文字轉換為圖像的處理都會降低質量,而不會增加價值。
嘗試 PDF OCR
無需安裝。直接在您的瀏覽器中工作。
