Others

為什麼有些 PDF 的搜尋速度比其他 PDF 更快

兩個 PDF 並排放在一個資料夾中。兩者的頁數相同。兩者均於同一年創建。您在兩者中輸入相同的搜尋字詞。幾乎立即回傳結果。另一個暫停,顯示旋轉的進度指示器,並花了幾秒鐘報告在第十二頁找到了該術語。這兩個 PDF 之間的搜尋速度差異不是隨機的。它取決於 PDF 的創建方式、文字是嵌入的還是 OCR 生成的、字體的編碼方式以及文件結構是否包含搜尋優化功能。了解為什麼某些PDF可搜尋文件的搜尋速度比其他文件更快,有助於您建立可高效搜尋的 PDF 並診斷需要注意的緩慢搜尋文件。

Why Are Some PDFs Faster to Search Through Than Others

PDF 搜尋的實際工作原理

當您搜尋 PDF 時,檢視者不會掃描可見頁面影像以尋找字元形狀。它查詢嵌入在 PDF 文件中的文字內容流。每個頁面都包含一個或多個內容流,其中列出了頁面上的字元、它們的位置以及用於顯示它們的字體。搜尋功能依序逐個字元讀取這些內容流,尋找與搜尋項目的匹配項。此順序掃描的速度取決於文字資料的組織方式。

具有結構良好的內容流的 PDF(其中文字按邏輯閱讀順序顯示且編碼一致)的搜尋速度與查看者從磁碟讀取資料的速度一樣快。具有碎片內容流的 PDF(其中單一段落的文字以非順序順序分散在多個流物件中)會強制搜尋功能在文件的不同部分之間跳轉,從而在搜尋之前重新組合記憶體中的文字。內容流的PDF格式結構是搜尋速度的主要決定因素。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

搜尋表現中的嵌入文字與 OCR 文本

嵌入文字是在文字處理器或佈局應用程式中編寫並直接寫入 PDF 的文本,儲存為字元程式碼序列。每個字元在內容流中佔據一個已知位置。搜尋功能線性讀取流並有效地找到匹配項。 OCR PDF文字(透過光學字元辨識掃描頁面影像產生的文字)的儲存方式不同。 OCR 引擎將每個識別的單字放置在頁面上的大致位置,但這些單字在內容流程中可能不符合嚴格的閱讀順序。

OCR 文字也可能包含辨識錯誤。即使頁面上的可見字元看起來正確,被 OCR 引擎誤讀為不同字元的字元也不會與搜尋字詞相符。即使 OCR 引擎輸出錯誤識別並將其放入內容流中,搜尋合約也不會找到合約。搜尋功能看不到頁面影像。它只能看到 OCR 文字。該文本中的錯誤會直接導致搜尋失敗。

字體編碼及其對搜尋的影響

PDF 中的字體可以透過多種方式進行編碼,編碼會影響搜尋速度。具有標準編碼的字體(例如 WinAnsiEncoding 或 MacRomanEncoding)將字元代碼直接對應到標準字形。由於映射很簡單,搜尋功能可以快速處理該文字。具有自訂編碼的字體,其中字元代碼由字體設計者任意分配,需要搜尋功能在字體編碼表中查找每個代碼以確定其代表什麼字元。此查找增加了每個字元比較的開銷。

CID 字型用於東亞字元集,使用兩級編碼,將字元代碼對應到 CID 值,然後將 CID 值對應到 Unicode。搜尋 CID 編碼字體中的文字需要解析每個字元的兩級映射。包含採用 CID 編碼字體的中文、日文或韓文文字的 PDF 的搜尋速度會比包含採用標準編碼字體的英文文字的 PDF 慢,這純粹是因為額外的編碼解析度步驟。建立 PDF 時所做的 PDF 字體編碼選擇會影響文件整個生命週期的搜尋效能。

頁面結構樹在搜尋中的作用

帶有標籤的 PDF 包含一個結構樹,它將文件內容組織為邏輯元素,例如章節、段落和圖形。結構樹為搜尋功能提供了文件的路線圖。搜尋功能可以導航結構樹以定位特定文件部分中的文本,而不是從文件開頭線性掃描內容流。在標籤的 PDF 中的搜尋速度會更快,因為結構樹提供了平面內容流所缺乏的索引。

未加標籤的 PDF 佔流通中 PDF 的大部分,缺乏這種結構樹。搜尋功能別無選擇,只能依序掃描內容流。對於較短的文檔,差異可以忽略不計。對於數百或數千頁的文檔,結構樹的存在或不存在可能會導致近乎即時的搜尋結果和明顯的延遲之間的差異。建立標記的 PDF 是一種輔助功能最佳實踐,也有利於 PDF 可搜尋 效能。

PDF 中的嵌入式搜尋索引

某些 PDF 建立工具可以將搜尋索引直接嵌入到 PDF 檔案中。這個索引是一個預先建立的查找表,將單字映射到它們出現的頁面。具有嵌入索引的 PDF 幾乎可以立即進行搜索,因為搜尋功能查詢索引而不是掃描內容流。索引尋找返回單字出現的頁碼,查看者可以直接跳到這些頁面。

嵌入式索引在通用 PDF 中並不常見,因為它們會增加檔案大小和索引建立時間。它們最常見於大型參考 PDF、技術手冊和文件集中,其中搜尋速度是優先考慮的。預設情況下,大多數 PDF 建立工作流程不包括索引產生。沒有嵌入索引是常態。當您遇到一個 PDF 的搜尋速度明顯快於其他類似大小的 PDF 時,嵌入索引可能是原因。

您可以採取哪些措施來提高搜尋速度

如果您建立的 PDF 會被頻繁搜索,請將其產生為具有標準字體編碼的標記 PDF。除非無法滿足設計要求,否則避免使用自訂字體編碼。如果 PDF 將包含非拉丁文本,請在對完整文件採用編碼方法之前測試範例的搜尋效能。對創建設定的少量投資可以讓每個使用該文件的人更快地進行搜索,從而獲得回報。

對於搜尋緩慢的現有 PDF,請考慮使用可產生更清晰內容流的現代引擎重新 OCRing OCR 產生的文字。透過結構分析工具運行 PDF,如果文件目前未加標籤,該工具可以新增標籤。 WukongPDF 支援OCR PDF 重新處理和文檔標記,可以提高現有 PDF 的搜尋效能,而無需從來源文檔重新建立它們。

PDF 建立日期和用於建立 PDF 的軟體版本可以解釋搜尋速度的差異。與 2008 版舊版工具創建的 PDF 相比,2024 版現代 PDF 庫創建的 PDF 可能具有更清晰的內容流和更有效率的文字編碼。 PDF 格式已經發展,更新的建立工具可以產生結構更好的文件。

對於作為文件管理工作流程的一部分經常搜尋的 PDF,請考慮提取文字並建立外部搜尋索引。具有全文搜尋索引的文件管理系統查詢索引,而不是 PDF 內容流。搜尋速度變得與 PDF 內部結構無關。

PDF 中使用的字體數量會影響搜尋速度,因為每次字體變更都需要搜尋功能載入新的編碼表。在其他因素相同的情況下,使用兩種字體的 PDF 搜尋速度比使用 20 種字體的 PDF 更快。

文件的PDF可搜尋效能在建立時由字型編碼、內容流程組織、文件標籤和索引嵌入的選擇決定。這些選擇對於文件作者來說是不可見的,但對於搜尋文件的任何人來說都是顯而易見的。

對於經常搜尋的文件集合,每次使用者鍵入查詢並收到近乎即時的結果時,創建結構良好、帶有標準字體編碼的標記 PDF 的投資就會得到回報。

本文介紹了在此特定場景中處理 PDF 的關鍵技術和注意事項。這裡描述的方法適用於不同的工具和平台,使讀者可以靈活地選擇最適合其工作流程和技術環境的方法。

概述的實際步驟提供了從最初的挑戰到可行的解決方案的清晰路徑。每種技術都因其可靠性和可訪問性而被選擇,以確保讀者無論以前使用 PDF 工具的經驗如何,都可以獲得一致的結果。

本文所述的搜尋速度差異是 PDF 建立過程中所做選擇的直接結果。了解這些因素有助於文件建立者產生可提供更好搜尋體驗的 PDF。

本文中描述的工具和技術提供了從最初的問題到可應用於各種文件和場景的工作解決方案的實用路徑。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →