您有一個可搜尋的 PDF。您將其轉換為 Word 進行編輯。您將編輯後的文件儲存回 PDF。新的 PDF 看起來與原始 PDF 相同,但當您搜尋文件中已知的單字時,搜尋不會傳回任何結果。原始 PDF 中可搜尋的文字對於新 PDF 中的搜尋功能不可見。 Word 的往返剝奪了文字的可搜尋性。
將PDF 轉換為Word,然後將Word 重新轉換為PDF 是編輯PDF 的常見工作流程,但每個轉換步驟都會帶來文字層損壞的機會。以 PDF 格式傳回的文字的儲存方式可能與原始文字不同,儲存為向量輪廓而不是字元代碼,或光柵化為圖像。這些結果中的每一個都會產生一個 PDF,其中文字可見但不可搜尋。

文字在格式轉換過程中如何儲存或遺失
在原始的可搜尋 PDF 中,文字儲存為映射到字體字形的字元代碼。字元 H 儲存為 ASCII 代碼 72,它告訴 PDF 閱讀器顯示嵌入字體中的 H 字形。搜尋功能掃描搜尋字詞的字元代碼並反白頁面上的對應位置。這種基於字元代碼的儲存使得文字可搜尋。
當PDF轉換為Word時,轉換器會提取字元代碼並將它們作為可編輯文字寫入Word文件中。 Word 中的文字是可搜尋的,因為 Word 將其儲存為 Unicode 字元代碼。只要轉換器正確提取字元代碼,從 PDF 到 Word 的轉換就可以保留可搜尋性。
當編輯後的Word文件儲存回PDF時,Word PDF引擎必須決定如何儲存文字。預設設定將文字儲存為帶有嵌入字體的字元代碼,從而保留可搜尋性。但是,某些 Word 功能和 PDF 設定會導致文字儲存為向量輪廓或光柵化為圖像。
Word 中的文字效果(例如文字陰影、反射、發光和 3D 旋轉)會導致 Word PDF 引擎將受影響的文字轉換為圖像。文字在視覺上看起來正確,但沒有可供搜尋功能找到的字元代碼。對於應用了視覺效果的任何文本,PDF 可搜尋 屬性都會遺失。
嘗試 PDF 轉 Word
無需安裝。直接在您的瀏覽器中工作。
如何透過往返保持文字可搜尋性
將編輯後的 Word 文件儲存為 PDF 之前,請檢查儲存設定。在 Word 中,開啟“檔案”、“選項”、“儲存”,並確保選取“在檔案中嵌入字體”。此設定可確保字體是作為基於字元的文字嵌入,而不是轉換為輪廓或圖像。
避免將文字效果應用於需要保持可搜尋的內容。使用粗體、斜體和顏色格式,而不是陰影、反射和發光效果。可以在不犧牲可搜尋性的情況下實現視覺區分。
WukongPDF 提供PDF Converter 工具,可以處理 PDF 以最佳化文字儲存。如果使用不可搜尋的文字建立 PDF,OCR 可以在現有視覺內容後面新增可搜尋的文字圖層。
驗證重新轉換後的可搜尋性
將Word文件儲存為PDF後,開啟PDF並測試搜尋功能。搜尋每頁上出現的單字。如果任何頁面未傳回明顯存在的單字的結果,則該頁面具有無法搜尋的文字。搜尋測試需要幾秒鐘的時間,並在分發文件之前捕獲可搜尋性損失。
如果遺失了可搜尋性,請對重新轉換的 PDF 執行 OCR 以新增可搜尋文字圖層。 OCR 識別可見文字並在其後面建立字元代碼。然後,搜尋功能可以透過 OCR 產生的字元代碼來尋找文字。這是事後修復,而不是預防,但它恢復了不可搜尋的 PDF 的可搜尋性。
對於需要保證可搜尋性的文檔,請完全避免 PDF 到 Word 到 PDF 的往返過程。編輯原始來源文檔、Word 文件、InDesign 文件、Google 文檔,並匯出新的 PDF。從原始檔案到 PDF 的單一匯出保留了可搜尋性,無需中間轉換步驟。
Word 相容模式會影響 PDF 輸出。以較舊的 DOC 格式而非 DOCX 格式儲存的文件可能會使用不同的文字儲存方法,從而影響 PDF 的可搜尋性。在匯出為 PDF 之前,將文件儲存為目前 DOCX 格式。
在 PDF 匯出過程中,Word 文字方塊中的文字可能會被光柵化,這取決於文字方塊格式。具有填滿效果、旋轉或文字方向變更的文字方塊比純文字方塊更有可能被光柵化。
當文字在 PDF 匯出過程中被光柵化時,它會變成文字圖像而不是編碼文字。影像顯示正確,但字元是像素,而不是代碼。 OCR 可以恢復文本,但 OCR 文本可能包含識別錯誤。
當字體可能未嵌入時,Word 中的 PDF 匯出選項包括點陣圖文字設定。此設定對使用具有嵌入限制的字體的文字進行光柵化。確保所有字體都允許嵌入可以防止這種強制光柵化。
往返轉換後,比較原始 PDF 和重新轉換的 PDF 的檔案大小。重新轉換的 PDF 顯著增大可能表示文字已光柵化為圖像,這比編碼文字消耗更多的儲存空間。
一些 PDF 到 Word 轉換器為掃描的 PDF 提供基於 OCR 的轉換模式,為數位 PDF 提供文字擷取模式。使用錯誤的模式會產生意想不到的結果。數字 PDF 應使用文字擷取(而不是 OCR)來保留原始字元編碼。
當文字可搜尋性喪失時,PDF 檢視器中的查找功能不會傳回明顯存在的單字的結果。在每個頁面上搜尋諸如「或」之類的常用字詞可以快速確認整個文件是否具有可搜尋的文字。
對於必須透過多個編輯週期保持可搜尋性的文檔,以可編輯格式、Word、Google Docs 或 InDesign 建立主文檔,並將 PDF 視為唯讀分發格式。所有編輯都在母版中進行,並在每個編輯週期後從母版重新產生 PDF。
輔助功能檢查器可以驗證文字的可搜尋性並識別具有不可搜尋文字的頁面。對重新轉換的 PDF 執行輔助功能檢查,以確認所有文字均已編碼且可存取。
PDF/UA 標準要求所有文字都編碼為 Unicode 字符,以確保可搜尋性和螢幕閱讀器存取。從 Word 匯出到 PDF/UA 會強制執行保留可搜尋性的文字編碼要求。
PDF 到 Word 轉換器的選擇會影響文字儲存。將視覺保真度置於文字可編輯性之上的轉換器可能會光柵化使用不常見字體或位置的文字。優先考慮文字可編輯性的轉換器可能會產生更多可搜尋的輸出。
當文字在 PDF 中儲存為連字 fi、fl、ffi 時,轉換器可能會將連字拆分為單獨的字元或將其保留為單一字元。搜尋函數的行為取決於轉換期間連字的處理方式。
防止未來轉換中的可搜尋性損失
如果 Word 文件使用藝術字、SmartArt 或嵌入的 Excel 圖表等功能,則來源 PDF 中最初基於向量的文字可能會在 Word 到 PDF 匯出過程中轉換為光柵圖像。這些功能在 PDF 輸出中呈現為影像。
Word 中的 PDF 建立設定包括從標題建立書籤的選項。此選項保留文件結構,但不影響文字可搜尋性。書籤和可搜尋性是獨立的功能。
透過搜尋每個頁面上出現的單字(例如文件語言中的常用單字)來測試可搜尋性,可以快速識別具有不可搜尋文字的頁面。如果任何頁面沒有傳回常見單字的結果,則該頁面存在文字編碼問題。
了解在 PDF 到 Word 到 PDF 往返過程中文字可搜尋性遺失的情況,使文件創作者能夠對其編輯工作流程做出明智的選擇,並保持其內容的可訪問性和可查找性。
要在 PDF 到 Word 到 PDF 的往返過程中保持文字的可搜尋性,需要注意每個步驟的轉換設置,並了解哪些 Word 功能會導致文字被光柵化而不是編碼為字元。
對於需要文字可搜尋性的文檔,建立一個工作流程來透過每次格式轉換保留原始編碼文字比在遺失後嘗試恢復可搜尋性更有效。
文字可搜尋性是使用者認為理所當然的一項功能,直到它不存在為止,恢復不可搜尋的 PDF 的可搜尋性需要從原始來源重新處理或在受影響的頁面上執行 OCR 以重新建立文字圖層。
PDF 到 Word 到 PDF 的往返過程是一種常見的編輯工作流程,它會帶來多種文本編碼降級或丟失的機會,了解每個風險點有助於用戶在整個過程中保持可搜尋性。
文字可搜尋性不是一個裝飾性的功能,而是一種基本的文件功能,它會影響可訪問性、可找到性以及提取和重新利用內容以用於其他用途的能力。
PDF 到 Word 轉換器的選擇會顯著影響往返的結果,針對文字可編輯性進行最佳化的轉換器比針對視覺保真度進行最佳化的轉換器產生更多可搜尋的輸出。
當往返過程中失去可搜尋性時,OCR 可以恢復可搜尋的文字層,但 OCR 文字將包含識別錯誤,必須修正這些錯誤才能使文件完全可靠。
對於需要可搜尋性的文檔,請維護原始來源文件並在每個編輯週期後匯出新的 PDF 比透過 Word 進行往返更可靠。
PDF 格式以與文字處理格式根本不同的方式保存文本,而這些表示形式之間的每次轉換都會帶來文本編碼中資訊遺失的風險。
| 往返階段 | 可搜尋性風險 | 緩解 |
|---|---|---|
| PDF 到 Word(提取) | 如果使用文字擷取轉換器則較低 | 使用具有文字擷取模式的轉換器 |
| 在 Word 中編輯 | 沒有任何; Word 文字始終可搜尋 | 避免文字效果(陰影、發光、3D) |
| Word 轉 PDF(匯出) | 中等的;影響導致光柵化 | 嵌入字體;避免對可搜尋文字的影響 |
| 出口後驗證 | 不適用 | 在每個頁面上搜尋常用詞 |
嘗試 PDF 轉 Word
無需安裝。直接在您的瀏覽器中工作。
