Others

您可以從拼合的 PDF 中恢復原始文字圖層嗎

拼合 PDF 會將所有註解、表單欄位和分層內容合併到單一靜態影像圖層中。拼合後,拼合前存在的原始文字圖層就消失了。曾經可選擇、可搜尋和可提取的文字字元變成了扁平化圖像中的像素。對於拼合文件的PDF 修復 詢問是否可以從拼裝輸出中恢復原始文字圖層。

簡而言之,答案取決於 PDF 是否被展平並保留了文字圖層。一些拼合操作將拼合圖像後面的原始文字保留為隱藏內容。其他展平操作會完全丟棄文本,並將其替換為渲染的圖像。在第一種情況下可以恢復,而在第二種情況下則不可能恢復。

WukongPDF 的PDF 格式 復原工具可以偵測並從拼合的 PDF 文件中擷取保留的文字圖層。

Can You Recover the Original Text Layer From a Flattened PDF

PDF 拼合的工作原理以及它刪除的內容

拼合將 PDF 頁面的所有可見層合併為單一渲染影像。註釋(包括反白、便條和繪圖標記)與頁面內容合併。表單欄位從互動式元素轉換為其填滿值的靜態視覺表示。透明效果被解析為不透明像素。結果是一個看起來與原始頁面相同的頁面,但沒有互動或分層結構。

實際上,拼合過程可能會也可能不會保留拼合圖像後面的原始文字圖層。當透過 Acrobat Pro 的拼合器預覽或透過具有某些設定的印前檢查工具執行拼合時,原始文字可能會保留為不可見圖層。當透過列印到 PDF 或透過第三方工具執行拼合時,文字圖層通常會完全丟棄。

快速測試可確定文字是否保留。開啟拼合的 PDF 並嘗試選擇頁面上的文字。如果可以選擇並複製文本,則文本圖層不會被展平。如果按一下文字未選擇任何內容或選擇整個頁面作為圖像,則文字圖層將被丟棄,僅保留視覺外觀。

WukongPDF

嘗試修復 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

方法 1:檢查拼合圖後面的隱藏文字圖層

在 Acrobat Pro 中,開啟拼合的 PDF,然後前往「工具」、「內容編輯」、「編輯文字和圖像」。按一下可見的文字區域。如果 Acrobat 在文字周圍顯示邊框並允許編輯,則拼合圖像後面會存在文字圖層。該文字存在於文件資料中,儘管在正常檢視期間它可能不可見作為可選文字。

如果文字存在,請使用 Acrobat Pro 的「將 PDF 匯出為文字」功能將其提取。即使視覺頁面看起來扁平化,提取的文字也可能包含原始內容。複製提取的文本並將其與原始內容的樣本進行比較。如果文字匹配,則已成功從拼合檔案中恢復原始文字圖層。

從廣義上看,在實際場景中,如果 Acrobat 找不到可編輯文本,則文本圖層在拼合過程中會被丟棄。頁面上的可視化文字由扁平圖像中的像素組成,而不是字元代碼。無法透過文字擷取進行恢復,因為沒有要提取的文字資料。

方法2:使用OCR重新建立遺失的文本圖層

當原始文字圖層在拼合過程中被丟棄時,OCR 提供了重新建立它的路徑。使用 Acrobat Pro 的識別文字功能對拼合的 PDF 運行 OCR。 OCR 引擎分析每個頁面的像素圖像,識別字元形狀,並使用識別的字元建立新的文字圖層。

從廣義上考慮,實際上,OCR 重新創建的文本層並不是原始文本。 OCR 會引入識別錯誤,特別是對於小文字、不常見的字體或複雜背景上的文字。對於乾淨、標準的文檔,重新建立的文字的準確度約為 95% 至 99%,而對於具有挑戰性的排版或佈局的文檔,則準確度較低。

OCR 後,將辨識的文字與原始內容的已知樣本(如果有)進行比較。手動更正 OCR 錯誤或接受重新建立的文字圖層作為原始文字圖層的近似值。 OCR 輸出可用於搜尋和文字擷取,但可能包含錯誤,需要在依賴文字用於法律、財務或監管目的之前進行驗證。

檢查 PDF 文件結構中的文本

若要明確檢查拼合 PDF 中是否存在文字數據,請檢查原始文件結構。在可以處理二進位檔案的文字編輯器(例如 VS Code 或 Notepad++)中開啟 PDF。從原始文件內容中搜尋可識別的文字字串。如果在文件資料中找到文字字串,則即使無法透過 PDF 閱讀器介面訪問,文字層也存在。

此方法需要對 PDF 內部結構有一定的了解。 PDF 中的文字儲存在 BT 和 ET 標記中,它們表示文字物件的開頭和結尾。在這些標記之間,字元代碼與定位命令一起列出。找到包含可識別文字的 BT 和 ET 標記表明文字資料在扁平化過程中倖存下來。

從實際角度來看,在實際場景中,如果在檔案資料中找不到文字字串,則拼合操作會將內容完全光柵化。這些頁面是圖像,不包含可恢復的文字資訊。 OCR 是建立文字圖層的唯一可用途徑。

防止未來拼合操作中文本層遺失

當拼合需要保留其文字圖層的 PDF 時,請使用保留隱藏文字的設定。在 Acrobat Pro 中,拼合預覽工具包含一個用於保留疊印和專色資訊的複選框,間接有助於保留文字資料。印前檢查工具提供明確保留文字的展平修復。

最安全的方法是在拼合之前保存 PDF 的未拼合副本。未展平的副本保留所有互動元素、註釋和文字圖層。分發扁平版本。將未拼合的原件存檔。如果需要恢復,原始資料會提供完整的來源資料。

從更廣泛的角度來看,在文檔工作流程中,對於關鍵文檔,請先在副本上測試拼合設置,然後再將其應用到原始文檔。驗證文字在展平後是否仍可恢復。如果恢復失敗,請調整設定。測試步驟會增加工作流程的時間並防止永久性文字遺失。

使用印前檢查來偵測並擷取隱藏文本層

Acrobat Pro 印前檢查工具包含專門用於分析 PDF 內容結構的設定檔。庫存報告列出了文件中存在的所有文字對象,包括在正常查看期間不可見的文字對象。在展平的 PDF 上執行此報告可以揭示文字資料是否在展平過程中倖存下來。

如果預檢報告標識文字對象,請使用匯出所有文字修復將它們提取到單獨的文件中。然後可以將提取的文字與可見頁面內容進行比較,以確定保留了多少原始文字以及它是否準確和完整。

從部分拼合的 PDF 恢復文字

某些扁平化操作僅影響特定的頁面元素,而使其他元素保持不變。表單欄位可能會被展平,而正文文字仍保留為可選字元。註釋可能會被展平,而底層頁面文字仍然存在。獨立檢查每種元素類型,以確定哪些元素被展平,哪些元素被保留。

從廣角來看,在文檔工作流程中,對於部分扁平化的文檔,從未扁平化的部分中提取倖存文本,並將其與扁平化部分的 OCR 輸出相結合。混合方法透過使用可用的原始文字和原始遺失的 OCR 重建文字來最大限度地恢復文字。

何時接受不可能恢復

如果發生這種情況,如果文件結構中不存在文本數據,如果 Acrobat 找不到可編輯文本,並且 OCR 產生不可接受的不準確結果,則無法恢復原始文本圖層。接受這個結論,並採取行動保護剩下的東西,而不是投入更多時間進行恢復嘗試。

記錄恢復嘗試及其結果。注意使用的工具、嘗試的方法以及得出的結論。該文件為未來的文件保管人提供服務,他們可能可以獲得更好的恢復工具,並且應該了解之前嘗試過的內容。

扁平化文件的長期歸檔策略

扁平化 PDF 通常是專門為存檔目的而創建的,因為它們消除了交互依賴性。歸檔拼合文件時,請盡可能將未拼合的原件與拼合版本一起儲存。原件保留了完整的文檔結構。扁平化版本提供穩定的歸檔格式。

對於僅存在拼合版本的文檔,請執行 OCR 以建立文字圖層並將其嵌入 PDF 中。 OCR 文字可能並不完美,但它可以實現未來不可能的搜尋和文字擷取。 OCR 層是扁平化影像和未來文件分析需求之間的橋樑。

文檔集合的自動扁平化偵測

管理大型文件集合的組織可以從扁平化 PDF 的自動檢測中受益。開啟每個 PDF、檢查是否存在可選文字並標記不存在文字的文件的腳本可識別需要 OCR 處理的文件。自動掃描可防止扁平化文件在沒有可搜尋文字層的情況下悄悄進入存檔。

將扁平化偵測整合到文件攝取工作流程中。當新的 PDF 進入系統時,檢查文字是否存在。如果文字不存在,則在文件到達存檔之前將其路由到 OCR 處理佇列。自動偵測和更正確保每個存檔文件都可搜尋。

WukongPDF

嘗試修復 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →