Others

您可以從 PDF 中刪除所有圖像並匯出純文字版本嗎

包含高解析度照片、圖表、徽標和裝飾圖像的 PDF 對於以文字為中心的工作流程來說可能不切實際。當您只需要文字時,剝離所有PDF圖像並匯出純文字版本會產生一個小得多的文件,僅包含文件文字內容。問題是產生的純文字輸出是否完整且可用於預期目的。

對於基於文字的 PDF,簡短的答案是肯定的,其中文字以可選字元的形式存在。對於文字是圖像一部分的掃描 PDF,剝離圖像會刪除包括文字在內的所有內容。主要區別在於本機文字 PDF(其中文字和圖像是單獨的圖層)和基於圖像的 PDF(其中整個頁面是沒有文字圖層的圖片)。

PDF 到文字 擷取會刪除影像,同時保留文字內容。對於文字具有主要含義而圖像是補充的文檔,純文字輸出是完全可用的。對於影像傳達重要訊息的文件(例如醫學掃描或建築圖),純文字輸出會遺失關鍵內容。

WukongPDF 的 PDF 處理工具包括影像剝離和文字擷取功能。

Can You Strip All Images From a PDF and Export a Text-Only Version

原生文字和基於圖像的 PDF 之間的區別

本機文字 PDF 將文字儲存為位於頁面上的字元代碼。圖像是覆蓋或放置在文字區塊之間的單獨物件。當您從本機文字 PDF 中刪除圖像時,文字保持完整且完全可讀。保留標題、段落和分頁符號等文件結構。只有裝飾性和說明性圖像消失。

基於影像的 PDF 將整個頁面儲存為光柵影像,通常來自掃描器或螢幕截圖。沒有要保留的文字字元。從基於影像的 PDF 中剝離影像會刪除所有內容,從而產生空白文件。對於經過 OCR 處理的掃描 PDF,影像後面有一個不可見的文字圖層。影像剝離會刪除可見的掃描頁面,但保留 OCR 文本,其中可能包含識別錯誤。

要確定您擁有哪種類型的 PDF,請在任何 PDF 閱讀器中開啟它並嘗試選擇一個文字單字。如果您可以選擇單個字符,則 PDF 是本機文本,並且圖像剝離將保留文本。如果按一下選擇整個頁面作為一個大圖像區塊,則 PDF 是基於圖像的,剝離圖像將不留下任何內容或僅留下 OCR 文字圖層。

WukongPDF

嘗試壓縮 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

方法 1:使用 Acrobat Pro PDF Optimizer 剝離影像

在 Acrobat Pro 中開啟 PDF,然後前往「檔案」、「另存為其他」、「最佳化 PDF」。在「PDF 優化器」對話方塊中,按一下左側面板中的「放棄物件」。選取標有“放棄所有圖像”的方塊。在清理下,選取刪除未使用的物件。按一下「確定」並以新名稱儲存優化後的檔案。 Acrobat 處理該檔案並刪除每個光柵影像物件。

實際上,最終的檔案大小可能會顯著減小。如果文件主要是帶有嵌入圖像的文本,則帶有高解析度照片的 20 MB PDF 可能會縮小到 100 KB 以下。開啟優化的檔案並捲動每個頁面以確認所有文字內容均存在且可讀。檢查影像已刪除的頁面區域。佈局可能會略有變化,因為之前圖像佔用的空間現在是空的。

如果任何重要內容與圖像一起被刪除,例如儲存為圖像而不是向量圖形的圖表,請撤銷操作並使用更具選擇性的方法。不要丟棄所有圖像,而是對其進行大量壓縮或用描述刪除內容的佔位符文字替換它們。

方法 2:程序化文本提取

PyMuPDF 和 pdfplumber 等 Python 庫提取文本,同時本機忽略圖像。提取僅讀取文字層,產生沒有任何圖像資料的乾淨文字流。提取的文字可以儲存為 .txt 檔案以進行編輯或輸入到新的純文字 PDF 中。程式設計方法是可編寫腳本、可重複的,並且可以處理多個檔案的批次。

對於具有 OCR 文字層的掃描 PDF,程式化擷取會讀取 OCR 文字。品質完全取決於 OCR 的準確性。使用現代 OCR 掃描乾淨的文件可以產生準確率高達 99% 的文字。使用舊 OCR 掃描的品質較差的文件可能會產生需要大量手動更正的文字。提取將包括文字層中存在的任何 OCR 錯誤。

提取後質量驗證

剝離影像或提取文字後,請在使用前驗證輸出品質。將提取的文字的字數與原始文件的手動估計進行比較。顯著差異表示內容遺失。搜尋原文中出現的已知術語,以確認它們出現在輸出中。檢查每個主要部分的第一段和最後一段以驗證完整性。

在文件工作流程中,對於文字準確性至關重要的文件(例如法律文件或財務報告),請讓第二位審閱者根據原始 PDF 抽取提取的文本。即使 99% 的準確率提取也意味著每百個單字有一個錯誤,這對於精確文件來說可能是不可接受的。驗證過程可以捕獲自動品質檢查遺漏的提取錯誤。

文檔類型可安全剝離? 取代
法律簡介是的,文字是首要的不需要
帶圖表的報告不,圖表包含數據壓縮而不是剝離
掃描文件不,掃描就是內容先OCR,再提取文本

當文字內容是主要值且圖像是偶然的時,從 PDF 中剝離圖像是合適的。產生的純文字檔案明顯較小,完全可搜索,並可用於文字分析、翻譯或內容重新利用。應在確認文字本身傳達了文件的本質意義後才做出剝離影像的決定。

當涉及文件工作流程時,對於圖像和文字協同工作的文檔,請保留完整的 PDF 並透過壓縮而不是刪除來優化它。壓縮的 PDF 保留了文字和圖像之間的視覺關係,同時減少了分發文件的大小。

影像剝離後 PDF 佈局會發生什麼

在典型的工作流程中,當圖像被刪除時,它們在頁面上佔據的空間就會變空。環繞圖像的文字可能會回流到空白區域。包含影像儲存格的表格將具有空白儲存格。圍繞特定圖像位置設計的頁面佈局可能看起來很尷尬。剝離後的 PDF 針對內容進行了最佳化,而不是針對視覺設計。

對於佈局完整性很重要的文檔,請考慮用佔位符文字取代圖像,而不是完全刪除它們。可以在每張圖像的位置插入諸如圖像已刪除:產品照片之類的標題。佔位符保留版面結構,同時確認視覺內容已被刻意刪除。

在影像剝離前使用 OCR 建立文字圖層

對於文件處理,對於缺少文字圖層的掃描 PDF,在影像剝離之前執行 OCR 會建立剝離過程保留的文字資料。 OCRmyPDF 可以透過單一指令為掃描的 PDF 新增文字圖層。經過 OCR 處理後,PDF 包含可見的掃描影像和不可見的文字圖層。然後剝離圖像會刪除掃描的頁面,同時保留已識別的文字。

在實踐中,OCR 品質直接決定剝離輸出的可用性。 OCR 準確率達到 99% 的文件會產生可用文本,但偶爾會出現錯誤。準確度為 80% 的文件產生的文字需要大量手動更正。在對掃描文件進行影像剝離之前,請執行 OCR 並評估範例頁面上的文字品質。

壓縮影像作為剝離的替代

對於完全刪除圖像會丟失有價值內容的文檔,積極的圖像壓縮提供了一個中間立場。透過高 JPEG 壓縮將影像尺寸縮小到 72 DPI 可以將 20 MB PDF 縮小到 2 到 3 MB,同時保持影像可識別。壓縮後的影像品質較低,但仍傳達視覺訊息。

將壓縮與選擇性影像刪除相結合可提供最大的靈活性。將圖像保留在重要的頁面上,例如內容中心的圖表和照片,並從沒有資訊用途的頁面上刪除裝飾圖像。混合方法需要更多的手工工作,但可以實現品質和尺寸的最佳平衡。

純文字 PDF 匯出適用於特定用例:將內容輸入文字分析管道、建立用於行動閱讀的輕量級版本以及準備翻譯文件(其中圖像會增加成本而不增加價值)。對於每個用例,文字是產品,圖像是可以丟棄的包裝。

應記錄刪除圖像的決定,以便未來純文字版本的讀者了解視覺內容被有意刪除。當有人將純文字版本與原始版本進行比較時,文件屬性或封面上的簡短註解可以防止混淆。

在大多數工具中,純文字 PDF 匯出是滿足特定需求的專用工具。它不是通用優化。對於大多數文檔,壓縮是比圖像刪除更好的第一步。在文字是唯一有價值的內容並且僅由文字來滿足文件目的的情況下,保留圖像剝離。

了解影像剝離的功能和限制可確保以正確的理由將其應用於正確的文檔,從而產生滿足其預期目的的輸出,而不會造成意外的內容遺失。純文字 PDF 可以很好地滿足特定目的,應根據文件類型和預期用途選擇性地應用。

WukongPDF

嘗試壓縮 PDF

無需安裝。直接在您的瀏覽器中工作。

立即開始 →