Tips & Tricks

如何在保留原始檔案名稱的同時對掃描的 PDF 批次執行 OCR

在掃描文件的資料夾上執行OCR PDF 應產生可搜尋的 PDF,其名稱與原始文件相符。當批次 OCR 工具對輸出檔案進行一般性重新命名(如 output1.pdf、output2.pdf)時,原始版本和可搜尋版本之間的連線就會遺失。透過 OCR 過程保留檔案名稱可以使掃描的文件井然有序且可追蹤。

檔案名稱保留是一個設定細節,而不是功能限制。大多數 OCR 工具預設會根據輸入檔案名稱產生輸出檔案名稱或允許指定輸出命名模式。關鍵是在運行批次之前找到正確的設定或命令列標誌,而不是在發現 200 個檔案已重新命名之後。

WukongPDF的掃描的PDFOCR工具單獨和批量處理文檔,同時保留原始文件名。

How to Batch-Run OCR on Scanned PDFs While Keeping Original Filenames

使用 Acrobat Pro 的操作精靈進行批次 OCR

Acrobat Pro 的操作精靈可自動對資料夾執行多步驟 PDF 處理。轉到“工具”、“操作嚮導”、“新建操作”。將識別文字步驟新增至操作中,選擇正確的 OCR 語言和輸出設定。新增「儲存」步驟,將檔案儲存到指定的輸出資料夾,並可選擇附加後綴(例如 _OCR)以區分可搜尋檔案和原始檔案。

對輸入資料夾運行操作。 Acrobat 開啟每個文件,執行 OCR,儲存輸出並將後綴附加到原始檔案名,然後移至下一個檔案。輸出資料夾包含可搜尋的 PDF,其名稱類似於與原始 report.pdf 對應的 report_OCR.pdf。後綴方法保留了原始檔名,同時清楚地表明哪些檔案已經過 OCR 處理。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →

使用 Tesseract 進行命令列批量 OCR

Tesseract 一次處理一個影像檔。對於掃描 PDF 資料夾的批次 OCR,首先將每個 PDF 頁面轉換為影像,執行 Tesseract,然後重新組合成可搜尋的 PDF。 shell 腳本處理管道。對於資料夾中的每個 PDF,腳本都會提取基本檔名,將頁面轉換為 TIFF 影像,使用適當的語言標誌來執行 Tesseract,並使用原始基本檔名產生可搜尋的 PDF。

此腳本使用參數擴充來移除檔案副檔名:base=${f%.pdf} 給出不帶 .pdf 的檔案名稱。 Tesseract 的輸出名稱為 $base,產生的可搜尋 PDF 儲存為 ${base}_searchable.pdf。原始檔名保留在輸出名稱中。一行循環處理整個資料夾:for f in *.pdf;做 tesseract $f ${f%.pdf} -l eng PDF;完成。

使用 OCRmyPDF 簡化批次 OCR

OCRmyPDF 是一個基於 Python 的命令列工具,可將 OCR 文字圖層新增至現有 PDF 中。它在內部處理圖像提取、OCR 和 PDF 重組。單一指令可處理一個 PDF:ocrmypdf input.pdf output.pdf。輸出保留頁面圖像,並在其後面添加可識別的文字作為不可見層。

對於批次處理,OCRmyPDF 接受帶有 --batch 標誌的資料夾路徑,或者可以在 shell 腳本中循環。與 Tesseract 相比,PDF 處理的主要優勢在於 OCRmyPDF 直接處理 PDF 輸入和輸出。不需要中間影像轉換。可以為每個檔案指定輸出檔名,保留原始命名約定。對於大容量掃描文件數位化,OCRmyPDF 與 shell 循環相結合,提供了從原始掃描到可搜尋檔案的最有效路徑。

工具間歇法文件名處理
Acrobat Pro 動作精靈建立動作,應用於資料夾保留原始檔名,加上後綴
超立方 CLIShell for 迴圈遍歷資料夾輸出與輸入檔名匹配
OCR我的PDF每個文件或批次單一命令根據設定覆蓋或建立新文件

驗證批次 OCR 輸出

批次後,在歸檔原始文件之前驗證輸出文件的樣本。從按字母順序排序的文件列表的不同部分打開三到五個輸出 PDF。搜尋掃描影像中可見的單字。如果搜尋找到該單字,則該檔案的 OCR 成功。抽查每個樣本文件的第一頁、中間頁和最後一頁。如果頁面具有不同的掃描質量,則文件中的 OCR 品質可能會有所不同。

當涉及文件工作流程時,對於 OCR 失敗的文件(由搜尋未找到任何內容的 PDF 指示),請使用調整後的設定重新執行 OCR。如果原始掃描品質較低,請將影像解析度提高到 400 DPI。如果 Tesseract 的結果不佳,請嘗試不同的 OCR 引擎。單獨處理問題文件,而不是重新執行整個批次。

具有檔案名稱保留功能的批次 OCR 將無法存取的掃描文件資料夾轉換為可搜尋的存檔,其中每個文件都可以追溯到其原始文件。檔案名稱是原始掃描件和 OCR 增強版之間的連結。

OCR 增強掃描 PDF 的長期儲存

設定完成後,在批次 OCR 處理後,將可搜尋的 PDF 儲存在保留頁面影像和 OCR 文字圖層的位置。具有嵌入文字圖層的 PDF/A 格式是檔案標準。使用 Acrobat Pro 或 Ghostscript 以及 PDF/A 輸出設定將 OCR 輸出轉換為 PDF/A。

實際上,OCR 文字層會增加最小的檔案大小開銷,通常為 5% 到 15%。為了可搜尋性而犧牲稍大的文件幾乎總是值得的。無法搜尋的掃描文件的用處明顯低於可以搜尋的掃描文件。

實際上,批次 OCR 輸出的目錄結構應反映處理巢狀資料夾時的輸入結構。保留相對路徑結構的遞歸批次腳本可確保 OCR 增強型檔案保持與原始檔案相同的組織層級結構。

就文件工作流程而言,對於包含數千個文件的超大型批量 OCR 項目,請考慮將工作負載分散到多個會話或電腦上。 OCR 計算量大,一批一萬頁在單一機器上可能需要幾個小時。

設定完成後,在完成批次 OCR 專案後,產生一個處理清單,列出每個輸入檔案、其輸出檔案、所使用的 OCR 引擎和設定以及處理日期。清單充當文件和已處理文件的記錄。

實際上,從不可搜尋的掃描檔案到可搜尋的 OCR 增強館藏的轉變是影響最大的數位化活動之一。搜尋以前無法存取的文件的能力將它們從靜態記錄轉變為活躍的資訊資源。

OCR 處理速度因文件複雜程度而異。純文字頁面處理速度很快。有表格、混合字體或裝飾元素的頁面需要更長的時間。一批統一的文字頁面比一批不同的內容完成得更快。

在大多數工具中,OCR 語言設定會影響批次時間和準確性。僅選擇文件中實際存在的語言可以避免不必要的處理開銷,並減少未使用的語言模型中的錯誤字元辨識。

對於同時包含文字和照片的文檔,OCR 引擎可能會嘗試識別照片區域中的文本,從而產生噪音字元。 OCR 後過濾透過分析已識別文字的空間分佈來消除這些偽影。

通常,OCR 輸入影像的 DPI 設定會平衡處理速度和準確性。 300 DPI 是標準建議。 400 DPI 提高了小文本的準確性。 200 DPI 處理速度更快,但可能會遺失精細字元。

批次 OCR 後,使用已知出現在原始文件中的術語對處理後的文件執行關鍵字搜尋測試。未找到關鍵字的檔案需要透過調整設定或手動審核來重新處理。

OCR 輸出檔案應儲存在將處理後的檔案與原始檔案分開的資料夾結構中。這可以防止意外重新處理已經 OCR 增強的文件並保持存檔井井有條。

在这种情况下,实际上,OCR 文本层可以被提取并单独存储为每个文档的纯文本文件。單獨的文字檔案支援在整個存檔中進行全文搜索,而無需單獨開啟每個 PDF。

對於文件處理,對於高價值的掃描檔案,請考慮使用兩種不同的引擎運行 OCR 並比較輸出。引擎之間的差異突顯了需要手動驗證的不確定識別。

批量 OCR 是紙本檔案和數位搜尋之間的橋樑。紙本文件櫃經過掃描和 OCR 處理後,就成為可搜尋的知識庫。從實體到可搜尋數位的轉變是組織可以做出的最有影響力的資訊管理轉型之一。

具有檔案名稱保存功能的批次 OCR 是無法存取的掃描文件資料夾和可搜尋數位檔案之間的橋樑。處理過程是自動化的。檔案名稱提供可追溯性。 OCR 文字圖層使每個文件都可被發現。這種組合將靜態集合轉變為活動資訊資源。

WukongPDF

嘗試 PDF OCR

無需安裝。直接在您的瀏覽器中工作。

立即開始 →