Uruchomienie OCR PDF na folderze zeskanowanych dokumentów powinno spowodować utworzenie przeszukiwalnych plików PDF o nazwach pasujących do oryginałów. Kiedy wsadowe narzędzia OCR zmieniają ogólnie nazwy plików wyjściowych, np. wynik1.pdf, wynik2.pdf, połączenie między wersją oryginalną a wersją, którą można przeszukiwać, zostaje utracone. Zachowywanie nazw plików w procesie OCR zapewnia uporządkowanie i identyfikowalność zeskanowanych dokumentów.
Zachowanie nazwy pliku jest szczegółem konfiguracji, a nie ograniczeniem funkcji. Większość narzędzi OCR domyślnie generuje nazwy plików wyjściowych na podstawie nazw plików wejściowych lub umożliwia określenie wzorca nazewnictwa wyjściowego. Kluczem jest znalezienie odpowiedniego ustawienia lub flagi wiersza poleceń przed uruchomieniem partii, a nie po odkryciu, że zmieniono nazwy 200 plików.
Narzędzia WukongPDF Skanowany plik PDF OCR przetwarzają dokumenty indywidualnie i wsadowo, zachowując oryginalne nazwy plików.

Wsadowy OCR za pomocą kreatora akcji programu Acrobat Pro
Kreator akcji programu Acrobat Pro automatyzuje wieloetapowe przetwarzanie plików PDF w folderze. Przejdź do Narzędzia, Kreator akcji, Nowa akcja. Dodaj do akcji krok Rozpoznaj tekst, wybierając prawidłowy język OCR i ustawienia wyjściowe. Dodaj krok Zapisz, który zapisuje pliki w określonym folderze wyjściowym, opcjonalnie dołączając przyrostek, taki jak _OCR, aby odróżnić pliki, które można przeszukiwać, od oryginałów.
Uruchom akcję w folderze wejściowym. Acrobat otwiera każdy plik, uruchamia OCR, zapisuje wynik z przyrostkiem dołączonym do oryginalnej nazwy pliku i przechodzi do następnego pliku. Folder wyjściowy zawiera przeszukiwalne pliki PDF o nazwach takich jak raport_OCR.pdf odpowiadających oryginalnemu raportowi.pdf. Podejście oparte na sufiksach zachowuje oryginalną nazwę pliku, jednocześnie wyraźnie wskazując, które pliki zostały przetworzone przez OCR.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Wsadowy OCR z wiersza poleceń z Tesseraktem
Tesseract przetwarza jeden plik obrazu na raz. W przypadku wsadowego OCR folderu zeskanowanych plików PDF najpierw przekonwertuj każdą stronę pliku PDF na obraz, uruchom Tesseract, a następnie połącz ponownie w plik PDF z możliwością przeszukiwania. Skrypt powłoki obsługuje potok. Dla każdego pliku PDF w folderze skrypt wyodrębnia podstawową nazwę pliku, konwertuje strony do obrazów TIFF, uruchamia Tesseract z odpowiednią flagą języka i generuje przeszukiwalny plik PDF z oryginalną podstawową nazwą pliku.
Skrypt wykorzystuje rozwinięcie parametrów w celu usunięcia rozszerzenia pliku: base=${f%.pdf} podaje nazwę pliku bez rozszerzenia .pdf. Wynik Tesseractu nosi nazwę $base, a wynikowy plik PDF z możliwością przeszukiwania jest zapisywany jako ${base}_searchable.pdf. Oryginalna nazwa pliku jest zachowywana w nazwie wyjściowej. Pętla jednowierszowa przetwarza cały folder: for f w formacie *.pdf; wykonaj tesseract $f ${f%.pdf} -l eng PDF; zrobione.
Uproszczony wsadowy OCR za pomocą OCRmyPDF
OCRmyPDF to narzędzie wiersza poleceń oparte na języku Python, które dodaje warstwę tekstową OCR do istniejących plików PDF. Obsługuje wewnętrznie wyodrębnianie obrazów, OCR i ponowne składanie plików PDF. Pojedyncze polecenie przetwarza jeden plik PDF: ocrmypdf input.pdf Output.pdf. Dane wyjściowe zachowują obrazy stron i dodają rozpoznany tekst za nimi w postaci niewidocznej warstwy.
W przypadku przetwarzania wsadowego OCRmyPDF akceptuje ścieżkę folderu z flagą --batch lub może być zapętlony w skrypcie powłoki. Kluczową przewagą nad Tesseract do przetwarzania plików PDF jest to, że OCRmyPDF współpracuje bezpośrednio z wejściem i wyjściem PDF. Nie jest wymagana pośrednia konwersja obrazu. Nazwę pliku wyjściowego można określić dla każdego pliku, zachowując oryginalną konwencję nazewnictwa. W przypadku digitalizacji dużych ilości zeskanowanych dokumentów, OCRmyPDF w połączeniu z pętlą powłoki zapewnia najbardziej efektywną ścieżkę od surowych skanów do przeszukiwalnych archiwów.
| Narzędzie | Metoda wsadowa | Obsługa nazw plików |
|---|---|---|
| Kreator akcji programu Acrobat Pro | Utwórz akcję, zastosuj do folderu | Zachowuje oryginalną nazwę pliku, dodaje przyrostek |
| Interfejs wiersza polecenia Tesseract | Powłoka z pętlą for nad folderem | Dane wyjściowe odpowiadają wejściowej nazwie pliku |
| OCRmyPDF | Pojedyncze polecenie na plik lub partię | Zastępuje lub tworzy nowy plik zgodnie z ustawieniami |
Weryfikacja zbiorczego wyniku OCR
Po przetworzeniu wsadowym należy sprawdzić próbkę plików wyjściowych przed zarchiwizowaniem oryginałów. Otwórz od trzech do pięciu wyjściowych plików PDF z różnych części alfabetycznie posortowanej listy plików. Wyszukaj słowo widoczne na zeskanowanym obrazie. Jeśli wyszukiwanie znajdzie słowo, OCR powiodło się dla tego pliku. Sprawdź pierwszą stronę, środkową stronę i ostatnią stronę każdego próbkowanego pliku. Jakość OCR może różnić się w obrębie dokumentu, jeśli strony mają różną jakość skanowania.
Jeśli chodzi o obieg dokumentów, w przypadku dokumentów, w przypadku których rozpoznawanie OCR nie powiodło się, co wskazuje plik PDF, w którym wyszukiwanie nic nie powoduje, należy ponownie uruchomić OCR z dostosowanymi ustawieniami. Jeśli skan oryginału jest niskiej jakości, zwiększ rozdzielczość obrazu do 400 DPI. Wypróbuj inny silnik OCR, jeśli Tesseract dał słabe wyniki. Przetwarzaj problematyczne pliki indywidualnie, zamiast ponownie uruchamiać całą partię.
Wsadowy OCR z zachowaniem nazwy pliku przekształca folder niedostępnych zeskanowanych dokumentów w przeszukiwalne archiwum, w którym każdy plik można prześledzić do oryginału. Nazwa pliku stanowi łącze pomiędzy oryginalnym skanem a wersją ulepszoną za pomocą OCR.
Długoterminowe przechowywanie zeskanowanych plików PDF ze wzmocnionym OCR
Po skonfigurowaniu, po wsadowym przetwarzaniu OCR, przechowuj przeszukiwalne pliki PDF w lokalizacji, która zachowuje zarówno obrazy stron, jak i warstwę tekstową OCR. Standardem archiwalnym jest format PDF/A z osadzoną warstwą tekstową. Konwertuj dane wyjściowe OCR na format PDF/A przy użyciu programu Acrobat Pro lub Ghostscript z ustawieniem wyjściowym PDF/A.
W praktyce warstwa tekstowa OCR zwiększa minimalny rozmiar pliku, zwykle od 5 do 15 procent. Prawie zawsze warto poświęcić nieco większe pliki na rzecz możliwości wyszukiwania. Zeskanowany dokument, którego nie można przeszukać, jest znacznie mniej przydatny niż taki, który może.
W praktyce struktura katalogów dla wsadowych wyników OCR powinna odzwierciedlać strukturę wejściową podczas przetwarzania zagnieżdżonych folderów. Rekursywny skrypt wsadowy, który zachowuje względną strukturę ścieżek, gwarantuje, że pliki wzmocnione OCR zachowują tę samą hierarchię organizacyjną co oryginały.
Jeśli chodzi o obieg dokumentów, w przypadku bardzo dużych projektów OCR wsadowych obejmujących tysiące dokumentów należy rozważyć podzielenie obciążenia na wiele sesji lub maszyn. OCR wymaga dużej mocy obliczeniowej, a partia dziesięciu tysięcy stron może zająć kilka godzin na jednym komputerze.
Po skonfigurowaniu i ukończeniu wsadowego projektu OCR wygeneruj manifest przetwarzania zawierający listę każdego pliku wejściowego, jego pliku wyjściowego, użytego silnika OCR i ustawień oraz daty przetwarzania. Manifest pełni funkcję dokumentacji i zapisu przetwarzanych plików.
Patrząc na to praktycznie, w praktyce przejście od nieprzeszukiwalnych zeskanowanych archiwów do zbiorów możliwych do przeszukiwania za pomocą OCR jest jednym z działań digitalizacyjnych o największym wpływie. Możliwość wyszukiwania wcześniej niedostępnych dokumentów przekształca je ze statycznych zapisów w aktywne źródła informacji.
Szybkość przetwarzania OCR różni się w zależności od złożoności dokumentu. Strony zawierające wyłącznie tekst są przetwarzane szybko. Strony zawierające tabele, mieszane czcionki lub elementy dekoracyjne trwają dłużej. Partia stron z jednolitym tekstem jest wykonywana szybciej niż partia o zróżnicowanej treści.
W przypadku większości narzędzi ustawienie języka OCR wpływa na czas i dokładność przetwarzania wsadowego. Wybór tylko języków faktycznie występujących w dokumentach pozwala uniknąć niepotrzebnego narzutu przetwarzania i ogranicza rozpoznawanie fałszywych znaków w nieużywanych modelach językowych.
W przypadku dokumentów zawierających zarówno tekst, jak i fotografie, silnik OCR może próbować rozpoznać tekst w obszarach fotografii, powodując powstawanie szumów. Filtrowanie po OCR usuwa te artefakty, analizując rozkład przestrzenny rozpoznanego tekstu.
Zwykle ustawienie DPI dla obrazów wejściowych OCR równoważy szybkość przetwarzania z dokładnością. Standardową rekomendacją jest 300 DPI. 400 DPI poprawia dokładność małego tekstu. 200 DPI przetwarza szybciej, ale może pomijać drobne znaki.
Po zbiorczym OCR przeprowadź test wyszukiwania słów kluczowych w przetworzonych plikach, używając terminów, o których wiadomo, że występują w oryginałach. Pliki, w których nie znaleziono słowa kluczowego, wymagają ponownego przetworzenia z dostosowanymi ustawieniami lub ręcznego sprawdzenia.
Pliki wyjściowe OCR powinny być przechowywane w strukturze folderów oddzielającej pliki przetworzone od oryginałów. Zapobiega to przypadkowemu ponownemu przetwarzaniu plików już wzmocnionych OCR i utrzymuje porządek w archiwum.
W tym kontekście w praktyce warstwę tekstową OCR można wyodrębnić i zapisać oddzielnie jako zwykły plik tekstowy dla każdego dokumentu. Oddzielne pliki tekstowe umożliwiają wyszukiwanie pełnotekstowe w całym archiwum bez konieczności otwierania każdego pliku PDF z osobna.
W przypadku przetwarzania dokumentów, w przypadku zeskanowanych archiwów o dużej wartości, rozważ uruchomienie OCR przy użyciu dwóch różnych silników i porównanie wyników. Rozbieżności między wyszukiwarkami podkreślają niepewne rozpoznanie, które wymaga ręcznej weryfikacji.
Batch OCR to pomost pomiędzy archiwami papierowymi a wyszukiwaniem cyfrowym. Szafka z dokumentami papierowymi, po zeskanowaniu i przetworzeniu za pomocą OCR, staje się bazą wiedzy z możliwością przeszukiwania. Przejście z rozwiązań fizycznych na cyfrowe z możliwością przeszukiwania to jedna z najbardziej wpływowych transformacji w zakresie zarządzania informacjami, jaką może przeprowadzić organizacja.
Wsadowy OCR z zachowaniem nazwy pliku to pomost pomiędzy folderem niedostępnych zeskanowanych dokumentów a cyfrowym archiwum z możliwością przeszukiwania. Przetwarzanie jest zautomatyzowane. Nazwy plików zapewniają identyfikowalność. Warstwa tekstowa OCR umożliwia wykrycie każdego dokumentu. Połączenie to przekształca statyczną kolekcję w aktywne źródło informacji.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
