Zeskanowany plik PDF złożony z różnych źródeł często zawiera strony w orientacji pionowej i poziomej. Arkusze kalkulacyjne finansowe pojawiają się jako strony poziome. Załączone dokumenty tekstowe są wyświetlane jako strony pionowe. Uruchomienie OCR na takim dokumencie bez uwzględnienia orientacji mieszanej powoduje rozpoznanie tekstu, w którym słowa na stronach poziomych są pomieszane, obrócone lub całkowicie pominięte, ponieważ silnik OCR przetworzył te strony w niewłaściwej orientacji.
Silniki OCR PDF analizują linie tekstu w celu określenia pozycji znaków i kolejności czytania. Gdy strona zostanie obrócona o 90 stopni w stosunku do oczekiwań silnika, linie tekstu biegną pionowo, a nie poziomo. Silnik albo nie rozpoznaje tekstu w całości, albo próbuje czytać w pionie, co daje nonsensowny wynik. Dokumenty o mieszanej orientacji wymagają wykrywania orientacji na stronie przed przetwarzaniem OCR.
WukongPDF Skanowany plik PDF Narzędzia OCR obsługują różne orientacje stron z automatycznym wykrywaniem obrotu każdej strony podczas procesu rozpoznawania.
Dlaczego orientacja strony ma znaczenie dla dokładności OCR
Silniki OCR działają poprzez wykrywanie wierszy znaków i analizowanie kształtów w każdym wierszu. Strona w orientacji pionowej zawiera poziome linie tekstu, które silnik przetwarza w sposób naturalny. Strona w orientacji poziomej, oglądana bez korekcji obrotu, ma linie tekstu biegnące pionowo z perspektywy silnika OCR. Silnik oczekuje tekstu poziomego i nie może odczytać tekstu pionowego.
Rozwiązaniem jest wykrycie orientacji każdej strony przed OCR i obrócenie stron poziomych do orientacji pionowej przed przetworzeniem. Po OCR strony można obrócić z powrotem do ich pierwotnej orientacji, przy prawidłowym ułożeniu rozpoznanej warstwy tekstowej. Rotacja podczas przetwarzania nie powoduje trwałej zmiany dokumentu; zmienia to jedynie sposób, w jaki silnik OCR widzi stronę.
Większość zautomatyzowanych narzędzi OCR zakłada, że wszystkie strony mają tę samą orientację, ponieważ jest to częsty przypadek dokumentów generowanych przez jeden skaner w jednej sesji. Dokumenty o mieszanej orientacji, często tworzone przez połączenie skanów z różnych źródeł, wymagają jawnej konfiguracji, aby prawidłowo obsługiwać różnice na stronie.
Metoda 1: Acrobat Pro z wykrywaniem rotacji poszczególnych stron
Funkcja OCR programu Acrobat Pro może przetwarzać dokumenty o różnej orientacji, jeśli jest odpowiednio skonfigurowana. Otwórz zeskanowany plik PDF w programie Acrobat Pro i przejdź do opcji Narzędzia, Skanuj i OCR, Rozpoznaj tekst, W tym pliku. Upewnij się, że w oknie dialogowym ustawień Rozpoznaj tekst wybrano właściwy język OCR jako główny język dokumentu. W sekcji Ustawienia włącz opcję Prostowanie i prostowanie, która pomaga programowi Acrobat wykryć obrót strony.
Acrobat przetwarza każdą stronę indywidualnie i próbuje wykryć dominującą orientację tekstu. W przypadku stron, których wykrywanie jest prawidłowe, wynik OCR jest dokładny i czytelny. W przypadku stron, których wykrywanie nie powiedzie się, np. stron z minimalną ilością tekstu lub złożonym tłem wizualnym, wynik OCR może być zakłócony lub całkowicie nieobecny. Po przetworzeniu OCR przejrzyj w szczególności strony poziome. Wyszukaj tekst, który możesz zobaczyć na tych stronach. Jeśli wyszukiwanie nic nie znajdzie, program Acrobat prawdopodobnie błędnie określił orientację.
W przypadku błędnie zidentyfikowanych stron obróć je ręcznie w narzędziu Organizuj strony i ponownie uruchom OCR tylko na tych stronach. Ręczna interwencja w przypadku każdej strony, której dotyczy problem, zajmuje tylko chwilę i zapewnia, że każda strona zawiera dokładnie rozpoznany tekst w dokumencie wyjściowym z możliwością przeszukiwania.
Metoda 2: Wstępne przetwarzanie za pomocą OCRmyPDF
OCRmyPDF, narzędzie wiersza poleceń typu open source zbudowane na bazie Tesseract OCR, obsługuje strony o różnej orientacji dzięki wbudowanej funkcji prostowania. Polecenie ocrmypdf --deskew input.pdf Output.pdf wykrywa orientację tekstu na każdej stronie, w razie potrzeby obraca strony, uruchamia OCR za pomocą Tesseract i generuje przeszukiwalny plik PDF. Flaga przekosu jest istotnym parametrem przy przetwarzaniu dokumentów o mieszanej orientacji.
OCRmyPDF przetwarza strony sekwencyjnie i automatycznie stosuje korektę orientacji na stronie. W przypadku dokumentów o dużym rotacji lub stron zawierających tekst zarówno w poziomie, jak i w pionie, algorytm prostowania ustawia stronę w oparciu o dominujący kierunek tekstu, co zapewnia najlepsze wyniki OCR dla większości zawartości strony. Kierunek tekstu mniejszościowego może mieć nieco zmniejszoną dokładność, ale ogólnie jest nadal rozpoznawany.
W obiegach dokumentów, w przypadku masowego przetwarzania wsadowego dokumentów o mieszanej orientacji, OCRmyPDF w połączeniu ze skryptem powłoki, który przetwarza wszystkie pliki PDF w folderze, zapewnia w pełni zautomatyzowany OCR bez ręcznej konfiguracji poszczególnych dokumentów. Automatyzacja obsługuje rutynowe przetwarzanie i tylko wyjątki wymagają przeglądu przez człowieka.
Weryfikacja wyników OCR w szczególności na stronach poziomych
Po przetworzeniu OCR zweryfikuj dane wyjściowe na stronach poziomych w ramach osobnej kontroli. Zaznacz tekst na stronie poziomej w wyjściowym pliku PDF i skopiuj go do edytora zwykłego tekstu. Skopiowany tekst należy czytać we właściwej kolejności, dopasowując się do zawartości strony wizualnej od góry do dołu i od lewej do prawej. Jeśli słowa są pomieszane, niewłaściwie uporządkowane lub pojawiają się w bezsensownych sekwencjach, oznacza to, że wykrywanie orientacji dla tej strony nie powiodło się.
Wyszukaj konkretne znane terminy pojawiające się na stronach poziomych. Tabela finansowa na stronie poziomej może zawierać określone kody kont, nazwy działów lub wartości liczbowe, które można wyszukiwać w wynikach OCR. Jeśli wyszukiwanie nie znajdzie żadnych dopasowań na stronach poziomych, ale znajdzie dopasowania na stronach pionowych tego samego dokumentu, silnik OCR prawdopodobnie całkowicie pominął zawartość poziomą. Strony te wymagają ponownego przetworzenia z określoną orientacją ręczną.
W obiegu dokumentów, w przypadku dokumentów, które będą służyć jako archiwa z możliwością przeszukiwania, etap weryfikacji stanowi bramkę jakości, która wychwytuje problemy z OCR związane z orientacją, zanim dokument trafi do stałego zbioru. Niezweryfikowane dane wyjściowe OCR, które po cichu pomijają całe strony treści, podważają cel tworzenia archiwum z możliwością przeszukiwania.
Przetwarzanie wsadowe Zeskanowanych kolekcji o różnej orientacji
W przypadku dużych zbiorów zeskanowanych dokumentów o różnej orientacji ręczna weryfikacja poszczególnych stron jest niepraktyczna. Zautomatyzuj proces za pomocą OCRmyPDF i flagi deskew, a następnie uruchom skrypt weryfikacyjny, który sprawdza każdą stronę wyjściową pod kątem obecności możliwego do przeszukiwania tekstu. Strony zawierające zero rozpoznanych znaków tekstowych lub bardzo małą liczbę znaków są oznaczane do ręcznego sprawdzenia i potencjalnego ponownego przetworzenia.
Skrypt weryfikacyjny odczytuje każdy plik PDF przetworzony przez OCR, wyodrębnia warstwę tekstową strona po stronie i zlicza liczbę rozpoznanych znaków na każdej stronie. Każda strona poniżej minimalnego progu znaków, np. dziesięciu znaków, jest oznaczana jako potencjalnie nieprzetworzona lub błędnie zorientowana. Oflagowane strony są zestawiane w raport, który kieruje ręcznym sprawdzeniem tylko tych stron, które faktycznie wymagają ludzkiej uwagi, zamiast wymagać sprawdzania każdej strony.
Jeśli chodzi o przepływy pracy, w przypadku trwających projektów digitalizacji, w których regularnie napływają nowe zeskanowane dokumenty, przepływ pracy wsadowy i weryfikacja staje się standardową procedurą operacyjną. Nowe dokumenty trafiają do rurociągu, są automatycznie przetwarzane przez OCR z wykrywaniem orientacji i tylko wyjątki wymagają interwencji człowieka. Automatyka radzi sobie z rutyną. Recenzent ludzki obsługuje wyjątki.
Poprawa OCR na stronach z rotacją wewnętrzną
Niektóre zeskanowane dokumenty zawierają strony, których treść jest obracana w obrębie strony, a nie sama strona. Poziomą tabelę finansową można wstawić do dokumentu w orientacji pionowej, obracając zawartość tabeli o 90 stopni, zachowując wymiary strony w pozycji pionowej. Strony te są najtrudniejsze do wykrycia orientacji, ponieważ wymiary strony nie wskazują, że potrzebny jest obrót.
W przypadku przetwarzania dokumentów, w przypadku stron z rotacją wewnętrzną, najbardziej niezawodne jest ręczne przetwarzanie wstępne. W programie Acrobat Pro użyj narzędzia Edytuj plik PDF, aby wybrać obrócony obszar zawartości, obróć go do właściwej orientacji poziomej i umieść go prawidłowo na stronie. Po skorygowaniu rotacji wewnętrznej uruchom OCR na poprawionej stronie. Etap ręcznego wstępnego przetwarzania zajmuje około minuty w przypadku każdej strony, której dotyczy problem, ale zapewnia czysty i dokładny wynik OCR.
Identyfikacja stron z rotacją wewnętrzną wymaga kontroli wzrokowej. Przeskanuj dokument i poszukaj stron, na których tekst wydaje się biegnąć w nieoczekiwanym kierunku względem krawędzi strony. Strony podlegające rotacji wewnętrznej są stosunkowo rzadkie w większości kolekcji dokumentów, ale w przypadku ich wystąpienia nieproporcjonalnie wpływają na jakość rozpoznawania OCR.
Wybór odpowiedniego mechanizmu OCR dla dokumentów o różnej orientacji
Różne silniki OCR obsługują wykrywanie orientacji z różną dokładnością. Tesseract z preprocesorem prostowania dobrze radzi sobie z umiarkowanym obrotem, ale może mieć problemy ze stronami obróconymi dokładnie o 90 lub 180 stopni. Google Cloud Vision OCR zawiera wbudowaną funkcję wykrywania orientacji, która niezawodnie obsługuje wszystkie kąty obrotu. W przypadku krytycznych dokumentów o mieszanej orientacji, gdzie istotna jest dokładność, usługi OCR oparte na chmurze zazwyczaj przewyższają lokalne silniki pod względem obsługi orientacji.
Przed zatwierdzeniem dużej partii przetestuj wybrany silnik OCR na małej próbce stron o różnej orientacji. Dziesięciostronicowy test ze znanymi wzorcami orientacji pokazuje, jak silnik radzi sobie z określonymi typami rotacji w dokumentach. Test trwa kilka minut i zapobiega godzinom ponownego przetwarzania, jeśli wykrywanie orientacji silnika okaże się niewystarczające dla konkretnego typu dokumentu.
Eksportowanie tekstu OCR z dokumentów o różnej orientacji w celu weryfikacji
Po przetworzeniu OCR wyeksportuj rozpoznany tekst, aby sprawdzić kompletność na wszystkich stronach. W programie Acrobat Pro przejdź do opcji Narzędzia, Eksportuj plik PDF i wybierz Tekst jako format wyjściowy. Wyeksportowany plik tekstowy powinien zawierać treść każdej strony w prawidłowej kolejności czytania. Otwórz plik tekstowy i wyszukaj terminy, o których wiesz, że pojawiają się na określonych stronach poziomych. Jeśli w eksporcie brakuje tych terminów, strony te prawdopodobnie zostały źle zorientowane podczas OCR i wymagają ponownego przetworzenia.
Jeśli chodzi o obsługę dokumentów, w przypadku dokumentów przeznaczonych do przeszukiwalnych archiwów wyeksportowany tekst służy jako niezależna weryfikacja, czy każda strona wniosła swoją treść do warstwy z możliwością przeszukiwania. Eksport tekstu zawierający luki lub brakujące sekcje oznacza błędy OCR wymagające uwagi, zanim dokument trafi do trwałego archiwum. Etap eksportu pełni funkcję bramki jakości, która wychwytuje problemy związane z OCR związane z orientacją, zanim staną się trwałymi brakami w archiwum.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
