Tips & Tricks

Jak OCR zeskanowanego dokumentu, w którym strony są naprzemiennie ułożone pionowo i poziomo w ramach jednego oprawionego woluminu

Zeskanowanie oprawionego tomu, takiego jak książka, praca dyplomowa, dziennik lub księga rachunkowa, powoduje utworzenie pliku PDF, w którym strony są naprzemiennie ułożone pionowo i poziomo. Lewe strony otwartej książki są skanowane w jednej orientacji, a prawe strony w innej, lub cała książka jest skanowana z naprzemiennym obrotem stron, ponieważ operator skanera odwracał książkę dla każdej rozłożonej strony bez obracania zeskanowanego obrazu. Rezultatem jest plik PDF, w którym co druga strona jest obrócona o 90 lub 180 stopni podczas oglądania na ekranie. Uruchomienie OCR tego dokumentu bez uprzedniej normalizacji orientacji strony powoduje, że tekst jest naprzemiennie prawidłowo zorientowany i obrócony, przez co rozpoznany tekst nie nadaje się do wyszukiwania ani wyodrębniania. Rozwiązanie wymaga etapu wstępnego przetwarzania, który wykrywa i koryguje orientację każdej strony przed jej przetworzeniem przez OCR.

How to OCR a Scanned Document Where Pages Alternate Between Portrait and Landscape Orientation Within a Single Bound Volume

Dlaczego skanowanie woluminów związanych powoduje zmianę orientacji strony

Podczas skanowania oprawionego woluminu każda rozłożona strona powoduje umieszczenie dwóch stron drukiem do dołu na skanerze. Lewa strona książki pojawia się po prawej stronie skanera, a prawa strona po lewej stronie, obrócona względem siebie o 180 stopni. Jeśli operator skanera nie skoryguje tego obrotu dla każdej strony, zeskanowany plik PDF będzie zawierał strony, na których co druga strona będzie odwrócona do góry nogami. W przypadku 200-stronicowej książki powstaje plik PDF zawierający 200 stron, z których 100 jest prawidłowo zorientowanych, a 100 jest obróconych o 180 stopni. Wzór jest regularny i przewidywalny: wszystkie strony nieparzyste mogą być prawidłowo zorientowane, a wszystkie strony parzyste obrócone lub odwrotnie.

Niektóre oprawione woluminy są skanowane poprzez umieszczenie otwartej książki na skanerze z tekstem biegnącym poziomo, w wyniku czego powstaje pojedynczy obraz zawierający zarówno lewą, jak i prawą stronę. Obraz ten jest następnie dzielony na dwie oddzielne strony, ale proces dzielenia nie zawsze powoduje obrócenie prawej strony w celu dopasowania orientacji strony lewej. Rezultatem jest plik PDF, w którym lewe strony są prawidłowo zorientowane, a prawe strony są obrócone o 90 stopni lub odwrotnie. Mechanizm OCR, który oczekuje, że tekst będzie przebiegał poziomo od lewej do prawej strony, nie może rozpoznać tekstu na obróconych stronach, ponieważ tekst jest układany pionowo lub do góry nogami.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Wykrywanie orientacji strony przed przetwarzaniem OCR

Przed uruchomieniem OCR sprawdź miniatury stron w przeglądarce plików PDF. Zmienna orientacja jest natychmiast widoczna w panelu miniatur, gdzie co druga miniatura wydaje się obrócona. Policz wzór orientacji: strony nieparzyste są prawidłowe, a strony parzyste obrócone to najczęstszy wzór, ale możliwy jest również odwrotny sposób. Jeśli wzorzec jest spójny, operacja rotacji wsadowej może skorygować wszystkie strony, których dotyczy problem, za pomocą jednego polecenia. Większość przeglądarek PDF umożliwia zaznaczenie wielu stron w panelu miniatur i zastosowanie obrotu do wszystkich wybranych stron jednocześnie. Zaznacz wszystkie strony parzyste, obróć je o 180 lub 90 stopni w zależności od potrzeb i zapisz dokument. Panel miniatur pokazuje teraz wszystkie strony we właściwej orientacji.

Narzędzie WukongPDF OCR PDF przetwarza każdą stronę niezależnie, ale zakłada, że tekst jest zorientowany poziomo. Jeśli strona zostanie obrócona, silnik OCR albo nie rozpoznaje żadnego tekstu, albo generuje zniekształcony wydruk, ponieważ próbuje odczytać tekst pionowy lub odwrócony do góry nogami, tak jakby był poziomy. Korekta orientacji strony przed OCR jest wymaganym etapem przetwarzania wstępnego. Po obróceniu odpowiednich stron i zapisaniu dokumentu uruchom OCR na znormalizowanym pliku PDF. Dokładność rozpoznawania będzie taka sama na wszystkich stronach, ponieważ każda strona przedstawia teraz tekst w orientacji oczekiwanej przez silnik OCR.

Postępowanie z niespójnymi wzorami orientacji w dokumencie

Nie wszystkie powiązane woluminy tworzą czysty, naprzemienny wzór. Książka zeskanowana przez dwóch różnych operatorów, zestaw wielotomowy skanowany w różnym czasie lub dokument, który został częściowo ponownie zeskanowany po pierwszym skanowaniu, może mieć nieregularne wzory orientacji. Strony od 1 do 50 mogą mieć naprzemienną orientację, strony od 51 do 80 mogą mieć prawidłową orientację, ponieważ zostały ponownie zeskanowane z właściwym obrotem, a strony od 81 do 200 mogą powrócić do naprzemiennego wzoru. Wykrywanie i korygowanie należy przeprowadzać sekcja po sekcji, a nie w ramach pojedynczej operacji wsadowej.

W przypadku wzorców o nieregularnej orientacji najbardziej niezawodną metodą jest ręczne przewijanie miniatur i obracanie poszczególnych stron lub zakresów stron. Zacznij od pierwszej strony i przeglądaj miniatury. Kiedy natkniesz się na obróconą stronę, określ, ile kolejnych stron ma tę samą orientację. Wybierz zakres i zastosuj obrót. Kontynuuj przeglądanie dokumentu, aż każda strona będzie prawidłowo zorientowana. Proces ten zajmuje od jednej do dwóch sekund na stronę, więc 200-stronicowy dokument zajmuje około pięciu minut. Czas jest dobrze wykorzystany, ponieważ dokładność OCR na prawidłowo zorientowanych stronach jest znacznie wyższa niż na stronach obróconych.

Automatyczne wykrywanie orientacji w przypadku dużych projektów o ograniczonej objętości

W przypadku projektów digitalizacji obejmujących setki lub tysiące stron ręczne sprawdzanie orientacji strona po stronie staje się niepraktyczne. Zautomatyzowane narzędzia do wykrywania orientacji mogą identyfikować obrócone strony na podstawie analizy kierunku tekstu. Narzędzia te próbkują znaki tekstowe na całej stronie i określają dominującą orientację, rozpoznając, który obrót tworzy prawidłowe słowa w oczekiwanym języku. Strona, której rozpoznanie tekstu zakończyło się pomyślnie przy 0 stopniach, ale nie przy 90, 180 i 270 stopniach, jest zorientowana prawidłowo. Strona, której rozpoznanie powiedzie się przy 180 stopniach, ale zakończy się niepowodzeniem przy 0, jest odwrócona do góry nogami i wymaga obrotu. Zautomatyzowane wykrywanie szybko przetwarza duże zestawy dokumentów, a ręczna wyrywkowa kontrola wyników potwierdza, że automatyzacja działała prawidłowo przed rozpoczęciem OCR.

Weryfikacja sygnału wyjściowego OCR w różnych orientacjach

Po poprawieniu orientacji strony i uruchomieniu OCR sprawdź, czy jakość rozpoznawania jest jednakowa w całym dokumencie. Szukaj tekstu, który pojawia się zarówno na oryginalnie poprawnych, jak i oryginalnie obróconych stronach. Wyszukiwanie powinno znaleźć wystąpienia na obu typach stron z jednakową niezawodnością. Jeśli tekst na oryginalnie obróconych stronach nie zostanie znaleziony, być może korekta obrotu nie została zastosowana prawidłowo lub silnik OCR mógł przetworzyć niektóre strony przed zapisaniem obrotu. Otwórz ponownie dokument, sprawdź w panelu miniatur, czy wszystkie orientacje stron są prawidłowe i w razie potrzeby ponownie uruchom OCR.

W przypadku oprawionych woluminów, w których jakość skanowania oryginału różni się w zależności od strony, np. książki, w której niektóre strony zostały dociśnięte płasko do szyby skanera, a inne mają krzywiznę w pobliżu grzbietu, dokładność rozpoznawania OCR będzie się odpowiednio różnić. Korekta orientacji rozwiązuje problem obracania, ale nie kompensuje innych problemów z jakością skanowania. Strony o znacznej krzywiźnie mogą wymagać ponownego zeskanowania lub wstępnego przetworzenia za pomocą filtra usuwającego zniekształcenia, zanim OCR będzie mógł osiągnąć akceptowalną dokładność. Potok Zeskanowany plik PDF do przeszukiwalnego tekstu działa najlepiej, gdy obrazy źródłowe są tak czyste i jednolicie zorientowane, jak to możliwe. Korekta orientacji jest pierwszym i najbardziej wpływowym krokiem. Usuwanie zniekształceń, regulacja kontrastu i usuwanie plamek to kolejne kroki, które dodatkowo poprawiają dokładność rozpoznawania w przypadku trudnych skanów o ograniczonej objętości.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →