Optyczne rozpoznawanie znaków polega na wykrywaniu ciemnych kształtów na jasnym tle i dopasowywaniu ich do znanych wzorów liter. Kiedy tło nie ma jednolitego, jasnego koloru, lecz zawiera wzór, teksturę lub znak wodny, silnik rozpoznawania staje przed znacznie trudniejszym problemem. Każdy wzorzysty element na stronie jest potencjalnym fałszywym alarmem, który OCR musi odróżnić od rzeczywistego tekstu. Papier ze znakiem wodnym, teksturowana papeteria, nadruki zabezpieczające w kratkę i dekoracyjne obramowania powodują wizualne zakłócenia, które zmniejszają dokładność rozpoznawania OCR. Pytaniem nie jest, czy OCR w ogóle poradzi sobie z takimi tłami, ale w jakich warunkach to się powiedzie i kiedy dokładność spadnie poniżej punktu użyteczności.

Jak wzory tła zakłócają rozpoznawanie znaków
Silniki OCR przetwarzają stronę, najpierw konwertując ją na binarny czarno-biały obraz w procesie zwanym progowaniem. Każdy piksel ciemniejszy niż wartość odcięcia staje się czarny. Każdy piksel jaśniejszy staje się biały. Na czystej białej stronie z ciemnym tekstem progowanie zapewnia wyraźny obraz, w którym każda litera jest wyraźnie widoczna. Na wzorzystym tle elementy wzoru ciemniejsze niż próg stają się czarnymi pikselami zmieszanymi z tekstem. Silnik OCR następnie próbuje zinterpretować te fragmenty wzorców jako części liter. Linia znaku wodnego przechodząca przez środek litery „e” może spowodować, że silnik zobaczy literę „c” z zabłąkanym znakiem. Teksturowane tło z małymi kropkami może spowodować, że silnik będzie widział okresy, których nie ma.
Specyficzny typ wzorca tła określa charakter błędów OCR. Drobne wzory kropek, takie jak te na papierze bezpiecznym lub starym papierze do pisania, tworzą plamki, które silnik OCR może zinterpretować jako znaki interpunkcyjne lub akcenty na znakach. Wzory linii, takie jak papier do notatników w linie lub papier milimetrowy, tworzą ciągłe zakłócenia, które mogą łączyć się z kreskami znaków, zamieniając literę „l” w literę „b”, jeśli linia zrówna się ze linią wznoszącą się. Znaki wodne z dużym tekstem lub logo tworzą obszary, w których zmienia się ciemność tła, powodując utratę tekstu w ciemnych obszarach znaku wodnego lub wprowadzenie fragmentów znaku wodnego jako tekstu w jasnych obszarach.
Gęstość wzoru w stosunku do gęstości tekstu ma ogromne znaczenie. Znak wodny, który jest znacznie jaśniejszy od tekstu, jak zaprojektowano większość profesjonalnych znaków wodnych, może przejść przez próg bez pozostawiania widocznych artefaktów. Domyślny próg mechanizmu OCR jest zwykle ustawiony tak, aby oddzielał czarny tekst od białego papieru, a znak wodny rejestrujący tylko 10–15 procent szarości może całkowicie spaść poniżej tego progu. Problem jest najbardziej dotkliwy w przypadku wzorów sięgających od 40 do 60 procent ciemności tekstu, gdzie funkcja progowania nie pozwala na wyraźne oddzielenie wzorca od tekstu, ponieważ zakresy ich intensywności nakładają się.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Techniki wstępnego przetwarzania poprawiające dokładność rozpoznawania OCR na wzorzystych tłach
Kilka technik wstępnego przetwarzania obrazu może zredukować lub wyeliminować wzorce tła, zanim silnik OCR przetworzy stronę. Najbardziej skuteczną techniką jest progowanie adaptacyjne, które oblicza różne wartości odcięcia jasności dla każdego obszaru strony, zamiast stosować jedną globalną wartość odcięcia. W obszarach, w których tło jest pokryte wzorami, próg adaptacyjny dostosowuje się tak, aby traktować średnią jasność wzoru jako poziom tła, zachowując tekst i tłumiąc wzór. Większość nowoczesnego oprogramowania OCR zawiera opcję progowania adaptacyjnego, chociaż może ona nie być domyślnie włączona.
Drugą techniką jest filtrowanie częstotliwości za pomocą transformaty Fouriera lub podobnego narzędzia matematycznego. Wzory tła są zwykle regularne i okresowe, co oznacza, że zajmują określone częstotliwości na obrazie. Tekst natomiast jest nieregularny i zajmuje szeroki zakres częstotliwości. Filtr w dziedzinie częstotliwości może identyfikować i tłumić wąskie pasma częstotliwości powiązane z wzorem tła, zachowując jednocześnie szerokopasmowy sygnał tekstu. Technika ta jest potężna, ale wymaga specjalistycznego oprogramowania do przetwarzania obrazu i jest zwykle stosowana w projektach digitalizacji na dużą skalę, a nie w przypadku pojedynczych dokumentów.
Narzędzie OCR PDF WukongPDF obejmuje wstępne przetwarzanie obrazu, które obsługuje typowe różnice w tle. W przypadku dokumentów z łagodnymi lub umiarkowanymi wzorami tła wbudowane przetwarzanie wstępne może wystarczyć do uzyskania użytecznego rozpoznawania tekstu bez konieczności wykonywania dodatkowych czynności ręcznych. Kluczem jest przetestowanie rozpoznawania na reprezentatywnej stronie przed przystąpieniem do przetwarzania całego dokumentu. Jeśli strona testowa zapewnia akceptowalną dokładność, kontynuuj partię. Jeśli strona testowa zawiera istotne błędy, obraz może wymagać zewnętrznego przetwarzania wstępnego przed OCR.
Kiedy ręczna transkrypcja przewyższa OCR w dokumentach z dużą ilością wzorów
Istnieje próg jakości, poniżej którego wynik OCR wymaga tak dużej ręcznej korekty, że wpisanie tekstu od zera byłoby szybsze. W przypadku dokumentów z gęstymi wzorami tła, gęstymi znakami wodnymi lub nadrukami zabezpieczającymi zajmującymi całą stronę funkcja OCR może wygenerować tekst, w którym co najmniej 20 procent znaków jest błędnych. Poprawianie jednego znaku na pięć w wielostronicowym dokumencie zajmuje więcej czasu niż wpisanie nowej treści, szczególnie gdy błędy są nieoczywiste, jak np. wstawiona kropka w miejscu błędnego odczytania kropki w tle, która zmienia znaczenie zdania bez łatwego do wykrycia podczas korekty.
Decyzja ekonomiczna zależy od długości dokumentu i wymaganej dokładności. Jednostronicowy list na papeterii ze znakiem wodnym można przepisać ręcznie w ciągu kilku minut. 200-stronicowa książka wydrukowana na teksturowanym papierze reprezentuje tygodnie ręcznej pracy, a nawet niedoskonały OCR, który poprawnie przechwytuje 85 procent tekstu, zapewnia znaczną przewagę na początku. W przypadku dużych projektów optymalnym przebiegiem pracy jest często OCR z agresywnym przetwarzaniem wstępnym, po którym następuje weryfikacja wyników przez człowieka, przy założeniu, że etap przeglądu wykryje i poprawi błędy wynikające ze wzorców. Potok Zeskanowany plik PDF do przeszukiwalnego tekstu działa najlepiej, gdy oczekiwania dotyczące dokładności są skalibrowane do stopnia trudności materiału źródłowego.
Wybór odpowiednich ustawień skanowania w celu zminimalizowania zakłóceń w tle
Kiedy kontrolujesz proces skanowania, kilka ustawień może zmniejszyć widoczność wzoru tła, zanim obraz dotrze do silnika OCR. Skanowanie w skali szarości, a nie w kolorze, eliminuje wzory oparte na kolorach, takie jak przyciemniane znaki wodne lub kolorowe nici zabezpieczające, które w przeciwnym razie powodowałyby różnice w kontraście. Ustawienie jasności skanera nieco wyższej niż normalnie powoduje, że jasne wzory tła znajdują się poniżej progu wykrywania, przy jednoczesnym zachowaniu ciemnego tekstu. Często wystarczy zwiększenie jasności o 10–15 procent, aby wyeliminować znaki wodne bez wpływu na czytelność tekstu.
Niektóre skanery są wyposażone w funkcję usuwania lub wygładzania tła zaprojektowaną specjalnie dla dokumentów na papierze kolorowym lub wzorzystym. Ta funkcja analizuje stronę i identyfikuje dominujący kolor lub wzór tła, a następnie normalizuje go do bieli, zachowując treść pierwszego planu. Jeśli to ustawienie jest dostępne, należy włączyć je dla każdego dokumentu, który będzie poddawany OCR. Poprawa dokładności rozpoznawania na podstawie czystych obrazów źródłowych znacznie przekracza to, co można osiągnąć poprzez przetwarzanie obrazu po zeskanowaniu.
Ocena dokładności OCR na wzorzystych dokumentach: co zaakceptować, a co wpisać ponownie
Praktyczny próg akceptowalnej dokładności OCR zależy od sposobu wykorzystania wyodrębnionego tekstu. W przypadku wyszukiwania pełnotekstowego w archiwum dokumentów wystarczająca może być dokładność na poziomie 80%. Wyszukiwanie określonego nazwiska lub numeru konta nadal powoduje odnalezienie dokumentu, nawet jeśli 20 procent otaczającego tekstu zawiera błędy. W przypadku wyodrębniania tekstu, który zostanie ponownie opublikowany, zacytowany lub wykorzystany w dalszej analizie, bardziej odpowiednim minimum jest dokładność 95%. Poniżej tego poziomu czas spędzony na poprawianiu błędów OCR zbliża się do czasu potrzebnego na ręczną transkrypcję dokumentu. Decyzja o zaakceptowaniu wyniku OCR lub ponownym wpisaniu od zera powinna opierać się na zmierzonej ocenie dokładności, a nie na wrażeniu powstałym po przejrzeniu kilku stron.
Pomiar dokładności OCR wymaga porównania próbki rozpoznanego tekstu z oryginalnym dokumentem. Wybierz od trzech do pięciu reprezentatywnych stron, policz całkowitą liczbę znaków w oryginale, policz liczbę błędów znakowych w wynikach OCR, w tym podstawienia, wstawienia i usunięcia, i oblicz współczynnik błędów. Pomiar ten zajmuje od dziesięciu do piętnastu minut i stanowi obiektywną podstawę do podjęcia decyzji, czy kontynuować automatyczną korektę, ręczny przegląd, czy pełne przepisanie. Pomiar pozwala również określić, jakie rodzaje błędów są najczęstsze, co pomaga w wyborze strategii korygowania. Jeśli błędy skupiają się na określonych typach wzorców, ukierunkowane przetwarzanie wstępne może je wyeliminować. Jeśli błędy są rozmieszczone losowo, dokładność rozpoznawania OCR jest ograniczona podstawową jakością obrazu źródłowego, a nie jakimkolwiek konkretnym problemem, który można naprawić.
Wzory tła na papierze nigdy nie były projektowane z myślą o OCR. Służą celom, od identyfikacji marki, przez zabezpieczenie przed fałszerstwem, po prosty efekt dekoracyjny. Obrazy PDF przechwycone z tych dokumentów przenoszą wzorce do sfery cyfrowej, gdzie stają się przeszkodami w ekstrakcji tekstu. Zrozumienie, które wzorce można złagodzić poprzez wstępne przetwarzanie, a które wymagają pracy ręcznej, pozwala podejmować świadome decyzje dotyczące każdego dokumentu, zamiast stosować ten sam przepływ pracy OCR do każdego skanu i liczyć na to, co najlepsze. Czas poświęcony na zrozumienie specyficznych wyzwań związanych z dokumentem zwraca się w postaci większej dokładności, mniejszej liczby ręcznych poprawek i cyfrowego wydruku tekstowego, który wiernie odzwierciedla oryginalną treść.
OCR na wzorzystym tle to połączenie technologii skanowania, przetwarzania obrazu i projektowania obiegu dokumentów. Żadna pojedyncza technika nie rozwiązuje wszystkich problemów związanych z wzorzystym tłem, ale połączenie odpowiednich ustawień skanowania, adaptacyjnego przetwarzania wstępnego i realistycznych oczekiwań dotyczących dokładności pozwala uzyskać użyteczne wyniki w przypadku zdecydowanej większości dokumentów. Narzędzia istnieją, a techniki są dobrze ugruntowane. Systematyczne ich stosowanie zamienia frustrującą awarię OCR w możliwy do opanowania proces kontroli jakości.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
