Skanujesz papierowy formularz, który ktoś wypełnił ręcznie. Tekst wydrukowany na formularzu jest wyraźny. Odręczne odpowiedzi w polach są niechlujne, ale czytelne dla człowieka. Uruchamiasz OCR na skanie, mając nadzieję, że formularz będzie można przeszukiwać, a odręczne odpowiedzi można wyodrębnić jako tekst. Wynik OCR drukowanego tekstu jest prawie idealny. Wynik OCR pisma ręcznego jest bełkotliwy. Silnik rozpoznawania, wytrenowany na drukowanych czcionkach, nie jest w stanie zrozumieć zmiennych, nieregularnych kształtów ludzkiego pisma.
Dokumenty zawierające tekst pisany na maszynie i odręcznie stanowią podwójne wyzwanie dla silników OCR PDF. Wydrukowany tekst wymaga standardowego OCR, który sprawdza się dobrze. Pismo ręczne wymaga specjalistycznego rozpoznawania pisma ręcznego, które jest mniej dokładne i wymaga innych ustawień. Obsługa obu typów treści w jednym dokumencie wymaga strategii, która odpowiednio traktuje każdy typ treści.

Dlaczego pismo odręczne jest o wiele trudniejsze w przypadku silników OCR
Funkcja OCR drukowanego tekstu polega na dopasowywaniu kształtów znaków do znanych wzorów czcionek. Litera „a” w 12-punktowym Times New Roman za każdym razem wygląda niemal identycznie. Silnik OCR przechowuje model wyglądu liter Times New Roman i dopasowuje go do tego modelu. Pismo ręczne nie ma takiego modelu. „a” każdego człowieka wygląda inaczej. Nawet „a” tej samej osoby różni się od jednego wystąpienia do drugiego w zależności od otaczających liter, szybkości pisania, kąta pióra i zmęczenia. Nie ma ustalonego wzorca, do którego można by dopasować.
Rozpoznawanie pisma ręcznego wykorzystuje modele uczenia maszynowego wyszkolone na tysiącach lub milionach próbek pisma ręcznego. Modele te uczą się statystycznych wzorców różnic w pismach pisanych odręcznie i potrafią rozpoznawać znaki, nawet jeśli znacznie odbiegają od dowolnego pojedynczego szablonu. Dokładność rozpoznawania pisma ręcznego znacznie się poprawiła dzięki głębokiemu uczeniu się, ale nadal pozostaje w znacznym stopniu w tyle za rozpoznawaniem tekstu drukowanego. Test porównawczy przeprowadzony w 2025 r. przez stowarzyszenie PDF Association wykazał, że dokładność OCR drukowanego tekstu w przypadku czystych skanów przekracza 97%. Dokładność rozpoznawania pisma ręcznego w tym samym teście wynosiła około 80–85%, co oznacza, że około jedno na pięć do sześciu odręcznych słów zawiera błąd (PDF Association, „OCR Accuracy Benchmark Report”, 2025).
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Strategie OCR dokumentów pisanych na maszynie i odręcznie
Najskuteczniejszą strategią jest podzielenie dokumentu na obszary napisane maszynowo i odręcznie i przetworzenie każdego z nich za pomocą odpowiedniego mechanizmu rozpoznawania. Tego rozdzielenia można dokonać ręcznie, przycinając lub maskując dokument na sekcje, albo automatycznie za pomocą mechanizmu rozpoznawania, który wykrywa typ zawartości w poszczególnych regionach.
Narzędzie OCR WukongPDF wykrywa, czy każdy obszar tekstu na stronie jest wydrukowany, czy napisany odręcznie i stosuje odpowiedni model rozpoznawania. Na formularzu z drukowanymi etykietami i odręcznymi odpowiedziami etykiety są rozpoznawane z wydrukowanym modelem tekstowym z dużą dokładnością. Odpowiedzi pisane odręcznie są przetwarzane przy użyciu modelu pisma ręcznego z dowolną dokładnością, na jaką pozwala jakość pisma ręcznego. Wynikiem jest pojedyncza warstwa tekstowa, która łączy oba wyniki rozpoznawania.
Poprawa dokładności rozpoznawania pisma ręcznego poprzez lepsze skanowanie
Jakość skanowania ma większy wpływ na rozpoznawanie pisma ręcznego niż na rozpoznawanie tekstu drukowanego. Skanuj w rozdzielczości minimum 300 DPI. Wyższa rozdzielczość zapewnia silnikowi rozpoznawania więcej pikseli na znak do analizy. Używaj trybu skali szarości lub koloru zamiast czystej czerni i bieli. Subtelne szare różnice w odręcznym pociągnięciu niosą ze sobą informacje o kształtach liter, które są pomijane w przypadku czystego czarno-białego progu. Odręczne „e” gdzie pętla jest częściowo wypełniona, może być rozpoznawalna w skali szarości, ale staje się nieodróżnialną plamą, gdy zostanie ustawiona jako czarno-biała.
Upewnij się, że pismo odręczne jest tak ciemne i spójne, jak to możliwe. Pismo ołówkiem jest trudniejsze do rozpoznania niż piórem, ponieważ grafit tworzy słabszą, bardziej zmienną linię. Najlepszy kontrast zapewnia niebieski lub czarny atrament na białym papierze. Czerwony atrament, zielony atrament lub kolorowy papier zmniejszają kontrast i dokładność. Jeśli kontrolujesz proces wypełniania formularzy, określ, że formularze powinny być wypełniane czarnym tuszem, aby uzyskać najlepsze wyniki OCR. Ta niewielka instrukcja w samym formularzu może poprawić dokładność ekstrakcji danych na dalszym etapie o 10 do 15 punktów procentowych.
Przeglądanie i poprawianie wyników pisma ręcznego OCR
Po OCR warstwa tekstowa Skanowany plik PDF będzie zawierać błędy skoncentrowane w obszarach zapisanych odręcznie. Wydrukowany tekst będzie prawie idealny. Skoncentruj swoją recenzję na odręcznych odpowiedziach. Otwórz plik PDF i wyszukaj typowe błędy OCR pisma ręcznego. Cyfrę 1 często kojarzy się z literą l. Cyfrę 0 często rozpoznaje się jako literę O. Kombinacja liter „th” oznacza jest często rozpoznawany jako „+h” ponieważ poprzeczka t wtapia się w h.
W przypadku danych z formularzy, które należy wyodrębnić do bazy danych lub arkusza kalkulacyjnego, niezbędny jest ręczny przegląd pól zapisanych odręcznie. Silnik rozpoznawania zapewnia najlepsze przypuszczenie. Człowiek musi zweryfikować to przypuszczenie z oryginalnym charakterem pisma. Ten etap weryfikacji ma miejsce, gdy oszczędność czasu OCR jest częściowo równoważona potrzebą ludzkiej kontroli jakości. Oszczędności netto zależą od wolumenu. W przypadku 10 formularzy ręczne wprowadzanie danych może być szybsze niż OCR plus sprawdzenie. W przypadku 500 formularzy sprawdzenie OCR plus jest znacznie szybsze, ponieważ etap przeglądu jest ograniczony do pól, w przypadku których pewność OCR jest niska. Wynik OCR WukongPDF zawiera poziom pewności dla każdego rozpoznanego bloku tekstu, co pozwala na sortowanie według pewności i przeglądanie tylko wyników o niskim poziomie pewności.
W przypadku formularzy, które będą przetwarzane w dużych ilościach, takich jak formularze wniosków medycznych, roszczenia ubezpieczeniowe lub wnioski rządowe, sam projekt formularza może poprawić dokładność rozpoznawania pisma ręcznego. Zaprojektuj formularz z oddzielnymi polami na znaki, po jednym polu na literę, a nie pojedynczą długą linią na nazwisko lub adres. Poszczególne pola znaków zmuszają autora do oddzielenia liter, co radykalnie poprawia dokładność rozpoznawania, ponieważ silnik OCR może odizolować każdy znak przed próbą rozpoznania. Jest to ta sama zasada, którą stosują formularze podatkowe i dokumenty imigracyjne na całym świecie. Pola są nieco niewygodne dla osoby wypełniającej formularz, ale umożliwiają automatyczne wyodrębnianie danych na dużą skalę, co jest kompromisem wymaganym przy przetwarzaniu dużych ilości formularzy.
Praktyczny punkt kontroli jakości po OCR w przypadku dokumentów mieszanych: wyszukaj typowe wzorce błędów OCR, które wskazują, że silnik pomylił pismo odręczne z tekstem drukowanym. Wyszukaj „cl” i sprawdź, czy to nie miało być „d.” Wyszukaj „0” i sprawdź, czy każde wystąpienie jest rzeczywiście zerem, a nie wielką literą O. Wyszukaj „1”; i sprawdź, czy jest to jedynka, a nie mała litera L lub duże I. Te trzy wyszukiwania wychwytują większość błędów OCR na poziomie znaków, zarówno w przypadku rozpoznawania pisma drukowanego, jak i odręcznego. Napraw znalezione błędy, a następnie przeprowadź jeszcze raz wyszukiwanie konkretnych nazw, liczb lub dat, które są krytyczne dla przeznaczenia dokumentu. Formularz, w którym drukowane instrukcje zawierają literówkę, jest denerwujący. Formularz, w którym odręcznie wpisano błędną dawkę leku, jest niebezpieczny.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
