Strona notatek ze spotkań zapisanych ręcznie w notatniku, sfotografowanych telefonem i zapisanych jako zeskanowany plik PDF zawiera cenne informacje, które są całkowicie niedostępne dla wyszukiwania, kopiowania i wklejania ani czytników ekranu. Słowa są widoczne dla ludzkiego oka, ale są to tylko kształty na obrazie wyświetlanym w komputerze. Konwersja tych odręcznych notatek na edytowalny tekst pisany na maszynie umożliwia ich przeszukiwanie, kopiowanie i wykorzystanie w dowolnym dokumencie lub aplikacji.
Rozpoznawanie pisma ręcznego jest trudniejsze niż rozpoznawanie tekstu drukowanego, ponieważ charakter pisma każdej osoby jest niepowtarzalny. Kształty liter różnią się znacznie bardziej u poszczególnych osób niż kroje drukowane, a mechanizm rozpoznawania musi poradzić sobie z tą zmiennością.
Konwertowanie odręcznych notatek w zeskanowanym dokumencie OCR PDF na edytowalny tekst pisany na maszynie wymaga silnika OCR obsługującego pismo ręczne, który rozpoznaje pismo odręczne kursywą i drukowane, a także przepływu pracy obsługującego wyższy poziom błędów rozpoznawania pisma ręcznego w porównaniu z OCR tekstu drukowanego. WukongPDF Zeskanowany plik PDF i narzędzia OCR obsługują rozpoznawanie tekstu, a poniższe wskazówki dotyczą maksymalizacji dokładności rozpoznawania pisma ręcznego.

Dlaczego rozpoznawanie pisma ręcznego jest znacznie trudniejsze niż tekst drukowany OCR
OCR tekstu drukowanego działa poprzez dopasowywanie kształtów znaków do znanych wzorów krojów pisma. Litera A w Times New Roman wygląda tak samo niezależnie od tego, czy ja ją piszę, czy ty ją piszesz, czy też drukuje ją maszyna. Silnik rozpoznawania ma przejrzysty, spójny szablon dla każdego znaku w każdej popularnej czcionce. Rozpoznawanie pisma ręcznego nie ma takich szablonów, ponieważ litera A u każdej osoby wygląda inaczej. Silnik musi rozpoznawać statystyczne wzorce odręcznych znaków przy ogromnej różnorodności kształtu, rozmiaru, nachylenia i połączeń między literami.
Kursywne pismo odręczne, w którym litery w słowie są ze sobą połączone, dodaje dodatkową warstwę złożoności. Mechanizm rozpoznawania musi podzielić połączone litery na pojedyncze znaki przed rozpoznaniem każdego z nich. Nieprawidłowa segmentacja, czyli podzielenie litery m na r i n lub połączenie dwóch liter w jedną, jest głównym źródłem błędów w rozpoznawaniu pisma ręcznego. Drukowane pismo odręczne, w którym każda litera jest pisana osobno, jest znacznie łatwiejsze w przetwarzaniu przez silniki rozpoznawania i zapewnia większą dokładność wyników.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Przygotowanie zeskanowanego obrazu do rozpoznawania pisma ręcznego
Jakość obrazu źródłowego jest najważniejszym czynnikiem wpływającym na dokładność rozpoznawania pisma ręcznego, ważniejszym niż wybór mechanizmu rozpoznawania. Zeskanuj lub sfotografuj stronę napisaną odręcznie w rozdzielczości co najmniej 300 DPI, przy czym w przypadku małego lub gęstego pisma ręcznego zalecana jest rozdzielczość 600 DPI. Zapewnij równomierne, pozbawione cieni oświetlenie całej strony. Trzymaj aparat lub telefon równolegle do strony, aby zminimalizować zniekształcenie perspektywy. Im lepszy obraz źródłowy, tym dokładniejsze rozpoznanie.
Popraw zeskanowany obraz przed uruchomieniem rozpoznawania. Zwiększ kontrast, aby przyciemnić atrament i rozjaśnić tło papieru. Zastosuj filtr wyostrzający, aby krawędzie pociągnięć odręcznych były wyraźniejsze. Konwertuj obraz na skalę szarości lub czystą czerń i biel, korzystając z progowania adaptacyjnego, które radzi sobie z nierównomiernym oświetleniem lepiej niż próg globalny. Ulepszony obraz przedstawia czystsze i wyraźniejsze kształty znaków silnikowi rozpoznawania.
Korzystanie z silników OCR obsługujących pismo ręczne
Silniki OCR ogólnego przeznaczenia, takie jak Tesseract, obejmują tryby rozpoznawania pisma ręcznego, które można włączyć w ustawieniach konfiguracyjnych. W Tesseract określ model języka obejmujący obsługę pisma ręcznego i ustaw tryb segmentacji strony, aby traktować obraz jako pojedynczy blok tekstu. Google Cloud Vision API i Microsoft Azure Computer Vision oferują funkcje rozpoznawania pisma ręcznego w swoich usługach OCR w chmurze.
Dedykowane aplikacje do rozpoznawania pisma ręcznego, takie jak Nebo, GoodNotes lub funkcja zamiany pisma odręcznego na tekst w Microsoft OneNote, są zoptymalizowane specjalnie pod kątem pisma ręcznego i często dają lepsze wyniki niż zwykłe silniki OCR stosowane w obsłudze pisma ręcznego. Wyeksportuj rozpoznany tekst z aplikacji do pisma odręcznego i w razie potrzeby ponownie zintegruj go z oryginalnym zeskanowanym plikiem PDF.
| Współczynnik | Wpływ na dokładność | Zalecenie |
|---|---|---|
| Rozdzielczość skanowania | Wyższa rozdzielczość zapewnia więcej szczegółów na znak | Minimalna rozdzielczość 300 DPI, 600 DPI w przypadku małego pisma ręcznego |
| Oświetlenie | Cienie i nierówne oświetlenie przesłaniają krawędzie postaci | Rozproszone, równomierne oświetlenie; unikaj lampy błyskowej aparatu |
| Styl pisma | Drukowanie pisma odręcznego jest łatwiejsze niż kursywą | Jeśli masz kontrolę nad źródłem, pisz drukiem, aby uzyskać lepsze wyniki |
| Wzmocnienie obrazu | Czystszy wkład zapewnia czystsze rozpoznawanie | Zwiększ kontrast, wyostrz, zastosuj progowanie adaptacyjne |
Sprawdzanie i poprawianie rozpoznanego tekstu
Rozpoznawanie pisma ręcznego zawsze powoduje błędy, zazwyczaj wskaźnik błędów znaków wynosi 5–20%, w zależności od jakości pisma ręcznego i warunków obrazu. Porównaj rozpoznany tekst z oryginalną, odręczną stroną i popraw błędnie rozpoznane słowa. Krok korekty wymaga czasu, ale jest niezbędny, aby dane wyjściowe nadawały się do wyszukiwania, kopiowania i wklejania lub dalszej edycji.
W przypadku dokumentów, gdzie wymagana jest doskonała dokładność, np. akt prawnych lub notatek medycznych, rozpoznany tekst należy traktować jako indeks wyszukiwania, a nie zamiennik oryginalnego pisma odręcznego. Zachowaj oryginalny zeskanowany obraz jako wiarygodny zapis. Użyj rozpoznanego tekstu, aby włączyć wyszukiwanie słów kluczowych, które znajdzie odpowiednią stronę w oryginalnym skanie. Połączenie rozpoznanego tekstu z możliwością przeszukiwania i oryginalnego obrazu zapewnia to, co najlepsze: łatwość wyszukiwania na podstawie tekstu i wierność obrazu.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
