Tips & Tricks

Jak przekonwertować odręczne notatki w zeskanowanym pliku PDF na edytowalny tekst pisany

Strona notatek ze spotkań zapisanych ręcznie w notatniku, sfotografowanych telefonem i zapisanych jako zeskanowany plik PDF zawiera cenne informacje, które są całkowicie niedostępne dla wyszukiwania, kopiowania i wklejania ani czytników ekranu. Słowa są widoczne dla ludzkiego oka, ale są to tylko kształty na obrazie wyświetlanym w komputerze. Konwersja tych odręcznych notatek na edytowalny tekst pisany na maszynie umożliwia ich przeszukiwanie, kopiowanie i wykorzystanie w dowolnym dokumencie lub aplikacji.

Rozpoznawanie pisma ręcznego jest trudniejsze niż rozpoznawanie tekstu drukowanego, ponieważ charakter pisma każdej osoby jest niepowtarzalny. Kształty liter różnią się znacznie bardziej u poszczególnych osób niż kroje drukowane, a mechanizm rozpoznawania musi poradzić sobie z tą zmiennością.

Konwertowanie odręcznych notatek w zeskanowanym dokumencie OCR PDF na edytowalny tekst pisany na maszynie wymaga silnika OCR obsługującego pismo ręczne, który rozpoznaje pismo odręczne kursywą i drukowane, a także przepływu pracy obsługującego wyższy poziom błędów rozpoznawania pisma ręcznego w porównaniu z OCR tekstu drukowanego. WukongPDF Zeskanowany plik PDF i narzędzia OCR obsługują rozpoznawanie tekstu, a poniższe wskazówki dotyczą maksymalizacji dokładności rozpoznawania pisma ręcznego.

How to Convert Handwritten Notes in a Scanned PDF Into Editable Typed Text

Dlaczego rozpoznawanie pisma ręcznego jest znacznie trudniejsze niż tekst drukowany OCR

OCR tekstu drukowanego działa poprzez dopasowywanie kształtów znaków do znanych wzorów krojów pisma. Litera A w Times New Roman wygląda tak samo niezależnie od tego, czy ja ją piszę, czy ty ją piszesz, czy też drukuje ją maszyna. Silnik rozpoznawania ma przejrzysty, spójny szablon dla każdego znaku w każdej popularnej czcionce. Rozpoznawanie pisma ręcznego nie ma takich szablonów, ponieważ litera A u każdej osoby wygląda inaczej. Silnik musi rozpoznawać statystyczne wzorce odręcznych znaków przy ogromnej różnorodności kształtu, rozmiaru, nachylenia i połączeń między literami.

Kursywne pismo odręczne, w którym litery w słowie są ze sobą połączone, dodaje dodatkową warstwę złożoności. Mechanizm rozpoznawania musi podzielić połączone litery na pojedyncze znaki przed rozpoznaniem każdego z nich. Nieprawidłowa segmentacja, czyli podzielenie litery m na r i n lub połączenie dwóch liter w jedną, jest głównym źródłem błędów w rozpoznawaniu pisma ręcznego. Drukowane pismo odręczne, w którym każda litera jest pisana osobno, jest znacznie łatwiejsze w przetwarzaniu przez silniki rozpoznawania i zapewnia większą dokładność wyników.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Przygotowanie zeskanowanego obrazu do rozpoznawania pisma ręcznego

Jakość obrazu źródłowego jest najważniejszym czynnikiem wpływającym na dokładność rozpoznawania pisma ręcznego, ważniejszym niż wybór mechanizmu rozpoznawania. Zeskanuj lub sfotografuj stronę napisaną odręcznie w rozdzielczości co najmniej 300 DPI, przy czym w przypadku małego lub gęstego pisma ręcznego zalecana jest rozdzielczość 600 DPI. Zapewnij równomierne, pozbawione cieni oświetlenie całej strony. Trzymaj aparat lub telefon równolegle do strony, aby zminimalizować zniekształcenie perspektywy. Im lepszy obraz źródłowy, tym dokładniejsze rozpoznanie.

Popraw zeskanowany obraz przed uruchomieniem rozpoznawania. Zwiększ kontrast, aby przyciemnić atrament i rozjaśnić tło papieru. Zastosuj filtr wyostrzający, aby krawędzie pociągnięć odręcznych były wyraźniejsze. Konwertuj obraz na skalę szarości lub czystą czerń i biel, korzystając z progowania adaptacyjnego, które radzi sobie z nierównomiernym oświetleniem lepiej niż próg globalny. Ulepszony obraz przedstawia czystsze i wyraźniejsze kształty znaków silnikowi rozpoznawania.

Korzystanie z silników OCR obsługujących pismo ręczne

Silniki OCR ogólnego przeznaczenia, takie jak Tesseract, obejmują tryby rozpoznawania pisma ręcznego, które można włączyć w ustawieniach konfiguracyjnych. W Tesseract określ model języka obejmujący obsługę pisma ręcznego i ustaw tryb segmentacji strony, aby traktować obraz jako pojedynczy blok tekstu. Google Cloud Vision API i Microsoft Azure Computer Vision oferują funkcje rozpoznawania pisma ręcznego w swoich usługach OCR w chmurze.

Dedykowane aplikacje do rozpoznawania pisma ręcznego, takie jak Nebo, GoodNotes lub funkcja zamiany pisma odręcznego na tekst w Microsoft OneNote, są zoptymalizowane specjalnie pod kątem pisma ręcznego i często dają lepsze wyniki niż zwykłe silniki OCR stosowane w obsłudze pisma ręcznego. Wyeksportuj rozpoznany tekst z aplikacji do pisma odręcznego i w razie potrzeby ponownie zintegruj go z oryginalnym zeskanowanym plikiem PDF.

WspółczynnikWpływ na dokładnośćZalecenie
Rozdzielczość skanowaniaWyższa rozdzielczość zapewnia więcej szczegółów na znakMinimalna rozdzielczość 300 DPI, 600 DPI w przypadku małego pisma ręcznego
OświetlenieCienie i nierówne oświetlenie przesłaniają krawędzie postaciRozproszone, równomierne oświetlenie; unikaj lampy błyskowej aparatu
Styl pismaDrukowanie pisma odręcznego jest łatwiejsze niż kursywąJeśli masz kontrolę nad źródłem, pisz drukiem, aby uzyskać lepsze wyniki
Wzmocnienie obrazuCzystszy wkład zapewnia czystsze rozpoznawanieZwiększ kontrast, wyostrz, zastosuj progowanie adaptacyjne

Sprawdzanie i poprawianie rozpoznanego tekstu

Rozpoznawanie pisma ręcznego zawsze powoduje błędy, zazwyczaj wskaźnik błędów znaków wynosi 5–20%, w zależności od jakości pisma ręcznego i warunków obrazu. Porównaj rozpoznany tekst z oryginalną, odręczną stroną i popraw błędnie rozpoznane słowa. Krok korekty wymaga czasu, ale jest niezbędny, aby dane wyjściowe nadawały się do wyszukiwania, kopiowania i wklejania lub dalszej edycji.

W przypadku dokumentów, gdzie wymagana jest doskonała dokładność, np. akt prawnych lub notatek medycznych, rozpoznany tekst należy traktować jako indeks wyszukiwania, a nie zamiennik oryginalnego pisma odręcznego. Zachowaj oryginalny zeskanowany obraz jako wiarygodny zapis. Użyj rozpoznanego tekstu, aby włączyć wyszukiwanie słów kluczowych, które znajdzie odpowiednią stronę w oryginalnym skanie. Połączenie rozpoznanego tekstu z możliwością przeszukiwania i oryginalnego obrazu zapewnia to, co najlepsze: łatwość wyszukiwania na podstawie tekstu i wierność obrazu.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →