Robisz zdjęcie wydrukowanego dokumentu telefonem. Może jest to strona z książki w bibliotece, ulotka ze spotkania, paragon potrzebny do raportu z wydatków lub tabliczka z ważnymi informacjami, którą widziałeś. Zdjęcie jest wystarczająco wyraźne, aby je odczytać, ale to tylko zdjęcie. Nie można w nim szukać słów. Nie można z niego kopiować i wklejać tekstu. Nie możesz go edytować. Jest to fotografia tekstu, a nie sam tekst.
Optyczne rozpoznawanie znaków może przekształcić to zdjęcie w edytowalny i przeszukiwalny tekst, a narzędzia do tego są dostępne w telefonie i przeglądarce. W procesie tym robione jest zdjęcie wydrukowanej strony i powstaje dokument, w którym możesz wyszukiwać, zaznaczać, kopiować i edytować każde słowo, tak jakbyś je wpisał samodzielnie.

Uzyskiwanie najlepszego możliwego zdjęcia do OCR
Dokładność rozpoznawania OCR zależy w dużej mierze od jakości obrazu wejściowego. Dobrze oświetlone, ostro wyostrzone zdjęcie płaskiej strony zostanie poddane OCR z dokładnością od 95% do 99%. Słabo oświetlone, rozmazane i przekrzywione zdjęcie zakrzywionej strony może spowodować rozpoznanie OCR z 70% dokładnością, co oznacza, że mniej więcej jedno na trzy lub cztery słowa zawiera błąd. Czas poświęcony na zrobienie dobrego zdjęcia zwraca się wielokrotnie, zmniejszając wysiłek związany z korektą.
Umieść dokument na płaskiej, dobrze oświetlonej powierzchni. Naturalne światło dzienne jest idealne, ponieważ jest rozproszone i pozbawione cieni. Oświetlenie nad głową biura działa, jeśli ustawisz się tak, aby cień nie padł na kartkę. Trzymaj telefon bezpośrednio nad stroną, równolegle do niej, a nie pod kątem. Aby utrzymać telefon stabilnie, użyj obu rąk lub oprzyj łokcie na powierzchni. Wypełnij ramkę stroną, pozostawiając niewielki margines wokół krawędzi. Dotknij ekranu, aby skupić się na tekście. Jeśli Twój telefon ma tryb skanowania dokumentów, użyj go. Na iPhonie aplikacja Notatki zawiera funkcję Skanuj dokumenty, która automatycznie wykrywa krawędzie strony, koryguje perspektywę i zwiększa kontrast. W systemie Android funkcja skanowania Dysku Google robi to samo.
Jeśli strona pochodzi z oprawionej książki i nie może leżeć płasko, delikatnie dociśnij grzbiet, aby zmniejszyć krzywiznę, i zaakceptuj fakt, że dokładność rozpoznawania OCR będzie niższa w pobliżu rynny, gdzie strona zakrzywia się w kierunku przeciwnym do aparatu. W przypadku krytycznego tekstu w pobliżu grzbietu zrób drugie zdjęcie, koncentrując się konkretnie na tym obszarze, trzymając telefon bliżej strony, aby zmaksymalizować rozdzielczość zakrzywionego tekstu.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Uruchamianie OCR zdjęcia przy użyciu wbudowanych narzędzi telefonu
iPhone'y obsługują tekst na żywo, wbudowaną funkcję OCR, która działa bezpośrednio w aplikacjach Aparat, Aplikacjach Zdjęcia i Safari. Skieruj aparat na tekst, a w rogu wizjera pojawi się ikona aktywnego tekstu. Kliknij, a telefon rozpozna tekst w czasie rzeczywistym. Możesz go natychmiast zaznaczyć, skopiować i wkleić. Jeśli zdjęcie znajduje się już w Twojej bibliotece, otwórz je w aplikacji Zdjęcia i poszukaj ikony aktywnego tekstu. Stuknij, aby podświetlić cały rozpoznany tekst. Możesz skopiować wybrane fragmenty lub całość. Live Text działa całkowicie na urządzeniu, bez konieczności połączenia z Internetem.
Telefony z Androidem mają Obiektyw Google wbudowany w Zdjęcia Google i aplikację Google. Otwórz zdjęcie w Zdjęciach Google i dotknij ikony Obiektyw. Google Lens rozpoznaje tekst na obrazie i pozwala go zaznaczać, kopiować, tłumaczyć lub przeszukiwać. Podobnie jak funkcja Live Text firmy Apple, Google Lens działa w trybie offline i rozpoznaje tekst na najnowszych urządzeniach. W przypadku obu platform wbudowany OCR jest przeznaczony do krótkich fragmentów, kilku zdań lub akapitu, a nie do dokumentów wielostronicowych. Wyodrębnia tekst, ale nie tworzy sformatowanego dokumentu.
Konwertowanie zdjęcia do pliku PDF z możliwością przeszukiwania za pomocą narzędzi OCR PDF
W przypadku zdjęcia, które musi stać się właściwym dokumentem, cały proces można wykonać w formacie PDF z warstwą tekstową z możliwością przeszukiwania. Narzędzia OCR oparte na przeglądarce obsługują cały proces. WukongPDF akceptuje przesyłanie zdjęć w formatach JPEG, PNG, HEIC i innych popularnych formatach. Prześlij zdjęcie. Narzędzie przetwarza je, rozpoznaje tekst i generuje plik PDF z oryginalnym zdjęciem jako widoczną stroną i rozpoznanym tekstem jako niewidoczną warstwą, którą można przeszukiwać. Wynik wygląda dokładnie tak, jak na zdjęciu, ale możesz teraz wyszukiwać słowa, zaznaczać i kopiować tekst, a plik zachowuje się jak każdy inny plik PDF.
Jeśli masz wiele zdjęć kolejnych stron, prześlij je razem. Narzędzie przetwarza każdy z nich i można je połączyć w jeden wielostronicowy plik PDF z możliwością przeszukiwania. Oto procedura digitalizacji krótkiego dokumentu za pomocą telefonu: sfotografuj każdą stronę, prześlij partię, uruchom OCR i pobierz pojedynczy plik PDF z możliwością przeszukiwania całego dokumentu. Proces ten zajmuje kilka minut w przypadku 10-stronicowego dokumentu i daje wynik, który jest funkcjonalnie równoważny zeskanowanemu plikowi PDF za pomocą skanera płaskiego.
Czyszczenie wyników OCR ze zdjęć
Zdjęcia robione telefonem, nawet te dobre, dają mniejszą dokładność OCR niż skany płaskie w rozdzielczości 300 DPI. Zdjęcie wydrukowanej strony wykonane telefonem zwykle jest rozpoznawane metodą OCR z dokładnością od 90% do 95%, co oznacza, że mniej więcej jedno słowo na 20 będzie zawierało błąd. Błędy skupiają się w przewidywalnych miejscach: przy krawędziach strony, gdzie obiektyw aparatu wprowadza zniekształcenia, małą czcionką poniżej 10 punktów oraz w obszarach zacienionych lub nierównomiernym oświetleniu.
Po przekonwertowaniu Zeskanowanego pliku PDF ze zdjęcia otwórz plik PDF i wyszukaj typowe błędy OCR. Wyszukaj „cl” które jest często rozpoznawane jako „d”; „rn” które jest często rozpoznawane jako „m”; i „1” które jest często rozpoznawane jako „l”. Przeczytaj tekst i popraw znalezione błędy. Czas potrzebny na czyszczenie zależy od długości dokumentu i jakości zdjęcia. Korekta jednostronicowego dokumentu zajmuje od 5 do 10 minut. 20-stronicowy dokument zajmuje godzinę lub dłużej. Etap czyszczenia oddziela niechlujny wynik OCR od dopracowanego, profesjonalnego dokumentu.
Kiedy zdjęcie przebija skaner
Zdjęcie wykonane telefonem nie zastępuje płaskiego skanera, gdy jakość jest dla nas najwyższym priorytetem. Ale zdjęcie telefonem jest nieskończenie lepsze niż skaner, którego nie masz przy sobie, kiedy go potrzebujesz. Najlepszy aparat to ten, który masz. Aby przechwycić tekst z książek bibliotecznych, materiałów konferencyjnych, notatek z tablicy, paragonów, znaków, menu i wszelkich materiałów drukowanych, które napotkasz poza biurkiem, zdjęcie wykonane telefonem, a następnie OCR zamienia ulotne spotkanie wizualne w trwały, przeszukiwalny i edytowalny tekst. Potok Image to PDF WukongPDF łączy zdjęcie zrobione telefonem z gotowym plikiem PDF w niecałą minutę, wypełniając lukę pomiędzy oglądaniem tekstu w świecie a udostępnieniem go w formie dokumentu, z którego można korzystać.
Jedno ograniczenie, które warto zrozumieć: zdjęcia dokumentów tekstowych wykonane telefonem zazwyczaj dają pliki o większym rozmiarze niż równoważne skany na platformie płaskiej, ponieważ aparaty telefoniczne rejestrują informacje o kolorach nawet w przypadku dokumentów czarno-białych. Zdjęcie pojedynczej strony tekstowej wykonane telefonem może mieć od 3 do 5 MB w formacie JPEG, natomiast skan tej samej strony w trybie czarno-białym na płycie płaskiej może mieć rozmiar 200 KB. Jeśli digitalizujesz wiele stron za pomocą telefonu, przekonwertuj zdjęcia do skali szarości przed uruchomieniem OCR. Zmniejsza to rozmiar pliku o 60% do 80% i często poprawia dokładność rozpoznawania OCR, ponieważ konwersja skali szarości eliminuje szumy kolorów i cienie, które dezorientują silnik rozpoznawania. Większość aplikacji do edycji zdjęć, w tym wbudowana aplikacja Zdjęcia na iPhone'a i Androida, zawiera filtr w skali szarości lub mono, który umożliwia wykonanie tego jednym dotknięciem każdego zdjęcia.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
