
Co OCR robi z zeskanowanym plikiem PDF
Optyczne rozpoznawanie znaków przekształca zeskanowany plik PDF, będący zbiorem obrazów stron, w dokument z możliwością przeszukiwania.
Proces OCR PDF analizuje każdy obraz strony, identyfikuje kształty znaków i tworzy niewidoczną warstwę tekstową za obrazem strony. Po OCR możesz wyszukiwać słowa w dokumencie, zaznaczać i kopiować tekst oraz używać czytników ekranu do czytania dokumentu na głos.
OCR przekształca pasywny obraz tekstu w aktywny dokument z możliwością przeszukiwania, który obsługuje zaznaczanie tekstu i czytniki ekranu.
Dokładność OCR zależy bezpośrednio od jakości oryginalnego skanu, przy czym najlepsze wyniki dają czyste skany w rozdzielczości 300 DPI.
Zeskanowany plik PDF bez funkcji OCR przypomina album ze zdjęciami z tekstem. Możesz patrzeć na słowa, ale nie możesz z nimi wchodzić w interakcję. Nie można wyszukiwać określonego terminu. Nie możesz skopiować akapitu, aby go zacytować. Nie można używać czytnika ekranu. OCR dodaje interaktywne możliwości, które sprawiają, że dokumenty cyfrowe są przydatne nie tylko do prostego przeglądania.
Dokładność OCR zależy od jakości oryginalnego skanu. Czysty skan o wysokiej rozdzielczości przy 300 DPI przy równomiernym oświetleniu i ostrej ostrości zapewnia dokładność OCR powyżej 99 procent w przypadku standardowego drukowanego tekstu. Skan w niskiej rozdzielczości, zdjęcie dokumentu wykonane pod kątem lub skan pomarszczonego lub poplamionego oryginału powodują niższą dokładność. Jakość skanowania bezpośrednio określa jakość wyniku OCR.
Warstwa tekstowa PDF Searchable dodana przez OCR jest oddzielona od obrazu strony. Wygląd pliku PDF nie zmienia się po OCR. Strona nadal wygląda jak zeskanowany obraz. Za tym obrazem rozpoznany tekst istnieje w postaci niewidocznych danych znakowych, do których mają dostęp wyszukiwarki, czytniki ekranu i narzędzia do zaznaczania tekstu.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Jak uruchomić OCR na zeskanowanym pliku PDF na różnych urządzeniach
W systemie Windows program Adobe Acrobat Pro może uruchamiać OCR na zeskanowanych plikach PDF. Otwórz plik PDF, wybierz narzędzie Skanuj i OCR, a następnie wybierz opcję Rozpoznaj tekst. Acrobat przetwarza każdą stronę, rozpoznaje tekst i dodaje warstwę tekstową z możliwością przeszukiwania. Zapisz plik. Plik PDF obsługuje teraz wyszukiwanie i zaznaczanie tekstu. Acrobat Pro zapewnia najdokładniejszy OCR w systemie Windows.
Na komputerze Mac wbudowana aplikacja Preview nie obsługuje funkcji OCR. Kilka narzędzi Mac PDF innych firm udostępnia funkcję OCR. Zarówno PDF Expert, jak i PDFpen zawierają silniki OCR, które przetwarzają zeskanowane pliki PDF i dodają przeszukiwalne warstwy tekstowe. Jakość OCR jest porównywalna z narzędziami Windows w przypadku standardowych dokumentów.
Oparte na przeglądarce narzędzie OCR WukongPDF działa na każdym systemie operacyjnym. Prześlij zeskanowany plik PDF, wybierz język dokumentu dla silnika OCR i uruchom rozpoznawanie. Po zakończeniu przetwarzania pobierz plik PDF z możliwością przeszukiwania. Podejście oparte na przeglądarce sprawia, że OCR jest dostępny bez konieczności instalowania oprogramowania.
W przypadku iPhone'a i Androida aplikacje skanera obsługujące funkcję OCR przetwarzają skanowanie podczas przechwytywania. Adobe Scan, Microsoft Lens i skaner wbudowany w aplikacji iPhone Notes automatycznie wykonują OCR podczas skanowania dokumentów. Powstały plik PDF można przeszukiwać natychmiast po zeskanowaniu, bez osobnego etapu przetwarzania OCR.
Poprawa dokładności OCR w przypadku trudnych dokumentów
Przed uruchomieniem OCR wybierz właściwy język dokumentu. Silnik OCR wykorzystuje słowniki specyficzne dla języka i dane o częstotliwości znaków do rozpoznawania niejednoznacznych znaków. Przeprowadzenie OCR na dokumencie francuskim z ustawieniem języka francuskiego daje lepsze wyniki niż użycie ustawienia języka angielskiego. W przypadku dokumentów wielojęzycznych wybierz język podstawowy i ręcznie popraw błędy we fragmentach języka dodatkowego.
Przeprostuj zeskanowane strony przed OCR. Zeskanowane strony, które są lekko obrócone, nawet o jeden lub dwa stopnie, zmniejszają dokładność OCR, ponieważ silnik OCR oczekuje, że linie tekstu będą poziome. Większość oprogramowania do skanowania zawiera funkcję automatycznego prostowania. Jeśli skan nie został przekrzywiony podczas przechwytywania, przesuń strony PDF przed uruchomieniem OCR.
Zwiększ rozdzielczość skanowania dokumentów zawierających mały tekst lub złożone układy. Tekst poniżej 10 punktów wymaga wyższej rozdzielczości skanowania, aby zapewnić dokładny OCR. W przypadku większości dokumentów wystarczający jest skan w rozdzielczości 300 DPI. W przypadku dokumentów zawierających tekst o długości 8 punktów lub mniejszej należy skanować w rozdzielczości 400 lub 600 DPI, aby zapewnić silnikowi OCR wystarczającą ilość danych w pikselach do rozróżnienia poszczególnych znaków.
W przypadku dokumentów o mieszanym typie zawartości, takich jak strony łączące tekst ze zdjęciami lub ilustracjami, silnik OCR powinien być skonfigurowany tak, aby rozpoznawał tylko strefy tekstowe. Próba rozpoznania tekstu z obszarów obrazu generuje niepotrzebne znaki. Większość narzędzi OCR zawiera funkcję wyboru strefy, która pozwala określić, które obszary strony zawierają tekst.
Weryfikacja i korekta wyniku OCR
Po zakończeniu OCR sprawdź wynik, wyszukując kilka słów widocznych na stronie. Jeśli wyszukiwanie je znajdzie, oznacza to, że OCR zakończył się pomyślnie. Jeśli w wyszukiwaniu pominięte zostaną oczywiste słowa, dokładność OCR może być niewystarczająca dla określonej czcionki, układu lub jakości obrazu tej strony.
W przypadku dokumentów, dla których dokładność rozpoznawania OCR ma kluczowe znaczenie, takich jak dokumentacja prawna lub medyczna, która musi umożliwiać pełne przeszukiwanie, należy ręcznie sprawdzić rozpoznany tekst. Niektóre narzędzia PDF umożliwiają przeglądanie i edycję ukrytej warstwy tekstowej. Popraw błędy rozpoznawania, szczególnie w nazwach własnych, liczbach i terminach technicznych, które silnik OCR z większym prawdopodobieństwem błędnie rozpozna.
Najczęstsze błędy OCR obejmują pomieszanie znaków. Litera l i cyfra 1 w wielu czcionkach wyglądają podobnie. Litery rn razem mogą wyglądać jak litera m.
Litery cl mogą wyglądać jak litera d. W wyniku tego pomieszania znaków powstają słowa wizualnie podobne do oryginału, ale tekstowo błędne. Ręczny przegląd sekcji krytycznych wyłapuje te błędy.
Po sprawdzeniu wyniku OCR zapisz dokument z nazwą pliku wskazującą, że został on przetworzony za pomocą OCR. Nazwa pliku, taka jak Report-OCR.pdf lub Report-Searchable.pdf, odróżnia wersję z możliwością wyszukiwania od oryginalnego skanu zawierającego tylko obraz.
Praktyczne zalety zeskanowanego pliku PDF z możliwością przeszukiwania stają się oczywiste, gdy po raz pierwszy chcesz znaleźć konkretną informację w dużym dokumencie. 200-stronicowa zeskanowana umowa bez OCR wymaga ręcznego przeczytania każdej strony w celu znalezienia konkretnej klauzuli. Wersja z możliwością przeszukiwania znajduje klauzulę w ciągu kilku sekund. W przypadku każdego dokumentu, do którego zamierzasz odwoływać się więcej niż raz, inwestycja w OCR się zwróci.
Przetworzone za pomocą OCR pliki PDF są także dostępne dla czytników ekranu, dzięki czemu mogą z nich korzystać osoby niedowidzące, które przy czytaniu dokumentów korzystają z technologii wspomagających. Zeskanowany plik PDF bez funkcji OCR jest całkowicie niedostępny dla czytników ekranu, ponieważ nie zawiera tekstu do odczytania na głos. Dodanie OCR sprawia, że dokument jest dostępny, co jest wymagane przez standardy dostępności, w tym Sekcję 508 i WCAG.
W przypadku dokumentów w językach innych niż angielski przed przetworzeniem wybierz właściwy język OCR. Silniki OCR korzystają z modeli rozpoznawania znaków specyficznych dla języka. Dokument w języku japońskim rozpoznany za pomocą modelu japońskiego daje znacznie lepsze wyniki niż ten sam dokument rozpoznany za pomocą modelu angielskiego.
OCR umożliwia także wyodrębnianie tekstu w celu ponownego wykorzystania w innych dokumentach. Kiedy chcesz zacytować fragment zeskanowanego dokumentu we własnym raporcie, OCR umożliwia skopiowanie tekstu. Bez OCR konieczne byłoby ręczne przepisanie fragmentu. Czas zaoszczędzony dzięki możliwości kopiowania i wklejania dokumentów przetworzonych przez OCR znacznie się wydłuża.
W przypadku zeskanowanych dokumentów, które zostaną zarchiwizowane, OCR jest niezbędnym etapem konserwacji. Zarchiwizowany dzisiaj plik PDF zawierający tylko zeskanowany obraz nie zapewnia przyszłym badaczom możliwości wyszukiwania. Plik PDF z możliwością przeszukiwania zapewnia dostęp do treści dokumentu poprzez wyszukiwanie tekstowe, radykalnie zwiększając użyteczność dokumentu dla przyszłych użytkowników.
Rozmiar pliku PDF nie zmienia się znacząco po OCR. Dane OCR dodają do każdej strony niewielką ilość danych tekstowych, zwykle kilka kilobajtów na stronę. Oryginalne obrazy stron pozostają niezmienione. Zwiększenie rozmiaru pliku jest nieistotne w kontekście poprawy funkcjonalności, jaką zapewnia przeszukiwalna warstwa tekstowa.
Przeszukiwalna warstwa tekstowa dodana przez OCR jest oddzielona od obrazu strony wizualnej. Gdy szukasz słowa w pliku PDF przetworzonym przez OCR, wyszukiwanie dotyczy warstwy tekstowej, a nie obrazu. Wynik wyszukiwania podświetla obszar obrazu strony, w którym znaleziono tekst.
Przetworzone za pomocą OCR pliki PDF obsługują funkcję zamiany tekstu na mowę, dzięki czemu są dostępne dla osób z wadami wzroku i każdego, kto woli słuchać dokumentów niż je czytać. Ta funkcja ułatwień dostępu jest znaczącą zaletą OCR, wykraczającą poza proste wyszukiwanie.
W przypadku dużych projektów OCR obejmujących setki lub tysiące zeskanowanych stron, wsadowe przetwarzanie OCR pozwala zaoszczędzić znaczną ilość czasu. Skonfiguruj ustawienia OCR raz i zastosuj je do całej partii dokumentów. Zamiast przeglądać każdą stronę, przejrzyj próbkę stron pod kątem dokładności.
Warstwę tekstową OCR można wyeksportować jako zwykły plik tekstowy, co pozwala na wykorzystanie zawartości dokumentu w innych aplikacjach. Wyeksportuj rozpoznany tekst, otwórz go w edytorze tekstu lub edytorze tekstu i użyj go jako podstawy nowego dokumentu.
Długoterminowa wartość pliku PDF przetworzonego za pomocą OCR jest widoczna za każdym razem, gdy trzeba znaleźć informacje w dokumencie. Przeszukiwalny plik PDF umowy, podręcznika lub dokumentu referencyjnego staje się zasobem, do którego możesz przeszukiwać, a nie statycznym plikiem, który musisz przeczytać ręcznie.
Wdrożenie OCR jako standardowego kroku w procesie skanowania dokumentów gwarantuje, że każdy dokument, który digitalizujesz, będzie można przeszukiwać od chwili, gdy trafi do Twojej biblioteki cyfrowej. Kilka dodatkowych sekund przetwarzania OCR podczas skanowania procentuje za każdym razem, gdy musisz znaleźć informacje w jakimkolwiek skanowanym dokumencie.
Dla każdego, kto zarządza biblioteką dokumentów cyfrowych, OCR jest pojedynczym, najskuteczniejszym etapem przetwarzania, jaki można zastosować w przypadku zeskanowanych plików PDF. Przekształca pasywne pliki obrazów w aktywne, przeszukiwalne i dostępne dokumenty.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
