
Co to jest zeskanowany plik PDF i czym różni się od natywnego pliku PDF
Zeskanowany plik PDF jest tworzony poprzez przechwytywanie obrazów fizycznych stron papierowych za pomocą skanera lub aparatu w telefonie. Każda strona pliku PDF jest fotografią oryginalnego dokumentu. Tekst widoczny na stronie istnieje tylko w postaci pikseli obrazu. W pliku PDF nie są przechowywane żadne rzeczywiste znaki tekstowe. Zeskanowany plik PDF to w zasadzie album ze zdjęciami, w którym każde zdjęcie zawiera tekst.
Najszybszym sposobem zidentyfikowania zeskanowanego pliku PDF jest zaznaczenie tekstu na stronie kursorem.
Technologia OCR wypełnia lukę pomiędzy zeskanowanymi i natywnymi plikami PDF, dodając warstwę tekstową z możliwością przeszukiwania.
Natywny plik PDF, zwany także cyfrowym plikiem PDF lub urodzonym cyfrowym plikiem PDF, jest tworzony bezpośrednio z aplikacji. Kiedy eksportujesz dokument programu Word do formatu PDF, zapisujesz arkusz kalkulacyjny w formacie PDF lub tworzysz plik PDF z aplikacji do projektowania, plik wynikowy zawiera rzeczywiste znaki tekstowe, które można wybierać i przeszukiwać, wraz z grafiką wektorową i osadzonymi czcionkami.
Tekst istnieje jako dane, a nie tylko jako piksele. Natywny plik PDF to dokument ustrukturyzowany, a nie zbiór obrazów stron.
Format PDF obsługuje oba typy treści w tym samym pliku. Plik PDF może zawierać strony zawierające zeskanowane obrazy i inne strony zawierające natywny tekst cyfrowy. Ten scenariusz z mieszaną zawartością jest powszechny, gdy dokumenty są składane z wielu źródeł, np. raport łączący cyfrowo utworzone strony tekstowe ze zeskanowanymi załącznikami ze źródeł drukowanych.
Praktyczna różnica między zeskanowanymi i natywnymi plikami PDF wpływa na wszystko, co możesz zrobić z dokumentem. Możesz wyszukiwać słowa w natywnym pliku PDF, ponieważ tekst istnieje w postaci danych znakowych, które można przeszukiwać. Nie można przeszukiwać zeskanowanego pliku PDF, jeśli nie został on przetworzony przy użyciu technologii OCR PDF, która rozpoznaje tekst na obrazach i dodaje niewidoczną warstwę tekstową z możliwością przeszukiwania. Możesz zaznaczać i kopiować tekst z natywnego pliku PDF. Nie można zaznaczyć tekstu ze zeskanowanego pliku PDF. Możesz edytować tekst w natywnym pliku PDF za pomocą edytora PDF. Nie można edytować tekstu w zeskanowanym pliku PDF, ponieważ nie ma tam znaków tekstowych do edycji.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Jak sprawdzić, czy plik PDF jest zeskanowany czy natywny
Najszybszym testem jest próba zaznaczenia tekstu w pliku PDF. Otwórz plik PDF, kliknij i przeciągnij słowo myszką lub palcem. Jeśli tekst zostanie podświetlony podczas przeciągania, oznacza to, że plik PDF zawiera natywny tekst, który można wybrać. Jeśli nic się nie dzieje przy próbie zaznaczenia tekstu, prawdopodobnie strona jest zeskanowanym obrazem. Jeśli niektóre słowa są podświetlone, a inne nie, plik PDF może zawierać częściową lub uszkodzoną warstwę tekstową.
Test powiększenia zapewnia kolejną szybką kontrolę. Powiększ fragment tekstu o 300 lub 400 procent. Jeśli tekst pozostaje ostry i wyraźny przy dużym powiększeniu, jest to prawdopodobnie natywny tekst wektorowy, który można płynnie skalować do dowolnego rozmiaru. Jeżeli przy dużym powiększeniu tekst ulega pikselowaniu i ma postrzępione krawędzie, jest to zeskanowany obraz. Ten test wizualny działa, ponieważ tekst wektorowy renderuje się płynnie przy każdym poziomie powiększenia, podczas gdy tekst oparty na obrazie ujawnia swoją strukturę pikseli po powiększeniu.
Narzędzia przeglądarki plików PDF mogą także raportować, czy dokument zawiera tekst. W programie Adobe Acrobat panel Właściwości dokumentu pokazuje liczbę stron oraz informację, czy plik zawiera tekst, który można przeszukiwać. Niektóre przeglądarki wyświetlają wskaźnik warstwy tekstowej. Narzędzia do analizy dokumentów mogą skanować pliki PDF i raportować odsetek stron zawierających tekst natywny w porównaniu z zawartością zawierającą wyłącznie obrazy.
Rozmiar pliku może stanowić wskazówkę, choć nie jest ona ostateczna. Zeskanowany plik PDF składający się z obrazów stron jest zwykle większy niż natywny tekstowy plik PDF o tej samej liczbie stron, ponieważ obrazy wymagają więcej miejsca na dysku niż tekst. 10-stronicowy plik PDF z tekstem natywnym może mieć od 100 do 500 kilobajtów. 10-stronicowy zeskanowany plik PDF może mieć od 2 do 10 megabajtów. Jednak natywny plik PDF z osadzonymi obrazami o wysokiej rozdzielczości może być również duży, więc sam rozmiar pliku nie jest wiarygodnym wskaźnikiem.
Dlaczego wyróżnienie ma znaczenie w codziennych zadaniach związanych z plikami PDF
Wyszukiwanie jest najczęstszym zadaniem, na które wpływa rozróżnienie zeskanowane i natywne. Jeśli otrzymasz 50-stronicowy plik PDF i chcesz znaleźć każdą wzmiankę o konkretnym terminie, natywny plik PDF daje odpowiedź w ciągu kilku sekund za pomocą funkcji wyszukiwania. Zeskanowany plik PDF wymaga ręcznego wizualnego skanowania każdej strony, co zajmuje kilka minut i może pominąć pewne zdarzenia. Możliwość wyszukiwania dokumentu zmienia sposób interakcji z nim.
Wyodrębnianie tekstu w celu ponownego wykorzystania w innych dokumentach wymaga tekstu natywnego. Jeśli chcesz zacytować akapit z pliku PDF we własnym raporcie, natywny plik PDF umożliwia bezpośrednie skopiowanie i wklejenie tekstu. Zeskanowany plik PDF wymaga ponownego wpisania tekstu lub uruchomienia OCR, aby można go było wyodrębnić. W przypadku dokumentów, do których często się odwołujesz, różnica między natychmiastowym kopiowaniem i wklejaniem a ręcznym przepisywaniem jest znacząca.
Narzędzia ułatwień dostępu, w tym czytniki ekranu używane przez osoby niedowidzące, wymagają tekstu natywnego. Czytnik ekranu może czytać na głos natywny plik PDF, ponieważ ma dostęp do znaków tekstowych. Czytnik ekranu nie może odczytać zeskanowanego pliku PDF, ponieważ nie ma dostępnych znaków tekstowych. Udostępnienie zeskanowanych plików PDF wymaga przetwarzania OCR w celu dodania warstwy tekstowej, którą mogą zinterpretować czytniki ekranu.
Format Skanowany PDF jest całkowicie odpowiedni do celów archiwalnych, gdzie dokument wystarczy oglądać jedynie jako obraz oryginału. Zeskanowana kopia podpisanej umowy służy jako wizualny zapis podpisanego dokumentu. Do wszelkich celów wymagających interakcji z tekstem, wyszukiwania, kopiowania, edytowania lub zapewniania dostępności niezbędny jest natywny plik PDF lub zeskanowany plik PDF za pomocą OCR.
Jak przekonwertować zeskanowany plik PDF na natywny plik PDF z możliwością przeszukiwania
Optyczne rozpoznawanie znaków to technologia, która przekształca zeskanowane obrazy stron w dokumenty zawierające warstwę tekstową, które można przeszukiwać. Uruchom OCR na zeskanowanym pliku PDF za pomocą narzędzia PDF obsługującego przetwarzanie OCR. Narzędzie analizuje każdy obraz strony, rozpoznaje znaki tekstowe i dodaje niewidoczną warstwę tekstową za obrazem strony. Po OCR plik PDF wygląda identycznie wizualnie, ale można go teraz przeszukiwać, a rozpoznany tekst można zaznaczyć i skopiować.
Dokładność rozpoznawania OCR zależy od jakości oryginalnego skanu. Czysty skan w rozdzielczości 300 DPI przy równomiernym oświetleniu, płaskich stronach i ostrej ostrości zapewnia dokładność OCR przekraczającą 99 procent.
Skanowanie w niskiej rozdzielczości przy 150 DPI z cieniami, zakrzywionymi stronami lub rozmazanym tekstem może zapewnić dokładność poniżej 95 procent i wymagać ręcznej korekty. Jakość skanowania określa jakość wyniku OCR.
Po uruchomieniu OCR zweryfikuj wyniki wyszukując kilka słów widocznych na stronie. Jeśli wyszukiwanie je znajdzie, oznacza to, że OCR zakończył się pomyślnie. Jeśli w wyszukiwaniu pominięto oczywiste słowa, funkcja OCR mogła mieć trudności z określoną czcionką, układem lub jakością obrazu na tej stronie. Uruchom ponownie OCR z dostosowanymi ustawieniami lub na skanie o wyższej jakości, jeśli to możliwe.
Narzędzie WukongPDF OCR PDF przetwarza zeskanowane dokumenty w przeglądarce i zwraca plik PDF z przeszukiwalną warstwą tekstową. Prześlij zeskanowany plik PDF, uruchom OCR i pobierz dokument obsługujący wyszukiwanie, zaznaczanie tekstu i dostęp do czytnika ekranu. Proces OCR zachowuje oryginalny wygląd wizualny, dodając jednocześnie warstwę tekstową, która sprawia, że dokument jest interaktywny.
Różnica w rozmiarze pliku pomiędzy zeskanowanymi i natywnymi plikami PDF staje się szczególnie istotna w przypadku dużych zbiorów dokumentów. Szafka na dokumenty papierowe zeskanowane do formatu PDF może wygenerować dziesiątki tysięcy zeskanowanych stron PDF, a każda strona to pełny obraz. Przy 500 kilobajtach na stronę w przypadku typowego skanowania w skali szarości 300 DPI 10 000 stron zajmuje 5 gigabajtów pamięci. Uruchamianie OCR na zeskanowanych plikach PDF nie zmniejsza rozmiaru pliku, ponieważ obrazy stron pozostają, ale dodaje warstwę tekstową z możliwością przeszukiwania, dzięki czemu kolekcja jest praktycznie użyteczna.
W przypadku dokumentów wymagających długoterminowej archiwizacji standardem archiwizacji jest format PDF/A. Zarówno zeskanowane pliki PDF, jak i natywne pliki PDF można konwertować do formatu PDF/A. Zeskanowany plik PDF przekonwertowany do formatu PDF/A pozostaje dokumentem opartym na obrazie z dodatkiem metadanych archiwalnych. Natywny plik PDF przekonwertowany do formatu PDF/A zachowuje swój tekst i właściwości strukturalne. PDF/A nie zmienia zeskanowanego charakteru dokumentu. Dodaje ustandaryzowane metadane i wymusza wymagania strukturalne, które poprawiają długoterminową trwałość.
W przypadku plików PDF zawierających strony zeskanowane i natywne, zastosuj OCR na zeskanowanych stronach, pozostawiając strony natywne nietknięte. Większość narzędzi OCR może przetwarzać określone zakresy stron, więc OCR można uruchamiać tylko na stronach, które tego potrzebują. Po przetworzeniu plik PDF zachowuje natywny tekst na oryginalnych stronach i zawiera warstwę tekstową z możliwością przeszukiwania na stronach, które wcześniej zawierały tylko obrazy, zapewniając spójne możliwości wyszukiwania w całym dokumencie.
W przypadku dokumentów, które będą drukowane i wypełniane ręcznie, zeskanowany plik PDF oryginalnego formularza jest całkowicie wystarczający. Odbiorca drukuje plik PDF, wypełnia puste miejsca piórem i albo zwraca kopię fizyczną, albo skanuje ją z powrotem do postaci cyfrowej. W przypadku dokumentów, które należy wypełnić cyfrowo, natywny plik PDF z polami formularzy jest znacznie lepszy, ponieważ odbiorca może pisać bezpośrednio w polach.
Wybór pomiędzy skanowaniem dokumentu do formatu PDF a utworzeniem natywnego pliku PDF z oryginalnego pliku źródłowego powinien uwzględniać cały cykl życia dokumentu, a nie tylko natychmiastową potrzebę. Zeskanowany plik PDF umowy można przesłać e-mailem do drugiej strony w celu sprawdzenia. Jeśli w ramach sporu trzeba będzie później przeszukać umowę pod kątem konkretnej klauzuli, brak możliwości przeszukiwania zeskanowanego pliku PDF staje się poważnym problemem. Tworzenie natywnego pliku PDF podczas tworzenia dokumentu zachowuje opcje, których nie zapewnia skanowanie.
Nowoczesne oprogramowanie do skanowania często obejmuje automatyczne przetwarzanie OCR, co w praktyce zaciera różnicę między zeskanowanymi i natywnymi plikami PDF. Dokument zeskanowany za pomocą aplikacji na telefon, która natychmiast po przechwyceniu wykonuje OCR, tworzy plik PDF, który technicznie jest zeskanowanym obrazem, ale funkcjonalnie można go przeszukiwać jak natywny plik PDF. To hybrydowe podejście łączy w sobie wygodę skanowania z możliwością przeszukiwania tekstu natywnego.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
