Plik PDF przychodzi e-mailem. Po otwarciu ukazuje się coś, co wygląda jak wydrukowany dokument. Tekst tam jest, formatowanie jest prawidłowe. Ale czy możesz zaznaczyć tekst kursorem, czy też kursor przesuwa się po nim tak, jakby był fotografią? Odpowiedź określa, czy plik PDF został utworzony w wyniku zeskanowania papieru, czy wygenerowany ze źródła cyfrowego, a także decyduje o tym, jak możesz pracować z plikiem.
Kliknięcie tekstu i sprawdzenie, czy kursor go zaznacza, czy ignoruje, odpowiada na pytanie w ciągu jednej sekundy.
Ustalenie, czy plik PDF został zeskanowany, czy utworzony cyfrowo, obejmuje sprawdzenie tekstu, który można zaznaczyć, sprawdzenie struktury pliku i wyszukanie charakterystycznych wizualnych artefaktów skanowania. Narzędzia OCR PDF OCR PDF umożliwiają przeszukiwanie zeskanowanych dokumentów, a poniższe kroki identyfikacji Skanowany plik PDF pozwalają określić, czy w pierwszej kolejności potrzebny jest OCR.

Test wyboru tekstu
Otwórz plik PDF i spróbuj zaznaczyć słowo tekstu za pomocą narzędzia do zaznaczania tekstu. Jeśli kursor podświetla słowo znak po znaku, plik PDF zawiera tekst do zaznaczenia i został utworzony cyfrowo lub został już poddany OCR. Jeśli kursor narysuje prostokąt zaznaczenia na całym obszarze bez podświetlania poszczególnych znaków, strona jest obrazem, a plik PDF został utworzony poprzez skanowanie.
Test wyboru tekstu jest szybki i ostateczny w przypadku kontroli pojedynczych stron. W przypadku dokumentów wielostronicowych przetestuj kilka stron od początku, środka i końca. Niektóre pliki PDF zawierają strony cyfrowe i zeskanowane; zazwyczaj jest to list motywacyjny utworzony cyfrowo, po którym następują zeskanowane załączniki. Test wyboru tekstu na każdej stronie pozwala określić, które strony są które.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Sprawdzanie rozmiaru pliku i liczby stron w poszukiwaniu wskazówek
Zeskanowane pliki PDF są zazwyczaj większe niż cyfrowe pliki PDF i mają tę samą liczbę stron, ponieważ każda strona stanowi obraz całostronicowy. 10-stronicowy zeskanowany plik PDF w rozdzielczości 300 DPI ma często rozmiar 5–15 MB. 10-stronicowy cyfrowy plik PDF o tej samej zawartości może mieć rozmiar 100–500 KB. Różnica w rozmiarze pliku jest szybką wskazówką jeszcze przed otwarciem pliku.
Zeskanowane pliki PDF mają zwykle mniej funkcji wewnętrznych. Żadnych zakładek, żadnych hiperłączy, żadnych osadzonych czcionek, żadnych metadanych poza podstawowymi właściwościami plików. Otwórz Właściwości dokumentu i sprawdź zakładkę Czcionki. Zeskanowany plik PDF nie zawiera żadnych czcionek, ponieważ cała zawartość to obrazy. Cyfrowy plik PDF zawiera listę czcionek używanych w dokumencie.
Sprawdzanie właściwości pliku pod kątem metody tworzenia
Właściwości dokumentu często obejmują aplikację, która utworzyła plik PDF. Plik PDF utworzony przez program Adobe Acrobat z programu Microsoft Word był prawdopodobnie cyfrowy. Zeskanowano plik PDF utworzony za pomocą sterownika skanera Canon lub programu HP Scan. Plik PDF utworzony przez aplikację OCR może być zeskanowanym dokumentem, który został przetworzony w celu umożliwienia wyszukiwania.
Pole producenta we Właściwościach dokumentu jest ustawiane przez aplikację tworzącą i nie zawsze jest niezawodne, ponieważ można je zmienić lub sfałszować. Połącz informacje o producencie z testem wyboru tekstu i sprawdzeniem czcionki, aby uzyskać pewność. Trzy niezależne testy prowadzące do tego samego wniosku są wiarygodne.
| Test | Wynik w cyfrowym formacie PDF | Wynik zeskanowanego pliku PDF |
|---|---|---|
| Wybór tekstu | Kursor podświetla poszczególne znaki | Kursor rysuje prostokąt zaznaczenia nad obrazem |
| Rozmiar pliku (10 stron) | 100-500 kB | 5-15 MB |
| Karta Czcionki we Właściwościach | Wyświetla listę osadzonych czcionek | Puste, bez czcionek |
| Pole producenta | Word, Acrobat, Chrome | Sterownik skanera, oprogramowanie do przetwarzania obrazu |
Wyszukiwanie wizualnych artefaktów skanowania
Powiększ do 400% obszaru tekstowego. Zeskanowane pliki PDF wykazują charakterystyczne artefakty przechwytywania obrazu: lekkie rozmycie na krawędziach znaków, nierównomierne przyciemnienie strony spowodowane oświetleniem skanera oraz drobinki kurzu lub ślady włosów na szybie skanera, które wyglądają jak słabe linie lub plamki. Cyfrowe pliki PDF pokazują wyraźne krawędzie znaków przy dowolnym poziomie powiększenia.
W zeskanowanych plikach PDF zawierających strony dwustronne mogą pojawiać się smugi i prześwitujący słaby, odwrócony tekst z drugiej strony papieru. Jest to ostateczny znak skanowania, ponieważ cyfrowe pliki PDF nie mają pojęcia przezroczystości papieru. Efekty duchowe pojawiają się w postaci szarego cienia tekstu za tekstem głównym, najbardziej widocznego w obszarach, w których tekst podstawowy jest rzadki.
Korzystanie z pól metadanych PDF w celu uzyskania dodatkowych wskazówek
Pola metadanych PDF, dostępne we Właściwościach dokumentu, mogą ujawnić pochodzenie dokumentu. Pole Tytuł zawierające nazwę pliku oryginalnego dokumentu, np. raport roczny-2025-ostateczny.docx, wskazuje, że plik PDF został utworzony na podstawie tego pliku programu Word. Puste pole Tytuł lub Tytuł pasujący do nazwy pliku PDF jest neutralne. Pole Twórcy zawierające listę programów Microsoft Word lub Dokumentów Google wskazuje na pochodzenie cyfrowe.
Pola Data utworzenia i Data modyfikacji mogą dostarczyć wskazówek na osi czasu. Plik PDF utworzony i zmodyfikowany tego samego dnia w odstępie kilku minut sugeruje bezpośredni eksport cyfrowy. Plik PDF z datą modyfikacji przypadającą wiele lat po dacie utworzenia mógł zostać poddany OCR lub przetworzony. Metadane przedstawiają historię dokumentu, która ujawnia, czy doszło do skanowania.
Co zrobić, gdy już znasz typ pliku PDF
W przypadku zeskanowanych plików PDF, które wymagają wyszukiwania, uruchom OCR, aby dodać warstwę tekstową. Proces OCR rozpoznaje tekst w obrazach stron i dodaje za nimi możliwy do wybrania tekst, który można przeszukiwać. Wygląd wizualny się nie zmienia. Plik PDF zyskuje możliwość wyszukiwania i kopiowania i wklejania.
W przypadku cyfrowych plików PDF, które muszą wyglądać na zeskanowane, zazwyczaj w przypadku oficjalnie wyglądających reprodukcji dokumentów, konwersja na obraz i odwrotnie jest niepotrzebna i pogarsza jakość. Cyfrowy plik PDF jest już w optymalnej formie. Każde przetwarzanie, które konwertuje tekst na obrazy, obniża jakość bez dodawania wartości.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
