Others

Jaka jest różnica między tekstem OCR a tekstem osadzonym w pliku PDF

Otwórz zeskanowany plik PDF i możesz zaznaczać, kopiować i przeszukiwać tekst tak, jakby był to natywny dokument cyfrowy. Tekst ten nie pochodził z oryginalnego skanu. Skaner wygenerował obraz strony, siatkę pikseli bez żadnych danych tekstowych. Tekst, który wybierasz i przeszukujesz, to tekst OCR wygenerowany przez oprogramowanie do optycznego rozpoznawania znaków, które analizuje obraz strony i konwertuje wzory pikseli na znaki. Jednak nie cały tekst do zaznaczenia w pliku PDF jest tekstem OCR. Niektóre pliki PDF zawierają osadzony tekst, który został utworzony cyfrowo i nigdy nie przeszedł przez skaner ani silnik rozpoznawania. Zrozumienie różnicy między tekstem OCR a tekstem osadzonym wyjaśnia, dlaczego niektóre pliki PDF wyszukują doskonale, a inne dają zniekształcone wyniki.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Co to jest tekst OCR i jak trafia do pliku PDF

Tekst OCR jest generowany maszynowo. Mechanizm OCR PDF sprawdza każdy kształt znaku na zeskanowanym obrazie strony, porównuje go z bazą danych znanych wzorców znaków i wyświetla najbardziej prawdopodobny pasujący znak wraz z jego pozycją na stronie. Rozpoznany tekst jest następnie osadzany w pliku PDF jako niewidoczna warstwa umieszczona dokładnie nad znakami oryginalnego obrazu. Zaznaczając i kopiując tekst ze zeskanowanego pliku PDF, kopiujesz z tej niewidocznej warstwy OCR, a nie z widocznego obrazu. Jeśli silnik OCR błędnie odczyta znak, skopiowany tekst będzie zawierał ten błąd, mimo że widoczny obraz będzie wyglądał poprawnie.

Jakość tekstu OCR zależy od kilku czynników: rozdzielczości i przejrzystości skanu oryginału, czcionki użytej w oryginalnym dokumencie, języka tekstu i zaawansowania silnika OCR. Czysty skan w rozdzielczości 300 DPI wydrukowanego laserowo dokumentu w języku angielskim, przetworzony przez nowoczesny silnik OCR, daje tekst niemal idealny. Skanowanie w rozdzielczości 150 DPI dokumentu wydrukowanego metodą igłową w języku o skomplikowanych kształtach znaków przetwarzanych przez podstawowy silnik OCR generuje tekst pełen błędów. Tekst OCR jest tak dokładny, jak pozwala na to silnik rozpoznawania i jakość skanowania.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Co to jest tekst osadzony i jak trafia do pliku PDF

Osadzony tekst jest autorski, ale nie rozpoznany. Kiedy edytor tekstu, aplikacja do publikowania na komputerach stacjonarnych lub biblioteka do tworzenia plików PDF generuje plik PDF, zapisuje tekst bezpośrednio do strumienia zawartości PDF. Każdy znak jest przechowywany jako specyficzny kod, który jest odwzorowywany na glifie w czcionce. Nie ma etapu rozpoznawania, ponieważ tekst nigdy nie był obrazem. Aplikacja, która utworzyła plik PDF, dokładnie wiedziała, jakie znaki są zapisywane i precyzyjnie je rejestrowała. Zaznaczając i kopiując tekst z cyfrowo utworzonego pliku PDF, kopiujesz dokładnie te znaki, które wpisał autor.

Tekst osadzony zawiera informacje o formatowaniu, których zazwyczaj brakuje w tekście OCR. Nazwy czcionek, pogrubienie i kursywa oraz odstępy między znakami są zachowywane w osadzonym tekście, ponieważ zostały określone przez autora w dokumencie źródłowym. Tekst OCR może zrekonstruować część tego formatowania, ale jest on wyciągany na podstawie wyglądu znaków, a nie przechowywany jako jawne metadane. Porównanie Format PDF pomiędzy zeskanowaną, a następnie OCR stroną a natywną stroną cyfrową ujawnia tę różnicę. Wersja OCR może umożliwiać zaznaczanie tekstu, ale zgłasza każdy znak jako tę samą czcionkę i tę samą wagę. Wersja cyfrowa zachowuje rozróżnienie czcionek zamierzone przez autora.

Jak sprawdzić, czy tekst w pliku PDF jest OCR czy osadzony

Najbardziej niezawodnym sposobem ustalenia, czy tekst w pliku PDF został wygenerowany za pomocą OCR, czy osadzony, jest sprawdzenie właściwości dokumentu, w szczególności listy czcionek. Otwórz plik PDF w przeglądarce, która może wyświetlić informacje o czcionkach. Adobe Acrobat wyświetli listę czcionek w obszarze Plik, Właściwości dokumentu, Czcionki. Jeśli na liście czcionek znajdują się czcionki o nazwach zawierających OCR lub jeśli czcionki są wymienione jako nieznane lub jako typ ogólny bez określonej nazwy, tekst prawdopodobnie został wygenerowany przez OCR. Jeśli lista czcionek zawiera określone, nazwane czcionki, takie jak Arial, Times New Roman lub Calibri z podtypami, takimi jak Pogrubienie lub Kursywa, tekst prawie na pewno jest osadzony ze źródła cyfrowego.

Kolejnym praktycznym testem jest poszukiwanie typowego wzorca błędów OCR. Przeszukaj plik PDF pod kątem typowych błędów zastępowania OCR, takich jak kombinacja liter rn, którą silniki OCR często błędnie odczytują jako pojedynczą literę m. Jeśli wyszukiwanie wykryje przypadki, w których stodoła zmienia się w bam, a kukurydza w com, tekst jest generowany przez OCR. W osadzonym tekście nie występują błędy podstawienia, ponieważ znaki nigdy nie były wizualnie niejednoznaczne. Jakość dokumentu PDF z możliwością wyszukiwania zależy od tego, czy tekst bazowy, OCR czy osadzony, dokładnie odzwierciedla widoczną treść.

Kiedy tekst OCR i tekst osadzony współistnieją w tym samym pliku PDF

Pojedynczy plik PDF może zawierać zarówno tekst OCR, jak i tekst osadzony na różnych stronach lub nawet na tej samej stronie. Pakiet umowy może zawierać cyfrowo napisaną treść umowy, która zawiera osadzony tekst, oraz zeskanowaną i przetworzoną przez OCR stronę podpisu, która zawiera tekst OCR. Raport badawczy może łączyć cyfrowo utworzone strony tekstowe ze zeskanowanymi i przetworzonymi za pomocą OCR zdjęciami historycznych wycinków prasowych. Tekst na stronie trzeciej jest tekstem osadzonym w doskonałej rozdzielczości. Tekst na stronie siódmej to tekst OCR, który może zawierać błędy rozpoznawania.

Ten scenariusz z mieszaną zawartością tworzy subtelną pułapkę dla każdego, kto wyszukuje lub wyodrębnia tekst z pliku PDF. Wyniki wyszukiwania z osadzonych stron tekstowych będą dokładne. Wyniki wyszukiwania na stronach tekstowych OCR mogą nie uwzględniać wystąpień, w których silnik OCR błędnie odczytał słowo, lub mogą zwracać fałszywe dopasowania, gdy silnik OCR podstawił podobne słowo. Podczas pracy z plikami PDF o mieszanej zawartości sprawdź tekst wyodrębniony ze stron OCR, zanim zaczniesz na nim polegać. Najbezpieczniejszym podejściem jest wizualne sprawdzenie odpowiedniego obrazu strony za każdym razem, gdy tekst wyodrębniony ze strony OCR jest używany do krytycznego celu.

Poprawa jakości tekstu OCR po fakcie

Jeśli plik PDF zawiera tekst OCR niskiej jakości, możliwości jego ulepszenia są ograniczone faktem, że proces skanowania oryginału i OCR został już zakończony. Nie można z mocą wsteczną poprawić jakości skanowania. Jedyne, co możesz zrobić, to ponownie OCR pliku PDF przy użyciu lepszego silnika. Wyodrębnij obrazy stron z pliku PDF w najwyższej dostępnej rozdzielczości i przepuść je przez nowoczesny silnik OCR, który może dać dokładniejsze wyniki niż oryginalny przebieg OCR. Zastąp starą warstwę tekstową OCR nową.

Niektóre edytory PDF umożliwiają ręczną korektę błędów OCR bezpośrednio w warstwie tekstowej. Otwórz plik PDF w trybie edycji, który ujawnia niewidoczny tekst OCR. Kliknij błędnie rozpoznane słowo i wpisz poprawkę. Ten proces ręcznej korekty jest praktyczny w przypadku kilku błędów na kilku stronach. Nie jest to praktyczne w przypadku 200-stronicowego dokumentu, w którym każdy akapit zawiera błędy rozpoznawania. W przypadku problemów z jakością rozpoznawania OCR na dużą skalę skuteczniejsze jest ponowne OCR całego dokumentu przy użyciu lepszego silnika.

Wybór pomiędzy OCR a tekstem osadzonym do tworzenia dokumentów

Podczas tworzenia pliku PDF, który będzie przeszukiwany, indeksowany lub archiwizowany, wybór pomiędzy skanowaniem i OCR a generowaniem natywnego cyfrowego pliku PDF ma długoterminowe konsekwencje. Natywny cyfrowy plik PDF z osadzonym tekstem jest mniejszy, wyszukuje szybciej i doskonale zachowuje dokładność tekstu. Zeskanowany i przetworzony plik PDF za pomocą OCR zachowuje wygląd oryginalnego dokumentu papierowego, ale stwarza możliwość wystąpienia błędów rozpoznawania, które z biegiem czasu nasilają się podczas kopiowania, cytowania i odwoływania się do pliku PDF.

W przypadku projektów archiwalnych najlepszą praktyką jest zachowanie obu formatów. Zachowaj skan w wysokiej rozdzielczości jako wzorzec archiwalny, aby zapewnić wierność wizualną. Wygeneruj natywną wersję cyfrową, wpisując ponownie lub stosując bardzo dokładny OCR z ręczną korektą, na potrzeby wyszukiwania i analizy tekstu. To podejście oparte na dwóch formatach zapewnia autentyczność oryginalnego skanu i użyteczność przeszukiwalnego tekstu. WukongPDF obsługuje przetwarzanie OCR PDF w celu konwersji zeskanowanych dokumentów na pliki PDF z możliwością przeszukiwania, a powstała w ten sposób warstwa tekstowa OCR zapewnia funkcję wyszukiwania i kopiowania, dzięki której zeskanowane dokumenty można wykorzystać w cyfrowych przepływach pracy.

Długoterminowa luka w niezawodności pomiędzy OCR a tekstem osadzonym

Pliki PDF wykonane metodą OCR starzeją się inaczej niż pliki PDF utworzone cyfrowo. Cyfrowo opracowany plik PDF otwarty dwadzieścia lat po utworzeniu doskonale wyświetla tekst, ponieważ kody znaków są jednoznaczne, a czcionki są osadzone. Otwarcie pliku PDF OCR dwadzieścia lat po utworzeniu zależy od jakości oryginalnego skanu i dokładności dostępnego wówczas silnika OCR. Błędy rozpoznawania, które na świeżym dokumencie były ledwo zauważalne, stają się poważną przeszkodą, gdy oryginalny dokument papierowy nie jest już dostępny do weryfikacji.

W przypadku dokumentów przeznaczonych do długotrwałego przechowywania zawsze preferowany jest tekst osadzony ze źródła cyfrowego, a nie tekst OCR. Jeśli dokument istnieje tylko w wersji papierowej i wymaga zeskanowania, zainwestuj w najwyższej jakości skanowanie i przetwarzanie OCR dostępne w danym momencie i zachowaj oryginalny dokument papierowy tak długo, jak to możliwe. Oryginał papierowy stanowi najlepszą kopię zapasową chroniącą przed błędami OCR, które mogą ujawnić się dopiero po latach.

Praktyczny test umożliwiający odróżnienie tekstu OCR PDF od tekstu osadzonego: powiększ akapit o 300 procent lub więcej i spójrz na krawędzie znaków. Tekst OCR często wykazuje niewielką rozbieżność pomiędzy widocznym obrazem znaku a niewidoczną warstwą tekstową. Osadzony tekst jest renderowany z doskonałym wyrównaniem, ponieważ kształty i pozycje znaków pochodzą z tego samego programu czcionek.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →