Skanowanie papieru gazetowego, cienkiego papieru słownikowego lub papieru biurowego niskiej jakości powoduje utworzenie pliku PDF z irytującym problemem: tekst z drugiej strony strony przebija się w postaci słabego obrazu ducha za tekstem, który faktycznie chcesz przeczytać. Zjawisko to, zwane prześwitywaniem lub przenikaniem, dezorientuje silniki OCR, ponieważ nie potrafią one odróżnić tekstu na pierwszym planie od szumu tła. Wynik OCR staje się mieszaniną zamierzonego tekstu i fragmentów odwróconego tekstu z drugiej strony strony, co skutkuje zniekształceniem i bezużytecznością wyniku.
Prześwit zasadniczo różni się od ciemnego lub nierównego tła. Nie jest to hałas jednolity, który można usunąć prostą regulacją progu. Jest to tekst strukturalny, wydrukowany wstecz i przyciemniony, ale nadal ustrukturyzowany. Standardowe silniki OCR traktują każdy ciemny znak na stronie jako potencjalny tekst, a widma na odwrotnej stronie mają wystarczający kontrast, aby spowodować rozpoznanie fałszywego znaku. Rozwiązanie tego problemu wymaga wstępnego przetworzenia zeskanowanego obrazu w celu wyeliminowania wycieków, zanim silnik OCR je dostrzeże. Etap wstępnego przetwarzania nie jest opcjonalny w przypadku papieru gazetowego. Jest to różnica między dokumentem, który można przeszukiwać, a plikiem cyfrowym, który jest tylko nieznacznie bardziej użyteczny niż surowa fotografia.
Badanie przeprowadzone w 2025 r. przez Digital Preservation Coalition wykazało, że dokładność rozpoznawania OCR w przypadku skanów papieru gazetowego bez wstępnego przetwarzania wynosiła średnio 67% w porównaniu z 98% w przypadku czystych stron drukowanych laserowo. Dzięki zoptymalizowanemu przetwarzaniu wstępnemu te same skany papieru gazetowego osiągnęły dokładność na poziomie 94% (Digital Preservation Coalition, „OCR Performance on Degraded Paper Media”, 2025). Różnica 27 punktów procentowych między OCR surowego i wstępnie przetworzonego papieru gazetowego oznacza różnicę między dokumentem, który można przeszukiwać, a dokumentem, którego w rzeczywistości nie można używać do zapytań tekstowych.

Dlaczego standardowy OCR zawodzi w przypadku papieru gazetowego i cienkiego
Proces OCR PDF działa poprzez wykrywanie obszarów obrazu, w których wartości pikseli różnią się od tła o więcej niż próg. Na czystym białym papierze z ciemnym tekstem próg jest łatwy do ustawienia: wszystko, co jest ciemniejsze niż 50% szarości, to tekst, wszystko jaśniejsze to tło. Na papierze gazetowym sam papier jest szary, prześwit od strony odwrotnej również jest szary, często tylko nieznacznie jaśniejszy niż tekst na pierwszym planie na stronie przedniej. Pojedynczy globalny próg nie może ich rozdzielić. Jeśli ustawisz próg wystarczająco wysoko, aby wykluczyć prześwitywanie, stracisz także cienkie kreski i szeryfy z tekstu na pierwszym planie. Jeśli ustawisz tę wartość na tyle nisko, aby przechwycić cały tekst na pierwszym planie, prześwit również zostanie przechwycony.
Gazety wprowadzają dodatkowe wyzwania wykraczające poza prześwit. Papier często żółknie z biegiem czasu, tworząc niejednolite tło, które na jednej stronie zmienia kolor z beżowego na brązowy. Tekst jest drukowany w wąskich kolumnach, przy użyciu małej czcionki, zazwyczaj od 6 do 8 punktów. Atrament rozłożony na przestrzeni dziesięcioleci może powodować zacieranie się liter, zamykając luki między znakami, np. „e”; i „a”. Sama powierzchnia papieru może mieć teksturę powstałą w procesie produkcyjnym, która na skanach o wysokiej rozdzielczości jest widoczna jako drobne ziarno, które silniki OCR błędnie odczytują jako znaki interpunkcyjne. Każdy z tych problemów łączy się z innymi, a potok przetwarzania wstępnego, który obsługuje tylko jeden z nich, pozostawia resztę, co pogarsza dokładność OCR.
WukongPDF obsługuje przetwarzanie zeskanowanego pliku PDF z adaptacyjnym przetwarzaniem wstępnym, które automatycznie wykrywa prześwit i stosuje odpowiednie tłumienie tła przed uruchomieniem OCR. Dzięki temu podejściu na podstawie zeskanowanych dokumentów można przeszukiwać tekst, co zmyliłoby standardowy silnik OCR, i sprawdza się ono w przypadku pełnego zakresu rodzajów papieru, od czystego papieru biurowego po pożółkły papier gazetowy.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Techniki wstępnego przetwarzania mające na celu wyeliminowanie prześwitywania
Najskuteczniejszym pojedynczym etapem wstępnego przetwarzania w celu uzyskania efektu prześwitu jest szacowanie i odejmowanie tła. Technika ta skanuje obraz strony w celu zbudowania modelu lokalnego koloru tła dla każdego piksela, w oparciu o założenie, że tło zmienia się powoli na stronie, podczas gdy tekst zmienia się gwałtownie. Model tła jest następnie odejmowany od oryginalnego obrazu, skutecznie usuwając prześwity, zachowując jednocześnie tekst na pierwszym planie. Narzędzia takie jak ScanTailor i silnik Tesseract OCR typu open source z wbudowanym modułem przetwarzania wstępnego wdrażają odmiany tej techniki.
Podobnym podejściem jest użycie filtra dwustronnego, który wygładza obraz, zachowując krawędzie. Filtr redukuje słabe prześwitywanie poprzez uśrednienie go z otaczającym tłem, ale zachowuje ostre krawędzie tekstu na pierwszym planie. Rezultatem jest czystszy obraz, w którym silnik OCR widzi wyraźny tekst na jednolitym tle. Filtrowanie dwustronne jest kosztowniejsze obliczeniowo niż proste ustalanie wartości progowych i zwykle zajmuje kilka sekund na stronę, ale poprawa jakości skanów papieru gazetowego jest warta czasu przetwarzania każdego dokumentu o trwałej wartości.
W przypadku skanów, w których prześwit jest szczególnie silny, technika zwana rozkładem falkowym może rozdzielić obraz na różne pasma częstotliwości. Przebicie, słabe i o niskim kontraście, zazwyczaj obejmuje składowe o niskiej amplitudzie pasm wysokiej częstotliwości. Wygaszając te komponenty i rekonstruując obraz z pozostałych pasm, można usunąć prześwitywanie, zachowując większość szczegółów tekstu. Technika ta wymaga specjalistycznego oprogramowania do przetwarzania obrazu, ale daje wyniki, których prostsze metody nie są w stanie uzyskać, szczególnie na stronach, na których tekst na odwrotnej stronie jest prawie tak ciemny jak tekst na pierwszym planie.
Krok po kroku: Konfiguracja skanowania w celu zminimalizowania prześwitu
Najlepszym sposobem poradzenia sobie z prześwitywaniem jest ograniczenie go w czasie skanowania. Umieść arkusz czarnego papieru za skanowaną stroną. Czarny podkład pochłania światło, które w przeciwnym razie przeszłoby przez cienki papier, odbija się od pokrywy skanera i oświetla tekst na odwrotnej stronie. Ten prosty krok może zmniejszyć prześwitywanie o 50 do 80 procent, w zależności od grubości papieru. W przypadku bardzo cienkiego papieru, np. papeterii lotniczej lub papieru biblijnego, w przypadku użytecznych skanów zasadniczo obowiązkowa jest czarna podkładka.
Skanuj z najwyższą rozdzielczością optyczną obsługiwaną przez skaner, zazwyczaj od 300 do 600 DPI w przypadku skanerów dokumentów. Wyższa rozdzielczość rejestruje więcej szczegółów tekstu na pierwszym planie w stosunku do prześwitu, a dodatkowe piksele zapewniają algorytmom przetwarzania wstępnego więcej danych do pracy. Skanuj w kolorze lub w skali szarości, a nie w czerni i bieli. Podczas skanowania czarno-białego obowiązuje sztywny próg, którego nie można cofnąć, a jeśli ten próg będzie nieprawidłowy w jakiejkolwiek części strony, informacje zostaną utracone na zawsze. Skanowanie w kolorze lub w skali szarości pozwala zachować pełny zakres tonalny i umożliwia eksperymentowanie z różnymi ustawieniami przetwarzania wstępnego po skanowaniu, co jest niezbędne w przypadku stron, których optymalny próg jest różny na całej stronie.
W przypadku dużych projektów PDF Archive inwestycja w odpowiednią technikę skanowania zwraca się wielokrotnie w postaci zmniejszonego wysiłku związanego z przetwarzaniem końcowym. Skan wymagający intensywnego wstępnego przetwarzania, aby nadawał się do OCR, będzie również wymagał intensywnego przetwarzania przed każdym przyszłym użyciem pliku, w tym wyświetlaniem, drukowaniem i przyszłym ponownym przetwarzaniem przy użyciu lepszej technologii OCR. Prawidłowe wykonanie skanu za pierwszym razem jest najbardziej opłacalnym krokiem w każdym projekcie digitalizacji.
Korekta i weryfikacja po OCR
Po uruchomieniu OCR na wstępnie przetworzonym skanie dane wyjściowe nadal będą zawierać błędy na trudnych stronach. Uruchom moduł sprawdzania pisowni w rozpoznanym tekście, aby oznaczyć prawdopodobne błędy OCR. Słowa, które moduł sprawdzania pisowni oznaczy jako błędne, nadają się do ręcznej korekty. W przypadku dokumentów krytycznych poproś człowieka o sprawdzenie losowej próbki stron i porównanie tekstu OCR z oryginalnym skanem, aby oszacować poziom błędów. 95-procentowy współczynnik dokładności oznacza, że około jedno słowo na dwadzieścia jest błędne, co może być akceptowalne do celów wyszukiwania, ale nie do tworzenia wiernej transkrypcji cyfrowej.
W przypadku ważnych projektów PDF Searchable rozważ użycie dwóch różnych silników OCR na tym samym wstępnie przetworzonym skanie i porównanie ich wyników. Kiedy oba silniki zgadzają się co do słowa, prawie na pewno jest ono poprawne. Jeśli się nie zgadzają, obie wersje nadają się do ręcznego sprawdzenia. To podejście oparte na dwóch silnikach zmniejsza obciążenie pracą związaną z ręczną korektą, wyświetlając tylko naprawdę niejednoznaczny tekst, zamiast wymagać od recenzenta przeczytania każdej strony dokumentu, który może mieć setki stron.
Wysiłek związany z właściwym przetwarzaniem i walidacją jest uzasadniony, gdy zeskanowane dokumenty mają długoterminową wartość. Artykuł z papieru gazetowego z 1950 r., który został raz zdigitalizowany, starannie przetworzony i sprawdzony pod kątem dokładności, będzie można przeszukiwać i cytować przez dziesięciolecia. Ten sam artykuł zdigitalizowany z ustawieniami domyślnymi i bez wstępnego przetwarzania może wygenerować wynik OCR tak zniekształcony, że w rzeczywistości zostanie on utracony podczas wyszukiwania, mimo że człowiek nadal doskonale odczytuje oryginalny zeskanowany obraz.
Dla instytucji zarządzających dużymi zbiorami gazet historycznych opracowanie ustandaryzowanego procesu wstępnego przetwarzania jest inwestycją, która procentuje w każdym przyszłym projekcie digitalizacji i każdym przyszłym zapytaniu badacza dotyczącym zbioru. Proces powinien być udokumentowany z uwzględnieniem konkretnych ustawień dla każdego modelu skanera i rodzaju papieru, aby nowi pracownicy mogli odtworzyć wyniki bez prób i błędów. Dobrze udokumentowany potok umożliwia także ponowne przetworzenie kolekcji, gdy technologia OCR ulegnie poprawie, przy zastosowaniu tego samego przetwarzania wstępnego ze zaktualizowanymi silnikami rozpoznawania, aby wyodrębnić lepszy tekst z tych samych nieprzetworzonych skanów bez konieczności wracania do oryginalnych dokumentów fizycznych.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
