Kompresujesz zeskanowany plik PDF, a rozmiar pliku spada z 15 MB do 2 MB. Liczby wyglądają świetnie. Następnie otwierasz skompresowany plik, a tekst, który w oryginale był wyraźny i ostry, teraz wygląda na miękki, rozmyty i nieco nieostry. Kompresja zadziałała, ale zadziałała zbyt agresywnie na tekst, przez co dokument jest trudniejszy do odczytania niż wcześniej.
Jest to najczęstsza skarga dotycząca kompresji, a dzieje się tak, ponieważ większość narzędzi do kompresji traktuje całą stronę jako pojedynczy obraz. Nie potrafią rozróżnić tekstu, który musi zachować ostrość, od tła lub fotografii, które tolerują większą kompresję. Zachowanie ostrości tekstu podczas kompresji wymaga zrozumienia, które ustawienia wpływają na czytelność tekstu i wybrania metody kompresji, która priorytetowo traktuje te części dokumentu, które użytkownicy faktycznie muszą przeczytać.

Dlaczego kompresja zamazuje tekst
Kompresja PDF polega na zmniejszeniu rozdzielczości obrazów osadzonych w pliku. W przypadku zeskanowanego pliku PDF każda strona, łącznie z tekstem, jest obrazem. Kiedy silnik kompresji ponownie próbkuje obraz strony z 300 DPI do 150 DPI, odrzuca połowę pikseli w każdym wymiarze, pozostawiając tylko jeden piksel z każdych czterech. Delikatne krawędzie liter, cienkie poziome kreski małej litery „t” subtelne krzywizny wyróżniające literę „c” od „e” wszystkie polegają na tych odrzuconych pikselach, aby wyglądać ostro. Przy rozdzielczości 150 DPI 12-punktowy znak, który na oryginalnym skanie miał 50 pikseli wysokości, ma teraz 25 pikseli wysokości. Przy 100 DPI ma około 17 pikseli wysokości. Przy rozdzielczości 72 DPI ma około 12 pikseli wysokości, co stanowi ledwo wystarczającą liczbę pikseli, aby wyrenderować rozpoznawalną literę.
Rodzaj algorytmu downsamplingu również ma znaczenie. Próbkowanie dwusześcienne, które oblicza nowe wartości pikseli poprzez uśrednianie otaczających pikseli, pozwala zachować gładkie gradienty na zdjęciach, ale zmiękcza ostre krawędzie liter. Podpróbkowanie, które wybiera jeden piksel z każdego bloku i odrzuca resztę, lepiej zachowuje ostrość krawędzi, ale może powodować postrzępione artefakty. W przypadku dokumentów zawierających dużo tekstu, dwusześcienne próbkowanie w zbyt niskiej rozdzielczości to kombinacja, która powoduje powstanie miękkiego, rozmytego tekstu, na który narzekają ludzie. Lepszym podejściem jest wybranie wyższej rozdzielczości docelowej, minimum 150 DPI dla tekstu, lub użycie metody kompresji, która pozwala na odmienne traktowanie tekstu i obrazów.
Wypróbuj opcję Kompresuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Wybór odpowiednich ustawień kompresji dla dokumentów zawierających dużo tekstu
W przypadku Kompresja PDF zeskanowanych dokumentów, gdzie czytelność tekstu jest priorytetem, kilka określonych ustawień zapewnia niezmiennie dobre wyniki. Ustaw docelową rozdzielczość na 150 DPI. Zachowuje to wystarczającą gęstość pikseli, aby 10-punktowy tekst pozostał wyraźny, a jednocześnie zapewnia zmniejszenie rozmiaru pliku o 50% do 70%. Nie schodź poniżej 150 DPI dla dokumentów, które będą czytane na ekranie. Przy rozdzielczości 100 DPI 10-punktowy tekst staje się zauważalnie miękki. Przy 72 DPI nawet 12-punktowy tekst zaczyna się pogarszać.
Wybierz kompresję JBIG2 dla czarno-białych stron tekstowych. JBIG2 został zaprojektowany specjalnie dla monochromatycznych obrazów dokumentów i osiąga znacznie lepsze współczynniki kompresji niż JPEG w przypadku tekstu, zachowując jednocześnie ostrość znaków. Działa poprzez identyfikację powtarzających się wzorców, każdego wystąpienia litery „e”; wygląda prawie identycznie i zapisuje każdy wzór raz. Jest to idealne rozwiązanie w przypadku dokumentów pisanych na maszynie. W przypadku stron zawierających tekst ze zdjęciami lub elementami kolorowymi użyj formatu JPEG2000 ze średnim lub wysokim ustawieniem jakości. JPEG2000 radzi sobie z mieszaną zawartością lepiej niż standardowy JPEG i wprowadza mniej widocznych artefaktów przy tym samym stopniu kompresji.
Włącz kompresję MRC (Mixed Raster Content), jeśli Twoje narzędzie ją obsługuje. MRC dzieli każdą stronę na warstwy: warstwę tekstową o wysokiej rozdzielczości zapewniającej ostrość, warstwę obrazu skompresowaną bardziej agresywnie i warstwę tła. To podejście oparte na warstwach, stosowane przez silnik kompresji, zachowuje ostrość tekstu, jednocześnie osiągając znaczną ogólną redukcję rozmiaru. Tekst pozostaje wyraźny, ponieważ jest kompresowany metodą bezstratną lub prawie bezstratną, podczas gdy tło i obrazy pochłaniają większość kompresji.
Sprawdzanie wyników kompresji przed wykonaniem
Po skompresowaniu otwórz skompresowany plik i wykonaj bezpośrednie porównanie z oryginałem. Powiększ do 100% i porównaj ten sam akapit tekstu. Spójrz na małe litery „e” „a” i „s” które mają najdrobniejsze szczegóły i jako pierwsze ulegają degradacji. Jeśli litery te wyglądają ostro, a ich wewnętrzne kształty są wyraźnie określone, ustawienia kompresji są odpowiednie. Jeśli liczniki, czyli zamknięte przestrzenie wewnątrz liter, zaczynają się wypełniać lub krawędzie liter wydają się miękkie, oznacza to, że kompresja była zbyt agresywna.
Wydrukuj stronę testową, jeśli dokument będzie drukowany. Artefakty kompresji, które są niewidoczne na ekranie, mogą być widoczne na papierze, ponieważ drukarki renderują z rozdzielczością od 300 do 600 DPI, czyli wyższą niż większość ekranów. Dokument, który wygląda akceptowalnie na monitorze w rozdzielczości 150 DPI, może wyglądać na miękki po wydrukowaniu w rozdzielczości 300 DPI, ponieważ drukarka odsłania brakujące szczegóły. Narzędzie Zmniejsz rozmiar pliku PDF WukongPDF zapewnia tryb podglądu, który symuluje wydruk przy różnych poziomach kompresji, umożliwiając sprawdzenie czytelności tekstu przed sfinalizowaniem ustawień kompresji.
Co zrobić, gdy kompresja już zamazała tekst
Jeśli skompresowałeś plik PDF i tekst jest teraz rozmazany, a nie masz już oryginalnego, nieskompresowanego pliku, sytuacja jest trudna, ale nie zawsze beznadziejna. Jeśli kompresja została zastosowana do pliku PDF, który pierwotnie miał oddzielną warstwę tekstową, uruchomienie OCR na skompresowanym pliku może przywrócić możliwość wyszukiwania, ale nie może przywrócić ostrości wizualnej oryginalnego tekstu. OCR dodaje warstwę tekstową za rozmytym obrazem. Obraz pozostaje niewyraźny. W przypadku zeskanowanych plików PDF, które nie mają oddzielnej warstwy tekstowej, jedyną ścieżką odzyskiwania jest zlokalizowanie oryginalnego skanu lub ponowne zeskanowanie dokumentu fizycznego w wyższej rozdzielczości i uniknięcie powtórzenia tego samego błędu kompresji.
Właśnie dlatego przechowywanie oryginalnego, nieskompresowanego pliku jest najważniejszym nawykiem kompresji. Kompresja powinna zawsze tworzyć kopię, nigdy nie nadpisywać oryginału. Przechowywanie jest niedrogie. Kilka megabajtów zaoszczędzonych w wyniku usunięcia oryginału jest wartych znacznie mniej niż godziny potrzebne na odtworzenie dokumentu z niewyraźnej, skompresowanej kopii. Narzędzie do kompresji zawsze generuje nowy plik, pozostawiając przesłany oryginał niezmieniony. Ten wybór projektu zapobiega zbyt powszechnemu scenariuszowi, w którym zorientujemy się, że ustawienia kompresji były nieprawidłowe dopiero po zniknięciu oryginału.
Kompresja kolorowych dokumentów bez rozmycia obrazów
Dokumenty zawierające tekst i kolorowe obrazy stanowią podwójne wyzwanie: tekst wymaga wysokiej rozdzielczości, aby był czytelny, a obrazy wymagają wierności kolorów. Rozwiązaniem jest użycie narzędzia do kompresji, które stosuje różne ustawienia do różnych typów treści na tej samej stronie. WukongPDF automatycznie wykrywa obszary tekstu i obszary obrazu na każdej stronie i stosuje do nich odpowiednią kompresję. Regiony tekstowe podlegają kompresji bezstratnej lub prawie bezstratnej w wyższej efektywnej rozdzielczości. Regiony obrazu otrzymują kompresję JPEG lub JPEG2000 w niższej rozdzielczości. Rezultatem jest wynik Jakość PDF, w którym zarówno tekst, jak i obrazy wyglądają dobrze, a rozmiar pliku jest znacznie mniejszy niż nieskompresowany oryginał.
Najważniejszym wnioskiem jest to, że rozmycie tekstu po kompresji nie jest nieuniknionym kompromisem. Jest to wynikiem ustawień kompresji, które nie zostały zoptymalizowane pod kątem zawartości dokumentu. Skan zawierający dużo tekstu wymaga innych ustawień niż album ze zdjęciami. Wybór odpowiednich ustawień dla dokumentu, który masz przed sobą i zawsze zachowanie oryginału, gwarantuje, że kompresja spełni obietnicę dotyczącą mniejszych plików, bez utraty czytelności, która przede wszystkim sprawia, że dokument jest użyteczny.
Ostatnią kwestią, którą wiele osób przeocza, jest wpływ formatu kompresji na przyszłe edycje. Jeśli skompresowany plik PDF będzie później wymagał OCR, dodatkowej kompresji lub konwersji formatu, umiarkowanie skompresowany plik przy rozdzielczości 150 DPI z bezstratnym kodowaniem tekstu przetrwa te kolejne operacje znacznie lepiej niż mocno skompresowany plik przy rozdzielczości 72 DPI ze stratnym JPEG. Każda rekompresja pliku stratnego pogłębia utratę jakości. Pierwsza kompresja może być ledwo zauważalna. Drugi, zastosowany do już skompresowanego pliku, powoduje degradację tekstu do tego stopnia, że staje się on nieczytelny. Kompresując plik PDF, podejmujesz decyzję nie tylko o rozmiarze tego pliku dzisiaj, ale także o tym, ile zapasów jakościowych pozostanie na potrzeby wszelkich operacji, jakie plik może przejść w przyszłości. Umiarkowana kompresja dzisiaj pozostawia miejsce na jutro. Agresywna kompresja wyczerpuje to pomieszczenie w jednym kroku.
Wypróbuj opcję Kompresuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
