Je comprimeert een gescande PDF en de bestandsgrootte daalt van 15 MB naar 2 MB. De cijfers zien er geweldig uit. Vervolgens opent u het gecomprimeerde bestand en de tekst, die in het origineel helder en scherp was, ziet er nu zacht, wazig en enigszins onscherp uit. De compressie werkte, maar werkte te agressief op de tekst, en het document is moeilijker te lezen dan voorheen.
Dit is de meest voorkomende klacht over compressie, en dit gebeurt omdat de meeste compressietools de hele pagina als één afbeelding behandelen. Ze kunnen geen onderscheid maken tussen de tekst die scherp moet blijven en de achtergrond of foto's die zwaardere compressie kunnen verdragen. Om de tekstscherpte tijdens compressie te behouden, is het nodig dat u begrijpt welke instellingen de leesbaarheid van tekst beïnvloeden en dat u een compressieaanpak kiest die prioriteit geeft aan de delen van het document die mensen daadwerkelijk moeten lezen.

Waarom compressie tekst überhaupt vervaagt
PDF-compressie werkt door de resolutie van afbeeldingen die in het bestand zijn ingesloten, te verlagen. Bij een gescande PDF is elke pagina een afbeelding, inclusief de tekst. Wanneer de compressie-engine de paginaafbeelding opnieuw bemonstert van 300 DPI naar 150 DPI, wordt de helft van de pixels in elke dimensie weggegooid, waardoor er slechts één pixel op de vier overblijft. De fijne randen van lettervormen, de dunne horizontale lijnen van een kleine letter ‘t’, de subtiele rondingen die een "c" van een "e," ze vertrouwen allemaal op die weggegooide pixels om er scherp uit te zien. Bij 150 DPI is een 12-punts teken dat in de originele scan 50 pixels hoog was, nu 25 pixels hoog. Bij 100 DPI is het ongeveer 17 pixels hoog. Bij 72 DPI is het ongeveer 12 pixels hoog, nauwelijks genoeg pixels om een herkenbare letter weer te geven.
Het type downsampling-algoritme is ook van belang. Bicubische downsampling, waarbij nieuwe pixelwaarden worden berekend door het middelen van omringende pixels, behoudt vloeiende gradiënten in foto's, maar verzacht de harde randen van lettervormen. Subsampling, waarbij één pixel uit elk blok wordt gekozen en de rest wordt weggegooid, behoudt de scherpte van de randen beter, maar kan grillige artefacten introduceren. Voor documenten met veel tekst is bicubische downsampling bij een te lage resolutie de combinatie die de zachte, vage tekst produceert waar mensen over klagen. Een betere aanpak is om een hogere doelresolutie te kiezen, minimaal 150 DPI voor tekst, of om een compressiemethode te gebruiken die tekst en afbeeldingen anders kan behandelen.
Probeer PDF comprimeren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
De juiste compressie-instellingen kiezen voor documenten met veel tekst
Voor PDF-compressie van gescande documenten waarbij de leesbaarheid van de tekst prioriteit heeft, leveren een paar specifieke instellingen consistent goede resultaten op. Stel de doelresolutie in op 150 DPI. Hierdoor blijft voldoende pixeldichtheid behouden om 10-punts tekst scherp te houden, terwijl de bestandsgrootte nog steeds met 50% tot 70% wordt verkleind. Ga niet onder de 150 DPI voor documenten die op het scherm worden gelezen. Bij 100 DPI wordt 10-punts tekst merkbaar zacht. Bij 72 DPI begint zelfs 12-punts tekst te verslechteren.
Kies JBIG2-compressie voor zwart-wittekstpagina's. JBIG2 is speciaal ontworpen voor monochrome documentafbeeldingen en bereikt dramatisch betere compressieverhoudingen dan JPEG op tekst, terwijl de karakterscherpte behouden blijft. Het werkt door terugkerende patronen te identificeren, waarbij elke instantie van de letter "e" ziet er bijna identiek uit en slaat elk patroon één keer op. Dit is ideaal voor getypte documenten. Voor pagina's die tekst combineren met foto's of kleurelementen, gebruikt u JPEG2000 met een gemiddelde tot hoge kwaliteitsinstelling. JPEG2000 verwerkt gemengde inhoud beter dan standaard JPEG en introduceert minder zichtbare artefacten bij dezelfde compressieverhouding.
Schakel MRC-compressie (Mixed Raster Content) in als uw tool dit ondersteunt. MRC verdeelt elke pagina in lagen: een tekstlaag die op een hoge resolutie wordt gehouden voor scherpte, een afbeeldingslaag die agressiever is gecomprimeerd en een achtergrondlaag. Deze op lagen gebaseerde aanpak, gebruikt door de compressie-engine, behoudt de scherpte van de tekst, terwijl toch een aanzienlijke algehele verkleining wordt bereikt. De tekst blijft scherp omdat deze wordt gecomprimeerd met een verliesvrije of bijna-verliesloze methode, terwijl de achtergrond en afbeeldingen het grootste deel van de compressie absorberen.
Compressieresultaten testen voordat u deze vastlegt
Open na de compressie het gecomprimeerde bestand en voer een vergelijking met het origineel uit. Zoom naar 100% en vergelijk dezelfde alinea tekst. Kijk naar de kleine letters "e," "een," en "s," die de fijnste details hebben en als eerste kapot gaan. Als deze letters er scherp uitzien en hun interne vormen duidelijk gedefinieerd zijn, zijn de compressie-instellingen geschikt. Als de tellers, de omsloten ruimtes binnenin letters, beginnen op te vullen of de letterranden er zacht uitzien, was de compressie te agressief.
Druk een testpagina af als het document wordt afgedrukt. Compressieartefacten die op het scherm onzichtbaar zijn, kunnen op papier zichtbaar worden omdat printers een resolutie van 300 tot 600 DPI weergeven, hoger dan de meeste schermen. Een document dat er op een monitor met 150 DPI acceptabel uitziet, kan er zacht uitzien als het wordt afgedrukt met 300 DPI, omdat de printer de ontbrekende details onthult. De tool PDF-grootte verkleinen van WukongPDF biedt een voorbeeldmodus die de afgedrukte uitvoer op verschillende compressieniveaus simuleert, zodat u de leesbaarheid van de tekst kunt verifiëren voordat u de compressie-instellingen voltooit.
Wat te doen als de compressie de tekst al wazig heeft gemaakt
Als je een PDF hebt gecomprimeerd en de tekst is nu wazig, en je hebt niet langer het originele, niet-gecomprimeerde bestand, dan is de situatie moeilijk, maar niet altijd hopeloos. Als de compressie werd toegepast op een PDF die oorspronkelijk een aparte tekstlaag had, kan het uitvoeren van OCR op het gecomprimeerde bestand de doorzoekbaarheid herstellen, maar niet de visuele scherpte van de originele tekst. OCR voegt een tekstlaag toe achter de wazige afbeelding. Het beeld blijft wazig. Voor gescande PDF's, die geen afzonderlijke tekstlaag hebben, is het enige herstelpad het lokaliseren van de originele scan of het opnieuw scannen van het fysieke document met een hogere resolutie en het vermijden van herhaling van dezelfde compressiefout.
Dit is de reden waarom het behouden van het originele, ongecomprimeerde bestand de allerbelangrijkste compressiegewoonte is. Compressie moet altijd een kopie opleveren en nooit het origineel overschrijven. Opslag is goedkoop. De paar megabytes die worden bespaard door het origineel te verwijderen, zijn veel minder waard dan de uren die nodig zijn om een document opnieuw te maken op basis van een wazige, gecomprimeerde kopie. De compressietool genereert altijd een nieuw bestand, waarbij het geüploade origineel onaangetast blijft. Deze ontwerpkeuze voorkomt het maar al te vaak voorkomende scenario waarbij je pas beseft dat de compressie-instellingen verkeerd waren nadat het origineel verdwenen is.
Kleurendocumenten comprimeren zonder afbeeldingen uit te wassen
Documenten die tekst combineren met kleurenafbeeldingen vormen een dubbele uitdaging: de tekst heeft een hoge resolutie nodig voor leesbaarheid, en de afbeeldingen hebben kleurgetrouwheid nodig. De oplossing is om een compressietool te gebruiken die verschillende instellingen toepast op verschillende inhoudstypen op dezelfde pagina. WukongPDF detecteert automatisch tekstgebieden en afbeeldingsgebieden binnen elke pagina en past op elke pagina de juiste compressie toe. Tekstgebieden krijgen verliesvrije of vrijwel verliesloze compressie met een hogere effectieve resolutie. Beeldgebieden krijgen JPEG- of JPEG2000-compressie met een lagere resolutie. Het resultaat is een uitvoer van PDF-kwaliteit waarin zowel tekst als afbeeldingen er goed uitzien, en de bestandsgrootte aanzienlijk kleiner is dan die van het ongecomprimeerde origineel.
De belangrijkste conclusie is dat onscherpe tekst na compressie geen onvermijdelijke afweging is. Dit is het resultaat van compressie-instellingen die niet zijn geoptimaliseerd voor de inhoud van het document. Een scan met veel tekst heeft andere instellingen nodig dan een fotoalbum. Door de juiste instellingen voor het document voor u te kiezen en altijd het origineel te behouden, zorgt u ervoor dat compressie de belofte van kleinere bestanden waarmaakt, zonder dat dit ten koste gaat van de leesbaarheid die het document in de eerste plaats nuttig maakt.
Een laatste overweging die veel mensen over het hoofd zien, is het effect van het compressieformaat op toekomstige bewerkingen. Als de gecomprimeerde PDF later OCR, extra compressie of formaatconversie nodig heeft, overleeft een matig gecomprimeerd bestand van 150 DPI met verliesvrije tekstcodering die daaropvolgende bewerkingen veel beter dan een zwaar gecomprimeerd bestand van 72 DPI met verliesvrije JPEG. Elke hercompressie van een bestand met verlies vergroot het kwaliteitsverlies. De eerste compressie is misschien nauwelijks merkbaar. De tweede, toegepast op het reeds gecomprimeerde bestand, verslechtert de tekst tot het punt van onleesbaarheid. Wanneer u een PDF comprimeert, neemt u niet alleen een beslissing over de huidige bestandsgrootte, maar ook over hoeveel kwaliteitsruimte er overblijft voor welke bewerkingen het bestand dan ook in de toekomst zal ondergaan. Een gematigde compressie vandaag laat ruimte voor morgen. Een agressieve compressie put die kamer in één stap uit.
Probeer PDF comprimeren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
