Comprimi un PDF scansionato e la dimensione del file scende da 15 MB a 2 MB. I numeri sembrano fantastici. Quindi apri il file compresso e il testo, che era nitido e nitido nell'originale, ora appare morbido, sfocato e leggermente sfocato. La compressione ha funzionato, ma in modo troppo aggressivo sul testo e il documento è più difficile da leggere rispetto a prima.
Questo è il problema di compressione più comune e si verifica perché la maggior parte degli strumenti di compressione tratta l'intera pagina come una singola immagine. Non riescono a distinguere tra il testo che deve rimanere nitido e lo sfondo o le fotografie che possono tollerare una compressione più pesante. Per preservare la nitidezza del testo durante la compressione è necessario comprendere quali impostazioni influiscono sulla leggibilità del testo e scegliere un approccio di compressione che dia priorità alle parti del documento che le persone effettivamente devono leggere.

Perché la compressione offusca il testo in primo luogo
La compressione PDF funziona riducendo la risoluzione delle immagini incorporate nel file. Per un PDF scansionato, ogni pagina è un'immagine, incluso il testo. Quando il motore di compressione ricampiona l'immagine della pagina da 300 DPI a 150 DPI, scarta metà dei pixel in ciascuna dimensione, mantenendo solo un pixel su quattro. I bordi sottili delle lettere, i sottili tratti orizzontali di una "t" minuscola; le sottili curve che contraddistinguono una "c" da una "e", tutti fanno affidamento su quei pixel scartati per apparire nitidi. A 150 DPI, un carattere di 12 punti che era alto 50 pixel nella scansione originale ora è alto 25 pixel. A 100 DPI, è alto circa 17 pixel. A 72 DPI, è alto circa 12 pixel, appena sufficienti per rendere una lettera riconoscibile.
Anche il tipo di algoritmo di downsampling è importante. Il downsampling bicubico, che calcola i nuovi valori dei pixel calcolando la media dei pixel circostanti, preserva i gradienti uniformi nelle fotografie ma ammorbidisce i bordi netti delle forme delle lettere. Il sottocampionamento, che preleva un pixel da ciascun blocco e scarta il resto, preserva meglio la nitidezza dei bordi ma può introdurre artefatti frastagliati. Per i documenti ricchi di testo, il downsampling bicubico a una risoluzione troppo bassa è la combinazione che produce il testo morbido e sfocato di cui le persone si lamentano. Un approccio migliore consiste nello scegliere una risoluzione target più elevata, minimo 150 DPI per il testo, oppure utilizzare un metodo di compressione in grado di trattare testo e immagini in modo diverso.
Prova a comprimere PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Scegliere le giuste impostazioni di compressione per documenti molto ricchi di testo
Per Compressione PDF di documenti scansionati in cui la leggibilità del testo è la priorità, alcune impostazioni specifiche producono risultati costantemente buoni. Imposta la risoluzione target su 150 DPI. Ciò mantiene una densità di pixel sufficiente affinché il testo di 10 punti rimanga nitido pur garantendo una riduzione delle dimensioni del file dal 50% al 70%. Non scendere sotto i 150 DPI per i documenti che verranno letti sullo schermo. A 100 DPI, il testo a 10 punti diventa notevolmente morbido. A 72 DPI, anche il testo a 12 punti inizia a peggiorare.
Scegli la compressione JBIG2 per le pagine di testo in bianco e nero. JBIG2 è progettato specificamente per immagini di documenti monocromatiche e raggiunge rapporti di compressione notevolmente migliori rispetto a JPEG sul testo, preservando la nitidezza dei caratteri. Funziona identificando schemi ricorrenti, ogni istanza della lettera "e" sembra quasi identico e memorizza ogni modello una volta. Questo è l'ideale per i documenti digitati. Per le pagine che mescolano testo con fotografie o elementi di colore, utilizzare JPEG2000 con un'impostazione di qualità da media ad alta. JPEG2000 gestisce i contenuti misti meglio del JPEG standard e introduce meno artefatti visibili con lo stesso rapporto di compressione.
Abilita la compressione MRC (Mixed Raster Content) se il tuo strumento la supporta. MRC separa ogni pagina in livelli: un livello di testo mantenuto ad alta risoluzione per la nitidezza, un livello di immagine compresso in modo più aggressivo e un livello di sfondo. Questo approccio basato su livelli, utilizzato dal motore di compressione, preserva la nitidezza del testo pur ottenendo una significativa riduzione delle dimensioni complessive. Il testo rimane nitido perché è compresso con un metodo senza o quasi senza perdita di dati, mentre lo sfondo e le immagini assorbono la maggior parte della compressione.
Verificare i risultati della compressione prima del commit
Dopo la compressione, apri il file compresso ed esegui un confronto affiancato con l'originale. Ingrandisci al 100% e confronta lo stesso paragrafo di testo. Osserva le lettere minuscole "e" "un", e "s", che hanno i dettagli più fini e sono i primi a degradarsi. Se queste lettere appaiono nitide e le loro forme interne sono chiaramente definite, le impostazioni di compressione sono appropriate. Se i contatori, gli spazi racchiusi all'interno delle lettere, iniziano a riempirsi o i bordi delle lettere appaiono morbidi, la compressione è stata troppo aggressiva.
Stampare una pagina di prova se il documento verrà stampato. Gli artefatti di compressione invisibili sullo schermo possono diventare evidenti sulla carta perché le stampanti eseguono il rendering a una risoluzione compresa tra 300 e 600 DPI, superiore rispetto alla maggior parte degli schermi. Un documento che appare accettabile su un monitor a 150 DPI potrebbe apparire morbido se stampato a 300 DPI perché la stampante rivela i dettagli mancanti. Lo strumento Riduci dimensioni PDF di WukongPDF fornisce una modalità di anteprima che simula l'output stampato a diversi livelli di compressione, consentendo di verificare la leggibilità del testo prima di finalizzare le impostazioni di compressione.
Cosa fare quando la compressione ha già offuscato il testo
Se hai compresso un PDF e il testo ora è sfocato, e non hai più il file originale non compresso, la situazione è difficile ma non sempre disperata. Se la compressione è stata applicata a un PDF che originariamente aveva un livello di testo separato, l'esecuzione dell'OCR sul file compresso può ripristinare la possibilità di ricerca, ma non può ripristinare la nitidezza visiva del testo originale. L'OCR aggiunge uno strato di testo dietro l'immagine sfocata. L'immagine rimane sfocata. Per i PDF scansionati, che non hanno un livello di testo separato, l'unico percorso di ripristino è individuare la scansione originale o eseguire nuovamente la scansione del documento fisico a una risoluzione più elevata ed evitare di ripetere lo stesso errore di compressione.
Questo è il motivo per cui mantenere il file originale non compresso è l'abitudine di compressione più importante. La compressione dovrebbe sempre produrre una copia e mai sovrascrivere l'originale. Lo stoccaggio è economico. I pochi megabyte salvati cancellando l'originale valgono molto meno delle ore necessarie per ricreare un documento da una copia compressa sfocata. Lo strumento di compressione genera sempre un nuovo file, lasciando intatto l'originale caricato. Questa scelta progettuale impedisce lo scenario fin troppo comune di rendersi conto che le impostazioni di compressione erano errate solo dopo la scomparsa dell'originale.
Compressione di documenti a colori senza sbiadire le immagini
I documenti che mescolano testo e immagini a colori presentano una doppia sfida: il testo necessita di un'alta risoluzione per essere leggibile e le immagini necessitano di fedeltà dei colori. La soluzione è utilizzare uno strumento di compressione che applichi impostazioni diverse a diversi tipi di contenuto sulla stessa pagina. WukongPDF rileva automaticamente le aree di testo e le aree di immagine all'interno di ciascuna pagina e applica a ciascuna la compressione appropriata. Le aree di testo ricevono una compressione senza o quasi senza perdita con una risoluzione effettiva più elevata. Le regioni dell'immagine ricevono la compressione JPEG o JPEG2000 a una risoluzione inferiore. Il risultato è un output di Qualità PDF in cui sia il testo che le immagini hanno un bell'aspetto e la dimensione del file è notevolmente inferiore rispetto all'originale non compresso.
Il punto fondamentale è che la sfocatura del testo dopo la compressione non è un compromesso inevitabile. È il risultato di impostazioni di compressione non ottimizzate per il contenuto del documento. Una scansione ricca di testo richiede impostazioni diverse rispetto a un album fotografico. Scegliere le impostazioni giuste per il documento che hai di fronte e mantenere sempre l'originale garantisce che la compressione mantenga la promessa di file più piccoli senza sacrificare la leggibilità che rende il documento utile in primo luogo.
Un'ultima considerazione che molte persone trascurano è l'effetto del formato di compressione sulle modifiche future. Se il PDF compresso avrà successivamente bisogno di OCR, compressione aggiuntiva o conversione del formato, un file moderatamente compresso a 150 DPI con codifica del testo senza perdita di dati sopravvive alle operazioni successive molto meglio di un file fortemente compresso a 72 DPI con JPEG con perdita. Ogni ricompressione di un file con perdita aggrava la perdita di qualità. La prima compressione potrebbe essere appena percettibile. Il secondo, applicato al file già compresso, degrada il testo fino a renderlo illeggibile. Quando comprimi un PDF, stai prendendo una decisione non solo sulla dimensione attuale del file, ma su quanto margine di qualità rimane per qualunque operazione il file potrebbe subire in futuro. Una moderata compressione oggi lascia spazio al domani. Una compressione aggressiva esaurisce quella stanza in un solo passaggio.
Prova a comprimere PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
