Apri un PDF che ieri era perfettamente leggibile. Oggi ogni pagina mostra simboli casuali invece del testo. Le lettere sono state sostituite da caselle quadrate, punti interrogativi, segni più o stringhe di caratteri completamente indipendenti come "%$#@!" dove dovrebbero essere le frasi. La struttura del documento è intatta. Le pagine ci sono. Le immagini vanno bene. Ma ogni parola su ogni pagina è stata trasformata in parole senza senso.
Si tratta di un errore di codifica dei caratteri ed è uno dei problemi PDF più allarmanti perché sembra che il file sia stato danneggiato in modo irreparabile. Nella maggior parte dei casi, il contenuto è intatto. Il PDF utilizza codici carattere che il visualizzatore non può associare alle forme corrette delle lettere. La correzione di solito comporta la riparazione della codifica dei caratteri, l'installazione del carattere mancante o il rendering del PDF tramite un motore che risolve correttamente la codifica.

Le tre cause più comuni di testo senza senso nei PDF
Causa uno: caratteri mancanti senza fallback incorporato. Il PDF è stato creato utilizzando un carattere non incorporato nel file e sul tuo sistema non è installato quel carattere. Il visualizzatore PDF tenta di sostituire un carattere diverso, ma il sostituto utilizza una codifica dei caratteri diversa. Il codice carattere che significava "A" nel carattere originale significa qualcos'altro nel carattere sostitutivo. Lo spettatore rende fedelmente il carattere sostitutivo, motivo per cui ogni lettera sulla pagina viene sostituita da un simbolo diverso.
Causa due: dati dei caratteri danneggiati all'interno del PDF. Il carattere è incorporato, ma i dati del carattere incorporato sono danneggiati. Ciò può accadere quando un PDF viene parzialmente scaricato, trasferito tramite un sistema di posta elettronica che modifica i dati binari o archiviato su un dispositivo di archiviazione guasto. I dati del carattere sono presenti ma contengono errori che causano un'errata interpretazione dei codici carattere da parte del motore di rendering. Il testo sembra casuale, ma in realtà è il risultato deterministico di un input danneggiato. Ogni volta che apri il file, lo stesso testo appare con le stesse parole senza senso perché la corruzione è nei dati dei caratteri memorizzati, non in un errore di rendering temporaneo.
Causa tre: codifica dei caratteri errata specificata nel PDF. Il PDF contiene una voce /Encoding che indica allo spettatore come mappare i codici dei caratteri sui glifi, ma la codifica specificata non corrisponde al modo in cui il testo è stato effettivamente scritto. Ciò accade più spesso con i PDF creati da software meno recenti o non standard che scrivevano il testo utilizzando una codifica ma dichiaravano una codifica diversa nei metadati del file. Lo spettatore applica la codifica dichiarata e produce parole senza senso. Se invece applicasse la codifica effettiva utilizzata dal creatore, il testo verrebbe visualizzato correttamente. Questa discrepanza tra la codifica dichiarata e quella effettiva è la più risolvibile delle tre cause perché i dati di testo sono intatti. Solo le istruzioni di mappatura sono sbagliate.
Prova a riparare PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Come diagnosticare quale problema presenta il tuo PDF
Una rapida serie di test restringe la causa. Innanzitutto, apri il PDF in un visualizzatore diverso. Se viene visualizzato correttamente in Adobe Acrobat ma mostra incomprensibili nel tuo browser, il problema è il renderer PDF del browser, non il file. Installa il carattere mancante o utilizza un visualizzatore diverso. Se il PDF mostra incomprensioni in ogni visualizzatore, il problema è nel file stesso.
In secondo luogo, controlla l'elenco Caratteri PDF nelle proprietà del documento. In Acrobat, vai su File, Proprietà, Caratteri. Se l'elenco dei caratteri mostra caratteri contrassegnati come non incorporati e tali caratteri non sono installati nel sistema, si è verificato un problema di carattere mancante. Installa il carattere o apri il file su un sistema che lo dispone. Se l'elenco dei caratteri mostra caratteri incorporati ma il testo è ancora incomprensibile, è probabile che i dati dei caratteri incorporati siano danneggiati.
Terzo, prova a selezionare e copiare il testo senza senso. Incollalo in un editor di testo. Se il testo incollato è il testo originale corretto, i caratteri vengono memorizzati correttamente nel PDF ma la mappatura della visualizzazione è interrotta. Ciò indica una mancata corrispondenza della dichiarazione di codifica. I dati del testo sono buoni. Lo spettatore lo sta semplicemente visualizzando in modo sbagliato. Se anche il testo incollato è incomprensibile, i dati del carattere stesso sono danneggiati, il che è un problema più profondo.
Come risolvere un PDF che mostra simboli casuali
Per i caratteri mancanti, installa il carattere richiesto sul tuo sistema. Il nome del carattere è elencato nelle proprietà del documento. Molti caratteri sono disponibili per il download gratuito, mentre i caratteri commerciali possono essere acquistati e installati. Una volta installato il carattere, riapri il PDF. Il testo dovrebbe essere visualizzato correttamente. Se l'installazione del carattere non è pratica, apri il PDF in un visualizzatore che offre una migliore sostituzione dei caratteri, come Adobe Acrobat piuttosto che un visualizzatore del browser, oppure utilizza WukongPDF per eseguire nuovamente il rendering del PDF con caratteri incorporati. Il processo di nuovo rendering risolve tutti i riferimenti ai caratteri e incorpora le forme effettive dei caratteri, producendo un PDF autonomo che verrà visualizzato correttamente su qualsiasi sistema.
Per i caratteri incorporati danneggiati, la soluzione consiste nel riparare o sostituire i dati dei caratteri. Lo strumento PDF Repair di WukongPDF è in grado di rilevare flussi di caratteri danneggiati e tentare di ricostruirli dai dati sopravvissuti. Se il carattere è parzialmente recuperabile, lo strumento estrae le porzioni intatte e ricostruisce un sottoinsieme di caratteri funzionante. Questo non sempre ha successo. Se il danneggiamento è esteso, il testo potrebbe essere parzialmente o completamente irrecuperabile e l'unica soluzione è individuare il documento di origine originale e ricreare il PDF.
Per le mancate corrispondenze di codifica, la soluzione più affidabile in tutti i casi è stampare il PDF su un nuovo PDF. Apri il file in qualsiasi visualizzatore che lo visualizzi correttamente, anche se solo un visualizzatore su un computer specifico lo esegue correttamente, e utilizza la funzione Stampa su PDF per creare un nuovo file. Il processo di stampa esegue nuovamente il rendering di ogni carattere utilizzando il rendering dei caratteri corrente del sistema, inserendo in modo efficace le forme dei caratteri corrette nel nuovo PDF come dati dei caratteri incorporati. La mancata corrispondenza della codifica viene risolta poiché il nuovo PDF utilizza una codifica standard con caratteri incorporati. Questa correzione preserva l'aspetto visivo del testo ma potrebbe perdere la codifica dei caratteri sottostante, il che è importante se il testo deve essere ricercabile o estraibile in un secondo momento. Per i documenti in cui la ricercabilità è importante, utilizza uno strumento dedicato Fix PDF che ripara la codifica preservando il livello di testo.
Prevenzione dei problemi di codifica dei caratteri nei PDF creati
Incorpora sempre i caratteri durante la creazione di PDF. Questa singola impostazione previene la stragrande maggioranza dei problemi di testo senza senso. In ogni applicazione che esporta in PDF, Word, InDesign, Illustrator, PowerPoint, è disponibile un'opzione per incorporare i caratteri. Trovalo. Abilitalo. Il PDF risultante sarà leggermente più grande, in genere da 50 KB a 200 KB per carattere, ma verrà visualizzato correttamente su ogni sistema in ogni visualizzatore, ora e in futuro.
Utilizza codifiche standard. Evita le codifiche di caratteri personalizzate a meno che tu non abbia un motivo specifico e non ne comprenda le implicazioni. La codifica standard PDF, WinAnsiEncoding per gli script latini e Identity-H per Unicode, è compresa da ogni visualizzatore di PDF. Le codifiche personalizzate possono essere comprese dal software che le ha create e nient'altro. Una codifica standard con caratteri incorporati è la combinazione più portabile e affidabile per il testo PDF che rimane leggibile su tutte le piattaforme e nel tempo.
Se trovi testo senza senso in un PDF creato da un'applicazione vecchia o specializzata, come un generatore di report mainframe, un sistema di contabilità legacy o un modulo di output di strumenti scientifici, il problema di codifica potrebbe risiedere nella tabella di mappatura dei caratteri del PDF piuttosto che nei caratteri mancanti. Questi sistemi a volte producono PDF in cui il testo viene archiviato utilizzando una codifica simbolo personalizzata che associa i codici dei caratteri alle posizioni dei glifi in un carattere anziché ai valori Unicode. Quando un visualizzatore moderno tenta di estrarre il testo come Unicode, la mappatura fallisce e i risultati sono senza senso. La soluzione per questi file consiste nell'utilizzare uno strumento di riparazione PDF in grado di rilevare codifiche non standard e sostituirle con mappature Unicode standard oppure estrarre il testo come codici di caratteri grezzi e ricostruire la codifica dai dati dei caratteri. Si tratta di un'operazione di riparazione specializzata che va oltre ciò che gestiscono gli strumenti PDF generici e in genere richiede uno strumento con supporto esplicito per la riparazione della codifica legacy.
Prova a riparare PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
