Tips & Tricks

Come riparare un PDF in cui tutto il testo appare come rettangoli vuoti a causa di un errore di sostituzione dei caratteri

Apri un PDF e invece di parole, ogni pagina è riempita con rettangoli vuoti, piccoli quadrati o righe di simboli segnaposto identici dove dovrebbe essere il testo. La struttura del documento è intatta. Il layout sembra corretto. Ma ogni lettera, numero e segno di punteggiatura è stato sostituito da una scatola vuota. Si tratta di un errore di sostituzione del carattere e significa che il PDF sta tentando di visualizzare il testo utilizzando un carattere che non è disponibile per il lettore PDF. I dati di testo sono ancora nel file. Non è stato cancellato o danneggiato. Il problema è interamente nel livello di rendering e questo lo rende risolvibile.

How to Repair a PDF Where All Text Appears as Empty Rectangles Due to Font Substitution Failure

Che cosa fa sì che la sostituzione dei caratteri produca rettangoli vuoti

La causa è più semplice di quanto suggerisca il sintomo.

Ogni PDF contiene istruzioni su come visualizzare il testo. Ogni porzione di testo fa riferimento a un carattere specifico incorporato nel PDF al momento della creazione o che dovrebbe essere disponibile nel sistema in cui verrà visualizzato. Quando il carattere è incorporato, il PDF contiene una copia dei dati del carattere e qualsiasi lettore PDF può visualizzare il testo correttamente indipendentemente dai caratteri installati sul dispositivo di visualizzazione. Quando il carattere non è incorporato, il lettore PDF deve trovare un carattere corrispondente nel sistema locale. Se non esiste alcuna corrispondenza, il lettore sostituisce un carattere di fallback. Nella maggior parte dei casi funziona adeguatamente: il testo viene visualizzato in un carattere tipografico leggermente diverso ma leggibile.

Il fallimento del rettangolo vuoto si verifica quando il meccanismo di sostituzione stesso si rompe. Ciò può verificarsi per diversi motivi. Il PDF può fare riferimento a un carattere utilizzando un nome interno che non corrisponde ad alcun nome di carattere standard riconosciuto dal sistema operativo. Il carattere può essere un carattere tipografico personalizzato o proprietario con codifica dei caratteri che i caratteri di fallback standard non possono mappare. Il file PDF potrebbe contenere un incorporamento di caratteri danneggiato o incompleto in cui i dati dei caratteri erano inclusi ma sono stati danneggiati durante il trasferimento del file, impedendo al lettore di decodificarli. In ogni caso, il lettore sa che il testo dovrebbe apparire in una posizione specifica, ma non ha dati di glifi da visualizzare, quindi disegna il simbolo universale per i caratteri mancanti: un rettangolo vuoto (ISO, 'ISO 32000-2:2020, Gestione dei caratteri in PDF', 2020).

WukongPDF

Prova a riparare PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Controllare se il carattere è incorporato o mancante

Il primo passaggio diagnostico consiste nel determinare se il PDF contiene caratteri incorporati e, in tal caso, se sono intatti. Apri il PDF in un visualizzatore in grado di visualizzare le proprietà del documento, come Adobe Acrobat. Passare a File, Proprietà, Caratteri. L'elenco dei caratteri mostra tutti i caratteri a cui fa riferimento il documento e se ciascuno di essi è incorporato o sottoinsieme incorporato. Un font incorporato visualizza il suo nome completo seguito da (Incorporato) o (Sottoinsieme incorporato). Un carattere non incorporato mostra solo il nome del carattere senza indicatore di incorporamento. Se i caratteri utilizzati dal testo mancante sono elencati come non incorporati, il problema è che sul dispositivo di visualizzazione non sono installati tali caratteri.

Se i caratteri sono elencati come incorporati ma il testo viene ancora visualizzato come rettangoli, è probabile che i dati dei caratteri incorporati siano danneggiati. Ciò può verificarsi quando un PDF viene trasferito tramite una connessione di rete inaffidabile, archiviato su un dispositivo di archiviazione guasto o elaborato da un software che non supporta completamente il formato di incorporamento dei caratteri utilizzato. I dati del carattere sono presenti nel file ma non possono essere decodificati. Il pannello delle proprietà del documento potrebbe ancora mostrare il carattere come incorporato perché la dichiarazione di incorporamento è intatta anche se i dati binari del carattere sono danneggiati.

Riparazione dei problemi relativi ai caratteri non incorporati

Per i PDF in cui i caratteri non sono mai stati incorporati, il percorso di riparazione consiste nell'installare i caratteri mancanti sul dispositivo di visualizzazione o nel ricreare il PDF con i caratteri incorporati. L'installazione dei caratteri funziona quando sai quali caratteri mancano e puoi ottenerli legalmente. Ciò è pratico quando il carattere mancante è un carattere tipografico commerciale comune come Helvetica o Times New Roman che già possiedi ma non hai installato sul dispositivo corrente. È meno pratico quando il carattere mancante è un carattere tipografico aziendale personalizzato o un carattere costoso concesso in licenza.

Lo strumento Ripara PDF di WukongPDF può rielaborare un PDF che presenta problemi di visualizzazione dei caratteri analizzando la codifica del testo e i riferimenti ai caratteri nel file. Per i caratteri non incorporati ampiamente disponibili, lo strumento può sostituire una corrispondenza simile che preserva il contenuto del testo e l'aspetto approssimativo. Per i documenti in cui il testo originale deve essere conservato esattamente, ricreare il PDF dal documento di origine con l'incorporamento dei caratteri abilitato è la soluzione a lungo termine più affidabile. La maggior parte degli elaboratori di testo e delle applicazioni di progettazione dispongono di un'impostazione denominata Incorpora caratteri o Incorpora tutti i caratteri nella finestra di dialogo di esportazione PDF. L'abilitazione di questa impostazione impedisce che la sostituzione dei caratteri diventi un problema.

Recuperare testo da PDF con caratteri incorporati danneggiati

Quando i caratteri incorporati sono danneggiati, i dati di testo in genere rimangono intatti anche se non possono essere visualizzati. I codici carattere che specificano quali lettere appaiono e dove vengono memorizzati separatamente dai dati dei glifi dei caratteri che indicano al renderer come disegnare quelle lettere. Puoi estrarre il contenuto testuale dal PDF anche quando il rendering visivo fallisce. Copia l'area di testo apparentemente vuota facendo clic e trascinandola su di essa. Anche se non è visibile nulla, il testo potrebbe essere selezionato. Incollalo in un editor di testo. Se viene visualizzato testo leggibile, i dati del testo sono intatti e solo il rendering dei caratteri risulta interrotto.

Se la funzione copia e incolla produce caratteri confusi, la codifica del carattere potrebbe non essere standard. In questo caso, utilizza la funzione di estrazione del testo PDF in uno strumento PDF dedicato, che tenta di decodificare il testo utilizzando più schemi di codifica. Il testo estratto può quindi essere inserito in un nuovo documento con i caratteri incorporati correttamente. Il PDF originale funge da riferimento visivo per il layout mentre il testo estratto fornisce il contenuto per la versione riparata. Questo ripristino in due passaggi preserva sia le informazioni che la relativa presentazione.

Prevenzione dei problemi relativi ai caratteri nei PDF creati

La prevenzione più efficace è incorporare sempre i caratteri durante la creazione di PDF. In Microsoft Word, l'opzione è in File, Opzioni, Salva, sotto Mantieni fedeltà durante la condivisione di questo documento. Seleziona Incorpora caratteri nel file. In Adobe InDesign e applicazioni di layout simili, la finestra di dialogo di esportazione PDF include una sezione di incorporamento dei caratteri in cui è possibile specificare quali caratteri incorporare. L'incorporamento dell'intero set di caratteri anziché di un sottoinsieme garantisce che, anche se il documento viene modificato in seguito e vengono utilizzati caratteri esterni al sottoinsieme originale, verranno visualizzati correttamente.

Per i PDF ricevuti da altri, tratta i problemi di rendering dei caratteri come un problema risolvibile anziché come un danno permanente. Il testo è quasi certamente ancora nel fascicolo. L'approccio Fix PDF consiste nel diagnosticare se i caratteri sono mancanti o danneggiati, estrarre il testo recuperabile e installare i caratteri mancanti o ricostruire il documento con caratteri incorporati. Un PDF pieno di rettangoli vuoti sembra allarmante, ma il contenuto dietro quei rettangoli è solitamente intatto e può essere recuperato con i passaggi giusti.

Sostituzione dei caratteri nelle scritture non latine e specializzate

Gli errori di sostituzione dei caratteri sono particolarmente comuni con gli script non latini come cinese, giapponese, coreano, arabo e cirillico. Questi sistemi di scrittura utilizzano set di caratteri molto più grandi dell'alfabeto latino e i caratteri che li supportano sono corrispondentemente più grandi, il che rende più probabile che vengano sottoinsiemi o omessi durante la creazione del PDF. Un PDF creato su un sistema con supporto completo dei font CJK potrebbe essere visualizzato come rettangoli vuoti su un sistema privo di tali font. Lo stesso vale per i set di caratteri specializzati utilizzati in matematica, notazione musicale e linguistica. I documenti che utilizzano questi script dovrebbero sempre avere caratteri completamente incorporati, non sottoinsiemi, per garantire la compatibilità multipiattaforma.

Quando si riceve un PDF con caratteri non latini mancanti, l'installazione del carattere specifico è spesso l'unica soluzione affidabile. Gli algoritmi di sostituzione dei caratteri progettati per gli script latini funzionano male con i set di caratteri non latini perché le forme dei glifi sono troppo diverse per una sostituzione significativa. Identificare il carattere esatto utilizzato nel documento originale, ottenerlo da una fonte legittima e installarlo nel sistema di visualizzazione ripristina il documento all'aspetto previsto. L'ecosistema Caratteri PDF supporta completamente Unicode, ma tale supporto dipende dai caratteri disponibili per il renderer. Un carattere mancante è una lacuna che nessuna sostituzione intelligente può colmare completamente per sistemi di scrittura complessi.

Il problema del rettangolo vuoto è tra i problemi PDF visivamente più allarmanti che un utente possa incontrare, ma è anche tra quelli risolvibili più costantemente. A differenza della corruzione strutturale in cui il file non può essere aperto affatto, un errore nel rendering dei caratteri significa che la struttura del file è intatta e il contenuto è presente. Il renderer semplicemente non può disegnare ciò che sa dovrebbe essere lì. Affrontando il problema metodicamente, controllando lo stato di incorporamento, identificando i caratteri mancanti e recuperando il contenuto del testo, trasforma un PDF che sembra distrutto in uno completamente utilizzabile e leggibile. L'apparenza della distruzione è un'illusione creata dal livello di rendering. I dati sottostanti sono quasi sempre recuperabili con i passaggi diagnostici e gli strumenti di riparazione corretti.

I rettangoli vuoti dove dovrebbe esserci il testo sono allarmanti la prima volta che li incontri. Dopo aver compreso il meccanismo di sostituzione dei caratteri alla base, diventano un problema tecnico gestibile con un percorso diagnostico chiaro e soluzioni affidabili. Il panico svanisce e inizia la risoluzione dei problemi.

WukongPDF

Prova a riparare PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →