Hai un PDF ricercabile. Lo converti in Word per apportare modifiche. Si salva nuovamente il documento modificato in PDF. Il nuovo PDF sembra identico all'originale, ma quando cerchi una parola che sai essere nel documento, la ricerca non restituisce risultati. Il testo ricercabile nel PDF originale è invisibile alla funzione di ricerca nel nuovo PDF. Il viaggio di andata e ritorno attraverso Word ha privato la ricercabilità del testo.
La conversione da PDF a Word seguita dalla riconversione da Word a PDF è un flusso di lavoro comune per la modifica dei PDF, ma ogni passaggio di conversione introduce opportunità di danneggiamento del livello di testo. Il testo che ritorna in formato PDF può essere archiviato in modo diverso dall'originale, archiviato come contorni vettoriali anziché codici carattere o rasterizzato in immagini. Ciascuno di questi risultati produce un PDF in cui il testo è visibile ma non ricercabile.

Come il testo sopravvive o viene perso durante la conversione del formato
Nel PDF ricercabile originale, il testo viene memorizzato come codici carattere mappati sui glifi dei caratteri. Il carattere H viene memorizzato come codice ASCII 72, che indica al lettore PDF di visualizzare il glifo per H dal carattere incorporato. La funzione di ricerca scansiona i codici dei caratteri per il termine di ricerca ed evidenzia le posizioni corrispondenti sulla pagina. Questa memorizzazione basata su codice carattere è ciò che rende il testo ricercabile.
Quando il PDF viene convertito in Word, il convertitore estrae i codici dei caratteri e li scrive nel documento Word come testo modificabile. Il testo in Word è ricercabile perché Word lo memorizza come codici di caratteri Unicode. La conversione da PDF a Word preserva la ricercabilità purché il convertitore estragga correttamente i codici dei caratteri.
Quando il documento Word modificato viene salvato nuovamente in PDF, il motore PDF di Word deve decidere come archiviare il testo. Le impostazioni predefinite memorizzano il testo come codici carattere con caratteri incorporati, preservando la ricercabilità. Tuttavia, alcune funzionalità di Word e impostazioni PDF determinano la memorizzazione del testo come contorni vettoriali o la rasterizzazione come immagini.
Gli effetti di testo in Word, come ombre, riflessi, bagliore e rotazione 3D, fanno sì che il motore PDF di Word converta il testo interessato in immagini. Il testo sembra corretto visivamente ma non ha codici di carattere che la funzione di ricerca possa trovare. La proprietà PDF Searchable viene persa per qualsiasi testo a cui sono applicati effetti visivi.
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Come preservare la ricercabilità del testo durante il viaggio di andata e ritorno
Prima di salvare il documento Word modificato in PDF, controlla le impostazioni di salvataggio. In Word, apri File, Opzioni, Salva e assicurati che Incorpora caratteri nel file sia selezionato. Questa impostazione garantisce che i caratteri vengano incorporati come testo basato sui caratteri anziché convertiti in contorni o immagini.
Evita di applicare effetti di testo a contenuti che devono rimanere ricercabili. Utilizza la formattazione in grassetto, corsivo e colore invece degli effetti ombra, riflesso e bagliore. La distinzione visiva può essere ottenuta senza sacrificare la ricercabilità.
WukongPDF fornisce strumenti PDF Converter in grado di elaborare PDF per ottimizzare l'archiviazione del testo. Se un PDF è stato creato con testo non ricercabile, l'OCR può aggiungere un livello di testo ricercabile dietro il contenuto visivo esistente.
Verifica della ricercabilità dopo la riconversione
Dopo aver salvato il documento Word in PDF, apri il PDF e prova la funzione di ricerca. Cerca una parola che appare su ogni pagina. Se una pagina non restituisce risultati per una parola visibilmente presente, quella pagina contiene testo non ricercabile. Il test di ricerca richiede pochi secondi e rileva la perdita di ricercabilità prima che il documento venga distribuito.
Se la ricercabilità è andata persa, esegui l'OCR sul PDF riconvertito per aggiungere un livello di testo ricercabile. L'OCR riconosce il testo visibile e crea dietro di esso codici di caratteri. La funzione di ricerca può quindi trovare il testo attraverso i codici carattere generati dall'OCR. Si tratta di una correzione post-hoc, non di una prevenzione, ma ripristina la possibilità di ricerca su un PDF non ricercabile.
Per i documenti che richiedono ricercabilità garantita, evita del tutto il viaggio di andata e ritorno da PDF a Word in PDF. Modifica il documento di origine originale, il file Word, il file InDesign, il documento Google ed esporta un nuovo PDF. La singola esportazione dall'origine al PDF preserva la ricercabilità senza passaggi intermedi di conversione.
La modalità di compatibilità di Word influisce sull'output PDF. I documenti salvati nel formato DOC precedente anziché in DOCX possono utilizzare metodi di archiviazione del testo diversi che influiscono sulla ricercabilità del PDF. Salva i documenti nel formato DOCX corrente prima di esportarli in PDF.
Il testo nelle caselle di testo di Word potrebbe essere rasterizzato durante l'esportazione PDF a seconda della formattazione della casella di testo. Le caselle di testo con effetti di riempimento, rotazione o modifiche alla direzione del testo hanno maggiori probabilità di essere rasterizzate rispetto alle caselle di testo semplice.
Quando il testo viene rasterizzato durante l'esportazione PDF, diventa un'immagine di testo anziché testo codificato. L'immagine viene visualizzata correttamente, ma i caratteri sono pixel, non codici. L'OCR può recuperare il testo, ma il testo OCR potrebbe contenere errori di riconoscimento.
Le opzioni di esportazione PDF in Word includono un'impostazione di testo bitmap quando i caratteri potrebbero non essere incorporati. Questa impostazione rasterizza il testo che utilizza caratteri con restrizioni di incorporamento. Garantire che tutti i caratteri consentano l'incorporamento previene questa rasterizzazione forzata.
Dopo la conversione di andata e ritorno, confronta la dimensione del file del PDF originale e del PDF riconvertito. Un PDF riconvertito significativamente più grande può indicare che il testo è stato rasterizzato in immagini, che consumano più spazio di archiviazione rispetto al testo codificato.
Alcuni convertitori da PDF a Word offrono una modalità di conversione basata su OCR per i PDF scansionati e una modalità di estrazione del testo per i PDF digitali. L'utilizzo della modalità sbagliata produce risultati imprevisti. I PDF digitali dovrebbero utilizzare l'estrazione del testo, non l'OCR, per preservare la codifica dei caratteri originale.
Quando si perde la ricercabilità del testo, la funzione Trova nel visualizzatore PDF non restituisce risultati per le parole visibilmente presenti. La ricerca di parole comuni come o e su ogni pagina conferma rapidamente se l'intero documento contiene testo ricercabile.
Per i documenti che devono mantenere la ricercabilità attraverso più cicli di modifica, stabilisci un documento master in un formato modificabile, Word, Google Docs o InDesign e tratta il PDF come un formato di distribuzione di sola lettura. Tutte le modifiche avvengono nel master e il PDF viene rigenerato dal master dopo ogni ciclo di modifica.
I controlli di accessibilità possono verificare la ricercabilità del testo e identificare le pagine con testo non ricercabile. Esegui un controllo di accessibilità sul PDF riconvertito per confermare che tutto il testo sia codificato e accessibile.
Lo standard PDF/UA richiede che tutto il testo sia codificato come caratteri Unicode, garantendo la ricercabilità e l'accesso allo screen reader. L'esportazione in PDF/UA da Word impone requisiti di codifica del testo che preservano la ricercabilità.
La scelta del convertitore da PDF a Word influisce sulla conservazione del testo. I convertitori che danno priorità alla fedeltà visiva rispetto alla modificabilità del testo possono rasterizzare il testo che utilizza caratteri o posizionamenti insoliti. I convertitori che danno priorità alla modificabilità del testo possono produrre un output più ricercabile.
Quando il testo viene archiviato come legature, fi, fl, ffi, nel PDF, il convertitore può dividere la legatura in caratteri separati o preservarla come un singolo carattere. Il comportamento della funzione di ricerca dipende da come è stata gestita la legatura durante la conversione.
Prevenire la perdita di ricercabilità nelle conversioni future
Il testo originariamente basato su vettori nel PDF di origine può essere convertito in immagini raster durante l'esportazione da Word a PDF se il documento Word utilizza funzionalità come WordArt, SmartArt o grafici Excel incorporati. Queste funzionalità vengono visualizzate come immagini nell'output PDF.
Le impostazioni di creazione PDF in Word includono un'opzione per creare segnalibri dalle intestazioni. Questa opzione preserva la struttura del documento ma non influisce sulla ricercabilità del testo. I segnalibri e la ricercabilità sono funzionalità indipendenti.
Testare la ricercabilità cercando una parola che appare su ogni pagina, ad esempio una parola comune nella lingua del documento, identifica rapidamente le pagine con testo non ricercabile. Se una pagina non restituisce risultati per una parola comune, quella pagina presenta un problema di codifica del testo.
Comprendere le condizioni in cui si perde la ricercabilità del testo durante il viaggio di andata e ritorno da PDF a Word a PDF consente ai creatori di documenti di fare scelte informate sul flusso di lavoro di modifica e di preservare l'accessibilità e la reperibilità dei loro contenuti.
Per preservare la ricercabilità del testo durante il viaggio di andata e ritorno da PDF a Word a PDF è necessario prestare attenzione alle impostazioni di conversione in ogni passaggio e comprendere quali funzionalità di Word determinano la rasterizzazione del testo anziché la codifica come caratteri.
Per i documenti in cui la ricercabilità del testo è un requisito, stabilire un flusso di lavoro che preservi il testo codificato originale attraverso ogni conversione del formato è più efficiente che tentare di ripristinare la ricercabilità dopo che è andata persa.
La ricercabilità del testo è una funzionalità che gli utenti danno per scontata fino a quando non viene assente e ripristinare la ricercabilità in un PDF non ricercabile richiede la rielaborazione dalla fonte originale o l'esecuzione dell'OCR sulle pagine interessate per ricreare il livello di testo.
Il viaggio di andata e ritorno da PDF a Word a PDF è un flusso di lavoro di modifica comune che introduce molteplici opportunità di deterioramento o perdita della codifica del testo e la comprensione di ogni punto di rischio aiuta gli utenti a preservare la ricercabilità durante il processo.
La ricercabilità del testo non è una caratteristica estetica ma una funzionalità fondamentale del documento che influisce sull'accessibilità, sulla reperibilità e sulla capacità di estrarre e riutilizzare il contenuto per altri usi.
La scelta del convertitore da PDF a Word influisce in modo significativo sul risultato del viaggio di andata e ritorno, con convertitori ottimizzati per la modificabilità del testo che producono un output più ricercabile rispetto a quelli ottimizzati per la fedeltà visiva.
Quando si perde la ricercabilità durante il viaggio di andata e ritorno, l'OCR può ripristinare un livello di testo ricercabile, ma il testo OCR conterrà errori di riconoscimento che dovranno essere corretti affinché il documento sia completamente affidabile.
Per i documenti in cui la ricercabilità è un requisito, il mantenimento del file di origine originale e l'esportazione di nuovi PDF dopo ogni ciclo di modifica sono più affidabili rispetto al passaggio attraverso Word.
Il formato PDF preserva il testo in un modo fondamentalmente diverso rispetto ai formati di elaborazione testi e ogni traduzione tra queste rappresentazioni introduce il rischio di perdita di informazioni nella codifica del testo.
| Tappa Andata e Ritorno | Rischio di ricercabilità | Mitigazione |
|---|---|---|
| Da PDF a Word (estrazione) | Basso se si utilizza un convertitore di estrazione testo | Utilizza il convertitore con la modalità di estrazione del testo |
| Modifica in Word | Nessuno; Il testo delle parole è sempre ricercabile | Evita effetti di testo (ombra, bagliore, 3D) |
| Da Word a PDF (esportazione) | Medio; gli effetti causano la rasterizzazione | Incorpora caratteri; evitare effetti sul testo ricercabile |
| Verifica post-esportazione | N / A | Cerca parole comuni in ogni pagina |
Prova da PDF a Word
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
