Others

Puoi recuperare il livello di testo originale da un PDF appiattito

L'appiattimento di un PDF unisce tutte le annotazioni, i campi modulo e i contenuti su più livelli in un unico livello di immagine statica. Una volta appiattito, il livello di testo originale esistente prima dell'appiattimento scompare. I caratteri di testo che una volta erano selezionabili, ricercabili ed estraibili diventano pixel nell'immagine appiattita. Ripara PDF per un documento appiattito chiede se il livello di testo originale può essere recuperato dall'output appiattito.

La risposta breve dipende dal fatto che il PDF sia stato appiattito mantenendo o senza il livello di testo. Alcune operazioni di appiattimento preservano il testo originale dietro l'immagine appiattita come contenuto nascosto. Altre operazioni di appiattimento scartano completamente il testo, sostituendolo con l'immagine renderizzata. Il recupero è possibile nel primo caso e impossibile nel secondo.

Gli strumenti di ripristino Formato PDF di WukongPDF possono rilevare ed estrarre livelli di testo conservati da documenti PDF appiattiti.

Can You Recover the Original Text Layer From a Flattened PDF

Come funziona l'appiattimento PDF e cosa rimuove

L'appiattimento combina tutti i livelli visibili di una pagina PDF in un'unica immagine sottoposta a rendering. Le annotazioni, tra cui evidenziazioni, note adesive e marcature di disegno, vengono unite al contenuto della pagina. I campi del modulo vengono convertiti da elementi interattivi in rappresentazioni visive statiche dei relativi valori compilati. Gli effetti di trasparenza vengono risolti in pixel opachi. Il risultato è una pagina che sembra identica all'originale ma non ha una struttura interattiva o a strati.

In pratica, il processo di appiattimento può preservare o meno lo strato di testo originale dietro l'immagine appiattita. Quando l'appiattimento viene eseguito tramite Anteprima conversione di Acrobat Pro o tramite lo strumento Preflight con determinate impostazioni, il testo originale potrebbe essere mantenuto come livello invisibile. Quando l'appiattimento viene eseguito tramite Stampa su PDF o tramite strumenti di terze parti, il livello di testo viene generalmente eliminato completamente.

Un test rapido determina se il testo è stato conservato. Apri il PDF appiattito e prova a selezionare il testo su una pagina. Se il testo può essere selezionato e copiato, il livello di testo è sopravvissuto all'appiattimento. Se facendo clic sul testo non si seleziona nulla o si seleziona l'intera pagina come immagine, il livello di testo viene scartato e rimane solo l'aspetto visivo.

WukongPDF

Prova a riparare PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Metodo 1: verificare la presenza di un livello di testo nascosto dietro l'immagine appiattita

In Acrobat Pro, apri il PDF appiattito e vai su Strumenti, Modifica contenuto, Modifica testo e immagini. Fare clic su un'area di testo visibile. Se Acrobat visualizza un riquadro di delimitazione attorno al testo e consente la modifica, dietro l'immagine appiattita esiste un livello di testo. Il testo è presente nei dati del file anche se potrebbe non essere visibile come testo selezionabile durante la normale visualizzazione.

Se il testo è presente, estrailo utilizzando la funzione Esporta PDF in testo di Acrobat Pro. Il testo estratto può contenere il contenuto originale anche se la pagina visiva appare appiattita. Copia il testo estratto e confrontalo con un campione del contenuto originale. Se il testo corrisponde, il livello di testo originale è stato recuperato con successo dal file appiattito.

In generale, negli scenari reali, se Acrobat non riesce a trovare testo modificabile, il livello di testo viene scartato durante l'appiattimento. Il testo visivo sulla pagina è composto da pixel nell'immagine appiattita, non da codici di carattere. Il ripristino tramite l'estrazione del testo non è possibile perché non ci sono dati di testo da estrarre.

Metodo 2: utilizzare l'OCR per ricreare il livello di testo perduto

Quando il livello di testo originale viene eliminato durante l'appiattimento, l'OCR fornisce un percorso per ricrearlo. Esegui l'OCR sul PDF appiattito utilizzando la funzione Riconosci testo di Acrobat Pro. Il motore OCR analizza l'immagine pixel di ogni pagina, identifica le forme dei caratteri e crea un nuovo livello di testo con i caratteri riconosciuti.

Considerando questo in generale, in pratica, il livello di testo ricreato dall'OCR non è il testo originale. L'OCR introduce errori di riconoscimento, in particolare con testo piccolo, caratteri insoliti o testo su sfondi complessi. Il testo ricreato avrà una precisione compresa tra il 95 e il 99% circa per documenti standard e puliti e meno accurato per documenti con tipografia o layout complessi.

Dopo l'OCR, confrontare il testo riconosciuto con un campione noto del contenuto originale, se disponibile. Correggere manualmente gli errori OCR o accettare il livello di testo ricreato come approssimazione dell'originale. L'output OCR è utilizzabile per la ricerca e l'estrazione del testo, ma potrebbe contenere errori che richiedono la verifica prima di poter fare affidamento sul testo per scopi legali, finanziari o normativi.

Verifica del testo nella struttura del file PDF

Per un controllo definitivo dell'esistenza di dati di testo in un PDF appiattito, esaminare la struttura del file non elaborato. Apri il PDF in un editor di testo in grado di gestire file binari, come VS Code o Notepad++. Cerca stringhe di testo riconoscibili dal contenuto del documento originale. Se vengono trovate stringhe di testo all'interno dei dati del file, il livello di testo esiste anche se non è accessibile tramite l'interfaccia del lettore PDF.

Questo approccio richiede una certa familiarità con la struttura interna del PDF. Il testo in un PDF viene archiviato all'interno dei contrassegni BT ed ET, che indicano l'inizio e la fine degli oggetti di testo. Tra questi contrassegni vengono elencati i codici dei caratteri con i comandi di posizionamento. Il rilevamento di marcatori BT ed ET contenenti testo riconoscibile indica che i dati di testo sono sopravvissuti all'appiattimento.

Da un punto di vista pratico, in scenari reali, se non vengono trovate stringhe di testo nei dati del file, l'operazione di appiattimento ha rasterizzato completamente il contenuto. Le pagine sono immagini e non contengono informazioni di testo recuperabili. L'OCR è l'unico percorso disponibile per creare un livello di testo.

Prevenzione della perdita del livello di testo nelle future operazioni di appiattimento

Quando si appiattisce un PDF che deve mantenere il livello di testo, utilizzare le impostazioni che preservano il testo nascosto. In Acrobat Pro, lo strumento Anteprima conversione include una casella di controllo per conservare le informazioni sulla sovrastampa e sulle tinte piatte, che aiuta indirettamente a preservare i dati di testo. Lo strumento Preflight offre correzioni di appiattimento che conservano esplicitamente il testo.

L'approccio più sicuro consiste nel salvare una copia non appiattita del PDF prima della conversione. La copia non appiattita conserva tutti gli elementi interattivi, le annotazioni e i livelli di testo. Distribuire la versione appiattita. Archiviare l'originale non appiattito. Se mai fosse necessario il ripristino, l'originale fornisce i dati di origine completi.

Considerando una visione più ampia, nei flussi di lavoro dei documenti, per i documenti critici, testare le impostazioni di appiattimento su una copia prima di applicarle all'originale. Verificare che il testo rimanga recuperabile dopo l'appiattimento. Modifica le impostazioni se il ripristino fallisce. La fase di test aggiunge minuti al flusso di lavoro e previene la perdita permanente di testo.

Utilizzo del preflight per rilevare ed estrarre livelli di testo nascosti

Lo strumento Acrobat Pro Preflight include profili appositamente progettati per analizzare la struttura del contenuto PDF. Il rapporto Inventario elenca tutti gli oggetti di testo presenti nel file, compresi quelli che non sono visibili durante la normale visualizzazione. L'esecuzione di questo rapporto su un PDF appiattito rivela se i dati di testo sono sopravvissuti al processo di appiattimento.

Se il rapporto di preflight identifica oggetti di testo, utilizzare la correzione Esporta tutto il testo per estrarli in un file separato. Il testo estratto può quindi essere confrontato con il contenuto visibile della pagina per determinare quanto del testo originale è stato conservato e se è accurato e completo.

Recupero di testo da PDF parzialmente appiattiti

Alcune operazioni di appiattimento influiscono solo su elementi specifici della pagina lasciandone intatti gli altri. I campi del modulo possono essere appiattiti mentre il corpo del testo rimane come caratteri selezionabili. Le annotazioni possono essere appiattite mentre il testo della pagina sottostante sopravvive. Esaminare ciascun tipo di elemento in modo indipendente per determinare cosa è stato appiattito e cosa è stato preservato.

Da un ampio angolo, nei flussi di lavoro dei documenti, per documenti parzialmente appiattiti, estrarre il testo sopravvissuto dalle porzioni non appiattite e combinarlo con l'output OCR dalle porzioni appiattite. L'approccio ibrido massimizza il recupero del testo utilizzando il testo originale dove disponibile e il testo ricostruito tramite OCR dove l'originale è andato perso.

Quando accettare che il recupero non sia possibile

Se ciò dovesse verificarsi, se nella struttura del file non esistono dati di testo, se Acrobat non riesce a trovare testo modificabile e se l'OCR produce risultati inaccettabilmente imprecisi, il livello di testo originale non può essere recuperato. Accettate questa conclusione e impegnatevi a preservare ciò che resta invece di investire più tempo nei tentativi di recupero.

Documentare il tentativo di recupero e il suo esito. Annotare gli strumenti utilizzati, i metodi provati e la conclusione raggiunta. La documentazione è utile ai futuri custodi dei documenti che potrebbero avere accesso a strumenti di ripristino migliori e dovrebbero comprendere cosa è stato tentato in precedenza.

Strategia di archiviazione a lungo termine per documenti appiattiti

I PDF appiattiti vengono spesso creati appositamente per scopi di archiviazione perché rimuovono le dipendenze interattive. Quando si archiviano documenti appiattiti, conservare l'originale non appiattito accanto alla versione appiattita quando possibile. L'originale conserva la struttura completa del documento. La versione appiattita fornisce il formato di archivio stabile.

Per i documenti in cui esiste solo la versione appiattita, esegui l'OCR per creare un livello di testo e incorporarlo nel PDF. Il testo OCR potrebbe non essere perfetto, ma consente future ricerche ed estrazioni di testo che altrimenti sarebbero impossibili. Il livello OCR è un ponte tra l'immagine appiattita e le future esigenze di analisi dei documenti.

Rilevamento automatico dell'appiattimento per raccolte di documenti

Le organizzazioni che gestiscono raccolte di documenti di grandi dimensioni traggono vantaggio dal rilevamento automatico dei PDF appiattiti. Uno script che apre ogni PDF, verifica la presenza di testo selezionabile e contrassegna i file in cui il testo è assente identifica i documenti che necessitano di elaborazione OCR. La scansione automatizzata impedisce ai documenti appiattiti di entrare silenziosamente nell'archivio senza livelli di testo ricercabili.

Integra il rilevamento dell'appiattimento nel flusso di lavoro di acquisizione dei documenti. Quando un nuovo PDF entra nel sistema, controlla la presenza di testo. Se il testo è assente, instrada il documento a una coda di elaborazione OCR prima che raggiunga l'archivio. Il rilevamento e la correzione automatizzati garantiscono che ogni documento archiviato sia ricercabile.

WukongPDF

Prova a riparare PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →