
Che cos'è un PDF scansionato e in cosa differisce da un PDF nativo
Un PDF scansionato viene creato acquisendo immagini di pagine cartacee fisiche utilizzando uno scanner o la fotocamera del telefono. Ogni pagina del PDF è una fotografia del documento originale. Il testo che vedi sulla pagina esiste solo come pixel nell'immagine. Nel file PDF non sono memorizzati caratteri di testo effettivi. Un PDF scansionato è essenzialmente un album fotografico in cui ogni foto contiene testo.
Il modo più rapido per identificare un PDF scansionato è provare a selezionare il testo sulla pagina con il cursore.
La tecnologia OCR colma il divario tra i PDF scansionati e quelli nativi aggiungendo un livello di testo ricercabile.
Un PDF nativo, chiamato anche PDF digitale o PDF nato digitale, viene creato direttamente da un'applicazione software. Quando esporti un documento Word in PDF, salvi un foglio di calcolo come PDF o crei un PDF da un'applicazione di progettazione, il file risultante contiene caratteri di testo effettivi, selezionabili e ricercabili, insieme a grafica vettoriale e caratteri incorporati.
Il testo esiste come dati, non solo come pixel. Un PDF nativo è un documento strutturato, non una raccolta di immagini di pagine.
Il Formato PDF supporta entrambi i tipi di contenuto all'interno dello stesso file. Un PDF può avere alcune pagine che sono immagini scansionate e altre pagine che sono testo digitale nativo. Questo scenario a contenuto misto è comune quando i documenti vengono assemblati da più fonti, come un report che combina pagine di testo create digitalmente con appendici scansionate da fonti stampate.
La differenza pratica tra PDF scansionati e nativi influisce su tutto ciò che puoi fare con il documento. È possibile cercare parole in un PDF nativo perché il testo esiste come dati di carattere ricercabili. Non è possibile eseguire ricerche in un PDF scansionato a meno che non sia stato elaborato con la tecnologia OCR PDF che riconosce il testo nelle immagini e aggiunge uno strato di testo ricercabile invisibile. È possibile selezionare e copiare testo da un PDF nativo. Non è possibile selezionare testo da un PDF scansionato. Puoi modificare il testo in un PDF nativo con un editor PDF. Non è possibile modificare il testo in un PDF scansionato perché non ci sono caratteri di testo da modificare.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Come determinare se un PDF è stato scansionato o nativo
Il test più rapido è provare a selezionare il testo nel PDF. Apri il PDF e fai clic e trascina su una parola con il mouse o il dito. Se il testo viene evidenziato mentre trascini, il PDF contiene testo nativo selezionabile. Se non succede nulla quando provi a selezionare il testo, è probabile che la pagina sia un'immagine digitalizzata. Se alcune parole vengono evidenziate ma altre no, il PDF potrebbe avere uno strato di testo parziale o danneggiato.
Il test dello zoom fornisce un altro rapido controllo. Ingrandisci al 300 o al 400% una sezione di testo. Se il testo rimane nitido e nitido anche con un ingrandimento elevato, è probabile che si tratti di testo vettoriale nativo che si adatta facilmente a qualsiasi dimensione. Se il testo diventa pixellato e presenta bordi frastagliati ad alto ingrandimento, si tratta di un'immagine digitalizzata. Questo test visivo funziona perché il testo vettoriale viene visualizzato in modo fluido a qualsiasi livello di zoom, mentre il testo basato su immagini rivela la sua struttura in pixel quando viene ingrandito.
Gli strumenti di visualizzazione PDF possono anche segnalare se un documento contiene testo. In Adobe Acrobat, il pannello Proprietà documento mostra il numero di pagine e se il file contiene testo ricercabile. Alcuni visualizzatori mostrano un indicatore del livello di testo. Gli strumenti di analisi dei documenti possono scansionare un PDF e segnalare la percentuale di pagine che contengono testo nativo rispetto al contenuto di sole immagini.
La dimensione del file può fornire un indizio, sebbene non sia definitivo. Un PDF scansionato composto da immagini di pagina è in genere più grande di un PDF di testo nativo con lo stesso numero di pagine perché le immagini richiedono più spazio di archiviazione rispetto al testo. Un PDF di testo nativo di 10 pagine potrebbe essere compreso tra 100 e 500 kilobyte. Un PDF scansionato di 10 pagine potrebbe occupare da 2 a 10 megabyte. Tuttavia, un PDF nativo con immagini incorporate ad alta risoluzione può anche essere di grandi dimensioni, quindi la dimensione del file da sola non è un indicatore affidabile.
Perché la distinzione è importante per le attività PDF quotidiane
La ricerca è l'attività più comune interessata dalla distinzione tra scansione e nativa. Se ricevi un PDF di 50 pagine e hai bisogno di trovare ogni menzione di un termine specifico, un PDF nativo ti darà la risposta in pochi secondi attraverso la funzione di ricerca. Un PDF scansionato ti obbliga a scansionare visivamente ogni pagina manualmente, il che richiede minuti e potrebbe perdere degli eventi. La possibilità di effettuare ricerche in un documento trasforma il modo in cui interagisci con esso.
L'estrazione del testo per il riutilizzo in altri documenti richiede testo nativo. Se devi citare un paragrafo da un PDF nel tuo report, un PDF nativo ti consente di copiare e incollare direttamente il testo. Un PDF scansionato richiede di ridigitare il testo o eseguire l'OCR per renderlo estraibile. Per i documenti a cui fai spesso riferimento, la differenza tra il copia e incolla istantaneo e la ribattitura manuale è significativa.
Gli strumenti di accessibilità, inclusi gli screen reader utilizzati dalle persone con problemi di vista, richiedono testo nativo. Uno screen reader può leggere ad alta voce un PDF nativo perché può accedere ai caratteri del testo. Uno screen reader non può leggere un PDF scansionato perché non ci sono caratteri di testo a cui accedere. Per rendere accessibili i PDF scansionati è necessaria l'elaborazione OCR per aggiungere un livello di testo che gli screen reader possano interpretare.
Il formato PDF scansionato è perfettamente adeguato per scopi di archiviazione in cui il documento deve essere visualizzato solo come immagine dell'originale. Una copia scannerizzata di un contratto firmato funge da registrazione visiva del documento firmato. Per qualsiasi scopo che richieda l'interazione con il testo, la ricerca, la copia, la modifica o l'accessibilità, è necessario un PDF nativo o un PDF scansionato con OCR.
Come convertire un PDF scansionato in un PDF nativo ricercabile
Il riconoscimento ottico dei caratteri è la tecnologia che converte le immagini delle pagine scansionate in documenti ricercabili con un livello di testo. Esegui l'OCR sul PDF scansionato utilizzando uno strumento PDF che supporti l'elaborazione OCR. Lo strumento analizza ogni immagine della pagina, riconosce i caratteri del testo e aggiunge uno strato di testo invisibile dietro l'immagine della pagina. Dopo l'OCR, il PDF appare identico visivamente ma ora è ricercabile e il testo riconosciuto può essere selezionato e copiato.
La precisione dell'OCR dipende dalla qualità della scansione originale. Una scansione pulita a 300 DPI con illuminazione uniforme, pagine piatte e messa a fuoco nitida produce una precisione OCR superiore al 99%.
Una scansione a bassa risoluzione a 150 DPI con ombre, pagine curve o testo sfocato può produrre una precisione inferiore al 95%, richiedendo una correzione manuale. La qualità della scansione determina la qualità dell'output OCR.
Dopo aver eseguito l'OCR, verifica i risultati cercando alcune parole che puoi vedere nella pagina. Se la ricerca li trova, l'OCR ha avuto successo. Se nella ricerca non vengono trovate parole ovvie, l'OCR potrebbe aver avuto difficoltà con il carattere, il layout o la qualità dell'immagine specifici di quella pagina. Eseguire nuovamente l'OCR con le impostazioni modificate o su una scansione di qualità superiore, se disponibile.
Lo strumento OCR PDF di WukongPDF elabora i documenti scansionati nel browser e restituisce un PDF con un livello di testo ricercabile. Carica il PDF scansionato, esegui l'OCR e scarica un documento che supporti la ricerca, la selezione del testo e l'accesso allo screen reader. Il processo OCR preserva l'aspetto visivo originale aggiungendo allo stesso tempo il livello di testo che rende il documento interattivo.
La differenza nella dimensione del file tra PDF scansionati e nativi diventa particolarmente importante quando si ha a che fare con raccolte di documenti di grandi dimensioni. Uno schedario di documenti cartacei scansionati in PDF potrebbe produrre decine di migliaia di pagine PDF scansionate, ciascuna pagina un'immagine completa. Con 500 kilobyte per pagina per una tipica scansione in scala di grigi da 300 DPI, 10.000 pagine consumano 5 gigabyte di spazio di archiviazione. L'esecuzione dell'OCR sui PDF scansionati non riduce le dimensioni del file, poiché le immagini delle pagine rimangono, ma aggiunge il livello di testo ricercabile che rende la raccolta praticamente utilizzabile.
Per i documenti che richiedono un'archiviazione a lungo termine, il formato PDF/A è lo standard di archiviazione. Sia i PDF scansionati che i PDF nativi possono essere convertiti in PDF/A. Un PDF scansionato convertito in PDF/A rimane un documento basato su immagini con l'aggiunta di metadati di archivio. Un PDF nativo convertito in PDF/A conserva il testo e le proprietà strutturali. PDF/A non modifica la natura scansionata rispetto a quella nativa del documento. Aggiunge metadati standardizzati e applica requisiti strutturali che migliorano la conservabilità a lungo termine.
Per i PDF che combinano pagine scansionate e native, applica l'OCR alle pagine scansionate lasciando intatte le pagine native. La maggior parte degli strumenti OCR è in grado di elaborare intervalli di pagine specifici, quindi puoi eseguire l'OCR solo sulle pagine che lo richiedono. Dopo l'elaborazione, il PDF conserva il testo nativo sulle pagine originali e dispone di un livello di testo ricercabile sulle pagine precedentemente di sole immagini, garantendo una ricercabilità coerente nell'intero documento.
Per i documenti che verranno stampati e compilati a mano, è perfettamente adeguato un PDF scansionato del modulo originale. Il destinatario stampa il PDF, riempie gli spazi vuoti con una penna e restituisce la copia fisica o la scansiona di nuovo in digitale. Per i documenti che devono essere compilati digitalmente, un PDF nativo con campi modulo è di gran lunga superiore perché il destinatario può digitare direttamente nei campi.
La scelta tra la scansione di un documento in PDF e la creazione di un PDF nativo dal file di origine originale dovrebbe considerare l'intero ciclo di vita del documento, non solo la necessità immediata. Un PDF scansionato di un contratto può essere inviato via email all'altra parte per la revisione. Se in seguito è necessario cercare nel contratto una clausola specifica durante una controversia, la mancanza di ricercabilità del PDF scansionato diventa una responsabilità significativa. La creazione di un PDF nativo al momento della creazione del documento preserva le opzioni che la scansione non preserva.
I moderni software di scansione spesso includono l'elaborazione OCR automatica, rendendo confusa la distinzione tra PDF scansionati e nativi nell'uso pratico. Un documento scansionato con un'app del telefono che esegue l'OCR immediatamente dopo l'acquisizione produce un PDF che tecnicamente è un'immagine scansionata ma funzionalmente ricercabile come un PDF nativo. Questo approccio ibrido combina la comodità della scansione con la ricercabilità del testo nativo.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
