Others

Qual è la differenza tra testo OCR e testo incorporato in un PDF?

Apri un PDF scansionato e puoi selezionare, copiare e cercare il testo come se fosse un documento digitale nativo. Quel testo non proviene dalla scansione originale. Lo scanner ha prodotto un'immagine della pagina, una griglia di pixel senza alcun dato di testo. Il testo che stai selezionando e cercando è testo OCR, generato dal software di riconoscimento ottico dei caratteri che ha analizzato l'immagine della pagina e convertito i modelli di pixel in caratteri. Ma non tutto il testo selezionabile in un PDF è testo OCR. Alcuni PDF contengono testo incorporato creato digitalmente e che non passa mai attraverso uno scanner o un motore di riconoscimento. Comprendere la differenza tra testo OCR e testo incorporato spiega perché alcuni PDF eseguono ricerche perfettamente mentre altri producono risultati confusi.

What Is the Difference Between OCR Text and Embedded Text in a PDF

Cos'è il testo OCR e come viene inserito in un PDF

Il testo OCR è generato automaticamente. Un motore OCR PDF esamina ogni forma di carattere nell'immagine di una pagina scansionata, la confronta con un database di modelli di caratteri noti e restituisce il carattere corrispondente più probabile insieme alla sua posizione sulla pagina. Il testo riconosciuto viene quindi incorporato nel PDF come uno strato invisibile posizionato esattamente sopra i caratteri dell'immagine originale. Quando selezioni e copi testo da un PDF scansionato, stai copiando da questo livello OCR invisibile, non dall'immagine visibile. Se il motore OCR legge erroneamente un carattere, il testo copiato conterrà quell'errore anche se l'immagine visibile sembra corretta.

La qualità del testo OCR dipende da diversi fattori: la risoluzione e la chiarezza della scansione originale, il carattere utilizzato nel documento originale, la lingua del testo e la sofisticatezza del motore OCR. Una scansione pulita a 300 DPI di un documento inglese stampato al laser ed elaborato da un moderno motore OCR produce un testo quasi perfetto. Una scansione a 150 DPI di un documento stampato a matrice di punti in una lingua con forme di caratteri complesse elaborate da un motore OCR di base produce testo pieno di errori. Il testo OCR è accurato quanto lo consentono il motore di riconoscimento e la qualità della scansione.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Cos'è il testo incorporato e come viene inserito in un PDF

Il testo incorporato viene creato, non riconosciuto. Quando un elaboratore di testi, un'applicazione di desktop publishing o una libreria per la creazione di PDF genera un PDF, scrive il testo direttamente nel flusso di contenuti PDF. Ogni carattere viene memorizzato come un codice specifico mappato su un glifo in un font. Non è prevista alcuna fase di riconoscimento poiché il testo non è mai stato un'immagine. L'applicazione che ha creato il PDF sapeva esattamente quali caratteri venivano scritti e li registrava con precisione. Quando selezioni e copi testo da un PDF creato digitalmente, copi gli esatti caratteri digitati dall'autore.

Il testo incorporato contiene informazioni di formattazione che in genere mancano al testo OCR. I nomi dei caratteri, lo stile in grassetto e corsivo e la spaziatura dei caratteri vengono conservati nel testo incorporato perché specificati dall'autore nel documento di origine. Il testo OCR può ricostruire parte di questa formattazione, ma viene dedotta dall'aspetto visivo dei caratteri anziché archiviata come metadati espliciti. Un confronto Formato PDF tra una pagina digitalizzata e poi sottoposta a OCR e una pagina digitale nativa rivela questa differenza. La versione OCR può consentire la selezione del testo ma riporta ogni carattere come lo stesso carattere con lo stesso peso. La versione digitale preserva le distinzioni dei caratteri previste dall'autore.

Come capire se il testo in un PDF è OCR o incorporato

Il modo più affidabile per determinare se il testo in un PDF è generato dall'OCR o incorporato è controllare le proprietà del documento, in particolare l'elenco dei caratteri. Apri il PDF in un visualizzatore in grado di visualizzare le informazioni sui caratteri. Adobe Acrobat mostra l'elenco dei caratteri in File, Proprietà del documento, Caratteri. Se l'elenco dei caratteri mostra caratteri con nomi che includono l'OCR o se i caratteri sono elencati come sconosciuti o come tipo generico senza un nome specifico, è probabile che il testo sia generato dall'OCR. Se l'elenco dei caratteri mostra caratteri specifici con nome come Arial, Times New Roman o Calibri con sottotipi come Grassetto o Corsivo, il testo è quasi certamente incorporato da una fonte digitale.

Un altro test pratico consiste nel cercare un modello di errore OCR comune. Cerca nel PDF errori comuni di sostituzione OCR come la combinazione di lettere rn, che i motori OCR spesso interpretano erroneamente come la singola lettera m. Se la ricerca rileva casi di fienile che diventa bam o di mais che diventa com, il testo viene generato tramite OCR. Il testo incorporato non contiene questi errori di sostituzione perché i caratteri non sono mai stati visivamente ambigui. La qualità PDF ricercabile di un documento dipende dal fatto che il testo sottostante, OCR o incorporato, rappresenti accuratamente il contenuto visibile.

Quando il testo OCR e il testo incorporato coesistono nello stesso PDF

Un singolo PDF può contenere sia testo OCR che testo incorporato su pagine diverse o anche sulla stessa pagina. Un pacchetto di contratto potrebbe includere il corpo del contratto creato digitalmente, che contiene testo incorporato, e una pagina di firma digitalizzata ed elaborata con OCR, che contiene testo OCR. Un rapporto di ricerca potrebbe combinare pagine di testo create digitalmente con fotografie scansionate ed elaborate tramite OCR di ritagli di giornali storici. Il testo a pagina tre è testo incorporato pixel-perfetto. Il testo a pagina sette è testo OCR che potrebbe contenere errori di riconoscimento.

Questo scenario a contenuto misto crea una sottile trappola per chiunque cerchi o estragga testo dal PDF. I risultati della ricerca dalle pagine di testo incorporato saranno accurati. I risultati della ricerca dalle pagine di testo OCR potrebbero non rilevare occorrenze in cui il motore OCR ha letto erroneamente una parola o potrebbero restituire false corrispondenze in cui il motore OCR ha sostituito una parola simile. Quando lavori con PDF a contenuto misto, verifica qualsiasi testo estratto dalle pagine OCR prima di fare affidamento su di esso. L'approccio più sicuro consiste nel controllare visivamente l'immagine della pagina corrispondente ogni volta che il testo estratto da una pagina OCR viene utilizzato per uno scopo critico.

Migliorare la qualità del testo OCR dopo il fatto

Quando un PDF contiene testo OCR di scarsa qualità, le opzioni per migliorarlo sono limitate dal fatto che la scansione originale e il processo OCR sono già stati completati. Non è possibile migliorare retroattivamente la qualità della scansione. Quello che puoi fare è ripetere l'OCR del PDF con un motore migliore. Estrai le immagini delle pagine dal PDF alla massima risoluzione disponibile ed eseguile tramite un moderno motore OCR che può produrre risultati più accurati rispetto al passaggio OCR originale. Sostituisci il vecchio livello di testo OCR con quello nuovo.

Alcuni editor PDF ti consentono di correggere manualmente gli errori OCR direttamente nel livello di testo. Apri il PDF in una modalità di modifica che rivela il testo OCR invisibile. Fare clic su una parola non riconosciuta e digitare la correzione. Questo processo di correzione manuale è pratico per una manciata di errori su poche pagine. Non è pratico per un documento di 200 pagine in cui ogni paragrafo contiene errori di riconoscimento. Per problemi di qualità OCR su larga scala, ripetere l'OCR dell'intero documento con un motore migliore è l'approccio più efficiente.

Scelta tra OCR e testo incorporato per la creazione di documenti

Quando si crea un PDF che verrà cercato, indicizzato o archiviato, la scelta tra scansione e OCR rispetto alla generazione di un PDF digitale nativo ha conseguenze a lungo termine. Un PDF digitale nativo con testo incorporato è più piccolo, effettua ricerche più velocemente e preserva perfettamente la precisione del testo. Un PDF scansionato ed elaborato con OCR conserva l'aspetto del documento cartaceo originale ma introduce la possibilità di errori di riconoscimento che si accumulano nel tempo man mano che il PDF viene copiato, citato e referenziato.

Per i progetti di archivio, la pratica migliore è preservare entrambi i formati. Mantieni la scansione ad alta risoluzione come master di archivio per la fedeltà visiva. Genera una versione digitale nativa, riscrivendo o applicando l'OCR ad alta precisione con correzione manuale, per la ricerca e l'analisi del testo. Questo approccio a doppio formato garantisce l'autenticità della scansione originale e l'usabilità del testo ricercabile. WukongPDF supporta l'elaborazione OCR PDF per convertire i documenti scansionati in PDF ricercabili e il livello di testo OCR risultante fornisce la funzionalità di ricerca e copia che rende i documenti scansionati utilizzabili nei flussi di lavoro digitali.

Il divario di affidabilità a lungo termine tra OCR e testo incorporato

I PDF sottoposti a OCR invecchiano in modo diverso rispetto ai PDF creati digitalmente. Un PDF creato digitalmente e aperto vent'anni dopo la creazione visualizza perfettamente il testo, poiché i codici dei caratteri non sono ambigui e i caratteri sono incorporati. Un PDF OCR aperto vent'anni dopo la creazione dipende dalla qualità della scansione originale e dall'accuratezza del motore OCR disponibile in quel momento. Errori di riconoscimento appena percettibili quando il documento era fresco diventano ostacoli significativi quando il documento cartaceo originale non è più disponibile per la verifica.

Per i documenti destinati alla conservazione a lungo termine, il testo incorporato da una fonte digitale è sempre preferibile al testo OCR. Se un documento esiste solo su carta e deve essere scansionato, investi nella scansione della massima qualità e nell'elaborazione OCR disponibile al momento e conserva il documento cartaceo originale il più a lungo possibile. L'originale cartaceo è la protezione definitiva contro gli errori OCR che potrebbero diventare evidenti solo anni dopo.

Un test pratico per distinguere il testo OCR PDF dal testo incorporato: ingrandisci un paragrafo al 300% o più e osserva i bordi dei caratteri. Il testo OCR mostra spesso un leggero disallineamento tra l'immagine del carattere visibile e il livello di testo invisibile. Il testo incorporato viene visualizzato con un allineamento perfetto perché le forme e le posizioni dei caratteri provengono dallo stesso programma di font.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →