
Che cosa fa l'OCR a un PDF scansionato
Il riconoscimento ottico dei caratteri trasforma un PDF scansionato, che è una raccolta di immagini di pagine, in un documento ricercabile.
Il processo OCR PDF analizza ogni immagine della pagina, identifica le forme dei caratteri e crea uno strato di testo invisibile dietro l'immagine della pagina. Dopo l'OCR, puoi cercare parole nel documento, selezionare e copiare testo e utilizzare le utilità per la lettura dello schermo per leggere il documento ad alta voce.
L'OCR trasforma un'immagine passiva di testo in un documento attivo e ricercabile che supporta la selezione del testo e gli screen reader.
La precisione dell'OCR dipende direttamente dalla qualità della scansione originale, con scansioni pulite a 300 DPI che producono i migliori risultati.
Un PDF scansionato senza OCR è come un album fotografico di testo. Puoi guardare le parole ma non puoi interagire con esse. Non è possibile cercare un termine specifico. Non è possibile copiare un paragrafo per citarlo. Non è possibile utilizzare uno screen reader. L'OCR aggiunge le funzionalità interattive che rendono i documenti digitali utili oltre la semplice visualizzazione.
La precisione dell'OCR dipende dalla qualità della scansione originale. Una scansione pulita e ad alta risoluzione a 300 DPI con illuminazione uniforme e messa a fuoco nitida produce una precisione OCR superiore al 99% per il testo stampato standard. Una scansione a bassa risoluzione, una fotografia di un documento scattata da un angolo o la scansione di un originale spiegazzato o macchiato producono una precisione inferiore. La qualità della scansione determina direttamente la qualità dell'output OCR.
Il livello di testo PDF ricercabile aggiunto dall'OCR è separato dall'immagine della pagina. L'aspetto visivo del PDF non cambia dopo l'OCR. La pagina sembra ancora un'immagine scansionata. Dietro quell'immagine, il testo riconosciuto esiste come dati di carattere invisibili a cui possono accedere motori di ricerca, lettori di schermo e strumenti di selezione del testo.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Come eseguire l'OCR su un PDF scansionato su dispositivi diversi
Su Windows, Adobe Acrobat Pro può eseguire l'OCR sui PDF scansionati. Apri il PDF, seleziona lo strumento Scansione e OCR e scegli Riconosci testo. Acrobat elabora ogni pagina, riconosce il testo e aggiunge il livello di testo ricercabile. Salvare il file. Il PDF ora supporta la ricerca e la selezione del testo. Acrobat Pro fornisce l'OCR più accurato su Windows.
Su Mac, l'applicazione Anteprima integrata non include l'OCR. Diversi strumenti PDF Mac di terze parti forniscono funzionalità OCR. PDF Expert e PDFpen includono entrambi motori OCR che elaborano i PDF scansionati e aggiungono livelli di testo ricercabili. La qualità dell'OCR è paragonabile agli strumenti Windows per i documenti standard.
Lo strumento OCR basato su browser di WukongPDF funziona su qualsiasi sistema operativo. Carica il PDF scansionato, seleziona la lingua del documento per il motore OCR ed esegui il riconoscimento. Scarica il PDF ricercabile al termine dell'elaborazione. L'approccio basato su browser rende l'OCR accessibile senza installare software.
Per iPhone e Android, le app per scanner che includono l'OCR elaborano la scansione durante l'acquisizione. Adobe Scan, Microsoft Lens e lo scanner integrato nell'app Notes per iPhone eseguono tutti l'OCR automaticamente durante la scansione dei documenti. Il PDF risultante è ricercabile immediatamente dopo la scansione, senza una fase di elaborazione OCR separata.
Migliorare la precisione del riconoscimento ottico dei caratteri per i documenti complessi
Selezionare la lingua corretta del documento prima di eseguire l'OCR. Il motore OCR utilizza dizionari specifici della lingua e dati sulla frequenza dei caratteri per risolvere caratteri ambigui. L'esecuzione dell'OCR su un documento francese con l'impostazione della lingua francese produce risultati migliori rispetto all'utilizzo dell'impostazione inglese. Per i documenti multilingue, seleziona la lingua principale e correggi manualmente gli errori nei passaggi della lingua secondaria.
Allineare le pagine scansionate prima dell'OCR. Le pagine scansionate leggermente ruotate, anche di uno o due gradi, riducono la precisione dell'OCR perché il motore OCR prevede che le righe di testo siano orizzontali. La maggior parte dei software di scansione include una funzionalità di raddrizzamento automatico. Se la scansione non è stata raddrizzata durante l'acquisizione, raddrizzare le pagine PDF prima di eseguire l'OCR.
Aumenta la risoluzione di scansione per documenti con testo piccolo o layout complessi. Il testo inferiore a 10 punti richiede una risoluzione di scansione più elevata per un OCR accurato. Una scansione a 300 DPI è sufficiente per la maggior parte dei documenti. Per documenti con testo di 8 punti o inferiore, esegui la scansione a 400 o 600 DPI per fornire al motore OCR dati pixel sufficienti per distinguere i singoli caratteri.
Per i documenti con tipi di contenuto misti, come pagine che combinano testo con fotografie o illustrazioni, il motore OCR deve essere configurato per riconoscere solo le zone di testo. Il tentativo di riconoscere il testo dalle aree dell'immagine produce caratteri inutili. La maggior parte degli strumenti OCR includono una funzione di selezione della zona che consente di specificare quali aree della pagina contengono testo.
Verifica e correzione dell'output OCR
Una volta completato l'OCR, verifica l'output cercando alcune parole che puoi vedere nella pagina. Se la ricerca li trova, l'OCR ha avuto successo. Se nella ricerca non vengono trovate parole ovvie, la precisione dell'OCR potrebbe essere insufficiente per il carattere, il layout o la qualità dell'immagine specifici di quella pagina.
Per i documenti in cui la precisione del riconoscimento ottico dei caratteri è fondamentale, ad esempio cartelle cliniche o legali che devono essere completamente ricercabili, rivedere manualmente il testo riconosciuto. Alcuni strumenti PDF ti consentono di visualizzare e modificare il livello di testo nascosto. Correggere gli errori di riconoscimento, in particolare nei nomi propri, nei numeri e nei termini tecnici che è più probabile che il motore OCR riconosca erroneamente.
Gli errori OCR più comuni riguardano la confusione dei caratteri. La lettera l e il numero 1 sono simili in molti caratteri. Le lettere rn insieme possono assomigliare alla lettera m.
Le lettere cl possono assomigliare alla lettera d. Queste confusioni di caratteri producono parole visivamente simili all'originale ma testualmente sbagliate. La revisione manuale delle sezioni critiche rileva questi errori.
Dopo aver verificato l'output dell'OCR, salvare il documento con un nome file che indichi che è stato elaborato con l'OCR. Un nome file come Report-OCR.pdf o Report-Searchable.pdf distingue la versione ricercabile dalla scansione originale di sola immagine.
Il vantaggio pratico di un PDF scansionato ricercabile diventa evidente la prima volta che è necessario trovare un'informazione specifica in un documento di grandi dimensioni. Un contratto scansionato di 200 pagine senza OCR richiede la lettura manuale di ogni pagina per trovare una clausola specifica. Una versione ricercabile trova la clausola in pochi secondi. Per qualsiasi documento a cui prevedi di fare riferimento più di una volta, l'investimento OCR si ripaga da solo.
I PDF elaborati dall'OCR sono accessibili anche agli screen reader, rendendoli utilizzabili da persone con problemi di vista che si affidano alla tecnologia assistiva per leggere i documenti. Un PDF scansionato senza OCR è completamente inaccessibile agli screen reader perché non c'è testo da leggere ad alta voce. L'aggiunta dell'OCR rende il documento accessibile, come richiesto dagli standard di accessibilità, tra cui la Sezione 508 e le WCAG.
Per i documenti in lingue diverse dall'inglese, selezionare la lingua OCR corretta prima dell'elaborazione. I motori OCR utilizzano modelli di riconoscimento dei caratteri specifici della lingua. Un documento in lingua giapponese riconosciuto con il modello giapponese produce risultati di gran lunga migliori rispetto allo stesso documento riconosciuto con il modello inglese.
L'OCR consente inoltre l'estrazione del testo per il riutilizzo in altri documenti. Quando è necessario citare un passaggio di un documento scansionato nel proprio report, l'OCR rende il testo copiabile. Senza OCR, dovresti riscrivere manualmente il passaggio. Il tempo risparmiato grazie alla possibilità di copiare e incollare documenti elaborati tramite OCR aumenta in modo significativo.
Per i documenti scansionati che verranno archiviati, l'OCR è una fase di conservazione essenziale. Un PDF scansionato di sole immagini archiviato oggi non fornisce alcuna funzionalità di ricerca per i futuri ricercatori. Un PDF ricercabile fornisce l'accesso al contenuto del documento tramite la ricerca di testo, aumentando notevolmente l'utilità del documento per i futuri utenti.
La dimensione del file PDF non cambia in modo significativo dopo l'OCR. I dati OCR aggiungono una piccola quantità di dati di testo a ciascuna pagina, in genere pochi kilobyte per pagina. Le immagini della pagina originale rimangono invariate. L'aumento delle dimensioni del file è trascurabile rispetto al miglioramento funzionale fornito dal livello di testo ricercabile.
Il livello di testo ricercabile aggiunto dall'OCR è separato dall'immagine visiva della pagina. Quando cerchi una parola in un PDF elaborato con OCR, la ricerca corrisponde al livello di testo, non all'immagine. Il risultato della ricerca evidenzia l'area dell'immagine della pagina in cui è stato trovato il testo.
I PDF elaborati dall'OCR supportano la lettura vocale, rendendoli accessibili alle persone con disabilità visive e a chiunque preferisca ascoltare i documenti piuttosto che leggerli. Questa funzionalità di accessibilità rappresenta un vantaggio significativo dell'OCR che va oltre la semplice ricercabilità.
Per progetti OCR di grandi dimensioni che coinvolgono centinaia o migliaia di pagine scansionate, l'elaborazione OCR batch consente di risparmiare tempo significativo. Configurare le impostazioni OCR una volta e applicarle all'intero batch di documenti. Esamina un campione di pagine per verificarne l'accuratezza anziché rivedere ogni pagina.
Il livello di testo OCR può essere esportato come file di testo semplice, consentendo l'utilizzo del contenuto del documento in altre applicazioni. Esporta il testo riconosciuto, aprilo in un editor di testo o in un elaboratore di testi e utilizzalo come base per un nuovo documento.
Il valore a lungo termine di un PDF elaborato tramite OCR si realizza ogni volta che è necessario trovare informazioni nel documento. Un PDF ricercabile di un contratto, di un manuale o di un documento di riferimento diventa una risorsa su cui puoi eseguire ricerche anziché un file statico da leggere manualmente.
L'implementazione dell'OCR come passaggio standard nel flusso di lavoro di scansione dei documenti garantisce che ogni documento digitalizzato sia ricercabile dal momento in cui entra nella tua libreria digitale. I pochi secondi extra di elaborazione OCR durante la scansione ti ripagheranno ogni volta che avrai bisogno di trovare informazioni in qualsiasi documento che hai scansionato.
Per chiunque gestisca una libreria di documenti digitali, l'OCR è la fase di elaborazione di maggior impatto che puoi applicare ai PDF scansionati. Trasforma i file di immagine passivi in documenti attivi, ricercabili e accessibili.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
