Tips & Tricks

Come esportare i risultati OCR da un PDF a JSON

L'esecuzione di OCR PDF su un documento scansionato produce testo riconosciuto, ma la maggior parte degli strumenti OCR genera quel testo come file di testo piatto o lo incorpora nuovamente nel PDF. L'esportazione dei risultati OCR direttamente in JSON fornisce dati strutturati e leggibili dalla macchina che possono essere inseriti in database, indici di ricerca, sistemi di gestione dei contenuti e flussi di lavoro automatizzati. Un sondaggio del 2025 condotto da AIIM International ha rilevato che il 43% delle organizzazioni ora preferisce formati di dati strutturati come JSON per il testo derivato da documenti perché si integrano più facilmente con le moderne applicazioni cloud e le pipeline AI (AIIM, "State of Intelligent Information Management", 2025).

Concetti chiave

L'esportazione dei risultati OCR in JSON preserva la struttura del testo riconosciuto, inclusi i numeri di pagina, le coordinate delle parole e i punteggi di confidenza, che vengono persi durante l'esportazione in testo normale. La maggior parte dei motori OCR moderni supportano l'output JSON in modo nativo, ma potrebbe essere necessario abilitare la funzionalità nelle impostazioni o selezionarla da un menu del formato di esportazione. Il file JSON risultante può essere utilizzato per la ricerca full-text, le pipeline di estrazione dei dati e l'addestramento di modelli di machine learning sul contenuto dei documenti.

Per gli sviluppatori che integrano OCR JSON nelle applicazioni, la maggior parte dei formati di output JSON include un campo versione che identifica la versione dello schema. Controlla sempre questo campo prima dell'analisi per evitare modifiche di rilievo quando il motore OCR aggiorna il suo formato di output. Una semplice protezione della versione all'inizio del codice di analisi previene errori criptici quando la struttura JSON cambia tra le versioni del motore.

How to Export OCR Results From a PDF to JSON

Perché l'output JSON è migliore del testo normale per i risultati OCR

L'output in testo normale dell'OCR scarta tutto tranne i caratteri stessi. Ottieni le parole ma perdi il numero di pagina in cui è apparsa ciascuna parola, le coordinate del riquadro di delimitazione che ti dicono dove si trova il testo sulla pagina, il punteggio di confidenza che indica quanto è sicuro il motore OCR su ciascun carattere e qualsiasi informazione strutturale come interruzioni di paragrafo e layout di colonna. JSON preserva tutto questo. Un file di output OCR JSON PDF scansionato contiene in genere una serie di oggetti di pagina, ciascuno con una serie di oggetti blocco di testo, ciascuno contenente il testo riconosciuto più la relativa posizione, dimensione e metadati di confidenza.

Questa struttura consente l'automazione a valle che è impossibile con il testo semplice. Uno script può leggere il file JSON ed estrarre solo il testo da un'area specifica di ciascuna pagina, ad esempio l'area dell'intestazione o una colonna della barra laterale. Può filtrare i risultati OCR poco attendibili per evitare di inquinare un indice di ricerca con testo confuso. Può ricostruire l'ordine di lettura di un layout a più colonne ordinando i blocchi di testo in base alle coordinate Y e X. Nessuna di queste operazioni è possibile con un file di testo semplice da OCR.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Passo passo: esportare i risultati OCR in JSON

Prima di eseguire l'OCR, controlla la risoluzione dell'immagine del PDF scansionato. La maggior parte dei motori OCR offre prestazioni migliori quando le immagini della pagina di input sono a 300 DPI. Al di sotto dei 200 DPI, la precisione del riconoscimento diminuisce notevolmente. Al di sopra di 400 DPI, il tempo di elaborazione aumenta senza un miglioramento significativo della precisione. Se il tuo PDF scansionato contiene immagini di pagina a bassa risoluzione, considera l'upscaling a 300 DPI prima di eseguire l'OCR con output JSON. La fase aggiuntiva di preelaborazione migliora notevolmente la qualità dei dati JSON.

Apri il tuo PDF scansionato in uno strumento OCR che supporti l'output strutturato. Tesseract, il motore OCR open source più utilizzato, supporta l'output JSON attraverso la sua interfaccia a riga di comando e attraverso la maggior parte delle applicazioni che lo raggruppano. In Tesseract, l'aggiunta del flag del formato di output produce un file JSON insieme al testo riconosciuto. Le API OCR commerciali di Google Cloud Vision, Amazon Textract e Microsoft Azure Form Recognizer restituiscono tutte JSON per impostazione predefinita, con il testo riconosciuto organizzato per pagina, blocco, paragrafo, riga e parola.

Dopo aver eseguito l'OCR con l'output JSON abilitato, apri il file risultante in un editor di testo per comprenderne la struttura. Il JSON conterrà matrici di oggetti della pagina. Ogni oggetto pagina contiene le dimensioni della pagina e gli array di oggetti blocco. Ogni blocco contiene il testo riconosciuto, un punteggio di confidenza generalmente compreso tra 0 e 100 e le coordinate del riquadro di delimitazione che descrivono la posizione del blocco sulla pagina. La familiarità con questa struttura ti consente di scrivere semplici script per estrarre esattamente i dati di cui hai bisogno. Lo strumento OCR di WukongPDF include un'opzione di esportazione JSON che organizza il testo riconosciuto con numeri di pagina, punteggi di confidenza e dati di posizione, quindi non è necessario configurare un motore OCR separato per ottenere un output strutturato.

Strutture JSON comuni per l'output OCR

La maggior parte degli output OCR JSON PDF scansionato includono anche una sezione di metadati globali nella parte superiore del file che registra il nome del motore OCR, la versione, la data di elaborazione e la lingua o le lingue rilevate nel documento. Questi metadati sono preziosi per gli audit trail e per il debug dei problemi di qualità dell'OCR. Se stai elaborando documenti da più origini, i metadati indicano quale motore ha prodotto ciascun risultato e se la versione del motore è cambiata tra i batch, il che può spiegare le differenze nella qualità del riconoscimento.

CampoDescrizioneValore di esempio
paginaNumero di pagina nel documento originale3
testoContenuto testuale riconosciuto"Fattura n. 4521"
fiduciaConfidenza OCR da 0 a 10094,7
bboxRiquadro di delimitazione [x, y, larghezza, altezza] in pixel[120, 340, 400, 28]
tipo_bloccoTipo di blocco di contenuto"paragrafo" o "tabella" o "linea"
linguaLingua rilevata del testo"it"

Utilizzo dei dati JSON OCR nei flussi di lavoro automatizzati

Vale la pena pianificare in anticipo la gestione degli errori. Un OCR eseguito su una pagina con una qualità dell'immagine molto scarsa può produrre un punteggio di confidenza inferiore al 50% per la maggior parte delle parole riconosciute. Il tuo flusso di lavoro dovrebbe definire una soglia minima di confidenza al di sotto della quale i risultati vengono contrassegnati per la revisione umana anziché essere inseriti automaticamente in un database o in un indice di ricerca. L'invio di output OCR PDF scansionati poco sicuri direttamente a un sistema di produzione inquina i dati con errori che sono molto più costosi da eliminare in un secondo momento piuttosto che contrassegnarli per la revisione al momento dell'estrazione.

Una volta che i risultati dell'OCR sono in JSON, le possibilità di automazione si espandono in modo significativo. Uno schema comune è quello di scrivere uno script che controlli una cartella alla ricerca di nuovi PDF scansionati, esegua l'OCR con output JSON, analizzi il JSON per estrarre campi specifici come numeri di fatture o date da posizioni note sulla pagina e inserisca tali valori in un database o foglio di calcolo. Poiché JSON include coordinate di posizione, lo script di estrazione può indirizzare il testo in aree specifiche della pagina indipendentemente dal contenuto complessivo del documento.

Per le applicazioni di ricerca, l'output JSON può essere inserito in un indice di ricerca come Elasticsearch o Algolia. Ogni pagina diventa un documento ricercabile con il numero di pagina come campo di metadati. I punteggi di confidenza ti consentono di ottimizzare la pertinenza della ricerca assegnando un peso maggiore al testo OCR ad alta confidenza. Gli utenti che cercano un termine visualizzano i risultati classificati in base alla certezza del motore OCR che il termine appaia effettivamente sulla pagina, riducendo le false corrispondenze derivanti da caratteri non riconosciuti.

Per le pipeline di intelligenza artificiale e machine learning, l'output OCR strutturato PDF scansionato in JSON è il formato di input standard. I modelli linguistici di grandi dimensioni e i sistemi di comprensione dei documenti utilizzano rappresentazioni JSON di

Domande frequenti

Come dovrei archiviare i file OCR JSON insieme ai PDF originali per l'accesso a lungo termine? Archivia i file JSON nella stessa cartella dei PDF con nomi di file corrispondenti. Ad esempio, report-2025.pdf e report-2025.ocr.json. Questa convenzione di denominazione rende banale per gli script trovare l'output OCR PDF scansionato per un determinato PDF. Per archivi di grandi dimensioni, valuta la possibilità di archiviare il JSON in un database di documenti che supporti la ricerca full-text anziché come file flat.

L'output JSON dell'OCR aumenta le dimensioni del file rispetto al testo normale?

Sì, di solito con un fattore da 3 a 5 volte. Un documento scansionato di 10 pagine che produce 15 KB di testo normale potrebbe produrre un file JSON da 50 a 75 KB. La dimensione aggiuntiva deriva dai metadati strutturali: numeri di pagina, riquadri di delimitazione e punteggi di confidenza per ogni parola riconosciuta. Per la maggior parte delle applicazioni, questo aumento di dimensione è trascurabile. Solo su scala molto ampia, come milioni di pagine, diventa una considerazione di archiviazione che vale la pena pianificare.

Posso convertire il testo normale esistente PDF scansionato Output OCR in JSON?

Non in modo significativo. Una volta appiattiti i risultati dell'OCR in testo semplice, i dati sulla posizione e i punteggi di confidenza vengono persi e non possono essere ricostruiti dal solo testo. Se hai bisogno di dati OCR strutturati da documenti precedentemente elaborati, l'approccio più affidabile è rieseguire l'OCR sui PDF scansionati originali con l'output JSON abilitato.

Quali motori OCR producono l'output JSON più utile?

I servizi OCR basati su cloud di Google, Amazon e Microsoft generalmente producono l'output JSON più dettagliato, con riquadri di delimitazione a livello di parola e punteggi di confidenza. Tesseract produce un solido JSON a livello di riga e di parola. La scelta migliore dipende dal volume, dal budget e dalla possibilità che i requisiti di privacy consentano l'invio di documenti a un servizio cloud.

Posso riconvertire l'output JSON OCR in un PDF ricercabile? Sì, anche se il processo richiede una libreria di generazione PDF in grado di posizionare oggetti di testo a coordinate specifiche. I dati del riquadro di delimitazione nell'output JSON indicano esattamente dove appartiene ciascuna parola nella pagina. Questo è l'inverso del processo di estrazione ed è utile quando è necessario creare un PDF ricercabile dal testo OCR corretto dopo aver corretto gli errori di riconoscimento nei dati JSON.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →