Tips & Tricks

Come eseguire l'OCR di un documento accademico scansionato in cui il testo delle note a piè di pagina e le citazioni a margine si sovrappongono fisicamente alla colonna di testo del corpo principale

How to OCR a Scanned Academic Paper Where Footnote Text and Margin Citations Physically Overlap With the Main Body Text Column

Perché l'OCR ha problemi con la sovrapposizione del testo delle note a piè di pagina e del contenuto a margine

I motori di riconoscimento ottico dei caratteri funzionano meglio quando il testo si trova in blocchi puliti e prevedibili con un'interlinea coerente e una chiara separazione tra le aree di contenuto. Un'operazione OCR PDF su una lettera commerciale standard o una nuova pagina produce in genere risultati accurati perché il testo scorre in paragrafi ordinati con ampi margini su tutti i lati. Gli articoli accademici presentano un problema fondamentalmente più difficile perché il loro layout raggruppa deliberatamente più flussi di testo distinti in stretta vicinanza fisica, con note a piè di pagina, citazioni a margine e corpo del testo che spesso si toccano o si sovrappongono ai loro confini.

La sfida principale è la segmentazione, la fase in cui il motore OCR divide l’immagine della pagina in aree di testo prima di tentare il riconoscimento dei caratteri. Quando un numero di riferimento di una nota a piè di pagina nel corpo del testo si trova direttamente sopra una linea di separazione della nota a piè di pagina e tale linea si trova direttamente sopra il testo della nota a piè di pagina stesso con una dimensione di carattere più piccola, l'algoritmo di segmentazione deve decidere dove finisce una regione di testo e inizia quella successiva. Una decisione sbagliata di segmentazione qui si traduce in errori di riconoscimento perché i caratteri di due flussi di testo diversi vengono inseriti nel motore di riconoscimento come se fossero un'unica riga continua. L'output si legge come un mix incomprensibile di parole del corpo del testo con frammenti di note a piè di pagina.

Le citazioni a margine aggiungono un terzo flusso di testo al problema. Nei documenti umanistici che seguono lo stile Chicago o nei documenti legali che utilizzano il formato Bluebook, le note a margine, i numeri di riga o le citazioni parallele corrono verticalmente o orizzontalmente accanto alla colonna di testo principale. Questi elementi di margine vengono spesso stampati con dimensioni in punti inferiori, a volte 7 o 8 punti, e possono utilizzare caratteri corsivi o condensati con cui i motori OCR già hanno difficoltà a dimensioni normali. Quando il testo a margine tocca fisicamente il corpo del testo, cosa che accade frequentemente in riviste dalla formattazione rigida con margini stretti, la sfida della segmentazione diventa a tre vie invece che a due.

Anche la qualità della carta dell'origine PDF scansionato aggrava la difficoltà dell'OCR. Molti documenti accademici vengono scansionati da volumi rilegati in cui la curvatura della pagina vicino al dorso fa piegare e distorcere il testo. Le note a piè di pagina sono la sezione più interessata dalla curvatura del dorso perché si trovano più vicine alla rilegatura. La combinazione di distorsione fisica della pagina curva, dimensioni ridotte del carattere e vicinanza al corpo del testo sopra crea una tempesta perfetta di condizioni avverse per la precisione dell'OCR.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Preelaborazione della pagina scansionata per separare aree di testo sovrapposte

Il modo più efficace per migliorare la precisione dell'OCR sulle pagine accademiche con elementi di testo sovrapposti è preelaborare l'immagine della pagina prima che raggiunga il motore OCR. Questa preelaborazione separa i diversi flussi di testo in modo che il motore non debba mai prendere decisioni ambigue sulla segmentazione.

Inizia raddrizzando la pagina scansionata per garantire che tutte le righe di testo siano perfettamente orizzontali. Anche un'inclinazione di un grado nella scansione originale può causare lo spostamento del testo della nota a piè di pagina nell'area del corpo del testo ai bordi della pagina, creando false sovrapposizioni che non esisterebbero su una pagina correttamente allineata. La maggior parte dei software di scansione dei documenti include il raddrizzamento automatico, ma per i documenti accademici scansionati da volumi rilegati, il raddrizzamento manuale con una linea di riferimento tracciata lungo la linea di base del corpo del testo produce risultati più accurati rispetto alla correzione automatica.

Dopo il raddrizzamento, il passo successivo è il mascheramento della regione. Utilizzando un editor di immagini o uno strumento di preelaborazione OCR dedicato, traccia una linea di separazione orizzontale tra l'area del corpo del testo e l'area della nota a piè di pagina. Questa riga indica al motore OCR downstream di trattare tutto ciò che sta sopra come un'area di testo e tutto ciò che sta sotto come un'area di testo separata. Nelle pagine in cui sono presenti note a piè di pagina, il separatore dovrebbe trovarsi appena sopra il filetto delle note a piè di pagina, la breve linea orizzontale che tradizionalmente separa il corpo del testo dalle note a piè di pagina nei lavori accademici stampati. Nelle pagine senza note a piè di pagina non è necessario alcun separatore.

Per le citazioni a margine e i numeri di riga, il mascheramento verticale è l'approccio equivalente. Disegna un separatore verticale tra il testo a margine e la colonna di testo principale. Nelle pagine con numeri di riga sul margine sinistro e citazioni sul margine destro, entrambi i lati necessitano di separatori verticali. L'obiettivo è suddividere la pagina in regioni rettangolari in cui ciascuna regione contiene esattamente un flusso di testo. Il motore OCR elabora quindi ciascuna regione in modo indipendente e produce output di testo riconosciuti separati che è possibile riassemblare nell'ordine di lettura corretto una volta completato il riconoscimento.

Configurazione delle impostazioni OCR per pagine accademiche multi-flusso

La maggior parte dei motori OCR professionali fornisce impostazioni che aiutano con i layout di pagina a più colonne e multi-stream. L'abilitazione dell'analisi automatica del layout è il punto di partenza, ma per le pagine accademiche con flussi di testo ravvicinati, la configurazione manuale delle zone produce risultati migliori rispetto all'analisi completamente automatica.

Definire zone di riconoscimento separate per il corpo del testo, l'area della nota a piè di pagina e ciascuna regione del testo a margine. All'interno di ciascuna zona, imposta la lingua appropriata, l'intervallo di dimensioni dei caratteri previsto e l'orientamento del testo. Le zone del corpo del testo dovrebbero prevedere un testo da 10 a 12 punti con orientamento orizzontale da sinistra a destra. Le zone delle note a piè di pagina dovrebbero prevedere un testo da 8 a 10 punti, sempre orizzontale ma con la consapevolezza che il testo delle note a piè di pagina spesso include URL, DOI e stringhe di citazioni che potrebbero confondere i modelli linguistici che prevedono una prosa naturale.

Nello specifico, per la zona del corpo del testo, abilitare l'impostazione che ignora il testo in apice e pedice ai fini della segmentazione della linea. I numeri di riferimento delle note a piè di pagina e gli esponenti matematici sono in genere più piccoli e sollevati sopra la linea di base, il che causa errori di calcolo dell'altezza della riga se il motore li tratta come parte della normale riga di testo. Ignorando il posizionamento dell'apice ai fini della segmentazione si mantengono intatte le righe del corpo del testo mentre i marcatori delle note a piè di pagina vengono riconosciuti come piccoli elementi separati che non influiscono sui limiti delle righe.

La qualità dell'output da PDF a testo migliora in modo significativo quando il risultato del riconoscimento di ciascuna zona viene salvato in un file di testo separato o in una sezione contrassegnata separata all'interno di un output combinato. Questo output separato in zone semplifica la verifica che il corpo del testo non sia confuso nel testo della nota a piè di pagina e che le citazioni a margine appaiano nella propria sezione di output chiaramente etichettata anziché interlacciate con il contenuto principale.

Pulizia post-riconoscimento per output OCR accademico

Anche con un'attenta preelaborazione e configurazione delle zone, alcuni errori di riconoscimento sono inevitabili su pagine accademiche fitte. Un processo strutturato di pulizia post-riconoscimento rileva e corregge questi errori residui prima che il testo entri nel documento finale.

Esegui un controllo ortografico solo sull'output del corpo del testo, con il dizionario del controllo ortografico impostato sulla lingua principale del documento. Le parole contrassegnate come errate nel corpo del testo che risultano essere scritte correttamente nel contenuto della nota a piè di pagina sono un chiaro segno che il confine della zona del corpo del testo era troppo ampio e ha catturato il testo della nota a piè di pagina. Regola il confine della zona per quelle pagine ed esegui nuovamente il riconoscimento anziché modificare manualmente i frammenti delle note a piè di pagina.

Per l'output del testo della nota a piè di pagina, verificare che ogni nota a piè di pagina inizi con il numero di riferimento previsto e che il testo della nota a piè di pagina scorra in modo continuo senza frammenti di testo del corpo intervallati. Un modello comune di errore post-riconoscimento è rappresentato dalle righe del corpo del testo che appaiono al centro del testo della nota a piè di pagina in cui la colonna del corpo del testo si estende più in basso nella pagina rispetto al limite della zona previsto. L'esame dell'immagine della pagina originale accanto al testo della nota a piè di pagina riconosciuto rileva rapidamente queste intrusioni perché l'argomento della frase passa improvvisamente dall'argomento accademico all'argomento del paragrafo del corpo non correlato.

Lo strumento OCR di WukongPDF supporta il riconoscimento basato su zone per layout di pagina complessi, inclusi documenti accademici a più colonne con note a piè di pagina e contenuto a margine. La definizione delle impostazioni per zona per lingua, intervallo di dimensioni dei caratteri e orientamento del testo prima di avviare il passaggio di riconoscimento produce un output OCR PDF più accurato rispetto all'elaborazione a zona singola sulle stesse pagine e il formato di output separato semplifica la verifica post-riconoscimento.

Gestione di casi particolari: notazione matematica, scritture non latine e lingue miste

Gli articoli accademici nei campi STEM aggiungono la notazione matematica alla sfida del testo sovrapposto. Equazioni e formule intervallate dal corpo del testo creano ulteriore complessità di segmentazione perché la notazione matematica utilizza simboli, lettere greche e formattazione bidimensionale come frazioni e apici che non seguono le stesse regole di layout del testo in prosa. I motori OCR progettati per il testo del documento funzionano male con la notazione matematica, così come i motori progettati per la matematica funzionano male con il testo del documento.

L'approccio più pratico per le pagine miste di matematica e prosa è una strategia OCR a due passaggi. Il primo passaggio utilizza un motore ottimizzato per i documenti per riconoscere tutte le regioni del testo in prosa, inclusi il corpo del testo, le note a piè di pagina e le citazioni a margine. Il secondo passaggio utilizza un motore di riconoscimento matematico nelle aree specifiche della pagina che contengono equazioni. L'unione dei due output in un documento combinato che preserva sia l'accuratezza della prosa del motore del documento sia l'accuratezza della formula del motore matematico produce il risultato complessivo più affidabile.

Per i documenti che mescolano scritture latine e non latine, come documenti in lingua inglese con citazioni arabe, cinesi o cirilliche nelle note a piè di pagina, configurare ciascuna zona di riconoscimento con la scrittura primaria corretta. La zona del corpo del testo utilizza la lingua principale del documento. Le zone delle note a piè di pagina che contengono passaggi in caratteri non latini potrebbero richiedere una configurazione di riconoscimento di più caratteri in grado di passare da una scrittura all'altra all'interno di una singola area di testo.

La tabella seguente riassume le configurazioni delle zone OCR consigliate per le diverse aree della pagina nei documenti accademici.

Regione paginaDimensione carattere previstaOrientamentoImpostazioni speciali
Corpo del testo10-12 puntiOrizzontaleIgnora l'apice per la segmentazione della linea
Note a piè di pagina8-10 puntiOrizzontaleMultiscrittura se le citazioni includono testo non latino
Margine sinistro (numeri di riga)7-9 puntiOrizzontale o verticaleEstrai come output separato; non fondersi con il corpo
Margine destro (citazioni)7-9 puntiOrizzontaleEstrai come output separato
Equazioni/FormuleVariabileOrizzontale con layout 2DUtilizza il motore matematico al secondo passaggio
WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →