Tips & Tricks

Come eseguire l'OCR di un PDF con direzione del testo verticale o da destra a sinistra

I motori OCR standard si basano su un presupposto fondamentale: il testo scorre orizzontalmente da sinistra a destra attraverso la pagina. Questa ipotesi funziona per l'inglese, lo spagnolo, il francese, il tedesco e la maggior parte delle lingue europee. Fallisce completamente per il testo giapponese impostato verticalmente in colonne tradizionali, per i segni cinesi in cui i caratteri si sovrappongono dall'alto verso il basso e per i documenti arabi ed ebraici in cui il testo scorre da destra a sinistra. L'esecuzione dell'OCR standard su questi documenti produce un output in cui i caratteri vengono riconosciuti individualmente ma assemblati nell'ordine sbagliato, rendendo il risultato inutilizzabile.

La capacità dei motori OCR PDF di gestire indicazioni di testo non standard è migliorata in modo significativo con l'ultima generazione di sistemi di riconoscimento basati sull'intelligenza artificiale. Questi motori rilevano l'orientamento del testo prima di tentarne il riconoscimento, identificano la direzione di lettura e ricostruiscono l'ordine logico di lettura indipendentemente dal layout visivo. Per i documenti con indicazioni di testo miste, come un articolo giapponese che include citazioni inglesi orizzontali, il motore cambia modalità a metà pagina.

How to OCR a PDF With Vertical or Right-to-Left Text Direction

Come i motori OCR rilevano e gestiscono la direzione del testo

I moderni motori OCR iniziano con una fase di analisi del layout che identifica le aree di testo, ne determina l'orientamento e le classifica in base alla direzione di lettura. Per il testo orizzontale, il motore rileva la linea di base e raggruppa i caratteri lungo essa. Per il testo verticale, il motore rileva l'asse verticale e raggruppa i caratteri in colonne. Per il testo da destra a sinistra, il motore identifica il set di caratteri dominante e inverte l'ordine predefinito delle parole da sinistra a destra.

Il rilevamento della direzione del testo si basa su diversi segnali. La presenza di intervalli di caratteri Unicode specifici indica le lingue probabili e le relative direzioni tipiche del testo. La disposizione spaziale dei caratteri rilevati, sia che formino linee orizzontali o colonne verticali, fornisce prova della disposizione. Le proporzioni dei riquadri di delimitazione dei caratteri forniscono un terzo segnale: i caratteri latini sono in genere più larghi che alti, mentre i caratteri CJK sono più o meno quadrati e i caratteri arabi si collegano orizzontalmente in modo da rivelare la direzione di lettura.

I motori OCR più affidabili combinano tutti e tre i tipi di segnale. Un documento contenente sia la scrittura araba, che implica la lettura da destra a sinistra, sia la scrittura latina, che implica la lettura da sinistra a destra, richiede che il motore analizzi ciascuna regione del testo in modo indipendente. Una pipeline Estrai dati PDF configurata correttamente per documenti multilingue include il rilevamento della direzione per regione anziché applicare una singola direzione all'intera pagina.

Ogni sistema di scrittura richiede una configurazione OCR fondamentalmente diversa.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Impostazioni OCR per testo verticale in giapponese, cinese e coreano

Il testo verticale giapponese, chiamato tategaki, è il sistema di scrittura verticale più comune nell'uso moderno. Appare in romanzi, giornali, documenti tradizionali e corrispondenza formale. Nel giapponese verticale, i caratteri vengono letti dall'alto verso il basso, con le colonne che procedono da destra a sinistra nella pagina. I numeri e le parole in caratteri latini incorporati nel testo giapponese verticale possono essere ruotati o impostati orizzontalmente all'interno del flusso verticale.

Per eseguire l'OCR del testo giapponese verticale, selezionare un motore di riconoscimento che supporti esplicitamente tategaki. I motori OCR generici potrebbero rilevare correttamente i caratteri ma visualizzarli in ordine orizzontale da sinistra a destra, producendo spazzatura. I motori OCR specifici per il giapponese comprendono l'ordine di lettura basato su colonne e il testo di output che può essere letto in modo naturale. Tesseract, il motore OCR open source, ha aggiunto un supporto giapponese verticale migliorato nella versione 5 e diversi motori commerciali ora lo offrono.

Per il testo verticale cinese, che appare nelle pubblicazioni tradizionali, nella calligrafia e in alcuni documenti formali, la sfida del riconoscimento è simile ma il set di caratteri è più ampio. Il cinese semplificato utilizza circa 7.000 caratteri di uso comune, mentre il cinese tradizionale ne utilizza oltre 13.000. Il motore OCR non deve solo rilevare il layout verticale ma anche distinguere tra caratteri visivamente simili che differiscono solo nei dettagli del tratto.

Il testo verticale coreano è raro nei documenti moderni ma appare nei testi storici e in alcune pubblicazioni tradizionali. L'alfabeto coreano, Hangul, assembla le singole lettere in blocchi di sillabe e nella scrittura verticale questi blocchi sono impilati dall'alto verso il basso. I motori OCR che gestiscono il testo verticale coreano devono riconoscere la struttura del blocco di sillabe nonché i singoli componenti delle lettere all'interno di ciascun blocco.

Impostazioni OCR per testo da destra a sinistra in arabo, ebraico e persiano

L'OCR arabo presenta sfide uniche che vanno oltre la direzione del testo. L'arabo è una scrittura corsiva in cui la maggior parte delle lettere si collega alle lettere vicine e la forma della lettera cambia a seconda della sua posizione nella parola: iniziale, mediale, finale o isolata. Il motore OCR deve riconoscere queste forme contestuali e associarle al carattere astratto corretto. Le connessioni mancate o le false connessioni tra lettere producono errori di riconoscimento specifici delle scritture corsive.

Quando si seleziona l'OCR ebraico, la scrittura non è corsiva ma include punti vocalici, chiamati niqqud, che appaiono come punti e trattini sopra, sotto o all'interno delle lettere. Questi segni vocalici sono piccoli, in genere da 2 a 4 pixel in un'immagine scansionata, e vengono facilmente persi durante la binarizzazione. Un motore OCR che non gestisce esplicitamente niqqud riconoscerà correttamente le consonanti ma eliminerà i segni vocalici, producendo un testo che un lettore umano può comprendere ma che è tecnicamente incompleto.

Il persiano e l'urdu utilizzano versioni estese della scrittura araba con caratteri aggiuntivi. Un motore OCR addestrato solo sull'arabo non vedrà questi caratteri aggiuntivi o li riconoscerà erroneamente come lettere arabe simili. Quando selezioni un motore OCR per queste lingue, verifica che elenchi specificamente il supporto per l'esatta variante di lingua e scrittura utilizzata dal documento, non solo per la scrittura araba in generale.

Gestione di documenti con direzioni miste

Molti documenti del mondo reale mescolano più indicazioni di testo sulla stessa pagina. Un documento tecnico giapponese può avere il corpo del testo in giapponese verticale, didascalie delle figure in inglese orizzontali ed equazioni matematiche che seguono le proprie regole di layout. Una lettera commerciale in arabo può includere il nome di una società inglese e un blocco di indirizzi nel formato da sinistra a destra sopra il corpo del testo da destra a sinistra.

Per i documenti con direzioni miste, la fase di preelaborazione OCR è fondamentale. Il documento deve essere segmentato in aree di testo e ciascuna area deve essere classificata in modo indipendente per la direzione del testo prima che inizi il riconoscimento. La selezione manuale della regione spesso produce risultati migliori rispetto alla segmentazione automatica per layout complessi. Disegna riquadri di delimitazione attorno a ciascuna area di testo e assegna la lingua e la direzione corrette a ciascuna casella.

Dopo l'OCR, verificare l'output controllando il testo che oltrepassa i limiti della direzione. Un errore comune nell'OCR a direzione mista è quello di sbagliare il confine tra due aree di testo, in modo che l'ultima parola di un'area da sinistra a destra venga aggiunta all'inizio di un'area da destra a sinistra o viceversa. Il controllo a campione di queste aree di confine rileva gli errori di segmentazione del layout che altrimenti produrrebbero risultati confusi.

Elaborazione post-OCR per indicazioni di testo non standard

Una volta completato l'OCR, potrebbe essere necessario riordinare il testo riconosciuto per produrre un ordine di lettura naturale. Alcuni motori OCR generano il testo giapponese verticale nell'ordine in cui è stato riconosciuto, dall'alto al basso all'interno di ciascuna colonna, colonna per colonna da sinistra a destra. Questo ordine non corrisponde all'ordine di lettura originale, che è colonna per colonna da destra a sinistra. Una fase di post-elaborazione che riordina le colonne produce la sequenza di lettura corretta.

Per i documenti con contenuto PDF scansionato che include testo bidirezionale, arabo con termini inglesi incorporati, l'algoritmo bidirezionale Unicode specifica come determinare l'ordine di visualizzazione. L'output OCR deve includere caratteri di controllo bidirezionale Unicode o seguire l'algoritmo in modo che il testo venga visualizzato correttamente quando incollato in applicazioni che supportano il testo bidirezionale.

WukongPDF fornisce l'elaborazione OCR tramite il browser per i PDF scansionati, con opzioni di selezione della lingua che includono il supporto per i principali sistemi di scrittura da destra a sinistra e verticale. Testare l'OCR su una pagina campione prima di elaborare l'intero documento consente di verificare che la direzione del testo venga gestita correttamente.

Per i documenti che contengono testo sia verticale che orizzontale sulla stessa pagina, ad esempio il layout di una rivista giapponese in cui l'articolo principale è verticale ma le didascalie e le barre laterali sono orizzontali, la suddivisione in zone manuale produce i risultati OCR più accurati. Disegna zone di riconoscimento separate per le regioni verticale e orizzontale, assegna la direzione corretta del testo a ciascuna ed esegui l'OCR sul documento suddiviso in zone. Il tempo extra dedicato alla suddivisione in zone ripaga in termini di precisione del riconoscimento.

Quando si elaborano documenti storici con layout di testo non standard, prepararsi al fatto che la precisione dell'OCR sarà inferiore rispetto ai moderni documenti stampati. I caratteri storici, la stampa non uniforme, la carta invecchiata con scolorimento e le varianti di caratteri non standard riducono la sicurezza del riconoscimento. Per il lavoro accademico o di archivio, considera l'output OCR come un punto di partenza per la trascrizione manuale piuttosto che come un prodotto finito.

Alcuni motori OCR supportano una modalità di formazione in cui fornisci esempi del carattere specifico o dello stile di grafia utilizzato nel documento. Addestrare il motore su poche pagine rappresentative migliora l'accuratezza del riconoscimento nell'intero documento. Questo approccio è particolarmente utile per documenti stampati con caratteri insoliti o per raccolte di documenti dello stesso editore in cui la tipografia è coerente su più volumi.

Una volta completato l'OCR su un documento da destra a sinistra, verifica che la direzione del testo sia corretta copiando alcune frasi dall'output e incollandole in un'applicazione che supporti il testo bidirezionale, come Microsoft Word o Google Docs. Se il testo viene visualizzato in ordine inverso, il motore OCR non ha applicato correttamente la direzione da destra a sinistra e l'output deve essere rielaborato con le impostazioni di direzione corrette.

Il tempo investito nell'impostazione dei parametri OCR corretti per indicazioni di testo non standard viene ripagato immediatamente in termini di precisione del riconoscimento. Un documento che richiede 30 minuti di correzione manuale dopo un OCR scadente potrebbe richiedere solo 5 minuti di pulizia dopo un OCR configurato correttamente.

Sistema di scritturaDirezioneRequisiti motore OCRSfida chiave
giapponese (tategaki)Colonne dall'alto verso il basso, da destra a sinistraMotore con supporto tategaki esplicitoInglese orizzontale misto in flusso verticale
Cinese (tradizionale)Colonne verticali, da destra a sinistraSet di caratteri di grandi dimensioni (oltre 13.000)Personaggi visivamente simili
araboCollegamento corsivo da destra a sinistraMotore di scrittura araba con forme posizionaliForme di lettere contestuali; segni diacritici
ebraicoDa destra a sinistra, con niqqudMotore di script ebraico con supporto vocalePiccoli segni vocalici persi nella binarizzazione
Persiano/UrduArabo esteso da destra a sinistraMotore specifico della linguaCaratteri aggiuntivi oltre al set arabo
WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →