Tips & Tricks

Come eseguire l'OCR di un PDF che contiene più lingue o testo non inglese

Esegui la scansione di un contratto bilingue. La colonna di sinistra è in inglese. La colonna di destra è in spagnolo. Entrambe le lingue devono essere ricercabili, ma un'esecuzione OCR standard configurata per una lingua rovinerà l'altra. L'OCR inglese applicato al testo spagnolo produce sciocchezze perché il motore di riconoscimento prevede frequenze di lettere e modelli di parole diversi. L'OCR spagnolo applicato all'inglese produce risultati altrettanto confusi. Hai bisogno di un OCR che comprenda entrambe le lingue contemporaneamente.

Multilingue OCR PDF è una funzionalità dei moderni motori di riconoscimento che può passare da un modello linguistico all'altro all'interno di un singolo documento. Il motore rileva in quale lingua è scritto ciascun blocco di testo e applica il modello di riconoscimento appropriato. Il risultato è un riconoscimento accurato del testo in tutte le lingue del documento.

How to OCR a PDF That Contains Multiple Languages or Non-English Text

Come i motori OCR gestiscono più lingue

I motori OCR riconoscono il testo confrontando le forme dei caratteri con modelli addestrati di come appaiono le lettere in ciascuna lingua. Un modello inglese sa che la lettera "e" è il più comune, ovvero "th"; appaiono spesso insieme e che alcune combinazioni di caratteri come "qx" non si verificano quasi mai. Un modello spagnolo sa che i caratteri accentati come "a" con accento, "n" con tilde e punti interrogativi invertiti sono comuni. Un modello francese prevede vocali accentate frequenti e digrammi specifici.

Quando specifichi più lingue per un lavoro OCR, il motore carica i modelli di caratteri per tutte le lingue specificate. Mentre elabora ciascun blocco di testo sulla pagina, valuta quale modello linguistico corrisponde meglio ai modelli di caratteri osservati e applica tale modello. Il rilevamento della lingua avviene automaticamente a livello di blocco di testo, quindi una pagina con corpo del testo in inglese e note a piè di pagina in francese viene gestita correttamente senza tagging manuale della lingua.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Impostazione dell'OCR multilingue

Nella selezione della lingua dello strumento OCR sono consentite più lingue. Seleziona tutte le lingue che appaiono nel documento. Per un contratto bilingue inglese-spagnolo, seleziona sia inglese che spagnolo. Per un documento dell'Unione Europea che contiene inglese, francese e tedesco, selezionarli tutti e tre. Per un lavoro accademico con testo inglese e citazioni in greco antico, seleziona Inglese e greco. Il motore carica tutti i modelli necessari.

Esiste un compromesso tra copertura linguistica e accuratezza. Ogni lingua aggiuntiva aggiunge più modelli di carattere al processo di riconoscimento, il che aumenta la possibilità di confusione tra caratteri simili di lingue diverse. La lettera cirillica "a"; sembra identico alla lettera latina "a"; ma rappresenta un suono diverso e appare in contesti diversi. L'aggiunta di lingue non necessarie aumenta il rischio che il motore classifichi erroneamente i blocchi di testo e applichi il modello linguistico sbagliato. Seleziona solo le lingue effettivamente presenti nel documento, non tutte le lingue che ritieni possano essere utili.

Scenari OCR multilingue comuni e come gestirli

Lo scenario multilingue più comune è un documento che è principalmente in una lingua con brevi passaggi, citazioni o note a piè di pagina in un'altra. Un articolo accademico in inglese con citazioni francesi nelle note. Un manuale di istruzioni in tedesco con termini tecnici in inglese. Un contratto legale in spagnolo con termini definiti in inglese. Per questi documenti, la lingua principale contiene la maggior parte del testo e la lingua secondaria appare in contesti brevi e prevedibili.

Il motore di riconoscimento gestisce bene questi documenti in lingue miste perché il cambio di lingua è localizzato in blocchi di testo specifici. Il corpo del testo inglese viene riconosciuto con il modello inglese. La citazione francese si riconosce con il modello francese. Poiché le due lingue vengono visualizzate in blocchi di testo separati, il rilevamento della lingua da parte del motore identifica correttamente quale modello utilizzare per ciascun blocco.

Uno scenario più impegnativo è un documento in cui le lingue sono intercalate sulla stessa riga, come un libro di testo che mostra una frase in inglese seguita dalla sua traduzione in spagnolo sulla stessa riga. Il motore OCR può trattare l'intera riga come un blocco di testo e applicare a tutto un modello linguistico, producendo errori nella metà della riga che è nell'altra lingua. Per questi documenti, l'approccio più accurato consiste nell'effettuare l'OCR del documento due volte, una in ciascuna lingua, e unire manualmente i risultati. Si tratta di un'operazione ad alta intensità di manodopera e pratica solo per documenti brevi in cui la precisione è fondamentale.

Verifica dei risultati OCR multilingue

Dopo aver eseguito l'OCR multilingue, verificare i risultati controllando il testo in ciascuna lingua. Cerca una parola che sai che appare in ogni lingua. Conferma che la ricerca lo trova. Seleziona il testo in ciascuna lingua e copialo per confermare che i caratteri siano corretti. Presta particolare attenzione ai caratteri accentati e ai simboli speciali. È molto probabile che il riconoscimento PDF scansionato non riesca su caratteri che non esistono nel modello linguistico dominante perché il motore potrebbe impostare automaticamente l'equivalente latino più vicino.

Gli errori OCR comuni nei documenti multilingue includono caratteri accentati sostituiti con i loro equivalenti non accentati, e con accento diventa e, n con tilde diventa n, punteggiatura speciale come punti interrogativi invertiti in spagnolo sostituiti con punti interrogativi standard e script non latini come cirillico o greco riconosciuti erroneamente come caratteri latini visivamente simili. Questi errori sono solitamente concentrati nei passaggi della lingua secondaria. Se il contenuto della lingua secondaria è critico, verifica manualmente tali passaggi rispetto al documento originale. Lo strumento OCR di WukongPDF fornisce un punteggio di confidenza per ciascun blocco di testo riconosciuto, con punteggi inferiori che indicano blocchi in cui il motore di riconoscimento era meno sicuro.

Per i documenti che mescolano lingue con alfabeto latino e scritture non latine, come un documento inglese con citazioni cinesi o arabe, la sfida dell'OCR multilingue è più significativa perché le forme dei caratteri sono fondamentalmente diverse. Il motore di riconoscimento deve distinguere tra sistemi di scrittura completamente separati. Seleziona le lingue specifiche per ciascuna famiglia di script visualizzata nel documento. La gestione del formato PDF di WukongPDF supporta la combinazione di script latini, cirillici, arabi, CJK e indiani in un singolo lavoro OCR, sebbene la precisione vari in base allo script e alla qualità della scansione.

Una tecnica pratica per migliorare l'OCR multilingue su documenti con sezioni linguistiche distinte: pre-separare il documento per lingua prima di eseguire l'OCR. Se un contratto di 20 pagine ha le prime 10 pagine in inglese e le ultime 10 pagine in spagnolo, dividere il documento in due file, eseguire l'OCR inglese sul primo e l'OCR spagnolo sul secondo, quindi unire nuovamente. Ciò evita completamente il sovraccarico del modello multilingue e produce una precisione leggermente superiore perché ogni lavoro OCR utilizza un modello linguistico singolo ottimizzato per il testo esatto che sta elaborando. Il flusso di lavoro suddiviso, OCR separatamente e riunione richiede qualche minuto in più ma produce in modo affidabile la massima precisione per i documenti con chiari confini linguistici. Riservare l'approccio OCR multilingue ai documenti in cui le lingue sono effettivamente interlacciate sulla stessa pagina e la separazione non è pratica.

Un ultimo suggerimento per l'OCR multilingue: se il documento contiene scritture da destra a sinistra come arabo, ebraico o persiano insieme a scritture da sinistra a destra come inglese o francese, la direzione del testo aggiunge complessità. I motori OCR devono rilevare non solo in quale lingua si trova ciascun blocco di testo, ma anche in quale direzione scorre il testo. Un blocco di testo arabo dovrebbe essere riconosciuto da destra a sinistra, mentre la didascalia inglese sottostante dovrebbe essere riconosciuta da sinistra a destra. La maggior parte dei moderni motori OCR gestiscono abbastanza bene i documenti con direzioni miste quando si specificano entrambe le famiglie linguistiche nelle impostazioni. Dopo l'OCR, verifica la direzione del testo copiando un passaggio in arabo e incollandolo in un editor di testo. I caratteri dovrebbero apparire nell'ordine di lettura corretto, non invertito.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →