Tips & Tricks

Come eseguire l'OCR di un documento PDF scritto in una lingua che non parli

Ricevere un PDF scansionato scritto in una lingua che non parli è più comune che mai nel mondo degli affari, nella ricerca accademica e nella revisione di documenti legali. Devi estrarre il testo, tradurlo e capire cosa dice il documento. La sfida non consiste solo nell'eseguire l'OCR sul file. Sta eseguendo l'OCR con le impostazioni della lingua corrette, quindi il testo estratto è sufficientemente accurato da poter essere tradotto. La selezione della lingua sbagliata durante l'elaborazione OCR PDF produce un output confuso che nessun motore di traduzione può recuperare.

I motori OCR non vedono le lettere. Vedono le forme e le abbinano ai modelli di caratteri per una lingua specifica. Se dici al motore OCR che il documento è in inglese ma in realtà è in russo, il motore mappa le forme cirilliche sui caratteri latini più vicini che conosce. Il risultato è una stringa di lettere dall'aspetto casuale che non ha alcuna relazione con il testo originale. Ottenere la corretta impostazione della lingua o utilizzare il rilevamento automatico, ove disponibile, è la decisione più importante nell'intero processo dall'OCR alla traduzione.

Gli strumenti PDF to Text e OCR di WukongPDF estraggono il testo dai documenti scansionati per la traduzione e l'analisi. Abbinando la corretta selezione della lingua OCR a un servizio di traduzione affidabile, si trasforma una scansione illeggibile in lingua straniera in un documento comprensibile in meno di cinque minuti.

How to OCR a PDF Document Written in a Language You Don't Speak

Passaggio 1: identificare la lingua del documento

Prima di toccare qualsiasi software OCR, identifica con certezza la lingua del documento. Se i metadati del documento o il nome del file suggeriscono la lingua, inizia da lì. In caso contrario, apri il PDF e guarda alcune pagine. Anche senza leggere il testo, i segnali visivi restringono notevolmente le possibilità. Le famiglie di scritture sono distintive: la scrittura latina è utilizzata nella maggior parte delle lingue europee. Il cirillico è usato per russo, ucraino, bulgaro e serbo. La scrittura araba copre l'arabo, il persiano e l'urdu. CJK copre cinese, giapponese e coreano. Devanagari copre hindi, marathi e nepalese.

Se non riesci a identificare visivamente nemmeno la famiglia di script, acquisisci uno screenshot di un paragrafo rappresentativo e caricalo nella funzione di traduzione delle immagini di Google Translate o in una ricerca di immagini inversa. Questi strumenti identificano sia la scrittura che la lingua specifica nella maggior parte dei casi. Sapere che il documento è tailandese anziché laotiano, o coreano anziché giapponese, fa la differenza tra un output OCR accurato e un rumore di carattere inutile.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Passaggio 2: selezionare uno strumento OCR che supporti la lingua di destinazione

Non tutti gli strumenti OCR supportano tutte le lingue. Adobe Acrobat Pro viene fornito con motori OCR per circa 40 lingue. Il suo strumento Riconosci testo include un menu a discesa per la selezione della lingua nella finestra di dialogo delle impostazioni. Tesseract, il motore OCR open source gratuito gestito da Google, supporta oltre 100 lingue tramite file di dati linguistici scaricabili. L'API Google Cloud Vision offre la copertura linguistica più ampia, con oltre 200 lingue, e include il rilevamento automatico della lingua come funzionalità opzionale.

Per un documento in una singola lingua che puoi identificare, uno qualsiasi di questi strumenti funziona purché si specifichi la lingua corretta prima di eseguire l'OCR. Per un documento che contiene più lingue, come un contratto bilingue con clausole sia in inglese che in francese, è necessario uno strumento che supporti più lingue simultanee o possa rilevare automaticamente in base al paragrafo. Google Cloud Vision e Tesseract con i pacchetti dati linguistici appropriati gestiscono entrambi documenti multilingue, sebbene la precisione sui confini del cambio di lingua non sia mai perfetta.

Passaggio 3: Configura ed esegui l'OCR con la lingua corretta

In Adobe Acrobat Pro, apri il PDF scansionato, vai su Strumenti, quindi Scansione e OCR, quindi seleziona Riconosci testo, quindi In questo file. Fare clic sul pulsante Modifica accanto al selettore della lingua. Nella finestra di dialogo Riconosci testo, scegli la lingua principale corretta dal menu a discesa. Se il documento contiene una seconda lingua, fai clic sul pulsante Aggiungi lingua e seleziona anche quella. Acrobat elabora entrambe le lingue contemporaneamente. Fare clic su OK, quindi su Riconosci testo. Acrobat esegue il passaggio OCR e incorpora il testo riconosciuto come uno strato invisibile dietro l'immagine scansionata. Il documento è ora ricercabile.

In Tesseract, l'invocazione da riga di comando specifica la lingua con il flag -l: tesseract input.pdf output -l rus per il russo, tesseract input.pdf output -l jpn per il giapponese o tesseract input.pdf output -l fra+eng per un documento bilingue francese-inglese. Installare prima i file di dati della lingua richiesti; Tesseract viene fornito solo in inglese per impostazione predefinita. Per Google Cloud Vision, la chiamata API include un parametro LanguageHints che accetta una serie di codici lingua BCP-47. Cloud Vision offre anche una modalità di rilevamento automatico della lingua che non richiede alcun suggerimento linguistico, rendendola l'opzione più semplice quando non conosci veramente la lingua del documento.

Passaggio 4: copia il testo estratto e traduci

Una volta completato l'OCR, verificare la qualità del testo prima di inviarlo alla traduzione. In Acrobat, apri lo strumento Trova e cerca una parola comune che riconosci nel documento. Se la ricerca trova corrispondenze, l'OCR ha funzionato. Seleziona un paragrafo del testo estratto, copialo e incollalo in un editor di testo semplice. Cerca errori OCR evidenti: simboli ripetuti, parole che si spezzano a metà o grandi blocchi di caratteri non riconosciuti. Se più del 5% del testo appare danneggiato, eseguire nuovamente l'OCR con un'impostazione della lingua diversa o con un'impostazione di risoluzione più elevata.

Una volta che il testo estratto supera un controllo di integrità visiva, copia l'intero testo e incollalo in uno strumento di traduzione. Google Translate, DeepL o Microsoft Translator accettano tutti input di testo semplice. Per documenti più lunghi, DeepL e Google Translate supportano il caricamento diretto di file PDF ricercabili, saltando il passaggio di copia manuale. Il risultato della traduzione è sufficientemente buono per la comprensione, la ricerca e l'uso aziendale interno. Per una precisione di livello legale, medico o di pubblicazione, invia il PDF ricercabile a un traduttore umano professionista, che utilizzerà il livello OCR come punto di partenza e correggerà la traduzione automatica rispetto alle pagine scansionate originali.

Gestione di documenti con script misti o caratteri non standard

I documenti che mescolano script, come un documento di ricerca arabo che include termini tecnici inglesi in caratteri latini, confondono i motori OCR che si aspettano un unico script. Configura prima l'OCR per la scrittura dominante, quindi esegui un secondo passaggio prendendo di mira la scrittura minoritaria sullo stesso documento. Unisci i risultati esportando entrambi i livelli OCR e combinandoli in un editor di testo. La precisione sui passaggi della scrittura minoritaria sarà inferiore perché il motore è ottimizzato per la scrittura primaria.

I caratteri non standard, inclusi i caratteri tipografici decorativi, i caratteri della vecchia macchina da scrivere e i caratteri corsivi simili a quelli scritti a mano, riducono la precisione dell'OCR anche con la lingua corretta selezionata. Pre-elabora questi documenti convertendo le pagine PDF in immagini ad alta risoluzione a 400 DPI o superiori, applicando un filtro di nitidezza e aumentando il contrasto prima di inserirli nel motore OCR. La preelaborazione integrata di Tesseract, abilitata con --psm 3 per la segmentazione automatica della pagina, gestisce variazioni moderate dei caratteri. Per testo gravemente degradato o stilizzato, l'API Google Cloud Vision generalmente supera i motori OCR locali perché i suoi modelli sono stati addestrati su un corpus più ampio di campioni di caratteri reali.

Strumento OCRSupporto multilingueRilevamento automaticoIdeale per
Adobe Acrobat ProOltre 40 lingueSelezione manualeDocumenti professionali, alta precisione
Tesseract (open source)Oltre 100 lingueÈ richiesta la selezione manualeElaborazione batch, scripting, gratuita
Google Cloud VisionOltre 200 lingueRilevamento automatico disponibileIntegrazione API, script misti
Servizi OCR on-line10-50 lingueSelezione manualeOCR rapido di un singolo documento

Verificare l'accuratezza prima di agire sui contenuti tradotti

L'OCR seguito dalla traduzione automatica introduce due livelli di potenziale errore: il riconoscimento errato dell'OCR e l'ambiguità della traduzione. Per i documenti critici, controlla l'output chiedendo a un collega bilingue o a un traduttore professionista di confrontare un paragrafo della traduzione selezionato casualmente con il PDF originale. Una verifica di cinque minuti rileva errori catastrofici come un'impostazione linguistica errata che ha prodotto un testo dall'aspetto plausibile ma del tutto errato.

Se gestisci regolarmente PDF scansionati in lingua straniera, crea una lista di controllo: identifica la lingua, seleziona il motore OCR corrispondente, esegui l'OCR con il parametro della lingua corretto, controlla a campione l'accuratezza dei caratteri del testo estratto, traduci e verifica un paragrafo di esempio. Dopo due o tre documenti, il flusso di lavoro diventa di routine e impiega meno di cinque minuti dall'apertura del file alla lettura del risultato tradotto.

Quando si tratta di elaborazione dei documenti, per i documenti sensibili alla sicurezza, l'OCR offline evita completamente l'esposizione al cloud. Tesseract viene eseguito localmente senza richieste di rete dopo aver scaricato una volta i file di dati della lingua. Adobe Acrobat Pro esegue anche l'OCR localmente tramite la funzione Riconosci testo senza accedere a Document Cloud. Per materiali riservati in lingua straniera, ad esempio atti giudiziari o corrispondenza aziendale sensibile, l'OCR locale abbinato alla revisione del testo offline mantiene il contenuto del documento originale all'interno del tuo ambiente controllato.

Quando il solo OCR non basta: i servizi di trascrizione assistita

Per i documenti in cui la precisione dell'OCR è inutilizzabilmente bassa a causa dell'estrema degradazione dei caratteri, del testo scritto a mano o di script fortemente misti, i servizi di trascrizione assistita forniscono output verificato da esseri umani. Questi servizi combinano un passaggio OCR iniziale della macchina con la revisione e la correzione umana, in genere addebitando costi per pagina. La tempistica varia da poche ore a qualche giorno. Per un singolo documento critico la cui accuratezza non è negoziabile, come un certificato di nascita in lingua straniera o il deposito di un brevetto, il costo della trascrizione umana è giustificato dal rischio di agire su un testo riconosciuto in modo errato. Eseguire prima l'OCR della macchina per valutare la qualità. Se più del 15% delle parole non vengono riconosciute o sono palesemente sbagliate, passa alla trascrizione assistita invece di dedicare ore a correggere manualmente l'output della macchina.

WukongPDF

Prova l'OCR dei PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →