Esegui la scansione di un menu bilingue. I nomi dei piatti sono in italiano. Le descrizioni sono in inglese. I prezzi sono numeri indipendenti dalla lingua. È necessario estrarre solo il testo italiano per creare un elenco di parole in lingua italiana, oppure solo il testo inglese da inviare a un traduttore per un'altra coppia linguistica. L'esecuzione dell'OCR sull'intero documento produce un mix di entrambe le lingue, il che va bene per la ricerca ma non per l'estrazione selettiva.
L'estrazione del testo in una sola lingua da un documento multilingue OCR PDF richiede un motore OCR in grado di identificare in quale lingua è scritto ciascun blocco di testo ed estrarre solo i blocchi che corrispondono alla lingua di destinazione. Si tratta di un'operazione più selettiva rispetto all'OCR standard, che riconosce tutto il testo indipendentemente dalla lingua.

Come funziona l'OCR con selezione della lingua
I motori OCR con supporto multilingue possono essere configurati per riconoscere il testo in più lingue contemporaneamente. Quando specifichi "Italiano e inglese" come le lingue OCR, il motore riconosce il testo in entrambe. Contrassegna inoltre ogni blocco di testo riconosciuto con la lingua in cui è stato riconosciuto. Un blocco di testo italiano viene contrassegnato come italiano. Un blocco di testo inglese è contrassegnato come inglese. Il tagging della lingua consente l'estrazione selettiva.
Dopo l'OCR, puoi filtrare il testo riconosciuto in base al tag della lingua. Esporta solo i blocchi contrassegnati come italiani. L'output è un documento contenente solo il testo italiano dal menu. Le descrizioni in inglese, riconosciute ma filtrate, non compaiono nell'output. Questa estrazione selettiva è utile per flussi di lavoro di traduzione, materiali per l'apprendimento delle lingue e analisi dei contenuti in cui è necessario che il testo in una lingua specifica sia isolato dal testo circostante in altre lingue.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Passo dopo passo: estrazione del testo in una lingua specifica
Carica il PDF scansionato sullo strumento OCR di WukongPDF. Seleziona le lingue presenti nel documento. Per il menu italiano-inglese selezionare sia italiano che inglese. Esegui l'OCR. Lo strumento riconosce tutto il testo e tagga ciascun blocco in base alla lingua. Una volta completato l'OCR, utilizzare il filtro della lingua per selezionare l'italiano. Esporta il testo filtrato come file di testo normale, documento Word o nuovo PDF contenente solo i blocchi italiani.
La precisione del rilevamento della lingua dipende dalle caratteristiche distintive delle lingue. L'italiano e l'inglese usano lo stesso alfabeto ma hanno modelli di parole diversi. Il motore OCR li distingue analizzando le frequenze delle parole. L'italiano ha molte parole che terminano con vocale. L'inglese ha molte parole che terminano con consonanti. Quanto più distinte sono le lingue, tanto più accurata sarà la codifica delle lingue. Due lingue strettamente correlate, come lo spagnolo e il portoghese, potrebbero essere confuse dal motore su brevi blocchi di testo.
Gestione di testo in lingue miste sulla stessa riga
Alcuni documenti mescolano le lingue in un'unica riga, come un libro di testo che abbina una frase in francese con la sua traduzione in inglese sulla stessa riga. Il motore OCR potrebbe classificare l'intera riga come lingua dominante, etichettando erroneamente le parole della lingua minoritaria. Per questi documenti, l'estrazione selettiva della lingua a livello di blocco non è sufficientemente precisa. Hai bisogno di un approccio diverso.
L'alternativa è eseguire l'OCR due volte, una volta con ciascuna lingua come unica lingua di riconoscimento. Il pass OCR solo italiano riconosce bene il testo italiano ma altera il testo inglese. Il pass solo inglese riconosce bene l'inglese ma distorce l'italiano. Confronta i due output e seleziona manualmente la versione corretta per ciascun segmento di testo. Questo approccio a doppio passaggio richiede più tempo ma produce l'estrazione specifica della lingua più accurata per i documenti in cui le lingue sono interlacciate a livello di frase.
Verifica e pulizia del testo estratto
Dopo aver estratto il testo nella lingua di destinazione, verificare che il filtro della lingua sia accurato. Cerca nel testo estratto parole chiaramente nella lingua sbagliata. Un'estrazione di testo italiano da un menu non deve contenere parole inglesi come "grilled" o "servito con" a meno che il menu non utilizzasse intenzionalmente quelle parole nelle descrizioni italiane. Il testo filtrato che contiene parole straniere inaspettate indica errori di codifica della lingua che richiedono una correzione manuale.
Esegui un controllo ortografico nella lingua di destinazione. Il controllo ortografico italiano contrassegnerà le parole inglesi erroneamente incluse nell'estrazione italiana. I flag di controllo ortografico rappresentano un modo efficace per trovare errori di codifica della lingua senza leggere ogni parola estratta. Il Estrai dati PDF che è stato filtrato per lingua e controllato ortograficamente è pronto per la traduzione, l'analisi o l'archiviazione. L'OCR PDF scansionato di WukongPDF con filtro linguistico produce estratti in una sola lingua più puliti rispetto alla post-elaborazione dell'output OCR in lingue miste per rimuovere la lingua indesiderata.
Un'applicazione pratica per l'OCR selettivo della lingua: creazione di glossari bilingui da documenti tradotti. Estrarre separatamente tutti i termini della lingua di partenza e tutti i termini della lingua di destinazione. Allinearli in base alla loro posizione sulla pagina, poiché ciascun termine di origine ha un termine di destinazione corrispondente approssimativamente nella stessa posizione verticale sulla pagina o in una colonna adiacente. L'output allineato diventa un elenco di termini che i traduttori possono utilizzare per garantire la coerenza tra le traduzioni future. Questa tecnica di creazione di glossari è ampiamente utilizzata nella traduzione tecnica dove la coerenza terminologica è fondamentale.
Per i documenti in cui le lingue sono in colonne separate, come un contratto bilingue a due colonne, l'estrazione selettiva della lingua diventa un'attività di selezione delle colonne. La colonna di sinistra è una lingua, la colonna di destra è un'altra. Invece di fare affidamento sul rilevamento della lingua, che può confondere lingue simili, ritaglia il PDF per estrarre ciascuna colonna separatamente. Esegui l'OCR in una sola lingua su ciascuna colonna. Questo approccio di ritaglio delle colonne è più affidabile del filtraggio della lingua per i documenti con una chiara separazione delle lingue in colonne.
Per i progetti di archivio che coinvolgono documenti storici multilingue, l'OCR selettivo della lingua combinato con il tagging dei metadati crea un archivio ricercabile in cui i ricercatori possono trovare contenuti in una lingua specifica tra migliaia di documenti. L'output OCR di ciascun documento è contrassegnato con le lingue rilevate. Un ricercatore che cerca documenti francesi del XVIII secolo può filtrare solo il testo in lingua francese in una raccolta multilingue. Questo approccio selettivo trasforma l’OCR archivistico da uno strumento schietto che mescola le lingue in uno strumento di precisione per la ricerca linguistica.
Prova l'OCR dei PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
