Tips & Tricks

Come tradurre il testo all'interno delle immagini incorporate in un PDF

Uno strumento di traduzione PDF elabora il flusso di testo nel documento, convertendo le parole da una lingua all'altra. Legge i paragrafi, i titoli e le didascalie. Ma non legge il testo che si trova all'interno delle immagini. Una fotografia di un cartello, uno screenshot di un'interfaccia utente in una lingua diversa, un grafico con etichette degli assi renderizzate come parte dell'immagine, tutti questi contengono testo che gli strumenti di traduzione standard ignorano perché il testo non è nel flusso di testo PDF. È incorporato nei pixel dell'immagine. Per tradurre il testo all'interno di immagini incorporate è necessario estrarre le immagini, eseguire l'OCR su di esse, tradurre il testo riconosciuto e quindi incorporare nuovamente le immagini tradotte o aggiungere la traduzione come sovrapposizione. Il flusso di lavoro Translate PDF per il testo incorporato in un'immagine è più complesso della traduzione di testo standard, ma copre contenuti che altrimenti rimarrebbero non tradotti.

How to Translate Text Inside Embedded Images in a PDF

Identificazione delle immagini che contengono testo traducibile

Non tutte le immagini in un PDF contengono testo che vale la pena tradurre. Una fotografia decorativa, una trama di sfondo e un logo aziendale potrebbero non contenere contenuti traducibili. Uno screenshot di un'applicazione software, un diagramma con componenti etichettati, una fotografia di un documento o di un segnale e un grafico con etichette degli assi incorporate contengono tutti testo che un lettore nella lingua di destinazione deve comprendere. Esegui la scansione del PDF e identifica ogni immagine che contiene testo. Contrassegna queste immagini per il flusso di lavoro di traduzione.

Le immagini che contengono testo nel PDF rientrano in due categorie: quelle in cui il testo fa parte dell'immagine in base alla progettazione, come uno screenshot o un diagramma con etichetta, e quelle in cui il testo appare nell'immagine perché il documento è stato scansionato anziché creato digitalmente. Un PDF scansionato è costituito da un'immagine di grandi dimensioni per pagina. Tutto il testo di una pagina scansionata è incorporato nell'immagine della pagina. Un PDF creato digitalmente può avere un singolo screenshot su una pagina altrimenti basata su testo. Le Immagini PDF che necessitano di traduzione sono quelle in cui il testo appare nei pixel dell'immagine e non nel flusso di testo PDF.

WukongPDF

Prova a tradurre PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Estrazione di immagini e riconoscimento del testo

Estrai le immagini dal PDF alla massima risoluzione disponibile. Utilizza uno strumento di estrazione di immagini PDF che preservi la risoluzione originale. Salva ogni immagine estratta come file PNG per evitare di introdurre artefatti di compressione durante la fase di estrazione. Apri ciascuna immagine estratta e conferma che il testo è leggibile. Se la risoluzione dell'immagine è troppo bassa perché il testo possa essere letto chiaramente, se possibile, estrai nuovamente a una risoluzione più elevata oppure tieni presente che questa immagine potrebbe produrre risultati OCR inaffidabili.

Esegui l'OCR su ciascuna immagine estratta per riconoscere il testo. Il motore OCR identifica le aree di testo all'interno dell'immagine e restituisce i caratteri riconosciuti insieme alle loro posizioni. Salva l'output OCR per ciascuna immagine, incluso il testo riconosciuto e le coordinate del riquadro di delimitazione di ciascuna area di testo. Queste informazioni saranno necessarie successivamente per posizionare il testo tradotto nella posizione corretta sull'immagine. WukongPDF gestisce l'elaborazione OCR PDF in grado di riconoscere il testo nelle immagini incorporate come parte del flusso di lavoro di conversione del documento.

Tradurre il testo riconosciuto preservando il contesto

Il testo riconosciuto dalle immagini è spesso frammentario. Un diagramma può contenere etichette di una sola parola. Uno screenshot può contenere voci di menu ed etichette di pulsanti senza contesto della frase. Questo testo frammentato rappresenta una sfida per i motori di traduzione automatica perché è assente il contesto linguistico circostante che chiarisce i significati delle parole. Fornisci quanto più contesto possibile. Se un'etichetta dice File e appare su uno screenshot di un menu software, nota nell'input di traduzione che si tratta di una voce di menu, non di un oggetto fisico.

Per le immagini con più regioni di testo, mantieni la mappatura tra ciascuna regione e la sua traduzione. Un diagramma con dieci etichette produce dieci stringhe di testo separate, ciascuna delle quali necessita di una traduzione. Mantieni insieme il testo originale, il testo tradotto e le coordinate del riquadro di delimitazione in un formato strutturato come un foglio di calcolo. Questa mappatura viene utilizzata nella fase finale per posizionare il testo tradotto sull'immagine. Affinché l'output Translate PDF sia utile, il testo tradotto deve apparire nella posizione corretta sull'immagine, sostituendo o accompagnando il testo originale.

Riposizionamento del testo tradotto sulle immagini

Esistono due approcci per posizionare il testo tradotto sulle immagini. Il primo approccio sostituisce il testo originale con la traduzione. Apri l'immagine in un editor di immagini. Per ciascuna area di testo, cancella il testo originale riempiendo l'area con il colore di sfondo. Posiziona il testo tradotto nella stessa area utilizzando un carattere che corrisponda il più possibile allo stile dell'originale. Questo approccio produce un'immagine tradotta pulita che assomiglia all'originale, ma in una lingua diversa.

Il secondo approccio aggiunge la traduzione accanto al testo originale. Posiziona il testo tradotto in un colore contrastante sotto o accanto al testo originale. Questo approccio preserva l'originale per i lettori che comprendono entrambe le lingue e desiderano confrontare la traduzione con la fonte. È più veloce della cancellazione e della sostituzione, ma l'immagine risultante è visivamente più complessa. Scegli l'approccio in base alle esigenze del pubblico. Un manuale di formazione per gli operatori che leggono solo la lingua di destinazione beneficia della sostituzione. Un documento di riferimento bilingue trae vantaggio dalla presentazione affiancata.

Re-incorporamento delle immagini tradotte nel PDF

Dopo che le immagini sono state elaborate con il testo tradotto, devono essere reinserite nel PDF. Sostituisci ogni immagine originale con la sua controparte tradotta. L'immagine sostitutiva deve occupare lo stesso spazio dell'originale sulla pagina. Se l'immagine tradotta ha dimensioni in pixel diverse rispetto all'originale, ridimensionala per farla corrispondere al riquadro di delimitazione originale nel PDF. Il layout della pagina PDF non dovrebbe cambiare. L'unica differenza visibile dovrebbe essere la lingua del testo all'interno delle immagini.

Salva il PDF con le immagini tradotte come nuova versione, mantenendo il PDF originale non tradotto come riferimento. Verifica il PDF tradotto aprendolo e controllando ciascuna immagine. Conferma che il testo tradotto sia leggibile, posizionato correttamente e privo di errori OCR o di traduzione. Un Translate PDF con traduzione di immagini incorporata è completo quando ogni elemento di testo nel documento, nel flusso di testo e nelle immagini, è accessibile a un lettore nella lingua di destinazione.

Quando scegliere la traduzione manuale rispetto a quella automatizzata

Per le immagini contenenti testo critico, come avvisi di sicurezza, note legali o specifiche tecniche, prendi in considerazione la traduzione manuale da parte di un traduttore umano anziché la traduzione automatica. Un errore OCR combinato con un errore di traduzione automatica può modificare il significato di un'istruzione di sicurezza in modi che hanno conseguenze reali. Il costo della traduzione umana per un numero limitato di immagini critiche è piccolo rispetto al costo di una traduzione errata.

Per grandi lotti di immagini per le quali la traduzione manuale non è pratica, implementa una fase di revisione. Dopo la traduzione automatica e il reincorporamento, chiedi a un revisore umano che legge la lingua di destinazione di controllare l'accuratezza di un campione delle immagini tradotte. Se il campione rivela errori sistemici, modifica le impostazioni dell'OCR o i parametri del motore di traduzione e rielabora il batch.

La traduzione del testo nelle immagini incorporate è spesso l'ultimo passaggio per rendere un PDF completamente accessibile a un pubblico internazionale. Il corpo del testo, i titoli e le didascalie sono stati tradotti. Le immagini rimangono come contenuto finale non tradotto. Il completamento di questo passaggio produce un documento in cui ogni parte di testo, con ogni mezzo, è disponibile nella lingua di destinazione.

Per i documenti aggiornati di frequente con immagini incorporate, valutare se il testo dell'immagine può essere spostato nel flusso di testo PDF durante il processo di creazione del documento. Un diagramma con etichette memorizzate come sovrapposizioni di testo anziché come parte dell'immagine può essere tradotto utilizzando strumenti di traduzione di testo standard, evitando completamente il flusso di lavoro di estrazione-OCR-traduzione-reembed.

La qualità dell'immagine tradotta finale dipende dalla qualità di ogni passaggio del processo. L'estrazione di immagini ad alta risoluzione produce un chiaro input OCR. L'OCR accurato produce il testo corretto per la traduzione. Un buon motore di traduzione preserva il significato. Un attento reincorporamento mantiene la qualità visiva. Ogni passaggio dipende da quello precedente.

Il flusso di lavoro Translate PDF per il testo incorporato in immagini è lo scenario di traduzione più laborioso perché combina l'elaborazione delle immagini, l'OCR, la traduzione e il reincorporamento in un'unica pipeline. Automatizzare il maggior numero possibile di passaggi riduce lo sforzo manuale.

Per le immagini che appaiono identiche in più PDF, come il logo di un'azienda con uno slogan o un diagramma standard, traduci l'immagine una volta e riutilizzala. L'immagine tradotta può essere sostituita in ogni PDF in cui appare l'immagine originale.

Questo articolo illustra le tecniche e le considerazioni chiave per lavorare con i PDF in questo scenario specifico. I metodi qui descritti si applicano a diversi strumenti e piattaforme, offrendo ai lettori la flessibilità di scegliere l'approccio che meglio si adatta al loro flusso di lavoro e al loro ambiente tecnico.

I passaggi pratici delineati forniscono un percorso chiaro dalla sfida iniziale a una soluzione operativa. Ciascuna tecnica è stata selezionata per la sua affidabilità e accessibilità, garantendo che i lettori possano ottenere risultati coerenti indipendentemente dalla loro precedente esperienza con gli strumenti PDF.

WukongPDF e piattaforme simili forniscono gli strumenti OCR e di elaborazione dei documenti che supportano il flusso di lavoro di traduzione del testo delle immagini descritto in questo articolo. La combinazione di questi strumenti consente una copertura completa della traduzione.

WukongPDF

Prova a tradurre PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →