Others

Cosa succede a simboli e caratteri durante la traduzione di PDF

Quando esegui un PDF tramite uno strumento di traduzione, il documento risultante spesso presenta problemi di formattazione che vanno oltre i semplici cambiamenti di layout. Caratteri speciali come simboli matematici, segni di valuta e lettere accentate possono essere sostituiti con caselle vuote, punti interrogativi o caratteri completamente sbagliati. I caratteri incorporati potrebbero interrompere il rendering, causando la scomparsa di intere sezioni di testo o la visualizzazione in un carattere di sistema predefinito. Capire cosa succede ai simboli e ai Caratteri PDF durante la traduzione ti aiuta ad anticipare questi problemi e a scegliere il giusto approccio alla traduzione per i documenti in cui la precisione dei simboli è importante.

Concetti chiave

Gli strumenti di traduzione PDF funzionano estraendo il livello di testo dal documento, eseguendolo attraverso un motore di traduzione automatica e ricollocando il testo tradotto nel layout originale. Simboli e caratteri speciali sono a rischio durante ogni fase di questa pipeline: l'estrazione potrebbe interpretare erroneamente la codifica dei simboli, il motore di traduzione potrebbe eliminare o corrompere i caratteri non alfabetici e il reinserimento potrebbe riscontrare problemi di sostituzione dei caratteri quando la lingua di destinazione utilizza caratteri non presenti nei caratteri incorporati del documento originale.

What Happens to Symbols and Fonts During PDF Translation

Come la traduzione PDF gestisce la fase di estrazione del testo

Prima che possa avvenire qualsiasi traduzione, lo strumento deve estrarre il testo leggibile dal PDF. Per un PDF digitale nativo con testo incorporato, questa estrazione legge i codici dei caratteri dai flussi di contenuto del documento e li mappa sui valori Unicode utilizzando la tabella di codifica del carattere incorporato. Simboli e caratteri speciali diventano problematici in questa fase quando la tabella di codifica è incompleta, danneggiata o utilizza una mappatura personalizzata che non segue le convenzioni Unicode. Un PDF creato da un software precedente può utilizzare una codifica non standard in cui ciò che appare come il simbolo dell'euro sullo schermo viene archiviato internamente come codice carattere che non corrisponde a nulla nelle tabelle Unicode standard.

Quando la mappatura della codifica fallisce, il processo di estrazione produce caratteri sostitutivi, in genere il carattere sostitutivo Unicode o un punto interrogativo. Questo fallimento avviene silenziosamente. Il testo estratto sembra normale a prima vista perché le lettere e i numeri attorno al simbolo vanno bene, ma il segno di valuta, l'operatore matematico o la lettera accentata che era fondamentale per il significato del documento è andato perso prima ancora che la traduzione iniziasse. Una fase di estrazione che non riesce a risolvere il simbolo dell'euro in un PDF finanziario trasforma il "Totale: 2.500 euro" in "Totale: 2.500" o "Totale: 2.500?" e l'output tradotto erediterà quell'errore.

WukongPDF

Prova a tradurre PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Che cosa fa il motore di traduzione ai simboli e ai caratteri speciali

I motori di traduzione automatica sono ottimizzati per il testo in linguaggio naturale. Quando incontrano una frase contenente un mix di parole e simboli, come una specifica tecnica o un rendiconto finanziario, la gestione dei simboli dipende dal motore specifico e dalla coppia linguistica. La maggior parte dei moderni sistemi di traduzione automatica neurale passerà attraverso simboli che riconoscono come non linguistici, come segni di valuta, segni di percentuale e operatori matematici comuni. Ma i simboli meno comuni, come il segno di sezione utilizzato nei documenti legali, il simbolo della laurea nei testi scientifici o la notazione specializzata di un particolare settore, possono essere eliminati o sostituiti dalla fase di normalizzazione del testo del motore di traduzione.

La fase di normalizzazione, che viene eseguita prima della traduzione vera e propria, converte il testo di input in una forma standardizzata. Può ridurre in minuscolo il testo, eliminare la punteggiatura considerata non essenziale e normalizzare i caratteri Unicode nelle loro forme canoniche. Per la maggior parte dei documenti questo è utile. Impedisce al motore di traduzione di trattare "Hello" e "ciao" come parole diverse. Ma per i documenti in cui simboli specifici hanno un significato, la normalizzazione può essere dannosa. Una formula chimica che utilizza numeri in pedice, un insieme di coordinate GPS con simboli di gradi e minuti o una citazione legale con segni di sezione possono essere tutti alterati dalla normalizzazione in modi che ne cambiano il significato o li rendono illeggibili.

Sostituzione dei caratteri: perché il testo tradotto spesso appare diverso

L'impatto visivo della sostituzione dei caratteri varia da sottile a grave. Quando un carattere latino sostituisce un altro carattere latino, la larghezza dei caratteri cambia leggermente ma il testo rimane leggibile. Quando un carattere latino sostituisce un sistema di scrittura non latino, il risultato è in genere una riga di rettangoli vuoti o punti interrogativi perché il carattere latino non contiene nessuno dei caratteri richiesti. Questo è il motivo per cui la traduzione in arabo, cinese, giapponese, coreano o cirillico richiede un'attenzione particolare alla disponibilità dei caratteri durante la fase di reinserimento.

Dopo la traduzione, il nuovo testo deve essere reinserito nel PDF. I caratteri incorporati del documento originale contengono solo i caratteri presenti nel testo originale. Quando il testo tradotto contiene caratteri che non erano presenti nell'originale, come i caratteri accentati nelle traduzioni francese o spagnola di un documento inglese, i caratteri incorporati originali non possono renderli. Il visualizzatore PDF utilizza un carattere sostitutivo, che quasi sicuramente avrà un aspetto diverso dal testo circostante. Il risultato è un documento in cui la maggior parte del testo appare nel carattere tipografico originale, ma occasionalmente parole tradotte o caratteri accentati appaiono in un carattere visibilmente diverso, conferendo alla pagina un aspetto irregolare e poco professionale.

Questo problema è più grave quando si traduce in lingue che utilizzano sistemi di scrittura completamente diversi. La traduzione di un PDF dall'inglese in russo, arabo, cinese o giapponese richiede caratteri che non contiene caratteri latini. L'intero testo tradotto deve essere reso con un carattere sostitutivo e il carattere visivo del documento cambia completamente. La geometria del layout che ha funzionato per il testo originale, con le sue specifiche larghezze di carattere e altezze di linea, non si adatterà al testo tradotto. Le interruzioni di riga si spostano, i paragrafi crescono o si restringono e gli elementi che erano accuratamente allineati diventano disallineati.

Scelta di un approccio traduttivo basato sulla sensibilità dei simboli

Un pratico controllo pre-traduzione consiste nell'aprire il PDF e copiare un paragrafo che contiene caratteri speciali in un editor di testo semplice. Se i caratteri speciali sopravvivono intatti all'operazione di copia e incolla, la codifica del testo del PDF è standard ed è improbabile che la fase di estrazione della traduzione li corrompe. Se i caratteri diventano confusi o scompaiono una volta incollati, il PDF utilizza una codifica non standard che causerà problemi durante la traduzione. Correggere la codifica all'origine, ad esempio ricreando il PDF con l'incorporamento dei caratteri abilitato, è più efficace che tentare di recuperare i caratteri danneggiati dopo la traduzione.

Per i documenti in cui i simboli sono fondamentali, come rapporti finanziari, articoli scientifici, documenti legali e manuali tecnici, l'approccio più sicuro è utilizzare un

Per i documenti tradotti in un sistema di scrittura diverso, accetta che l'output avrà un aspetto diverso dall'originale e pianifica di conseguenza. Invece di aspettarti una corrispondenza del layout perfetta al pixel, concentrati sulla produzione di un documento pulito e leggibile nella lingua di destinazione. Dopo la traduzione, pianifica il tempo per la regolazione manuale o semiautomatica del layout. Regola la larghezza delle colonne, riallinea le tabelle e controlla che tutti i caratteri speciali siano stati visualizzati correttamente. Il tempo extra dedicato alla formattazione post-traduzione rappresenta il costo del lavoro su diversi sistemi di scrittura, e gli strumenti che promettono una traduzione cross-script senza interruzioni senza alcun lavoro di impaginazione stanno semplificando eccessivamente un problema veramente difficile. Lo strumento di traduzione di WukongPDF preserva i dati dei caratteri incorporati durante tutto il processo di conversione, riducendo al minimo la corruzione dei simboli che si verifica quando i caratteri vengono sostituiti durante il reinserimento del testo.

Domande frequenti

Devo tradurre direttamente un PDF o convertirlo prima in un formato modificabile, tradurlo e riesportarlo in PDF? L'approccio in due passaggi, conversione in Word, traduzione del documento Word ed esportazione in PDF, generalmente produce una migliore fedeltà dei simboli perché Word gestisce Unicode in modo più coerente rispetto all'estrazione del testo PDF non elaborato. Il costo è che il viaggio di andata e ritorno attraverso Word introduce modifiche al layout che devono essere corrette manualmente. Per i documenti brevi, il metodo in due passaggi vale lo sforzo di impaginazione. Per documenti molto lunghi, la traduzione diretta del PDF con uno strumento che preservi la codifica è più pratica.

Posso tradurre un PDF estraendo il testo, traducendolo esternamente e reinserindolo manualmente nel layout PDF? Sì, questa pipeline manuale ti offre il controllo completo sulla gestione dei simboli e sulla selezione dei caratteri in ogni fase, ma richiede molto tempo ed è pratica solo per documenti brevi. Per un manuale tecnico di 50 pagine il reinserimento manuale non è fattibile. La decisione tra traduzione automatica e manuale riguarda in definitiva quanto controllo è necessario sull'output e quanto tempo si può investire.

Posso evitare la perdita di simboli convertendo il PDF in Word prima della traduzione?

La conversione in Word consente innanzitutto allo strumento di traduzione di accedere al testo tramite la gestione Unicode di Microsoft Word, che generalmente è più affidabile dell'estrazione del testo PDF non elaborato. Questo passaggio aggiuntivo spesso risolve la perdita di simboli correlata alla codifica, in particolare per i documenti creati da software moderni che utilizzano già la codifica Unicode standard. Il compromesso è che la stessa conversione di Word può introdurre modifiche al layout. Per i documenti ricchi di simboli, la maggiore precisione dei caratteri solitamente giustifica il lavoro di impaginazione.

Perché le equazioni matematiche spesso si interrompono durante la traduzione di PDF?

Le equazioni matematiche nei PDF vengono generalmente archiviate come un mix di caratteri di testo per variabili e numeri, oltre a simboli matematici speciali da un carattere matematico dedicato, oltre a barre di frazione disegnate da vettori, segni radicali e altri elementi di notazione. Quando il motore di traduzione elabora il livello di testo, tratta l'equazione come una frase e può riorganizzare o normalizzare la sequenza dei simboli. Gli elementi disegnati da vettori non sono affatto testo e attraversano la traduzione senza essere toccati, ma il loro allineamento rispetto al testo tradotto è quasi sempre interrotto. Per i documenti con un elevato contenuto matematico, l'approccio più affidabile è escludere le equazioni dalla traduzione e tradurre solo la prosa circostante.

Esiste un formato PDF che gestisce la traduzione Formato PDF meglio degli altri?

I PDF/A con caratteri Unicode completamente incorporati vengono tradotti in modo più affidabile rispetto ai PDF standard con sottoinsiemi di caratteri e codifiche personalizzate. L'incorporamento completo e i requisiti Unicode in PDF/A eliminano le due fonti più comuni di corruzione dei simboli durante la traduzione: glifi dei caratteri mancanti e mappature dei caratteri non standard. Se sai che un documento verrà tradotto, salvarlo come PDF/A prima di eseguire la traduzione è un passaggio utile.

WukongPDF

Prova a tradurre PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →