Un PDF con tag contiene metadati di accessibilità nascosti che gli screen reader utilizzano per descrivere immagini, tabelle e struttura del documento agli utenti ipovedenti. Il testo visibile sulla pagina può essere in inglese mentre le descrizioni del testo alternativo, i riepiloghi delle tabelle e le etichette strutturali devono essere disponibili in più lingue per un pubblico internazionale. Per tradurre solo questo livello nascosto senza toccare il contenuto visibile del documento è necessario lavorare direttamente con la struttura dei tag del PDF, una capacità che manca alla maggior parte degli strumenti di traduzione generici.
Lo standard PDF/UA (Universal Accessibility, ISO 14289) richiede che i PDF contrassegnati forniscano testo alternativo per tutti gli elementi di contenuto non testuale. In un'organizzazione multilingue, un contratto scritto in francese potrebbe richiedere che il testo alternativo sia disponibile in inglese, tedesco e olandese in modo che i revisori dell'accessibilità in ciascun paese possano verificarne la conformità. Tradurre l’intero documento sarebbe inutile e costoso. Solo poche centinaia di parole di testo alternativo ed etichette strutturali richiedono attenzione. Questa attività rientra in una categoria ristretta che si colloca tra il documento completo Traduci PDF e la modifica manuale dell'accessibilità, e poche organizzazioni hanno stabilito un flusso di lavoro standard per questo.
Le conseguenze dei metadati di accessibilità non tradotti sono più significative di quanto potrebbero sembrare. Un utente di screen reader che accede a un contratto in lingua francese con solo testo alternativo in inglese sentirà descrizioni in inglese che interrompono il contenuto in francese, creando un'esperienza confusa e disorientante. Per le agenzie governative e le organizzazioni finanziate con fondi pubblici soggette a normative sull’accessibilità, ciò rappresenta un divario di conformità che può avere conseguenze legali. La traduzione del livello di accessibilità non è una cosa piacevole da avere per le organizzazioni multilingue. Fa parte del rispetto degli obblighi di accessibilità in tutte le lingue servite dall'organizzazione.

Comprensione della struttura dei tag PDF e dove si trova il testo alternativo
Un PDF con tag organizza il suo contenuto in una struttura ad albero logica, con elementi come Documento, Parte, Setta, P, Tabella, Figura e Formula. Ogni elemento può avere attributi e quello fondamentale per la traduzione è la voce /Alt, che memorizza la descrizione testuale alternativa. Un elemento Figura che rappresenta un grafico potrebbe avere una voce /Alt contenente "Grafico a barre che mostra la crescita trimestrale dei ricavi dal primo trimestre del 2022 al quarto trimestre del 2024 con un aumento del 12% su base annua". Questo testo non viene mai visualizzato nella pagina visibile. Esiste esclusivamente nella struttura dei tag per il consumo dello screen reader.
La voce /Alt è una stringa di testo archiviata come oggetto stringa PDF o come stringa con escape XML all'interno del contenuto contrassegnato del documento. Per estrarlo, tradurlo e riscriverlo senza disturbare la struttura dei tag circostante è necessario uno strumento in grado di analizzare il contenuto PDF con tag a livello di oggetto. La maggior parte degli editor PDF che visualizzano un albero di tag nel pannello di accessibilità possono modificare singole voci /Alt, ma tradurne dozzine o centinaia manualmente è lento e soggetto a errori, poiché ciascuna voce richiede un ciclo di apertura-modifica-salvataggio separato.
Oltre alle voci /Alt, ci sono altri elementi di accessibilità traducibili. L'attributo /Summary sugli elementi della tabella fornisce una panoramica testuale della struttura e dello scopo della tabella. La voce /ActualText sugli elementi Span può sovrascrivere il testo visivo per le utilità per la lettura dello schermo, utile quando il testo visivo è un'abbreviazione che deve essere espansa. Anche le descrizioni dei campi del modulo archiviate nella voce /TU (descrizione comando) necessitano di traduzione. Una traduzione completa per l’accessibilità copre tutti questi elementi. Per un contratto di 50 pagine con 30 figure, 15 tabelle e 40 campi modulo, il testo totale di accessibilità traducibile potrebbe essere compreso tra 2.000 e 3.000 parole, sufficienti per consentire a un traduttore di dedicarvi parte di una giornata, ma molto meno della traduzione del testo completo del documento.
Prova a tradurre PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Estrazione del testo di accessibilità per la traduzione
Il primo passo è fare un inventario di ciò che necessita di traduzione. Utilizzare un controllo di accessibilità PDF o un visualizzatore di tag per esportare un elenco di tutte le voci /Alt, /Summary, /ActualText e /TU nel documento. La maggior parte degli strumenti di convalida dell'accessibilità, incluso il controllo dell'accessibilità integrato in Adobe Acrobat Pro, può produrre un report che mostra ogni elemento del tag con questi attributi e i relativi valori di testo correnti. Esporta questo elenco in un formato strutturato come CSV, con colonne per il tipo di tag, identificatore di elemento, testo originale e una colonna di traduzione vuota.
Invia le stringhe di testo originali a un traduttore o a un servizio di traduzione automatica. Il formato strutturato garantisce che ogni stringa tradotta rimanga associata al suo elemento sorgente, il che è essenziale per riscrivere le traduzioni nelle posizioni corrette. Per garantire la conformità Accessibilità PDF, le traduzioni devono soddisfare gli stessi standard di qualità del testo alternativo originale. Una buona descrizione del testo alternativo è concisa, in genere inferiore a 150 caratteri, e descrive il contenuto e la funzione dell'elemento piuttosto che il suo aspetto. La traduzione dovrebbe preservare questa concisione e questo focus funzionale.
WukongPDF supporta la modifica dei Tag PDF e degli attributi di accessibilità a livello di singolo elemento, rendendo pratico l'aggiornamento delle traduzioni del testo alternativo senza influenzare il contenuto visibile della pagina. L'editor di tag strutturati mostra la gerarchia completa degli elementi con tutti gli attributi traducibili e la funzione di aggiornamento batch consente di importare traduzioni da un file CSV e applicarle agli elementi corretti in un'unica operazione.
Riscrivere le traduzioni nella struttura dei tag
Dopo aver ricevuto le traduzioni, la fase di riscrittura richiede uno strumento in grado di navigare nell'albero dei tag PDF e aggiornare i valori dei singoli attributi. Apri il PDF in un editor di tag che mostra l'albero completo della struttura. Per ogni elemento tradotto, individua l'elemento nell'albero, seleziona il suo /Alt o un altro attributo e incolla il testo tradotto. Salvare il file quando tutte le voci sono state aggiornate. Verifica il risultato utilizzando uno screen reader o uno strumento di convalida dell'accessibilità. Navigare nel documento con lo screen reader attivo e verificare che ogni descrizione tradotta venga letta nella lingua prevista.
Per i documenti che verranno distribuiti in più lingue, valutare se il PDF debba contenere tutte le versioni linguistiche del testo alternativo in un unico file o se debbano essere creati PDF separati specifici per lingua. La specifica PDF supporta il tagging della lingua a livello di elemento, quindi un singolo file può teoricamente contenere testo alternativo in inglese nella Figura 1 e testo alternativo in francese nella Figura 2. Tuttavia, il supporto dello screen reader per il cambio di lingua per elemento non è coerente tra le diverse applicazioni di screen reader. Se la conformità all’accessibilità è un requisito, PDF separati per lingua rappresentano la scelta più sicura e testabile in modo più affidabile.
Automazione del flusso di lavoro per set di documenti di grandi dimensioni
Per le organizzazioni che necessitano di localizzare i metadati di accessibilità su centinaia o migliaia di PDF, l'approccio di write-back manuale non è scalabile. In questi casi, l'estrazione, la traduzione e il writeback dovrebbero essere scriptati. Utilizza una libreria PDF che supporti l'accesso alla struttura dei tag, come Apache PDFBox per Java o pikepdf per Python, per estrarre a livello di codice tutti gli attributi traducibili, inviarli a un'API di traduzione e riscrivere i risultati.
Lo script dovrebbe registrare ogni attributo che modifica e produrre un rapporto di confronto prima e dopo in modo che un revisore umano possa controllare a campione le traduzioni. L'automazione del flusso di lavoro riduce il costo per documento ma introduce il rischio di errori sistemici, come un termine tradotto male che appare in dozzine di descrizioni di testo alternativo e viene scoperto solo dopo la distribuzione. Una revisione in batch di un campione casuale, oltre alla revisione mirata di tutte le traduzioni contrassegnate come poco attendibili dall'API di traduzione, bilancia l'efficienza con la qualità e fornisce un record di garanzia della qualità difendibile.
Prova a tradurre PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
