Un PDF balisé contient des métadonnées d'accessibilité cachées que les lecteurs d'écran utilisent pour décrire les images, les tableaux et la structure du document aux utilisateurs malvoyants. Le texte visible sur la page peut être en anglais tandis que les descriptions du texte alternatif, les résumés des tableaux et les étiquettes structurelles doivent être disponibles dans plusieurs langues pour un public international. Traduire uniquement cette couche cachée sans toucher au contenu visible du document nécessite de travailler directement avec la structure de balises du PDF, une capacité qui manque à la plupart des outils de traduction à usage général.
La norme PDF/UA (Accessibilité universelle, ISO 14289) exige que les PDF balisés fournissent un texte alternatif pour tous les éléments de contenu non textuels. Dans une organisation multilingue, un contrat rédigé en français peut nécessiter que son texte alternatif soit disponible en anglais, allemand et néerlandais afin que les évaluateurs d'accessibilité de chaque pays puissent vérifier la conformité. Traduire l’intégralité du document serait inutile et coûteux. Seuls quelques centaines de mots de texte alternatif et d’étiquettes structurelles nécessitent une attention particulière. Cette tâche entre dans une catégorie étroite qui se situe entre le document complet Traduire le PDF et l'édition manuelle d'accessibilité, et peu d'organisations ont établi un flux de travail standard pour cela.
Les conséquences des métadonnées d’accessibilité non traduites sont plus importantes qu’il n’y paraît. Un utilisateur de lecteur d'écran accédant à un contrat en français avec uniquement un texte alternatif en anglais entendra des descriptions en anglais interrompant le contenu en français, créant ainsi une expérience déroutante et désorientante. Pour les agences gouvernementales et les organisations financées par des fonds publics soumises aux réglementations en matière d'accessibilité, cela représente un manque de conformité qui peut avoir des conséquences juridiques. Traduire la couche d’accessibilité n’est pas une nécessité pour les organisations multilingues. Cela fait partie du respect des obligations en matière d’accessibilité dans toutes les langues servies par l’organisation.

Comprendre la structure des balises PDF et où se trouve le texte alternatif
Un PDF balisé organise son contenu dans une arborescence de structure logique, avec des éléments tels que Document, Partie, Sect, P, Tableau, Figure et Formule. Chaque élément peut avoir des attributs, et l'attribut essentiel pour la traduction est l'entrée /Alt, qui stocke la description textuelle alternative. Un élément Figure représentant un graphique peut avoir une entrée /Alt contenant "Diagramme à barres montrant la croissance trimestrielle des revenus du premier trimestre 2022 au quatrième trimestre 2024 avec une augmentation de 12 % d'une année sur l'autre". Ce texte n'est jamais affiché sur la page visible. Il existe uniquement dans la structure des balises pour la consommation des lecteurs d'écran.
L'entrée /Alt est une chaîne de texte stockée sous forme d'objet chaîne PDF ou de chaîne avec échappement XML dans le contenu marqué du document. L'extraire, le traduire et le réécrire sans perturber la structure des balises environnantes nécessite un outil capable d'analyser le contenu PDF balisé au niveau de l'objet. La plupart des éditeurs PDF qui affichent une arborescence de balises dans leur panneau d'accessibilité peuvent modifier des entrées /Alt individuelles, mais la traduction manuelle de dizaines ou de centaines d'entre elles est lente et sujette aux erreurs, chaque entrée nécessitant un cycle d'ouverture-édition-sauvegarde distinct.
Au-delà des entrées /Alt, il existe d'autres éléments d'accessibilité traduisibles. L'attribut /Summary sur les éléments Table fournit un aperçu textuel de la structure et de l'objectif du tableau. L'entrée /ActualText sur les éléments Span peut remplacer le texte visuel pour les lecteurs d'écran, ce qui est utile lorsque le texte visuel est une abréviation qui doit être développée. Les descriptions des champs de formulaire stockées dans l'entrée /TU (info-bulle) doivent également être traduites. Une traduction complète en matière d’accessibilité couvre tous ces éléments. Pour un contrat de 50 pages comportant 30 figures, 15 tableaux et 40 champs de formulaire, le texte d'accessibilité total traduisible peut être de 2 000 à 3 000 mots, soit suffisamment pour qu'un traducteur y consacre une partie d'une journée, mais bien moins que la traduction du texte complet du document.
Essayez de traduire le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Extraction du texte d'accessibilité pour traduction
La première étape consiste à inventorier ce qui nécessite une traduction. Utilisez un vérificateur d'accessibilité PDF ou une visionneuse de balises pour exporter une liste de toutes les entrées /Alt, /Summary, /ActualText et /TU du document. La plupart des outils de validation de l'accessibilité, y compris le vérificateur d'accessibilité intégré dans Adobe Acrobat Pro, peuvent produire un rapport montrant chaque élément de balise avec ces attributs et leurs valeurs de texte actuelles. Exportez cette liste dans un format structuré tel que CSV, avec des colonnes pour le type de balise, l'identifiant de l'élément, le texte original et une colonne de traduction vide.
Envoyez les chaînes de texte originales à un traducteur ou à un service de traduction automatique. Le format structuré garantit que chaque chaîne traduite reste associée à son élément source, ce qui est essentiel pour réécrire les traductions aux emplacements corrects. Pour la conformité Accessibilité PDF, les traductions doivent répondre aux mêmes normes de qualité que le texte alternatif original. Une bonne description de texte alternatif est concise, généralement inférieure à 150 caractères, et décrit le contenu et la fonction de l'élément plutôt que son apparence. La traduction doit préserver cette concision et cette orientation fonctionnelle.
WukongPDF prend en charge l'édition des Les balises PDF et les attributs d'accessibilité au niveau des éléments individuels, ce qui rend pratique la mise à jour des traductions de texte alternatif sans affecter le contenu visible de la page. L'éditeur de balises structurées affiche la hiérarchie complète des éléments avec tous les attributs traduisibles, et la fonction de mise à jour par lots vous permet d'importer des traductions à partir d'un fichier CSV et de les appliquer aux éléments corrects en une seule opération.
Réécriture des traductions dans la structure de balises
Après avoir reçu les traductions, l'étape de réécriture nécessite un outil capable de parcourir l'arborescence des balises PDF et de mettre à jour les valeurs d'attribut individuelles. Ouvrez le PDF dans un éditeur de balises qui affiche l'arborescence complète de la structure. Pour chaque élément traduit, localisez l'élément dans l'arborescence, sélectionnez son /Alt ou un autre attribut et collez le texte traduit. Enregistrez le fichier lorsque toutes les entrées ont été mises à jour. Vérifiez le résultat à l’aide d’un lecteur d’écran ou d’un outil de validation d’accessibilité. Naviguez dans le document avec le lecteur d'écran actif et confirmez que chaque description traduite est lue dans la langue attendue.
Pour les documents qui seront distribués dans plusieurs langues, déterminez si le PDF doit contenir toutes les versions linguistiques du texte alternatif dans un seul fichier ou si des PDF distincts spécifiques à la langue doivent être créés. La spécification PDF prend en charge le balisage de langue au niveau des éléments, de sorte qu'un seul fichier peut théoriquement contenir du texte alternatif en anglais sur la figure 1 et du texte alternatif en français sur la figure 2. Cependant, la prise en charge du lecteur d'écran pour le changement de langue par élément est incohérente entre les différentes applications de lecteur d'écran. Si la conformité en matière d'accessibilité est une exigence, des fichiers PDF distincts par langue constituent le choix le plus sûr et le plus fiable.
Automatisation du flux de travail pour les grands ensembles de documents
Pour les organisations qui ont besoin de localiser les métadonnées d’accessibilité sur des centaines ou des milliers de PDF, l’approche de réécriture manuelle n’est pas évolutive. Dans ces cas, l’extraction, la traduction et la réécriture doivent être scriptées. Utilisez une bibliothèque PDF prenant en charge l'accès à la structure de balises, telle qu'Apache PDFBox pour Java ou pikepdf pour Python, pour extraire par programme tous les attributs traduisibles, les envoyer à une API de traduction et réécrire les résultats.
Le script doit enregistrer chaque attribut qu'il modifie et produire un rapport de comparaison avant et après afin qu'un réviseur humain puisse vérifier les traductions. L'automatisation du flux de travail réduit le coût par document mais introduit un risque d'erreurs systémiques, comme un terme mal traduit qui apparaît dans des dizaines de descriptions de texte alternatif et n'est découvert qu'après distribution. Une révision par lots d'un échantillon aléatoire, ainsi qu'une révision ciblée de toutes les traductions signalées comme étant de faible confiance par l'API de traduction, équilibrent efficacité et qualité et fournissent un dossier d'assurance qualité défendable.
Essayez de traduire le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
