Lorsque vous exécutez un PDF via un outil de traduction, le document résultant présente souvent des problèmes de formatage qui vont au-delà de simples changements de mise en page. Les caractères spéciaux tels que les symboles mathématiques, les signes monétaires et les lettres accentuées peuvent être remplacés par des cases vides, des points d'interrogation ou des caractères complètement erronés. Les polices intégrées peuvent cesser de s'afficher, entraînant la disparition ou l'affichage de sections entières de texte dans une police système par défaut. Comprendre ce qui arrive aux symboles et aux Polices PDF pendant la traduction vous aide à anticiper ces problèmes et à choisir la bonne approche de traduction pour les documents où la précision des symboles est importante.
Points clés à retenir
Les outils de traduction PDF fonctionnent en extrayant la couche de texte du document, en l'exécutant via un moteur de traduction automatique et en replaçant le texte traduit dans la mise en page d'origine. Les symboles et les caractères spéciaux sont menacés à chaque étape de ce pipeline : l'extraction peut mal interpréter le codage des symboles, le moteur de traduction peut supprimer ou corrompre les caractères non alphabétiques, et la réinsertion peut rencontrer des problèmes de substitution de police lorsque la langue cible utilise des caractères non présents dans les polices intégrées du document d'origine.

Comment la traduction PDF gère l'étape d'extraction de texte
Avant qu’une traduction puisse avoir lieu, l’outil doit extraire le texte lisible du PDF. Pour un PDF numérique natif avec texte intégré, cette extraction lit les codes de caractères des flux de contenu du document et les mappe aux valeurs Unicode à l'aide de la table d'encodage de la police intégrée. Les symboles et caractères spéciaux deviennent problématiques à ce stade lorsque la table de codage est incomplète, endommagée ou utilise un mappage personnalisé qui ne respecte pas les conventions Unicode. Un PDF créé par un logiciel plus ancien peut utiliser un encodage non standard dans lequel ce qui ressemble à un signe en euro à l'écran est stocké en interne sous la forme d'un code de caractère qui ne correspond à rien dans les tableaux Unicode standard.
Lorsque le mappage d'encodage échoue, le processus d'extraction produit des caractères de remplacement, généralement le caractère de remplacement Unicode ou un point d'interrogation. Cet échec se produit silencieusement. Le texte extrait semble normal à première vue car les lettres et les chiffres autour du symbole sont corrects, mais le signe monétaire, l'opérateur mathématique ou la lettre accentuée qui étaient essentiels à la signification du document ont été perdus avant même que la traduction ne commence. Une étape d'extraction qui ne parvient pas à résoudre le signe de l'euro dans un PDF financier tourne à "Total : 2 500 euros" en « Total : 2 500 » ou "Total : 2 500 ?" et la sortie traduite héritera de cette erreur.
Essayez de traduire le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Ce que fait le moteur de traduction aux symboles et caractères spéciaux
Les moteurs de traduction automatique sont optimisés pour le texte en langage naturel. Lorsqu'ils rencontrent une phrase contenant un mélange de mots et de symboles, comme une spécification technique ou un état financier, le traitement des symboles dépend du moteur et de la paire de langues spécifiques. La plupart des systèmes de traduction automatique neuronale modernes transmettent des symboles qu'ils reconnaissent comme non linguistiques, tels que les signes monétaires, les pourcentages et les opérateurs mathématiques courants. Mais des symboles moins courants, tels que le signe de section utilisé dans les documents juridiques, le symbole du diplôme dans le texte scientifique ou la notation spécialisée d'un secteur particulier, peuvent être supprimés ou remplacés par l'étape de normalisation du texte du moteur de traduction.
L'étape de normalisation, qui s'exécute avant la traduction proprement dite, convertit le texte saisi sous une forme standardisée. Il peut mettre le texte en minuscules, supprimer la ponctuation qu'il considère comme non essentielle et normaliser les caractères Unicode selon leurs formes canoniques. Pour la plupart des documents, cela est utile. Cela empêche le moteur de traduction de traiter « Bonjour » et "bonjour" comme des mots différents. Mais pour les documents où des symboles spécifiques ont une signification, la normalisation peut être préjudiciable. Une formule chimique qui utilise des nombres en indice, un ensemble de coordonnées GPS avec des symboles de degrés et de minutes ou une citation légale avec des marques de section peuvent tous être modifiés par normalisation de manière à modifier leur signification ou à les rendre illisibles.
Substitution de polices : pourquoi le texte traduit est souvent différent
L'impact visuel de la substitution de polices va de subtil à grave. Lorsqu'une police latine remplace une autre police latine, la largeur des caractères change légèrement mais le texte reste lisible. Lorsqu'une police latine remplace un système d'écriture non latin, le résultat est généralement une rangée de rectangles vides ou de points d'interrogation, car la police latine ne contient aucun des caractères requis. C'est pourquoi la traduction vers l'arabe, le chinois, le japonais, le coréen ou le cyrillique nécessite une attention particulière à la disponibilité des polices lors de la phase de réinsertion.
Après traduction, le nouveau texte doit être réinséré dans le PDF. Les polices intégrées au document original contiennent uniquement les caractères présents dans le texte original. Lorsque le texte traduit contient des caractères qui ne figuraient pas dans l'original, tels que des caractères accentués dans les traductions françaises ou espagnoles d'un document anglais, les polices intégrées d'origine ne peuvent pas les restituer. La visionneuse PDF utilise une police de substitution, qui sera presque certainement différente du texte environnant. Le résultat est un document dans lequel la plupart du texte apparaît dans la police d'origine, mais où des mots traduits ou des caractères accentués apparaissent occasionnellement dans une police visiblement différente, donnant à la page une apparence inégale et peu professionnelle.
Ce problème est particulièrement grave lors de la traduction vers des langues utilisant des systèmes d’écriture totalement différents. La traduction d'un PDF anglais en russe, arabe, chinois ou japonais nécessite des caractères qu'aucune police d'écriture latine ne contient. L'intégralité du texte traduit doit être restituée avec une police de substitution et le caractère visuel du document change complètement. La géométrie de mise en page qui fonctionnait pour le texte original, avec ses largeurs de caractères et hauteurs de lignes spécifiques, ne s'adaptera pas au texte traduit. Les sauts de ligne se déplacent, les paragraphes s'agrandissent ou se rétrécissent et les éléments soigneusement alignés deviennent mal alignés.
Choisir une approche de traduction basée sur la sensibilité des symboles
Une vérification pratique avant la traduction consiste à ouvrir le PDF et à copier un paragraphe contenant des caractères spéciaux dans un éditeur de texte brut. Si les caractères spéciaux survivent intacts à l'opération de copier-coller, l'encodage du texte du PDF est standard et il est peu probable que l'étape d'extraction de la traduction les corrompt. Si les caractères sont tronqués ou disparaissent une fois collés, le PDF utilise un encodage non standard qui entraînera des problèmes lors de la traduction. Corriger l'encodage à la source, par exemple en recréant le PDF avec l'intégration des polices activée, est plus efficace que d'essayer de récupérer les caractères corrompus après la traduction.
Pour les documents pour lesquels les symboles sont essentiels, tels que les rapports financiers, les articles scientifiques, les documents juridiques et les manuels techniques, l'approche la plus sûre consiste à utiliser un
Pour les documents traduits dans un système d’écriture différent, acceptez que le résultat soit différent de l’original et planifiez en conséquence. Au lieu de vous attendre à une mise en page parfaite au pixel près, concentrez-vous sur la production d’un document propre et lisible dans la langue cible. Après la traduction, prévoyez du temps pour l’ajustement manuel ou semi-automatique de la mise en page. Ajustez la largeur des colonnes, réalignez les tableaux et vérifiez que tous les caractères spéciaux sont correctement rendus. Le temps supplémentaire consacré au formatage post-traduction représente le coût du travail sur plusieurs systèmes d'écriture, et les outils qui promettent une traduction transparente de scripts croisés sans aucun travail de mise en page simplifient à l'extrême un problème véritablement difficile. L'outil de traduction de WukongPDF préserve les données de police intégrées tout au long du processus de conversion, minimisant ainsi la corruption des symboles qui se produit lorsque les polices sont remplacées lors de la réinsertion de texte.
Foire aux questions
Dois-je traduire un PDF directement ou le convertir d'abord dans un format modifiable, le traduire et le réexporter au format PDF ? L'approche en deux étapes, conversion vers Word, traduction du document Word et réexportation au format PDF, produit généralement une meilleure fidélité des symboles, car Word gère Unicode de manière plus cohérente que l'extraction de texte PDF brut. Le coût est que l'aller-retour via Word introduit des modifications de mise en page qui doivent être corrigées manuellement. Pour les documents courts, la méthode en deux étapes vaut l’effort de mise en page. Pour les documents très longs, la traduction PDF directe avec un outil préservant l’encodage est plus pratique.
Puis-je traduire un PDF en extrayant le texte, en le traduisant en externe et en le replaçant manuellement dans la mise en page PDF ? Oui, ce pipeline manuel vous donne un contrôle total sur la gestion des symboles et la sélection des polices à chaque étape, mais il prend du temps et n'est pratique que pour les documents courts. Pour un manuel technique de 50 pages, la réinsertion manuelle n’est pas réalisable. La décision entre traduction automatique et traduction manuelle dépend en fin de compte du degré de contrôle dont vous avez besoin sur le résultat et du temps que vous pouvez investir.
Puis-je éviter la perte de symboles en convertissant le PDF en Word avant de le traduire ?
La conversion vers Word permet d'abord à l'outil de traduction d'accéder au texte via la gestion Unicode de Microsoft Word, qui est généralement plus fiable que l'extraction de texte PDF brut. Cette étape supplémentaire résout souvent la perte de symboles liée au codage, en particulier pour les documents créés par un logiciel moderne qui utilise déjà le codage Unicode standard. Le compromis est que la conversion Word elle-même peut introduire des modifications de mise en page. Pour les documents contenant beaucoup de symboles, la précision améliorée des caractères justifie généralement le travail de mise en page.
Pourquoi les équations mathématiques se cassent-elles souvent lors de la traduction PDF ?
Les équations mathématiques dans les PDF sont généralement stockées sous la forme d'un mélange de caractères de texte pour les variables et les nombres, ainsi que de symboles mathématiques spéciaux provenant d'une police mathématique dédiée, ainsi que de barres de fractions dessinées par vecteur, de signes radicaux et d'autres éléments de notation. Lorsque le moteur de traduction traite la couche de texte, il traite l'équation comme une phrase et peut réorganiser ou normaliser la séquence de symboles. Les éléments dessinés vectoriels ne sont pas du tout du texte et passent par la traduction sans être touchés, mais leur alignement par rapport au texte traduit est presque toujours rompu. Pour les documents à fort contenu mathématique, l’approche la plus fiable consiste à exclure les équations de la traduction et à traduire uniquement la prose qui les entoure.
Existe-t-il un format PDF qui gère mieux la traduction Format PDF que les autres ?
Le PDF/A avec des polices Unicode entièrement intégrées se traduit de manière plus fiable que les PDF standard avec des sous-ensembles de polices et des encodages personnalisés. L'intégration complète et les exigences Unicode dans PDF/A éliminent les deux sources les plus courantes de corruption des symboles lors de la traduction : les glyphes de police manquants et les mappages de caractères non standard. Si vous savez qu'un document sera traduit, l'enregistrer au format PDF/A avant de lancer la traduction est une étape intéressante.
Essayez de traduire le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
