Tips & Tricks

Comment traduire uniquement le texte des cellules d'un tableau PDF tout en gardant les chiffres intacts

La traduction d'un tableau PDF présente un défi unique que la traduction classique de documents ne présente pas. Les tableaux mélangent deux types de données fondamentalement différents : du texte qui doit être traduit et des nombres qui doivent rester exactement tels qu'ils sont. Une liste de prix en euros nécessite que les descriptions de produits soient traduites du français vers l'anglais, mais les prix, les quantités et les codes SKU doivent rester absolument inchangés. Un rapport financier nécessite la traduction des commentaires tandis que les chiffres de revenus et les valeurs en pourcentage restent verrouillés. Les outils standards Translate PDF traitent souvent tout le contenu de manière uniforme, ce qui risque de modifier les nombres via des modifications de formatage, une conversion de séparateur décimal ou une substitution accidentelle de caractères.

Le problème n’est pas que les outils de traduction ne peuvent pas distinguer le texte des chiffres. La plupart des moteurs de traduction modernes reconnaissent les modèles numériques et les laissent inchangés de manière isolée. Les problèmes surviennent lorsque des nombres sont incorporés dans des chaînes à contenu mixte, lorsque le processus d'extraction PDF identifie mal les limites des cellules et lorsque la réinsertion du texte traduit brise la disposition du tableau. Une approche méthodique qui sépare le texte du contenu numérique avant la traduction produit des résultats toujours précis.

Les outils PDF Export et de traduction du WukongPDF préservent la structure des tableaux lors de la conversion de la langue. Pour les documents contenant beaucoup de tableaux, le prétraitement des tableaux pour isoler les cellules numériques avant d'exécuter le moteur de traduction donne le résultat le plus précis avec le moins de corrections post-traduction.

How to Translate Only the Text in PDF Table Cells While Keeping Numbers Untouched

Pourquoi les outils de traduction modifient parfois les nombres

Les moteurs de traduction traitent les chaînes de texte comme des unités linguistiques. Lorsqu'une cellule de tableau contient 1 500 unités, le moteur considère cela comme une chaîne mixte et doit décider si 1 500 est un nombre à laisser seul ou une partie d'une phrase à traduire. La plupart des moteurs formés sur les modèles 2024 et ultérieurs gèrent cela correctement pour les formats numériques courants. Les cas extrêmes qui posent encore des problèmes incluent les séparateurs décimaux, où la notation européenne 1 500,00 peut être convertie inutilement en 1 500,00 US, et les symboles monétaires, où le moteur peut déplacer ou dupliquer le symbole en fonction des conventions de la langue cible.

Les formats de date sont une autre victime fréquente. Une date écrite comme 03/07/2025 dans un document source en anglais américain signifie le 7 mars 2025. Si le moteur de traduction localise également le formatage de la date pour un public anglais britannique, il peut convertir l'affichage au 03/07/2025, ce qui change complètement la signification. L'approche la plus sûre consiste à traiter les dates comme un contenu protégé aux côtés des chiffres, en traduisant uniquement le texte environnant.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Méthode 1 : Pré-traitement du tableau dans Excel

Le flux de travail le plus contrôlable consiste à extraire le tableau PDF dans Excel avant de le traduire. Convertissez le PDF en Excel à l'aide d'un outil qui préserve la structure du tableau. Dans la feuille de calcul obtenue, parcourez les colonnes et identifiez celles qui contiennent du texte traduisible par rapport aux données numériques. Insérez une nouvelle feuille pour le contenu traduit. Copiez uniquement les colonnes de texte dans un format convivial pour la traduction : collez-les directement dans un outil de traduction ou exportez-les dans un fichier séparé.

Après avoir traduit les colonnes de texte, collez à nouveau le texte traduit dans la feuille de calcul aux positions correspondantes, en gardant les colonnes numériques complètement intactes. Examinez le tableau combiné pour détecter les problèmes d'alignement des cellules, puis exportez la feuille de calcul complétée au format PDF. Cette méthode garantit zéro altération numérique car les nombres ne transitent jamais par le moteur de traduction. Le compromis est qu'il nécessite un flux de travail manuel colonne par colonne, ce qui est pratique pour les tableaux de 10 à 50 lignes mais devient fastidieux pour les documents comportant des centaines de lignes.

Méthode 2 : Utilisation d'une approche de masquage de contenu basée sur Regex

Certains outils de traduction professionnels et plates-formes de TAO (traduction assistée par ordinateur) prennent en charge les modèles d'expression régulière qui marquent un texte spécifique comme non traduisible. Avant d'exécuter la traduction, définissez des modèles d'expression régulière qui correspondent à vos formats numériques : chiffres avec virgules, chiffres avec points décimaux, nombres avec préfixe de devise, valeurs de pourcentage et modèles de date. Appliquez ces modèles en tant que règles de contenu protégé. Le moteur de traduction ignore ensuite tout segment de texte correspondant à un modèle protégé, traduisant uniquement le texte restant.

Cette méthode fonctionne bien pour les documents dans lesquels la plupart des données numériques suivent des formats prévisibles. Un catalogue de produits avec un format de prix cohérent dans toutes les entrées, par exemple, peut être protégé avec un modèle tel que \$\d{1,3}(,\d{3})*\.\d{2} pour les montants en dollars. Pour les documents avec des formats numériques variés dans différentes sections, l'approche regex nécessite plus de modèles et plus de tests. Après la traduction, vérifiez ponctuellement au moins 10 valeurs numériques dans différentes parties du document pour confirmer qu'aucune dérive de formatage ne s'est produite.

Méthode 3 : Le workflow Copier-Traduire-Coller

Pour un seul tableau dans un PDF, l'approche la plus simple consiste à copier les cellules de texte une colonne à la fois, à les exécuter via un outil de traduction et à recoller les résultats dans une copie du tableau d'origine. Utilisez un éditeur PDF qui vous permet de sélectionner et de copier du texte à partir de cellules individuelles du tableau. Collez le texte de chaque colonne dans une zone de texte de traduction, copiez le résultat traduit et collez-le dans la colonne correspondante d'un tableau reconstruit dans Word, Google Docs ou un éditeur PDF prenant en charge l'édition de tableau.

Cette méthode est fastidieuse pour les grands tableaux, mais vous donne un contrôle au niveau des pixels sur ce qui est traduit et ce qui reste original. L'étape de collage est l'endroit où les problèmes de mise en page surviennent. Le texte traduit est souvent plus long que le texte source, parfois de 20 à 30 % pour des langues comme l'allemand ou l'espagnol. Avant de finaliser le tableau, ajustez la largeur des colonnes pour accueillir le texte traduit plus long sans casser la grille du tableau. Si le contenu traduit ne rentre pas dans les dimensions de la cellule d'origine, envisagez de réduire la taille de la police de 0,5 à 1 point plutôt que de laisser le texte déborder ou être tronqué.

Gestion des cellules à contenu mixte

Certaines cellules du tableau mélangent véritablement du texte et des chiffres dans une seule chaîne : Commander 15 unités de pièce de rechange BP-4402 est un exemple dans lequel le numéro 15 et le code de pièce BP-4402 doivent survivre à la traduction sans modification pendant que le texte qui les entoure est converti dans la langue cible. Pour ces cellules, enveloppez les segments numériques et les identifiants dans des jetons d'espace réservé avant la traduction. Remplacez 15 par NUM1 et BP-4402 par CODE1. Exécutez la traduction. Remplacez ensuite les espaces réservés par les valeurs d'origine dans la sortie traduite.

Cette technique d'espace réservé fonctionne de manière fiable car les moteurs de traduction traitent les espaces réservés comme des jetons non traduisibles et les conservent textuellement. Après la traduction, une simple recherche et remplacement rétablit les espaces réservés aux valeurs d'origine. Pour les tableaux comportant de nombreuses cellules au contenu mixte, automatisez l’insertion et le remplacement des espaces réservés avec un court script plutôt que de le faire manuellement.

ApprocheComment ça marcheLimitations
Traduction complèteTraduisez tout, puis corrigez manuellement les chiffresÉtape de correction fastidieuse
Copie-traduction sélectiveCopiez uniquement les cellules de texte, traduisez en externe, collezPréservation de la mise en page fragile
Protection des modèles RegexMarquer les modèles numériques comme texte protégé dans l'outil de traductionNécessite un outil prenant en charge les expressions régulières ou les plages protégées
Approche PDF à deux couchesExtrayez les nombres séparément, traduisez le texte, recombinezFlux de travail complexe, idéal pour les documents de grande valeur

Traduire uniquement le texte des cellules d'un tableau PDF tout en gardant les chiffres intacts est une tâche de précision. La méthode de prétraitement Excel est la plus fiable pour les tableaux complexes. La protection basée sur Regex fonctionne pour les documents avec des formats numériques prévisibles. L’approche manuelle copier-traduire-coller répond à des besoins rapides et ponctuels. Quelle que soit la méthode que vous choisissez, une passe de vérification de cinq minutes comparant un échantillon de valeurs numériques avant et après la traduction détecte tout problème avant que le document n'atteigne son public.

Liste de contrôle de la qualité après traduction

Après avoir traduit le texte de votre tableau PDF, effectuez un contrôle qualité systématique avant de partager le document. Tout d’abord, comparez le nombre total de lignes dans les tableaux d’origine et traduits. Si les nombres diffèrent, une ligne a été supprimée ou dupliquée lors de l’étape d’extraction ou d’insertion. Deuxièmement, vérifiez cinq valeurs numériques dans différentes colonnes par rapport au document original. Vérifiez que les points décimaux, les virgules, les symboles monétaires et les signes négatifs restent inchangés. Troisièmement, vérifiez que l’alignement des colonnes est cohérent sur toutes les lignes. Une seule colonne mal alignée décale toutes les données de cette colonne par rapport aux en-têtes.

Lorsque vous traduisez des tableaux destinés à un usage professionnel ou juridique, demandez à un locuteur natif de la langue cible de réviser un échantillon de cellules traduites. La traduction automatique du contenu des tableaux produit parfois des traductions techniquement correctes mais contextuellement inappropriées pour des termes spécifiques à un secteur. Un examen humain de cinq minutes détecte les problèmes de terminologie qui n'ont pas été détectés lors des contrôles de qualité automatisés. Les flux de travail Translate PDF qui incluent une étape de vérification humaine produisent des résultats toujours fiables pour les documents critiques pour l'entreprise.

Le temps supplémentaire passé à isoler le contenu numérique avant la traduction est payant en termes de précision. Une liste de prix traduite où chaque numéro est correct mais où le nom du produit est légèrement maladroit est un document utilisable. Une liste de prix traduite avec des noms de produits parfaits mais des décimales décalées est un handicap. Donnez la priorité à la précision numérique et vérifiez avec des contrôles ponctuels.

Automatisation de la protection numérique dans les flux de traduction récurrents

Pour les organisations qui traduisent des documents de table similaires selon un calendrier récurrent, la création d'un script de prétraitement qui identifie et protège automatiquement les cellules numériques supprime l'étape d'inspection manuelle du flux de travail. Un script Python utilisant des expressions régulières peut analyser un CSV extrait du PDF, marquer les colonnes contenant plus de 80 % de valeurs numériques comme protégées et générer un fichier balisé dans lequel l'outil de traduction peut voir quel contenu ignorer. Le script s'exécute en moins d'une seconde pour les tableaux comportant des milliers de lignes, et sa cohérence élimine le risque qu'un réviseur humain manque accidentellement un numéro qui aurait dû être protégé du moteur de traduction. Après avoir mis en œuvre un flux de travail de protection numérique, effectuez une comparaison entre les tableaux PDF source et traduits une fois par trimestre pour confirmer que les règles de protection détectent toujours chaque modèle numérique de votre ensemble de documents en évolution.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →