Others

Pouvez-vous conserver le calque de texte d'origine lors de la traduction d'un PDF

La traduction d'un PDF remplace généralement le texte original par la version traduite. Le texte en langue source a disparu de la sortie. Pour certains cas d’utilisation, il est utile de conserver le texte original en tant que couche cachée à côté de la traduction. Un lecteur bilingue peut vérifier la traduction par rapport à l'original. Un futur traducteur peut voir quel était le texte source sans localiser le document original. Et un moteur de recherche peut indexer les deux langues, ce qui rend le document accessible dans l'une ou l'autre. La question est de savoir si les outils Translate PDF peuvent préserver la couche de texte d'origine lors de la traduction, et dans quelles conditions cela est possible.

Points clés à retenir

La plupart des outils de traduction PDF remplacent le texte original par la version traduite. La préservation du texte original sous forme de couche cachée nécessite un outil prenant en charge la sortie bilingue ou parallèle, dans laquelle le texte original est stocké sous forme de couche invisible sous le texte traduit. Cette fonctionnalité est disponible dans certains outils de traduction professionnels, mais n'est pas standard dans les traducteurs PDF grand public. Une approche alternative consiste à traduire une copie du PDF et à conserver l'original en tant que document de référence distinct.

Can You Keep the Original Text Layer When Translating a PDF

Comment fonctionnent les calques de texte PDF pendant la traduction

L’étape d’extraction de texte est celle où réside l’essentiel de la complexité. L'outil de traduction doit non seulement extraire le texte visible, mais également enregistrer sa position exacte, les propriétés de la police et l'encodage de chaque caractère. Lors de la remise en place du texte traduit, l'outil a besoin des données de position du texte d'origine pour aligner correctement le nouveau texte. Un outil qui préserve le texte original sous forme de calque caché doit stocker deux ensembles complets de données textuelles et gérer leur superposition. Cela double à peu près la charge de travail de traitement de texte, c'est pourquoi de nombreux outils n'offrent pas cette fonctionnalité. La capacité technique existe dans la spécification PDF. La limitation réside dans la mise en œuvre de l’outil, pas dans le format.

Un PDF stocke le texte sous forme de codes de caractères dans les flux de contenu. Lorsqu'un outil de traduction traite le PDF, il extrait ces codes de caractères, les mappe à un texte lisible, envoie le texte à un moteur de traduction et replace le texte traduit dans le document. Le flux de travail standard remplace les codes de caractères d'origine par ceux traduits. Le texte original a disparu du fichier. Il n'y a pas d'annulation. Pour préserver le texte original, l'outil de traduction doit créer un deuxième calque de texte contenant la langue source, le marquer comme masqué ou non imprimable et placer le texte traduit dans le calque visible. Ceci est techniquement possible mais nécessite que l'outil de traduction gère les deux couches de texte tout au long du processus.

La spécification PDF prend en charge les groupes de contenu facultatifs, communément appelés Couches PDF, qui peuvent être affichés ou masqués indépendamment. Un outil de traduction pourrait placer le texte original dans un calque et le texte traduit dans un autre, le calque original étant masqué par défaut. Les lecteurs qui souhaitent voir le texte original peuvent activer/désactiver la visibilité des calques dans leur visionneuse PDF. Cette approche préserve les deux langues dans un seul fichier et permet au lecteur de contrôler quelle langue est visible. La capacité technique existe au format PDF. La question est de savoir si un outil de traduction donné l’implémente.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Outils de traduction prenant en charge la préservation du texte original

Les plateformes de traduction professionnelle utilisées par les agences de localisation prennent souvent en charge la sortie PDF bilingue. Ces outils sont conçus pour les flux de travail dans lesquels un réviseur doit comparer la traduction au texte source. Le PDF de sortie contient les deux couches de langue, et le réviseur peut basculer entre elles ou les afficher côte à côte dans une interface de révision spécialisée. Ces outils sont généralement basés sur un abonnement et conçus pour les travaux de traduction commerciale à volume élevé plutôt que pour la traduction occasionnelle de documents.

Pour les utilisateurs grand public et petites entreprises, les options sont plus limitées. Certains services de traduction PDF en ligne proposent un format de sortie côte à côte dans lequel le texte original et le texte traduit apparaissent en paragraphes alternés ou sur deux colonnes. Cela préserve visiblement les deux langues plutôt que d’en masquer une en tant que couche. Le document est plus long mais les deux langues sont accessibles sans basculement de calque. L'outil de traduction de WukongPDF prend en charge un mode de sortie côte à côte qui place les paragraphes originaux et traduits les uns à côté des autres, préservant ainsi les deux langues dans un seul document lisible.

Alternative : conserver le PDF original comme référence

Pour les équipes qui doivent maintenir des versions bilingues de documents sur plusieurs cycles de révision, une approche de gestion documentaire fonctionne mieux qu'une approche à fichier unique. Stockez les PDF originaux et traduits dans un référentiel à version contrôlée avec une convention de dénomination qui les relie. Lorsque le document original est mis à jour, la convention de dénomination indique clairement quelle traduction doit être mise à jour pour correspondre. Ce flux de travail est plus fiable qu'un seul PDF bilingue pour les documents qui changent au fil du temps.

Lorsque l'outil de traduction ne prend pas en charge la sortie bilingue, le flux de travail le plus simple consiste à traduire une copie du PDF et à conserver l'original en tant que fichier de référence distinct. Nommez les fichiers de manière cohérente afin que la relation entre eux soit claire. Une convention de dénomination telle que report-2025-en.pdf pour la traduction anglaise et report-2025-fr-original.pdf pour l'original français rend la relation évidente pour quiconque parcourt le dossier. Stockez les deux fichiers au même emplacement et référencez le nom de fichier d'origine dans les métadonnées du document traduit ou dans une note de la page de garde.

À des fins d’archivage, la paire original-plus-traduction est souvent l’approche la plus fiable. Chaque fichier est un PDF standard que tout lecteur peut ouvrir. Il n'y a aucune dépendance aux paramètres de visibilité des couches ou aux outils de visualisation spécialisés. La paire de fichiers documente à la fois le texte source et la traduction dans un format qui restera accessible pendant des décennies. Cette approche n’est peut-être pas aussi élégante qu’un seul PDF bilingue, mais elle est plus fiable à long terme.

Vérifier que le calque de texte d'origine est intact

Exécutez un test d’extraction de texte sur le PDF bilingue. Extrayez tout le texte du document et recherchez un mot ou une expression distinctif de la langue d'origine. S'il apparaît dans le texte extrait, le calque d'origine est présent et correctement encodé. Si le texte extrait contient uniquement la langue traduite, la couche d'origine est manquante ou n'a pas été codée en tant que texte extractible. Ce test détecte les échecs d'encodage qui ne seraient pas détectés par une inspection visuelle du panneau des calques.

Si votre outil de traduction prétend conserver le texte original sous forme de couche cachée, vérifiez-le avant de vous y fier. Ouvrez le PDF traduit dans une visionneuse prenant en charge le basculement de la visibilité des calques, tel qu'Adobe Acrobat Pro. Recherchez un panneau de calques dans le volet de navigation. Si l'outil a créé correctement le calque de texte d'origine, il apparaîtra comme un calque nommé avec une bascule de visibilité. Activez et désactivez le calque pour confirmer que le texte d'origine apparaît et disparaît comme prévu. Exécutez une recherche textuelle pour un mot dont vous savez qu'il apparaît dans l'original mais qui a été modifié dans la traduction. Si la recherche trouve le mot original, la couche est présente et consultable.

Vérifiez également la taille du fichier PDF bilingue par rapport à la taille d’une version traduite standard. Un PDF comportant deux calques de texte sera environ 10 à 30 % plus grand qu'une version monolingue, selon la quantité de texte. Un PDF bilingue de la même taille qu'une traduction standard ne contient probablement pas la couche de texte d'origine, indépendamment de ce que prétend la documentation de l'outil. La différence de taille de fichier est une vérification rapide et fiable.

Foire aux questions

Le calque de texte original masqué augmentera-t-il considérablement la taille du fichier ? L'augmentation est proportionnelle à la quantité de texte, généralement de 15 à 30 % pour les documents contenant beaucoup de texte. Pour les documents contenant beaucoup d’images où le texte ne représente qu’une petite fraction de la taille totale du fichier, l’augmentation est négligeable. L'approche double couche ajoute une deuxième copie des données texte et des métadonnées de gestion des couches, mais elle ne duplique pas les images, les polices ou la structure des pages. Pour une utilisation archivistique, l’augmentation modérée de la taille des fichiers constitue un compromis raisonnable pour l’accessibilité bilingue.

La préservation du calque de texte d'origine affecte-t-elle la capacité de recherche du PDF ?

Oui, positivement. Avec les deux couches linguistiques présentes, le PDF est consultable dans les deux langues. Un utilisateur qui recherche un terme dans la langue d'origine le trouvera dans la couche cachée, et un utilisateur qui recherche dans la langue traduite le trouvera dans la couche visible. Cette double possibilité de recherche est l’un des principaux avantages de la préservation du texte original.

Puis-je extraire le texte original d'un PDF bilingue pour récupérer le document source ?

Si la couche de texte d'origine est présente et correctement encodée, son extraction récupère le texte source avec une haute fidélité. La qualité de l'extraction dépend de la manière dont l'outil de traduction a stocké le texte original. Les outils qui le stockent sous forme de flux de texte complet et non corrompu produisent une sortie extractible. Les outils qui le stockent sous forme d'objets texte fragmentés peuvent produire une sortie extractible avec des phrases brisées qui nécessitent un nettoyage manuel.

Un PDF bilingue est-il plus volumineux que la conservation de deux fichiers distincts ?

Généralement non. Un PDF bilingue comportant les deux couches linguistiques est généralement plus petit que la taille combinée de deux PDF monolingues distincts, car les images, les polices et la structure des pages sont partagées entre les couches. Le calque de texte n'ajoute qu'une petite quantité de données. Pour les environnements de stockage limité, le PDF bilingue est plus efficace que la conservation de deux fichiers distincts.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →