Tips & Tricks

Comment rédiger du texte dans une seule langue spécifique à partir d'un document PDF multilingue sans affecter l'autre langue

Les PDF multilingues sont courants dans les contextes commerciaux internationaux, gouvernementaux et juridiques. Un contrat peut apparaître en anglais et en français dans des colonnes parallèles sur chaque page, chaque version linguistique ayant le même poids juridique. Un manuel de produit peut comprendre des sections distinctes en anglais, espagnol et chinois, chacune adressée à un marché régional différent. Un formulaire gouvernemental peut fournir des instructions en cinq langues empilées sur une seule page, de sorte qu'un seul document serve à l'ensemble d'une population multilingue. Le défi que représente la rédaction d'informations à partir d'un tel document est fondamentalement plus complexe que la rédaction d'un PDF monolingue, car vous devez prendre des décisions délibérées, langue par langue, quant au texte à supprimer et à celui à conserver.

Vous devrez peut-être supprimer du texte sensible dans une langue tout en conservant les informations identiques dans une autre langue où elles ne sont pas considérées comme sensibles selon les règles de divulgation de cette juridiction. Vous devrez peut-être expurger uniquement la version anglaise d'un nom personnel tout en laissant les versions française et espagnole entièrement visibles, car différentes réglementations en matière de confidentialité s'appliquent aux différentes versions linguistiques du même document officiel. Ou vous devrez peut-être rédiger des informations classifiées dans une section linguistique tout en laissant intacts les résumés non classifiés dans d’autres langues. Ces scénarios nécessitent une technique de rédaction qui fonctionne au niveau de blocs de texte individuels plutôt que de pages entières, et cette technique commence par comprendre exactement comment le contenu multilingue est stocké dans un fichier PDF.

How to Redact Text in Only One Specific Language From a Multi-Language PDF Document Without Affecting the Other Language

Comment le texte multilingue est stocké dans un document PDF

Un fichier PDF stocke le texte sous forme de caractères individuels, chacun positionné à des coordonnées x et y précises sur le canevas de la page. Chaque caractère porte son propre identifiant de police, sa taille, sa couleur et ses coordonnées de placement exactes. Il est important de noter que le format PDF n’a aucun concept de langage intégré. Un bloc de texte anglais et un bloc de texte français sur la même page ne sont étiquetés ou étiquetés comme anglais ou français nulle part dans la structure du fichier. Il s'agit simplement de deux collections indépendantes de caractères positionnés dans différentes zones de la page, probablement rendus avec différentes polices optimisées pour le jeu de caractères et les conventions typographiques particulières de chaque langue.

Cette absence de métadonnées linguistiques est, paradoxalement, à la fois le plus grand obstacle à la rédaction spécifique à une langue et la caractéristique qui la rend techniquement possible. C’est un obstacle car aucun outil de rédaction ne peut identifier automatiquement quel texte appartient à quelle langue en lisant une balise de métadonnées. Il n'y a pas de colonne de langue dans la table des objets internes du PDF. C'est ce qui rend possible la rédaction spécifique à une langue, car l'indépendance structurelle complète des blocs de texte de chaque langue par rapport aux autres signifie que la rédaction d'une version linguistique n'affecte pas réellement l'autre. Les passages de texte anglais et les passages de texte français occupent des plages d'octets différentes dans le fichier et peuvent être manipulés indépendamment.

Concrètement, cela signifie que lorsque vous dessinez un rectangle de rédaction sur un paragraphe de texte anglais dans la colonne de gauche d'une mise en page à deux colonnes, l'outil de rédaction PDF supprime uniquement les traits de caractères dont les coordonnées se trouvent dans ce rectangle. Le texte français dans la colonne de droite, assis en toute sécurité à différentes coordonnées, est intact. La séparation est purement géométrique et non linguistique, mais elle fonctionne car la géométrie est en corrélation fiable avec la frontière linguistique. Tant que vous pouvez identifier avec précision quelles régions de chaque page contiennent quelle langue, vous pouvez rédiger de manière sélective par langue.

WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Créer une carte linguistique avant d'effectuer des expurgations

L’étape préparatoire la plus importante à la rédaction spécifique à une langue consiste à créer une carte linguistique complète du document avant de rédiger quoi que ce soit. Parcourez chaque page systématiquement et identifiez précisément quels blocs de texte appartiennent à quelle langue. Dans une mise en page en colonnes parallèles, indiquez que la colonne de gauche est la langue A et la colonne de droite la langue B sur les pages 1 à 20. Dans une mise en page empilée, notez que le tiers supérieur de chaque page est en anglais, le tiers du milieu en espagnol et le tiers inférieur en chinois. Dans un document où les langues alternent par section, marquez les plages de pages pour chaque section linguistique. Créez un document de référence simple, qu'il s'agisse d'une feuille de calcul, de captures d'écran annotées ou de notes manuscrites, que vous pourrez consulter pendant le processus de rédaction pour confirmer quel texte appartient à quelle langue.

La carte linguistique sert de référence faisant autorité lorsque vous effectuez un zoom avant sur un paragraphe spécifique et que vous devez vérifier la langue que vous consultez avant d'appliquer une rédaction. Cela évite l'erreur de rédaction spécifique à la langue la plus courante : la rédaction accidentelle d'un texte dans la mauvaise langue parce que vous avez perdu la trace de la région linguistique dans laquelle vous travailliez. Le temps passé à créer la carte est insignifiant comparé au temps et aux conséquences potentielles de devoir expliquer pourquoi un texte dans la mauvaise langue a été rédigé à partir d'un document officiel.

Utilisation des informations de police pour faciliter l'identification de la langue

Bien que le format PDF ne stocke pas les balises de langue, il stocke des informations détaillées sur les polices pour chaque caractère exécuté, et ces données de police peuvent servir de puissant proxy pour l'identification de la langue. Différents systèmes d'écriture nécessitent des technologies de polices fondamentalement différentes. Le tableau ci-dessous mappe les types de scripts de police courants aux langues qu'ils représentent généralement et aux considérations de rédaction pour chacun.

Type de script de policeLangues probables représentéesConsidérations clés relatives à la rédaction
Polices d'écriture latineAnglais, français, espagnol, allemand, italien, portugais, néerlandais et la plupart des autres langues d'Europe occidentaleVérifiez visuellement quelle langue spécifique ; les caractères se chevauchent fortement dans les langues
Polices CJK (SimSun, MS Mincho, Batang)Chinois (simplifié ou traditionnel), japonais, coréenLe nom de la police indique souvent directement la langue cible
Polices d'écriture arabeArabe, persan (farsi), ourdou, pachtoSens du texte de droite à gauche ; les rectangles de rédaction doivent tenir compte de la mise en page RTL
Polices d'écriture cyrilliqueRusse, ukrainien, bulgare, serbe, macédonienLes formes des glyphes sont très similaires dans ces langues ; vérification visuelle indispensable
Polices Devanagari et IndicHindi, marathi, népalais, sanskrit et autres langues d'Asie du SudLa mise en forme complexe des glyphes peut affecter le placement du rectangle de rédaction

Les informations sur les polices de caractères réduisent le problème d'identification des langues de « laquelle des sept mille langues du monde » à « laquelle d'une petite poignée de langues qui utilisent ce système d'écriture particulier ». Lorsqu'elle est combinée à une inspection visuelle du contenu réel du texte, l'identification basée sur les polices est suffisamment fiable pour permettre une rédaction fiable dans une langue spécifique dans pratiquement tous les documents du monde réel.

Réalisation d'une rédaction spécifique à une langue avec les outils PDF standard

Les outils de rédaction PDF standard n'incluent pas de fonction de sélection de langue. Il n'y a pas de menu déroulant dans lequel vous pouvez choisir « Caviarder l'anglais uniquement » ou « Cavicher le français uniquement ». La rédaction est effectuée en dessinant des zones rectangulaires sur le contenu que vous souhaitez supprimer définitivement du fichier. Pour une rédaction spécifique à une langue, cela signifie que vous devez soigneusement dessiner des rectangles de rédaction qui couvrent uniquement le texte dans la langue cible tout en évitant précisément le texte dans d'autres langues qui occupe des zones adjacentes ou proches de la même page.

Dans une disposition claire en colonnes parallèles où l'anglais occupe les 45 pour cent de gauche de la page et le français les 45 pour cent à droite avec une gouttière claire entre les deux, la tâche est gérable. Vous dessinez des rectangles de rédaction couvrant le texte de la colonne anglaise et laissez la colonne française entièrement seule. Dans les documents où les langues sont entrelacées, comme un formulaire dans lequel chaque étiquette de champ apparaît dans trois langues empilées verticalement, la tâche nécessite un zoom avant d'au moins 200 % et le dessin de rectangles étroits et précis qui couvrent uniquement la ligne de la langue cible sans couper la ligne au-dessus ou en dessous.

L'outil PDF Redaction de WukongPDF effectue une véritable rédaction destructrice, supprimant définitivement le contenu sélectionné de la structure du fichier PDF plutôt que de simplement le recouvrir d'un rectangle noir. Pour une rédaction spécifique à une langue, effectuez un zoom avant avec un grossissement d'au moins 200 % sur chaque page. Dessinez soigneusement vos rectangles de rédaction, en vérifiant que chaque rectangle couvre uniquement le texte de la langue cible. Après avoir appliqué toutes les rédactions, faites défiler l'intégralité du document avec un zoom normal pour effectuer une vérification visuelle. Confirmez que le texte dans la langue non cible est entièrement intact, parfaitement lisible et ne présente aucun signe de coupure accidentelle aux limites entre les régions linguistiques.

Gestion du contenu partagé qui apparaît dans toutes les versions linguistiques

Certains éléments d'un document multilingue sont partagés dans toutes les versions linguistiques de par leur nature. Un numéro de référence de contrat, un numéro de dossier judiciaire, un montant monétaire, une date ou une adresse de propriété peuvent apparaître de manière identique dans chaque section linguistique car ce sont des faits qui ne changent pas avec la traduction. Si ces informations partagées doivent être expurgées, elles doivent être expurgées dans chaque version linguistique où elles apparaissent. Laisser un numéro de dossier visible dans la section française alors qu'il a été expurgé de la section anglaise crée une incohérence évidente et préjudiciable que tout examinateur remarquera immédiatement.

S’il existe une raison légitime de conserver les informations partagées dans une langue tout en les expurgeant dans une autre, cette raison doit être explicitement documentée. Créez une brève note d'accompagnement ou intégrez des métadonnées dans le PDF qui expliquent quelle version linguistique a été rédigée, la base juridique ou réglementaire spécifique de la rédaction sélective et l'autorité en vertu de laquelle la décision de rédaction a été prise. Cette documentation protège à la fois la personne qui a effectué la rédaction et l'organisation qui a publié le document en établissant que la suppression sélective était une décision délibérée et justifiée plutôt qu'un oubli ou une erreur dans le processus de rédaction.

Pour les documents pour lesquels les exigences de rédaction spécifiques à une langue sont motivées par des cadres juridiques multi-juridictionnels véritablement complexes, consultez un conseiller juridique avant d'effectuer les rédactions. La capacité technique de rédaction par langue existe et est fiable lorsqu'elle est effectuée avec soin. L’opportunité juridique de divulguer sélectivement des informations par langue est une question distincte qui dépend entièrement du contexte réglementaire spécifique. Les implications Traduire PDF doivent également être pesées : un destinataire qui peut lire uniquement la version linguistique non expurgée peut recevoir un ensemble d'informations divulguées sensiblement différent d'un destinataire limité à la version expurgée.

WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →