Others

Pouvez-vous convertir un PDF en Word et conserver l'ordre de lecture d'origine pour les langues s'écrivant de droite à gauche

La conversion d'un PDF en Word est déjà assez difficile lorsque le document source est en anglais, avec un simple ordre de lecture de gauche à droite et de haut en bas. Lorsque le document source est en arabe, hébreu, persan ou ourdou, la conversion doit également déterminer correctement que le texte s'écoule de droite à gauche, que les nombres dans le texte RTL sont écrits de gauche à droite et que la mise en page globale commence par le côté droit. La plupart des convertisseurs PDF vers Word sont conçus et testés principalement sur des documents LTR, et leurs performances sur le contenu RTL vont d'imparfaites à complètement inutilisables.

Le format PDF ne stocke pas explicitement l'ordre de lecture en tant que propriété du texte. Il stocke des passages de texte individuels sous forme de glyphes positionnés sur la page. Pour le texte LTR, un convertisseur peut raisonnablement supposer que le texte se lit de gauche à droite et de haut en bas, car cela correspond à la présentation physique. Pour le texte RTL, cette hypothèse est tout à fait fausse. Une ligne de texte arabe qui se lit de droite à gauche sur la page sera inversée par un convertisseur qui assume l'ordre LTR, produisant une sortie où chaque ligne est orthographiée à l'envers. Il ne s'agit pas d'un problème de formatage mineur. Une ligne arabe inversée est illisible pour un arabophone.

Une étude de 2025 sur la précision de l'extraction de PDF en texte dans plusieurs langues a révélé que les taux d'erreur d'extraction RTL étaient 3,6 fois plus élevés que les taux d'erreur d'extraction LTR dans le même ensemble d'outils de conversion, l'inversion de l'ordre des mots étant le type d'erreur le plus courant (Computational Linguistics Institute, « Multilingual PDF Text Extraction Accuracy », 2025). L’étude a également révélé que les erreurs n’étaient pas aléatoires. Des outils spécifiques géraient systématiquement RTL correctement ou produisaient une sortie systématiquement inversée, ce qui signifie que choisir le bon outil pour la conversion RTL est plus important que de modifier les paramètres de conversion, et changer d'outil peut corriger une conversion qui semble désespérément interrompue.

Can You Convert a PDF to Word and Preserve the Original Reading Order for Right-to-Left Languages

Comment PDF stocke le texte RTL et pourquoi l'extraction simple échoue

Dans un PDF, le texte est stocké sous la forme d'une séquence d'index de glyphes et de commandes de positionnement. Pour chaque passage de texte, le PDF spécifie la police, les codes de glyphe des caractères et les coordonnées X et Y de chaque glyphe de la page. Il n'y a pas de drapeau explicite indiquant "ce texte est arabe". ou "cette ligne se lit de droite à gauche." Un PDF Converter doit déduire la direction du texte à partir des codes de caractères Unicode, qui codent la directionnalité via l'algorithme bidirectionnel Unicode. Les caractères arabes et hébreux ont une direction RTL intrinsèque, et l'algorithme Unicode spécifie comment réorganiser une séquence mixte de caractères RTL et LTR pour l'affichage.

Le problème est que l’ordre d’extraction brut des glyphes d’un PDF peut ne pas correspondre à l’ordre logique des caractères du texte original. Un rédacteur PDF est libre de placer les glyphes sur la page dans n'importe quel ordre, et certains logiciels de rédaction placent les glyphes RTL de gauche à droite dans le flux de contenu même si l'ordre de lecture est de droite à gauche. Un convertisseur qui concatène naïvement les glyphes dans l'ordre d'extraction produira un texte qui se lit correctement ou à l'envers, selon la manière dont l'auteur du PDF d'origine a choisi d'encoder le texte. Le même document arabe, lorsqu'il est imprimé au format PDF à partir de deux traitements de texte différents, peut produire des flux de contenu avec un ordre de glyphes différent, et un convertisseur qui fonctionne parfaitement pour l'un peut produire du texte inversé pour l'autre.

L'algorithme bidirectionnel Unicode, spécifié dans l'annexe 9 de la norme Unicode, définit comment réorganiser une séquence de caractères avec une directionnalité mixte pour l'affichage. Un convertisseur qui implémente correctement cet algorithme peut gérer correctement la plupart des textes RTL, quel que soit l'ordre des glyphes dans le flux de contenu PDF. Cependant, la qualité de la mise en œuvre varie. L'algorithme gère bien les cas courants, mais présente des cas extrêmes impliquant des remplacements de direction imbriqués, de la ponctuation aux limites de direction et du texte à écriture mixte tel qu'un terme technique anglais dans une phrase arabe.

WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Choisir un convertisseur qui gère l'ordre de lecture RTL

Les convertisseurs les plus fiables pour les documents RTL sont ceux qui implémentent l'algorithme bidirectionnel Unicode lors de l'extraction de texte. Adobe Acrobat Pro et plusieurs bibliothèques open source, notamment Apache PDFBox et pdfplumber, prennent en charge cet algorithme à des degrés divers. Avant de vous engager dans un convertisseur pour un lot de documents RTL, testez-le avec une seule page représentative. Extrayez le texte dans Word et comparez le résultat, mot par mot, au PDF original. Vérifiez l'inversion de l'ordre des mots dans les phrases, le positionnement correct des nombres dans le texte RTL et les séquences mixtes LTR/RTL telles qu'un nom de société en anglais dans un paragraphe arabe.

Si votre convertisseur inverse systématiquement le texte RTL, vous pouvez parfois contourner le problème en utilisant un chemin de conversion qui passe par un format intermédiaire. Convertissez le PDF en HTML ou en un format de texte balisé à l'aide d'un outil qui gère correctement RTL. Importez ensuite le format intermédiaire dans Word. Ce processus en deux étapes est moins pratique que la conversion directe de PDF en Word, mais lorsque le chemin direct produit du texte inversé, le chemin indirect est la seule voie automatisée vers une sortie utilisable.

Le WukongPDF prend en charge la conversion compatible RTL qui applique automatiquement le sens de lecture et l'alignement du texte corrects lorsque les métadonnées du document source indiquent une langue RTL. Le convertisseur détecte le script principal du document et applique les règles directionnelles appropriées lors de l'extraction du texte, produisant ainsi un document Word avec l'orientation des paragraphes, l'alignement du texte et l'ordre des caractères corrects.

Préserver la structure de mise en page avec les documents RTL

L’ordre de lecture n’affecte pas seulement le texte. La mise en page entière d'un document RTL est mise en miroir par rapport à un document LTR. La première page d’un livre arabe est ce qu’un lecteur anglais considérerait comme la dernière page. Les tableaux vont de droite à gauche. Les listes sont en retrait à droite. La marge de reliure se trouve à droite des pages de droite. Une conversion qui gère correctement la direction du texte mais n'ajuste pas la structure de mise en page produira un document Word dans lequel le texte se lit correctement mais où tout est positionné comme s'il s'agissait d'un document LTR, avec des paragraphes alignés à gauche et des listes indentées à gauche qui semblent incorrectes pour un lecteur RTL.

Lorsque la conversion PDF vers Word est destinée à l'édition et à la réexportation, la préservation de la mise en page Format PDF est moins critique car l'éditeur ajustera la structure. Lorsque la conversion est effectuée à des fins d'archivage ou de référence, où le document Word doit correspondre visuellement au PDF original, la préservation de la mise en page est plus importante. Dans ces cas-là, choisissez un convertisseur qui préserve le positionnement de la zone de texte, la disposition des colonnes et l’alignement des marges par rapport à l’original. Après la conversion, vérifiez manuellement que le sens du texte est correct sur chaque page. Vérifiez que l'alignement des paragraphes est défini sur l'alignement à droite pour le texte arabe et hébreu plutôt que sur l'alignement à gauche par défaut. Vérifiez que les colonnes de tous les tableaux sont dans le bon ordre de droite à gauche. Ces vérifications manuelles détectent les problèmes que la conversion automatisée ne peut pas détecter car le convertisseur ne comprend pas la signification sémantique du contenu.

WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →