Tips & Tricks

Comment traduire du texte à l'intérieur d'images intégrées dans un PDF

Un outil de traduction PDF traite le flux de texte dans le document, convertissant les mots d'une langue à une autre. Il lit les paragraphes, les titres et les légendes. Mais il ne lit pas le texte contenu dans les images. Une photographie d'un panneau, une capture d'écran d'une interface utilisateur dans une langue différente, un graphique avec des étiquettes d'axe rendus dans le cadre de l'image, tout cela contient du texte que les outils de traduction standard ignorent car le texte ne figure pas dans le flux de texte PDF. Il est intégré aux pixels de l'image. La traduction de texte dans des images intégrées nécessite d'extraire les images, d'exécuter l'OCR dessus, de traduire le texte reconnu, puis de réintégrer les images traduites ou d'ajouter la traduction en superposition. Le flux de travail Translate PDF pour le texte intégré à une image est plus complexe que la traduction de texte standard, mais il couvre du contenu qui autrement resterait non traduit.

How to Translate Text Inside Embedded Images in a PDF

Identifier les images contenant du texte traduisible

Toutes les images d'un PDF ne contiennent pas de texte qui mérite d'être traduit. Une photographie décorative, une texture d’arrière-plan et un logo d’entreprise ne peuvent contenir aucun contenu traduisible. Une capture d'écran d'une application logicielle, un diagramme avec des composants étiquetés, une photographie d'un document ou d'un panneau et un graphique avec des étiquettes d'axes intégrées contiennent tous du texte qu'un lecteur dans la langue cible doit comprendre. Parcourez le PDF et identifiez chaque image contenant du texte. Marquez ces images pour le flux de travail de traduction.

Les images qui contiennent du texte dans le PDF se répartissent en deux catégories : celles dont le texte fait partie de l'image de par sa conception, comme une capture d'écran ou un diagramme étiqueté, et celles dont le texte apparaît dans l'image parce que le document a été numérisé plutôt que créé numériquement. Un PDF numérisé est une grande image par page. Tout le texte d'une page numérisée est intégré dans l'image de la page. Un PDF créé numériquement peut comporter une seule capture d'écran sur une page autrement textuelle. Les Images PDF qui nécessitent une traduction sont celles où le texte apparaît dans les pixels de l'image et non dans le flux de texte PDF.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Extraire des images et reconnaître le texte

Extrayez les images du PDF à la plus haute résolution disponible. Utilisez un outil d'extraction d'images PDF qui préserve la résolution d'origine. Enregistrez chaque image extraite sous forme de fichier PNG pour éviter d'introduire des artefacts de compression lors de l'étape d'extraction. Ouvrez chaque image extraite et confirmez que le texte est lisible. Si la résolution de l'image est trop faible pour que le texte soit lu clairement, ré-extraitez-le à une résolution plus élevée si possible, ou notez que cette image peut produire des résultats OCR peu fiables.

Exécutez l'OCR sur chaque image extraite pour reconnaître le texte. Le moteur OCR identifie les zones de texte dans l'image et affiche les caractères reconnus ainsi que leurs positions. Enregistrez la sortie OCR pour chaque image, y compris le texte reconnu et les coordonnées du cadre de délimitation de chaque région de texte. Ces informations sont nécessaires ultérieurement pour placer le texte traduit dans la bonne position sur l'image. WukongPDF gère le traitement OCR PDF qui peut reconnaître le texte dans les images intégrées dans le cadre du flux de travail de conversion de documents.

Traduire le texte reconnu tout en préservant le contexte

Le texte reconnu à partir des images est souvent fragmentaire. Un diagramme peut contenir des étiquettes d’un seul mot. Une capture d'écran peut contenir des éléments de menu et des étiquettes de boutons sans contexte de phrase. Ce texte fragmenté constitue un défi pour les moteurs de traduction automatique, car le contexte linguistique environnant qui lève l'ambiguïté sur le sens des mots est absent. Fournissez autant de contexte que possible. Si une étiquette indique Fichier et apparaît sur une capture d'écran d'un menu de logiciel, notez dans l'entrée de traduction qu'il s'agit d'un élément de menu et non d'un objet physique.

Pour les images comportant plusieurs régions de texte, conservez le mappage entre chaque région et sa traduction. Un diagramme comportant dix étiquettes produit dix chaînes de texte distinctes, chacune nécessitant une traduction. Conservez le texte original, le texte traduit et les coordonnées du cadre de délimitation ensemble dans un format structuré tel qu'une feuille de calcul. Ce mappage est utilisé dans l'étape finale pour placer le texte traduit sur l'image. Pour que la sortie Translate PDF soit utile, le texte traduit doit apparaître au bon endroit sur l'image, remplaçant ou accompagnant le texte original.

Remettre le texte traduit sur les images

Il existe deux approches pour placer du texte traduit sur des images. La première approche remplace le texte original par la traduction. Ouvrez l'image dans un éditeur d'images. Pour chaque zone de texte, effacez le texte original en remplissant la zone avec la couleur d'arrière-plan. Placez le texte traduit dans la même région en utilisant une police qui correspond le plus possible au style de l'original. Cette approche produit une image traduite propre qui ressemble à l’original, mais dans une langue différente.

La deuxième approche ajoute la traduction aux côtés du texte original. Placez le texte traduit dans une couleur contrastante en dessous ou à côté du texte original. Cette approche préserve l'original pour les lecteurs qui comprennent les deux langues et souhaitent comparer la traduction avec la source. C'est plus rapide que d'effacer et de remplacer, mais l'image résultante est visuellement plus chargée. Choisissez l'approche en fonction des besoins du public. Un manuel de formation destiné aux opérateurs qui ne lisent que la langue cible bénéficie du remplacement. Un document de référence bilingue bénéficie d’une présentation côte à côte.

Réintégration des images traduites dans le PDF

Une fois les images traitées avec le texte traduit, elles doivent être réinsérées dans le PDF. Remplacez chaque image originale par sa contrepartie traduite. L'image de remplacement doit tenir dans le même espace de la page que l'originale. Si l'image traduite a des dimensions en pixels différentes de celles de l'original, redimensionnez-la pour qu'elle corresponde au cadre de délimitation d'origine dans le PDF. La mise en page du PDF ne devrait pas changer. La seule différence visible devrait être la langue du texte dans les images.

Enregistrez le PDF avec les images traduites en tant que nouvelle version, en conservant le PDF original non traduit comme référence. Vérifiez le PDF traduit en l'ouvrant et en vérifiant chaque image. Confirmez que le texte traduit est lisible, correctement positionné et exempt d'erreurs d'OCR ou de traduction. Un Translate PDF avec traduction d'images intégrées est terminé lorsque chaque élément de texte du document, dans le flux de texte et dans les images, est accessible à un lecteur dans la langue cible.

Quand choisir la traduction manuelle plutôt que la traduction automatisée

Pour les images contenant du texte critique, tel que des avertissements de sécurité, des mentions légales ou des spécifications techniques, envisagez une traduction manuelle par un traducteur humain plutôt qu'une traduction automatique. Une erreur OCR combinée à une erreur de traduction automatique peut modifier le sens d’une consigne de sécurité d’une manière qui a de réelles conséquences. Le coût d’une traduction humaine pour un petit nombre d’images critiques est faible comparé au coût d’une traduction incorrecte.

Pour les grands lots d’images pour lesquels la traduction manuelle n’est pas pratique, mettez en œuvre une étape de révision. Après la traduction automatique et la réintégration, demandez à un réviseur humain qui lit la langue cible de vérifier l'exactitude d'un échantillon des images traduites. Si l'échantillon révèle des erreurs systémiques, ajustez les paramètres OCR ou les paramètres du moteur de traduction et retraitez le lot.

La traduction de texte dans des images intégrées est souvent la dernière étape pour rendre un PDF entièrement accessible à un public international. Le corps du texte, les titres et les légendes ont été traduits. Les images restent le contenu final non traduit. La réalisation de cette étape produit un document dans lequel chaque morceau de texte, sur tous les supports, est disponible dans la langue cible.

Pour les documents fréquemment mis à jour contenant des images intégrées, déterminez si le texte de l'image peut être déplacé dans le flux de texte PDF pendant le processus de création du document. Un diagramme avec des étiquettes stockées sous forme de superpositions de texte plutôt que dans le cadre de l'image peut être traduit à l'aide d'outils de traduction de texte standard, évitant ainsi entièrement le flux de travail d'extraction-OCR-traduction-réintégration.

La qualité de l’image traduite finale dépend de la qualité de chaque étape du pipeline. Une extraction d’image haute résolution produit une entrée OCR claire. Une OCR précise produit un texte correct à traduire. Un bon moteur de traduction préserve le sens. Une réintégration minutieuse préserve la qualité visuelle. Chaque étape dépend de la précédente.

Le flux de travail Translate PDF pour le texte incorporé dans une image est le scénario de traduction le plus exigeant en main-d'œuvre car il combine le traitement de l'image, l'OCR, la traduction et la réintégration dans un seul pipeline. L'automatisation d'autant d'étapes que possible réduit l'effort manuel.

Pour les images qui apparaissent de manière identique dans plusieurs PDF, comme un logo d'entreprise avec un slogan ou un diagramme standard, traduisez l'image une fois et réutilisez-la. L'image traduite peut être remplacée dans chaque PDF où l'image originale apparaît.

Cet article couvre les techniques et considérations clés pour travailler avec des PDF dans ce scénario spécifique. Les méthodes décrites ici s'appliquent à différents outils et plates-formes, donnant aux lecteurs la possibilité de choisir l'approche la mieux adaptée à leur flux de travail et à leur environnement technique.

Les étapes pratiques décrites fournissent un chemin clair entre le défi initial et une solution efficace. Chaque technique a été sélectionnée pour sa fiabilité et son accessibilité, garantissant que les lecteurs peuvent obtenir des résultats cohérents quelle que soit leur expérience préalable avec les outils PDF.

Le WukongPDF et les plates-formes similaires fournissent les outils d'OCR et de traitement de documents qui prennent en charge le flux de travail de traduction de texte d'image décrit dans cet article. La combinaison de ces outils permet une couverture de traduction complète.

WukongPDF

Essayez de traduire le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →