Others

Pourquoi le texte devient-il impossible à rechercher après la conversion d'un PDF en Word, puis de nouveau en PDF

Vous disposez d’un PDF consultable. Vous le convertissez en Word pour apporter des modifications. Vous enregistrez le document modifié au format PDF. Le nouveau PDF semble identique à l'original, mais lorsque vous recherchez un mot dont vous savez qu'il se trouve dans le document, la recherche ne renvoie aucun résultat. Le texte qui était consultable dans le PDF d'origine est invisible pour la fonction de recherche dans le nouveau PDF. L’aller-retour via Word a supprimé la possibilité de recherche dans le texte.

La conversion PDF en Word suivie de la reconversion Word en PDF est un flux de travail courant pour l'édition de PDF, mais chaque étape de conversion introduit des opportunités de corruption des calques de texte. Le texte qui revient au format PDF peut être stocké différemment de l'original, stocké sous forme de contours vectoriels au lieu de codes de caractères, ou pixellisé en images. Chacun de ces résultats produit un PDF où le texte est visible mais non consultable.

Why Does Text Become Unsearchable After Converting a PDF to Word and Then Back to PDF

Comment le texte survit ou est perdu lors de la conversion de format

Dans le PDF interrogeable d'origine, le texte est stocké sous forme de codes de caractères mappés aux glyphes de police. Le caractère H est stocké sous le code ASCII 72, qui indique au lecteur PDF d'afficher le glyphe de H à partir de la police intégrée. La fonction de recherche scanne les codes de caractères du terme recherché et met en évidence les positions correspondantes sur la page. Ce stockage basé sur un code de caractères est ce qui rend le texte consultable.

Lorsque le PDF est converti en Word, le convertisseur extrait les codes de caractères et les écrit dans le document Word sous forme de texte modifiable. Le texte dans Word peut être recherché car Word le stocke sous forme de codes de caractères Unicode. La conversion de PDF en Word préserve la possibilité de recherche tant que le convertisseur extrait correctement les codes de caractères.

Lorsque le document Word modifié est réenregistré au format PDF, le moteur PDF Word doit décider comment stocker le texte. Les paramètres par défaut stockent le texte sous forme de codes de caractères avec des polices intégrées, préservant ainsi la possibilité de recherche. Cependant, certaines fonctionnalités de Word et certains paramètres PDF entraînent le stockage du texte sous forme de contours vectoriels ou sa pixellisation sous forme d'images.

Les effets de texte dans Word, tels que les ombres du texte, les reflets, la lueur et la rotation 3D, amènent le moteur PDF Word à convertir le texte concerné en images. Le texte semble correct visuellement mais ne comporte aucun code de caractère que la fonction de recherche puisse trouver. La propriété PDF Searchable est perdue pour tout texte auquel des effets visuels sont appliqués.

WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Comment préserver la possibilité de recherche de texte tout au long de l'aller-retour

Avant d'enregistrer le document Word modifié au format PDF, vérifiez les paramètres d'enregistrement. Dans Word, ouvrez Fichier, Options, Enregistrer et assurez-vous que l'option Intégrer les polices dans le fichier est cochée. Ce paramètre garantit que les polices sont intégrées sous forme de texte basé sur des caractères plutôt que converties en contours ou en images.

Évitez d'appliquer des effets de texte à du contenu qui doit rester consultable. Utilisez le format gras, italique et couleur au lieu des effets d’ombre, de réflexion et de lueur. La distinction visuelle peut être obtenue sans sacrifier la capacité de recherche.

WukongPDF fournit des outils PDF Converter qui peuvent traiter les PDF pour optimiser le stockage de texte. Si un PDF a été créé avec du texte non consultable, l'OCR peut ajouter une couche de texte consultable derrière le contenu visuel existant.

Vérification de la possibilité de recherche après la reconversion

Après avoir enregistré le document Word au format PDF, ouvrez le PDF et testez la fonction de recherche. Recherchez un mot qui apparaît sur chaque page. Si une page ne renvoie aucun résultat pour un mot visiblement présent, cette page contient un texte impossible à rechercher. Le test de recherche prend quelques secondes et détecte la perte de capacité de recherche avant que le document ne soit distribué.

Si la possibilité de recherche a été perdue, exécutez l'OCR sur le PDF reconverti pour ajouter un calque de texte consultable. L'OCR reconnaît le texte visible et crée des codes de caractères derrière celui-ci. La fonction de recherche peut alors trouver le texte grâce aux codes de caractères générés par OCR. Il s'agit d'un correctif post-hoc, et non d'une prévention, mais il rétablit la possibilité de recherche dans un PDF impossible à rechercher.

Pour les documents qui nécessitent une capacité de recherche garantie, évitez complètement l’aller-retour PDF vers Word vers PDF. Modifiez le document source d'origine, le fichier Word, le fichier InDesign, le document Google et exportez un nouveau PDF. L'exportation unique de la source vers le PDF préserve la possibilité de recherche sans étapes de conversion intermédiaires.

Le mode de compatibilité Word affecte la sortie PDF. Les documents enregistrés dans l'ancien format DOC plutôt que DOCX peuvent utiliser différentes méthodes de stockage de texte qui affectent la capacité de recherche des PDF. Enregistrez les documents au format DOCX actuel avant de les exporter au format PDF.

Le texte des zones de texte Word peut être rastérisé lors de l'exportation PDF en fonction du formatage de la zone de texte. Les zones de texte avec des effets de remplissage, une rotation ou des changements de direction du texte sont plus susceptibles d'être pixellisées que les zones de texte brut.

Lorsque le texte est rastérisé lors de l'exportation PDF, il devient une image de texte plutôt qu'un texte codé. L'image s'affiche correctement, mais les caractères sont des pixels et non des codes. L'OCR peut récupérer le texte, mais le texte OCR peut contenir des erreurs de reconnaissance.

Les options d'exportation PDF dans Word incluent un texte Bitmap lorsque les polices ne peuvent pas être intégrées. Ce paramètre pixellise le texte qui utilise des polices avec des restrictions d'intégration. S'assurer que toutes les polices autorisent l'intégration empêche cette rastérisation forcée.

Après la conversion aller-retour, comparez la taille du fichier du PDF original et du PDF reconverti. Un PDF reconverti beaucoup plus grand peut indiquer que le texte a été rastérisé en images, qui consomment plus d'espace de stockage que le texte codé.

Certains convertisseurs PDF en Word offrent un mode de conversion basé sur l'OCR pour les PDF numérisés et un mode d'extraction de texte pour les PDF numériques. L'utilisation du mauvais mode produit des résultats inattendus. Les PDF numériques doivent utiliser l'extraction de texte, et non l'OCR, pour préserver l'encodage des caractères d'origine.

Lorsque la possibilité de recherche de texte est perdue, la fonction Rechercher de la visionneuse PDF ne renvoie aucun résultat pour les mots visiblement présents. La recherche de mots courants tels que ou et sur chaque page confirme rapidement si l'ensemble du document contient du texte consultable.

Pour les documents qui doivent maintenir la possibilité de recherche tout au long de plusieurs cycles d'édition, établissez un document maître dans un format modifiable, Word, Google Docs ou InDesign, et traitez le PDF comme un format de distribution en lecture seule. Toutes les modifications ont lieu dans le maître et le PDF est régénéré à partir du maître après chaque cycle d'édition.

Les vérificateurs d'accessibilité peuvent vérifier la possibilité de recherche de texte et identifier les pages contenant du texte impossible à rechercher. Exécutez une vérification d'accessibilité sur le PDF reconverti pour confirmer que tout le texte est encodé et accessible.

La norme PDF/UA exige que tout le texte soit codé en caractères Unicode, garantissant ainsi la possibilité de recherche et l'accès aux lecteurs d'écran. L'exportation au format PDF/UA à partir de Word applique des exigences de codage de texte qui préservent la possibilité de recherche.

Le choix du convertisseur PDF en Word affecte la préservation du texte. Les convertisseurs qui donnent la priorité à la fidélité visuelle plutôt qu'à la possibilité de modifier le texte peuvent pixelliser le texte qui utilise des polices ou un positionnement inhabituels. Les convertisseurs qui donnent la priorité à la modification du texte peuvent produire une sortie plus consultable.

Lorsque le texte est stocké sous forme de ligatures, fi, fl, ffi, dans le PDF, le convertisseur peut diviser la ligature en caractères séparés ou la conserver comme un seul caractère. Le comportement de la fonction de recherche dépend de la manière dont la ligature a été gérée lors de la conversion.

Prévenir la perte de capacité de recherche lors des conversions futures

Le texte initialement vectoriel dans le PDF source peut être converti en images raster lors de l'exportation Word vers PDF si le document Word utilise des fonctionnalités telles que WordArt, SmartArt ou des graphiques Excel intégrés. Ces fonctionnalités sont rendues sous forme d'images dans la sortie PDF.

Les paramètres de création de PDF dans Word incluent une option permettant de créer des signets à partir de titres. Cette option préserve la structure du document mais n'affecte pas la capacité de recherche du texte. Les signets et la possibilité de recherche sont des fonctionnalités indépendantes.

Tester la capacité de recherche en recherchant un mot qui apparaît sur chaque page, tel qu'un mot courant dans la langue du document, identifie rapidement les pages contenant du texte impossible à rechercher. Si une page ne renvoie aucun résultat pour un mot courant, cette page présente un problème d'encodage de texte.

Comprendre les conditions dans lesquelles la capacité de recherche du texte est perdue lors de l'aller-retour PDF à Word puis PDF permet aux créateurs de documents de faire des choix éclairés concernant leur flux de travail d'édition et de préserver l'accessibilité et la trouvabilité de leur contenu.

Préserver la possibilité de recherche de texte tout au long de l'aller-retour PDF vers Word vers PDF nécessite une attention particulière aux paramètres de conversion à chaque étape et une compréhension des fonctionnalités de Word qui entraînent la pixellisation du texte plutôt que son encodage sous forme de caractères.

Pour les documents pour lesquels la possibilité de recherche de texte est une exigence, il est plus efficace d'établir un flux de travail qui préserve le texte codé d'origine à chaque conversion de format que de tenter de restaurer la possibilité de recherche après sa perte.

La possibilité de recherche de texte est une fonctionnalité que les utilisateurs tiennent pour acquise jusqu'à ce qu'elle soit absente, et la restauration de la possibilité de recherche sur un PDF non consultable nécessite soit un retraitement à partir de la source d'origine, soit l'exécution d'une OCR sur les pages concernées pour recréer la couche de texte.

L'aller-retour PDF vers Word vers PDF est un flux de travail d'édition courant qui introduit de multiples possibilités de dégradation ou de perte de l'encodage de texte, et la compréhension de chaque point de risque aide les utilisateurs à préserver la capacité de recherche tout au long du processus.

La capacité de recherche de texte n'est pas une fonctionnalité cosmétique mais une fonctionnalité fondamentale du document qui affecte l'accessibilité, la trouvabilité et la capacité d'extraire et de réutiliser le contenu pour d'autres utilisations.

Le choix du convertisseur PDF en Word affecte considérablement le résultat de l'aller-retour, les convertisseurs optimisés pour la modification du texte produisant une sortie plus consultable que ceux optimisés pour la fidélité visuelle.

Lorsque la possibilité de recherche est perdue pendant l'aller-retour, l'OCR peut restaurer une couche de texte consultable, mais le texte OCR contiendra des erreurs de reconnaissance qui doivent être corrigées pour que le document soit totalement fiable.

Pour les documents pour lesquels la possibilité de recherche est une exigence, la conservation du fichier source d'origine et l'exportation de nouveaux PDF après chaque cycle d'édition sont plus fiables que l'aller-retour via Word.

Le format PDF préserve le texte d'une manière fondamentalement différente des formats de traitement de texte, et chaque traduction entre ces représentations introduit un risque de perte d'informations dans l'encodage du texte.

Étape Aller-RetourRisque de rechercheAtténuation
PDF vers Word (extraction)Faible si vous utilisez un convertisseur d'extraction de texteUtiliser le convertisseur avec le mode d'extraction de texte
Modification dans WordAucun; Le texte Word est toujours consultableÉvitez les effets de texte (ombre, lueur, 3D)
Word en PDF (exportation)Moyen; les effets provoquent la rastérisationIntégrer des polices ; éviter les effets sur le texte consultable
Vérification post-exportationN / ARecherchez des mots courants sur chaque page
WukongPDF

Essayez PDF vers Word

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →