
Pourquoi un PDF qui ressemble à du texte peut ne pas être modifiable
Vous ouvrez un PDF, voyez des mots à l'écran et supposez que vous pouvez les modifier. Lorsque vous cliquez sur le texte et que rien ne se passe, ou lorsque vous essayez de taper et que le curseur n'apparaît pas, vous découvrez que le PDF qui ressemble à un document texte n'est en réalité pas du tout un document modifiable. Cette expérience est frustrante et courante car les PDF peuvent contenir du texte sous des formes fondamentalement différentes, dont certaines seulement sont modifiables.
L'exécution de l'OCR sur un PDF numérisé ajoute une couche de texte consultable et modifiable derrière chaque image de page du document.
La conversion du PDF vers un format modifiable et inversement constitue une solution de secours fiable lorsque l'édition directe n'est pas possible.
Un éditeur PDF peut modifier le texte qui existe en tant qu'objets texte réels dans le PDF, chaque caractère étant représenté sous la forme d'un code de caractère sélectionnable et modifiable. C’est ce qu’on appelle le texte natif ou en direct. Un Format PDF peut également contenir du texte qui existe uniquement sous forme d'image, comme un document numérisé où le texte fait partie de la photographie de la page. Le texte basé sur une image ne peut pas être sélectionné, recherché ou modifié car le PDF ne contient aucune donnée de caractère, uniquement des pixels qui forment la forme des lettres. Avant de savoir si un PDF est modifiable, vous devez savoir quel type de texte il contient.
Le test le plus rapide consiste à essayer de sélectionner du texte dans le PDF. Cliquez et faites glisser sur un mot. Si le texte est mis en surbrillance lorsque vous faites glisser, il s'agit d'un texte natif et peut potentiellement être modifié. Si rien n'est mis en surbrillance et que le curseur ne change pas, le texte est basé sur une image et ne peut pas être directement modifié. Si le texte est mis en évidence mais que la mise en évidence est inégale, en sélectionnant certains mots mais en en sautant d'autres, le PDF contient un mélange de texte natif et de texte qui n'existe que sous forme d'éléments visuels, une situation courante dans les PDF créés par des logiciels plus anciens ou en combinant plusieurs documents sources.
Essayez de modifier le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Raisons courantes pour lesquelles votre texte PDF ne peut pas être modifié
La raison la plus courante est que le PDF est un document numérisé. Un PDF créé en numérisant des pages papier avec un scanner à plat ou une application d'appareil photo pour téléphone contient des images de texte, et non des caractères de texte réels. Même si vous pouvez lire les mots à l'écran, le fichier PDF ne contient aucune donnée textuelle modifiable. Pour rendre un PDF numérisé modifiable, vous devez d'abord exécuter l'OCR pour reconnaître le texte dans les images et créer un calque de texte invisible derrière chaque image de page. Après l'OCR, le texte devient consultable et, dans de nombreux éditeurs PDF, modifiable comme s'il s'agissait d'un texte natif.
Les restrictions de mot de passe ou d'autorisation sont un autre obstacle courant à l'édition. Un PDF protégé par un mot de passe d'autorisations peut être ouvert et visualisé, mais les autorisations peuvent bloquer la modification, la copie ou l'impression. Si vous pouvez ouvrir le PDF et voir le texte mais que les outils d'édition sont grisés ou génèrent un message d'erreur, vérifiez les paramètres de sécurité du document. Dans la plupart des visionneuses PDF, le panneau Propriétés du document ou Sécurité indique les autorisations restreintes. Si la modification est restreinte et que vous disposez du mot de passe d'autorisation, vous pouvez supprimer les restrictions et activer la modification.
Le PDF peut contenir du texte qui a été converti en contours ou en courbes lors de la création. Les graphistes convertissent parfois le texte en contours dans des applications telles qu'Adobe Illustrator avant de créer un PDF pour garantir que les polices s'affichent correctement, que le destinataire les ait installées ou non. Le texte converti en contours semble visuellement identique au texte natif, mais se compose de formes vectorielles plutôt que de données de caractères. L'outil No Edit PDF] peut modifier le texte avec contour sous forme de texte car les informations sur les caractères ont été supprimées lors de la conversion en contours.
Les problèmes d'encodage des polices peuvent rendre le texte non modifiable même lorsque le PDF contient des caractères de texte natifs. Certains fichiers PDF utilisent des encodages de polices personnalisés qui mappent les codes de caractères aux glyphes de manière non standard. L'outil d'édition voit les codes de caractères mais ne peut pas déterminer quels caractères ils représentent, il refuse donc de les modifier pour éviter de corrompre le texte. Ce problème est plus courant dans les PDF générés par des logiciels spécialisés, des systèmes existants ou des documents utilisant des scripts non latins avec une gestion des polices personnalisée. La réexportation du PDF à partir de l'application d'origine avec l'intégration des polices activée résout souvent le problème d'encodage.
Comment rendre un PDF numérisé modifiable à l'aide de l'OCR
La reconnaissance optique des caractères est le processus qui convertit les images d'un texte en texte modifiable. La technologie OCR moderne est très précise pour des numérisations nettes et bien éclairées de texte imprimé dans des polices courantes et des tailles typiques. L'exécution de l'OCR sur un PDF numérisé ajoute une couche de texte cachée derrière chaque image de page contenant les caractères reconnus. Une fois l'OCR terminée, vous pouvez rechercher du texte dans le document et, dans la plupart des éditeurs PDF, modifier le texte reconnu comme s'il était initialement natif.
La qualité de la sortie OCR dépend de la qualité des images numérisées. Une numérisation haute résolution à 300 DPI avec un éclairage uniforme, des pages plates et une mise au point nette produit une précision OCR supérieure à 99 % pour le texte imprimé standard. Une numérisation basse résolution à 150 DPI avec des ombres, des pages incurvées d'un livre relié ou des zones floues produit une précision moindre et nécessite davantage de corrections manuelles après l'OCR. La numérisation de documents avec l'OCR à l'esprit, c'est-à-dire des pages plates, un bon éclairage et une résolution adéquate, rend le processus d'édition considérablement plus fluide.
La plupart des éditeurs PDF prenant en charge l'OCR incluent la sélection de la langue dans les paramètres de reconnaissance. La sélection de la bonne langue améliore la précision car le moteur OCR utilise des dictionnaires spécifiques à la langue et des données de fréquence de caractères pour résoudre les caractères ambigus. Un document en français reconnu avec le paramètre de langue française produit de meilleurs résultats que le même document reconnu avec le paramètre de langue anglaise. Pour les documents multilingues, sélectionnez la langue principale et corrigez manuellement les erreurs dans les passages de la langue secondaire.
L'outil PDF OCR de WukongPDF traite les documents numérisés dans le navigateur et renvoie un PDF avec une couche de texte consultable et modifiable. Le moteur OCR prend en charge plusieurs langues et gère les types de documents courants, notamment les lettres, les formulaires, les reçus et les articles. Après l'OCR, le PDF numérisé auparavant non modifiable devient modifiable, avec le texte reconnu disponible pour la sélection, la recherche et la modification.
Approches alternatives lorsque l'édition directe de PDF n'est pas possible
Lorsqu'un PDF ne peut pas être rendu directement modifiable, soit parce qu'il s'agit d'un document numérisé sans accès à l'OCR, soit parce qu'il comporte des restrictions de sécurité que vous ne pouvez pas supprimer, des flux de travail alternatifs vous permettent d'obtenir le même résultat par un chemin différent. Convertissez le PDF dans un format modifiable comme Word ou Google Docs, apportez vos modifications dans ce format et reconvertissez le document modifié au format PDF. L'aller-retour dans un format modifiable prend plus de temps que l'édition directe, mais fonctionne pour n'importe quel PDF pouvant être ouvert et visualisé.
Pour les documents qui ne nécessitent que des corrections mineures, comme la correction d'une faute de frappe dans un seul paragraphe, utiliser les outils d'annotation du PDF pour couvrir le texte incorrect avec un rectangle blanc et taper le texte corrigé par-dessus constitue une solution de contournement pragmatique. Cette méthode ne modifie pas véritablement le texte sous-jacent et la structure du document, de sorte que la correction basée sur les annotations est invisible pour les outils de recherche et d'accessibilité, mais pour des corrections visuelles rapides sur un document qui sera imprimé ou visualisé sous forme d'image, elle produit des résultats acceptables.
Pour les documents qui nécessitent une édition approfondie et ne peuvent pas être édités directement, l'approche la plus fiable consiste à revenir au document source original s'il est disponible.
Le document Word, Google Doc ou InDesign utilisé pour créer le PDF contient du texte modifiable qui peut être modifié et réexporté vers un nouveau PDF. Il est souvent plus rapide de contacter le créateur du document pour obtenir le fichier source ou de localiser le fichier source dans vos propres dossiers que de lutter pour modifier un PDF peu coopératif.
Certains PDF qui semblent contenir du texte natif ont en fait le texte stocké d'une manière que les outils d'édition ne peuvent pas modifier, même si le texte peut être recherché et sélectionné. Cette situation se produit lorsqu'un PDF possède un calque de texte correct, qui permet la recherche et la sélection, mais que l'encodage de police sous-jacent empêche l'outil d'édition de mapper les caractères modifiés aux glyphes visuels corrects. L'outil d'édition peut lire le texte mais ne peut pas réécrire les modifications dans le document sans potentiellement corrompre le mappage des caractères. Cette défense contre l'édition est parfois intentionnelle de la part du créateur du document.
La prolifération des outils d'édition de PDF a rendu l'édition de PDF plus facile que jamais, mais elle a également créé une confusion sur ce qui constitue l'édition. Ajouter une annotation de texte en haut d'une page PDF n'est pas la même chose que modifier le texte sous-jacent. Remplacer une image sur une page PDF n'est pas la même chose que modifier le texte qui décrit l'image. Comprendre la différence entre les modifications basées sur des annotations, qui superposent le nouveau contenu au-dessus de la page existante, et la véritable édition de texte, qui modifie le contenu réel du texte dans la structure PDF, vous aide à choisir le bon outil et la bonne approche pour chaque tâche d'édition.
Pour les documents qui résistent à toutes les tentatives d’édition et contiennent des informations dont la mise à jour est essentielle, l’option nucléaire consiste à recréer le document à partir de zéro. Utilisez le PDF comme référence visuelle et retapez le contenu dans un traitement de texte ou une application de conception, en apportant vos modifications pendant le processus de recréation. Cette approche demande beaucoup de main-d'œuvre, mais produit un document propre et entièrement modifiable, sans problèmes de formatage résiduels, problèmes de police ou artefacts de conversion. Recréer un document à partir d'un PDF prend du temps proportionnel à la longueur et à la complexité du document, et pour les documents courts nécessitant une édition importante, cela peut en fait être plus rapide que de lutter avec des outils d'édition PDF peu coopératifs.
Essayez de modifier le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
