Vous rédigez un numéro de sécurité sociale à partir d'un PDF à l'aide de l'outil de rédaction de votre éditeur PDF. Vous voyez la boîte noire apparaître, enregistrez le fichier et envoyez-le. Le destinataire convertit le PDF en Word pour le modifier et trouve le numéro de sécurité sociale entièrement visible dans le document converti, comme si la rédaction n'avait jamais eu lieu. Ce n'est pas un bug. C’est le comportement attendu de la plupart des outils de rédaction lorsque le document subit une conversion de format, et cela a provoqué de véritables violations de données.
En 2024, le bureau du commissaire à l'information du Royaume-Uni a signalé que la rédaction incorrecte de PDF était la troisième cause la plus fréquente de violations de données impliquant des documents gouvernementaux (ICO, « Data Security Incident Trends », 2024). La cause première la plus fréquente n'était pas un échec de rédaction, mais un échec de vérification que la rédaction avait survécu tout au long du cycle de vie du document, y compris les conversions de format qu'il pourrait subir en aval.

Comment fonctionne une rédaction PDF appropriée au niveau des données
Une bonne Rédaction PDF est fondamentalement différente du dessin d'une boîte noire sur du texte. Lorsque vous utilisez un véritable outil de rédaction, deux choses se produisent : le texte visible est recouvert d'un rectangle noir et le contenu du texte sous-jacent est supprimé du calque de texte du PDF. Les caractères eux-mêmes sont supprimés du flux de données du fichier. Une application de lecture n’a rien à afficher sous la boîte noire car il n’y a rien là-bas.
Lorsque vous dessinez un rectangle noir sur du texte à l'aide d'outils d'annotation et que vous l'appelez expurgé, vous avez effectué ce que les professionnels de la sécurité appellent une expurgation cosmétique. Le texte est toujours là dans la couche de données du PDF, entièrement intact et extractible. N'importe qui peut sélectionner le texte, le copier, le coller ailleurs et lire chaque mot sous la case noire. Convertissez le PDF dans n'importe quel autre format et l'outil de conversion lit le texte sous-jacent, pas la superposition visuelle. La rédaction disparaît parce qu’elle n’a jamais été réelle en premier lieu.
La distinction entre rédaction réelle et cosmétique est si cruciale que les agences gouvernementales et les cabinets d'avocats l'incluent désormais dans la formation obligatoire du personnel qui manipule des documents sensibles. Un seul dossier judiciaire, une réponse FOIA ou une soumission réglementaire mal rédigée peut exposer des données personnelles à grande échelle, et les conséquences en matière de réputation et juridiques dépassent de loin les quelques secondes supplémentaires nécessaires pour utiliser les outils de rédaction appropriés.
Un scénario particulièrement dangereux survient lorsqu’un document passe entre plusieurs mains. La personne A applique la rédaction appropriée, la personne B ouvre le fichier et voit des boîtes noires, suppose que la rédaction est terminée et le transmet. Mais si la personne A a utilisé un outil de rédaction cosmétique sans s'en rendre compte, la confiance de la personne B dans les boîtes noires est déplacée. Ce problème de chaîne de confiance est la raison pour laquelle les organisations devraient standardiser un outil de rédaction unique et vérifié et former tout le personnel à l'utiliser correctement.
Une variante particulièrement insidieuse de la rédaction cosmétique est la rédaction en boîte blanche. Certains utilisateurs dessinent un rectangle blanc sur le texte, en supposant que le blanc sur blanc rend le texte invisible. Cela échoue car la sélection de texte ou la conversion du document révèle le texte en dessous et le logiciel de lecteur d'écran le lit à haute voix, quelle que soit la couleur visuelle. La rédaction en boîte blanche n’est pas une rédaction du tout.
Essayez de rédiger un PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Qu'arrive-t-il à la rédaction lors de la conversion de format
La conversion de format crée un nouveau document en lisant le PDF source et en écrivant son contenu dans un format différent. L'outil de conversion analyse la structure PDF et extrait le texte, les images et les informations de mise en page. Pour la conversion PDF Format, la question cruciale est de savoir quel contenu textuel l'outil de conversion trouve dans les zones rédigées.
Si la rédaction était authentique et que le texte a été supprimé du flux de contenu du PDF, l'outil de conversion ne trouve rien dans ces zones et n'écrit rien. Le document de sortie ne contient aucun texte là où se trouvaient les expurgations. Si la rédaction était cosmétique, une boîte noire superposée avec le texte toujours présent en dessous, l'outil de conversion trouve le texte et l'écrit consciencieusement dans le document de sortie. La boîte noire est un élément visuel, pas un élément de données, et la plupart des outils de conversion ignorent les superpositions visuelles lors de l'extraction du contenu textuel.
Le WukongPDF fournit un outil de rédaction qui supprime le contenu au niveau des données, pas seulement au niveau visuel. Lorsque vous appliquez la rédaction via un outil PDF Security correctement implémenté qui fonctionne sur le flux de texte du document, les informations supprimées ne peuvent pas réapparaître via la conversion de format car les données n'existent tout simplement plus dans le fichier.
Certains convertisseurs PDF en Word tentent spécifiquement de conserver les annotations, notamment les zones de commentaires, les surlignages et les formes dessinées. Si une rédaction cosmétique a été appliquée sous forme d'annotation, le convertisseur peut reproduire fidèlement le rectangle noir sous forme de forme Word. Mais comme le texte sous-jacent n'a jamais été supprimé, le document Word affichera à la fois le rectangle noir et le texte situé en dessous, qui peut être sélectionné, copiable et entièrement visible par toute personne qui déplace ou supprime le rectangle.
La conversion de format n’est pas la seule voie par laquelle du contenu expurgé peut fuir. Il suffit de sélectionner tout le texte d'un PDF avec des expurgations cosmétiques et de le coller dans un éditeur de texte pour révéler le contenu expurgé. La recherche dans le PDF d'un terme expurgé à l'aide de la fonction Rechercher le localisera même s'il est visuellement masqué. Les lecteurs d'écran et les outils d'accessibilité lisent la couche de texte sous-jacente. Ces chemins d’extraction alternatifs contournent tous la superposition visuelle sur laquelle repose la rédaction cosmétique.
Rédaction basée sur l'OCR et problème de réapparition du texte
Les PDF numérisés ajoutent une autre couche de complexité à la rédaction. Un document numérisé est essentiellement une photographie d’un morceau de papier. Le texte n'est pas stocké sous forme de caractères mais sous forme de pixels dans une image. Les outils de rédaction standard qui fonctionnent sur les calques de texte ne peuvent pas supprimer le texte d'une image, ils dessinent donc des zones noires sur l'image. Il s’agit d’une rédaction cosmétique par nécessité et non par choix.
Pour rédiger correctement un PDF numérisé, vous avez besoin d'un outil qui modifie les données d'image réelles, en remplaçant les valeurs de pixels dans la zone rédigée par du noir uni. Une fois l'image modifiée, vous exécutez ensuite l'OCR sur le document pour créer un calque de texte pour le contenu non expurgé uniquement. Si vous effectuez une OCR avant de rédiger, le texte OCR du contenu rédigé se trouve dans la couche de texte et sera extrait par n'importe quel outil de conversion de format.
Une erreur courante lors de la rédaction d'un PDF numérisé consiste à utiliser d'abord l'OCR pour rendre le document consultable, puis à appliquer des marques de rédaction, puis à le réenregistrer. Cette séquence laisse intacte la couche de texte générée par OCR sous les marques de rédaction. Toute conversion ou extraction de texte ultérieure récupérera le texte rédigé de la couche OCR. La séquence correcte est la suivante : rédigez d'abord les pixels de l'image, puis OCR l'image nettoyée. Cet ordre garantit que la couche de texte ne contient jamais le contenu rédigé.
Comment vérifier que la rédaction survit à la conversion
La seule façon d’être certain que votre rédaction est permanente est de la tester. Après avoir rédigé un PDF, convertissez-le en fichier texte brut et recherchez le contenu rédigé. Si le fichier texte contient les données expurgées, votre expurgation n'a pas été efficace. Une vérification plus rapide consiste à sélectionner tout le texte du PDF après rédaction et à le coller dans un éditeur de texte. Si le tampon de collage contient du texte expurgé, la rédaction était cosmétique.
Pour les PDF numérisés, convertissez une page dans un format d'image tel que PNG et inspectez visuellement les zones expurgées avec un zoom élevé. Si vous pouvez voir une quelconque trace du contenu original à travers la superposition noire, notamment sur les écrans à haute luminosité ou lors de l'impression, la rédaction est insuffisante. Un seul pixel de contenu visible peut parfois suffire à reconstituer l’information originale.
Créez une liste de contrôle de vérification qui comprend chacune de ces étapes et exigez-la dans le cadre de votre processus de publication de documents. Les quelques minutes nécessaires pour vérifier la suppression sont négligeables par rapport aux heures, jours ou mois de correction qui suivent une violation de données causée par un échec de suppression. Cette étape n'est pas facultative pour toute organisation qui gère des données personnelles ou des informations confidentielles.
Rédaction des métadonnées : la couche souvent négligée
Même lorsque le texte visible est correctement rédigé, un PDF peut toujours divulguer des informations sensibles via ses métadonnées. Les métadonnées PDF incluent le titre du document, le nom de l'auteur, la date de création, l'historique des modifications et parfois les noms des personnes qui ont révisé ou signé le document. Les outils de conversion de format préservent généralement les métadonnées lorsque cela est possible, de sorte que les métadonnées rédigées survivent à la conversion aussi sûrement que le contenu prévu du document.
Une étude réalisée en 2025 par l'Institut SANS a analysé 500 PDF expurgés accessibles au public sur des sites Web gouvernementaux et a révélé que 12 % contenaient des informations sensibles dans des champs de métadonnées qui n'avaient pas été nettoyés (Institut SANS, « Données cachées dans les documents publics », 2025). Dans plusieurs cas, les informations expurgées dans le corps du document ont pu être croisées et confirmées à l’aide de métadonnées non expurgées. Le nettoyage des métadonnées avant leur publication est aussi important que la rédaction du contenu visible.
Le même processus de vérification doit être appliqué à tout document soumis à une conversion, quelle que soit la manière dont la conversion est effectuée. Si votre flux de travail comprend une étape de conversion automatisée, intégrez une vérification de vérification de rédaction à cette automatisation plutôt que de vous fier à des vérifications ponctuelles manuelles. Un script qui recherche dans la sortie convertie les termes expurgés connus peut détecter les échecs que la révision manuelle pourrait manquer.
L'intégration de la vérification de la rédaction dans votre liste de contrôle standard d'examen des documents garantit que cette étape de sécurité critique n'est jamais ignorée.
Essayez de rédiger un PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
