Vous disposez d'un contrat de 60 pages et avant de le partager avec l'autre partie, vous devez supprimer chaque instance du nom de votre client, son adresse, ses numéros de compte et toute autre information confidentielle. Le nom apparaît 47 fois sur 30 pages différentes. Trouver et supprimer manuellement chaque occurrence prendrait une heure et vous en manqueriez presque certainement quelques-unes. Une fonction de recherche et de rédaction effectue le travail en quelques secondes, trouvant chaque correspondance et les supprimant toutes en une seule opération.
La rédaction basée sur la recherche est le moyen le plus efficace de nettoyer un document lorsque vous savez exactement quels mots, expressions ou modèles doivent être supprimés. Il combine la recherche de texte avec la suppression permanente du contenu et, lorsqu'il est effectué correctement, il garantit qu'aucune instance du texte cible ne survit dans le document.

En quoi la rédaction d'un PDF diffère du dessin d'une boîte noire sur du texte
Une erreur courante et dangereuse consiste à confondre rédaction et dessin. Certaines personnes ouvrent un PDF, dessinent un rectangle noir sur du texte sensible et supposent que le texte est masqué. Ce n'est pas. Le rectangle noir est une annotation superposée en haut de la page. Le texte original est toujours dans le fichier situé en dessous. Toute personne qui ouvre le PDF dans une visionneuse capable de masquer les annotations, ou qui copie et colle le texte de la page, peut récupérer les informations prétendument expurgées. Cette erreur a conduit à des violations de données réelles où des dossiers judiciaires, des documents gouvernementaux et des divulgations d'entreprises ont exposé par inadvertance des informations expurgées parce que l'auteur a utilisé un outil de dessin au lieu d'un outil d'expurgation.
True Rédaction PDF supprime définitivement les données texte et image du fichier. Lorsque vous appliquez la rédaction, l'outil supprime le contenu sous-jacent des flux de données du PDF et place une superposition opaque à sa place. Les informations originales ont disparu. Il ne peut pas être récupéré en masquant les annotations, en copiant du texte ou en inspectant la structure interne du fichier. Pour tout document où la vie privée ou la confidentialité est en jeu, une véritable rédaction est la seule méthode acceptable.
Essayez de rédiger un PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Pas à pas : rechercher et rédiger chaque occurrence d'un mot
Ouvrez le PDF dans un outil prenant en charge la rédaction basée sur la recherche. Un outil de rédaction comprend une fonction de recherche et de rédaction. Tapez le mot ou la phrase que vous souhaitez rechercher. L'outil recherche dans l'intégralité du document et répertorie chaque occurrence, avec le numéro de page, le contexte environnant et un aperçu de la correspondance. Consultez la liste pour confirmer que vous souhaitez expurger toutes les instances. Parfois, un mot apparaît à la fois comme une information sensible et comme un terme générique. Si le nom de famille du client est "Rice" et que le document traite également du riz, vous devez examiner chaque correspondance individuellement plutôt que de les expurger toutes aveuglément.
Après avoir examiné les correspondances, sélectionnez celles que vous souhaitez expurger. Vous pouvez choisir des correspondances individuelles, toutes les correspondances sur une page spécifique ou toutes les correspondances dans le document. Appliquez la rédaction. L'outil supprime définitivement le texte sélectionné et place une boîte noire ou la marque de rédaction de votre choix sur chaque emplacement. Enregistrez le fichier expurgé sous un nouveau nom. Le fichier original non expurgé doit être stocké en toute sécurité et séparément de la version expurgée. La rédaction est irréversible, c’est là le point. Vous ne pouvez pas envoyer accidentellement la version non expurgée si vous ne disposez que de la version expurgée.
Modèles de rédaction : adresses e-mail, numéros de téléphone et numéros d'identification
Au-delà des mots exacts, de nombreux scénarios de rédaction impliquent des modèles. Chaque adresse e-mail dans un document doit être supprimée. Chaque numéro de sécurité sociale au format 123-45-6789 doit être supprimé. Chaque numéro de carte de crédit au format à 16 chiffres doit être supprimé. Les outils de rédaction avancés prennent en charge les expressions régulières, ou regex, qui définissent des modèles plutôt que du texte exact. Une expression régulière comme \b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b correspond aux adresses e-mail. Une expression régulière telle que \b\d{3}-\d{2}-\d{4}\b correspond aux numéros de sécurité sociale.
La rédaction basée sur des modèles est puissante mais nécessite de la prudence. Une expression régulière trop large correspondra au texte que vous n’aviez pas l’intention de rédiger. Une expression régulière trop étroite manquera des instances qui ne correspondent pas exactement au modèle. Après avoir exécuté une rédaction basée sur un modèle, examinez manuellement chaque correspondance avant de postuler. L'expression régulière trouve des candidats. Le jugement humain décide quels candidats contiennent réellement des informations sensibles. L'éditeur PDF de WukongPDF prend en charge à la fois la recherche de correspondance exacte et la recherche de rédaction basée sur des modèles, avec une interface d'examen des correspondances qui affiche chaque correspondance dans son contexte avant de valider la rédaction.
Vérifier que la rédaction était complète
Après rédaction, vérifiez les résultats avec deux tests. Tout d’abord, numérisez visuellement le document. Les zones expurgées doivent être clairement marquées avec la superposition, la case noire, la case blanche ou le texte personnalisé de votre choix comme [SUPPRIMÉ]. Aucun texte sensible ne doit être visible. Deuxièmement, essayez d'extraire le texte. Dans n'importe quelle visionneuse PDF, appuyez sur Ctrl-A pour sélectionner tout le texte d'une page, puis copiez-le et collez-le dans un éditeur de texte. Le texte collé ne doit contenir aucune information expurgée. Si du texte rédigé apparaît dans la sortie collée, cela signifie que la rédaction n'a pas été correctement appliquée, que la superposition a été placée sous forme d'annotation plutôt que de suppression permanente du contenu et que le document n'est pas sécurisé.
Troisièmement, recherchez dans le PDF expurgé les termes expurgés. Appuyez sur Ctrl-F et recherchez le mot ou la phrase sensible. La recherche ne devrait renvoyer aucun résultat. S'il trouve des correspondances, la rédaction les a manquées, ce qui peut se produire si le texte a été stocké sous forme d'image plutôt que sous forme de texte sélectionnable, ou si le texte apparaît dans un champ de métadonnées de document plutôt que dans le contenu de la page. Pour le texte basé sur une image, exécutez l'OCR sur le fichier rédigé et recherchez la sortie OCR. Si l'OCR reconnaît le texte supposément expurgé, l'image n'a pas été expurgée, seul le calque de texte l'a été, et vous devez également expurger le calque d'image. L'outil de rédaction PDF Privacy de WukongPDF rédige simultanément le calque de texte et le calque d'image, comblant ainsi cet écart commun.
Caviardage de documents numérisés et de PDF contenant uniquement des images
Les PDF numérisés présentent un défi de rédaction unique, car le texte fait partie d'une image et non d'un calque de texte distinct. La rédaction basée sur la recherche ne parvient pas à trouver des mots dans les images. Il n'y a pas de texte à rechercher. Pour rédiger un document numérisé, vous devez d'abord exécuter l'OCR pour créer un calque de texte consultable, puis rechercher ce calque de texte pour trouver et marquer les zones de rédaction, puis appliquer la rédaction à l'image sous-jacente. La couche de texte identifie l'emplacement des informations sensibles sur la page. L’outil de rédaction supprime ensuite définitivement ces régions de pixels de l’image.
Après avoir rédigé un document numérisé, exécutez à nouveau l'OCR sur la version expurgée et vérifiez que le texte nouvellement reconnu ne contient pas les informations expurgées. Cette double vérification OCR détecte le mode d'échec le plus courant de la rédaction d'un document numérisé : le moteur OCR a trouvé le texte, vous l'avez marqué pour rédaction, mais le rectangle de rédaction était légèrement mal aligné et ne couvrait pas entièrement les pixels du texte, laissant des fragments de caractères visibles. Quelques pixels d’une lettre suffisent à une personne déterminée pour reconstituer le mot original. Zoomez à 200 % sur les zones expurgées et confirmez la couverture complète au niveau des pixels.
Au-delà des mots et des modèles, une rédaction approfondie doit également vérifier les métadonnées du document. Un PDF parfaitement rédigé sur chaque page peut toujours divulguer des informations sensibles via ses propriétés de document : le champ auteur peut contenir le nom de la personne dont les informations ont été rédigées, le titre peut contenir un nom de projet confidentiel et le champ Mots-clés peut répertorier des termes qui auraient dû être supprimés. Après avoir rédigé le contenu de la page, ouvrez les propriétés du document et effacez les champs Auteur, Sujet, Titre et Mots-clés. Si le PDF contient des pièces jointes intégrées, ce qui arrive parfois avec des rapports incluant des feuilles de calcul ou des fichiers de données, ces pièces jointes doivent être rédigées ou supprimées séparément. Ils ne sont pas affectés par la rédaction au niveau de la page. Une liste de contrôle de rédaction complète couvre trois couches : le contenu de la page, les champs de métadonnées et les fichiers intégrés. L'absence de l'une de ces couches peut annuler la protection appliquée aux deux autres.
Essayez de rédiger un PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
