Others

Pouvez-vous rédiger automatiquement un modèle comme des numéros de téléphone ou des adresses e-mail sur l'ensemble d'un PDF

Un document de découverte juridique de 300 pages contient des numéros de téléphone, des adresses e-mail et des numéros de sécurité sociale dispersés sur ses pages. Trouver et expurger manuellement chacun d’entre eux prendrait des jours et risquerait quand même d’en manquer. La rédaction automatique basée sur des modèles recherche dans l'ensemble du document le texte qui correspond à des formats spécifiques, des numéros de téléphone, des adresses e-mail, des numéros de carte de crédit, et applique une rédaction à chaque correspondance en une seule opération. La question n’est pas de savoir si cela est possible, mais plutôt de savoir dans quelle mesure cela est précis et quelle surveillance cela nécessite.

Rédaction PDF basée sur des modèles utilise des expressions régulières pour identifier le texte qui correspond à des modèles prédéfinis ou personnalisés. Un modèle de numéro de téléphone correspond à des séquences telles que (555) 123-4567 ou 555-123-4567. Un modèle d'e-mail correspond à des séquences telles que nom@domaine.com. Un modèle de numéro de sécurité sociale correspond à ###-##-####. L'outil analyse le calque de texte PDF, trouve chaque correspondance et les rédige simultanément.

Can You Redact a Pattern Like Phone Numbers or Email Addresses Automatically Across an Entire PDF

Comment fonctionne la rédaction basée sur des modèles

L'outil de rédaction extrait d'abord le texte du flux de contenu PDF et recherche les modèles spécifiés. Lorsqu'une correspondance est trouvée, l'outil enregistre le numéro de page et les coordonnées du texte correspondant sur cette page. Une fois la recherche terminée sur toutes les pages, l'outil applique des marques de rédaction à chaque emplacement enregistré, couvrant le texte et le supprimant du calque de texte.

La précision de la rédaction basée sur un motif dépend de deux facteurs : la précision du motif et la qualité du calque de texte PDF. Un modèle précis capture le texte souhaité tout en évitant les fausses correspondances. Un modèle de numéro de téléphone doit faire la distinction entre les numéros de téléphone réels et d'autres séquences de chiffres qui ont la même longueur, telles que les numéros de facture, les plages de dates ou les numéros de pièce.

La correspondance de modèles permet de trouver ce que les yeux humains mettraient des heures à localiser.

La qualité du calque de texte détermine si le motif peut trouver le texte. Si le PDF a été créé à partir d'un document numérisé avec OCR, l'OCR peut avoir mal reconnu certains caractères. Un numéro de téléphone dont le chiffre « 5 » a été reconnu à tort comme « S » ne correspondra pas au modèle de numéro de téléphone. L’outil de rédaction ne peut pas rédiger ce qu’il ne trouve pas, et les erreurs OCR créent des lacunes dans la détection des modèles.

WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Modèles courants et leurs pièges

Les numéros de sécurité sociale sont le modèle le plus couramment expurgé et le plus susceptible de produire de fausses correspondances. Une séquence de neuf chiffres avec des traits d'union aux bons endroits peut être un numéro de sécurité sociale, mais il peut également s'agir d'un code de produit, d'un identifiant de document ou d'une plage de dates écrite dans un format inhabituel. La rédaction basée sur des modèles ne comprend pas le contexte. Cela correspond au modèle, pas au sens.

Les adresses e-mail sont plus faciles à faire correspondre avec précision car le symbole @ est distinctif et apparaît rarement en dehors des adresses e-mail. Cependant, les adresses e-mail intégrées dans les PDF sous forme de liens mailto plutôt que de texte visible peuvent ne pas correspondre à une recherche de modèle basée sur du texte. L'outil de rédaction recherche le calque de texte visible, et non les annotations de lien sous-jacentes.

Les numéros de carte de crédit suivent un format spécifique, 16 chiffres, parfois regroupés par quatre, qui réussit la vérification de l'algorithme de Luhn. Les outils de rédaction basés sur des modèles qui incluent la validation Luhn réduisent considérablement les fausses correspondances, car les séquences aléatoires à 16 chiffres réussissent rarement le contrôle. Si votre outil de rédaction n'inclut pas la validation Luhn, examinez manuellement les correspondances de cartes de crédit avant d'appliquer la rédaction.

Les modèles personnalisés vous permettent de rédiger des informations spécifiques à l'organisation. Un format d'ID d'employé, un modèle de numéro de compte client ou un code de projet interne peuvent être définis en tant qu'expression régulière personnalisée. L'avantage PDF Security des modèles personnalisés est qu'ils ciblent les informations qui manqueraient aux modèles génériques, ce qui rend la rédaction plus complète.

Vérification des correspondances de modèles avant d'appliquer la rédaction

N’appliquez jamais de rédaction basée sur des modèles sans d’abord examiner les correspondances. L'étape de révision vous permet de désélectionner les fausses correspondances et d'ajouter manuellement les correspondances manquées. Un modèle qui produit 500 correspondances peut avoir 480 correspondances correctes et 20 fausses correspondances. Les 20 fausses correspondances, si elles étaient appliquées, supprimeraient incorrectement le texte qui devrait rester visible. L’étape de révision empêche cela.

La plupart des outils de rédaction affichent les correspondances sous forme de texte en surbrillance dans un panneau de révision. Faites défiler la liste des correspondances et vérifiez chacune d’elles par rapport à son contexte sur la page. Désélectionnez les correspondances qui ne sont clairement pas la cible prévue. Cet examen manuel est plus rapide que la recherche manuelle de chaque instance car l'outil a effectué la recherche, mais il reste essentiel pour l'exactitude.

Après avoir appliqué la rédaction et enregistré le document, vérifiez la rédaction en convertissant le PDF en texte brut et en recherchant les modèles rédigés dans la sortie texte. Si l’un des modèles apparaît dans le fichier texte, la rédaction n’est pas terminée. Cette vérification après rédaction détecte les correspondances de modèles qui se trouvaient dans la couche de texte mais qui n'ont pas été rédigées avec succès.

Limites de la rédaction basée sur des modèles

La rédaction basée sur des modèles ne fonctionne que sur les PDF basés sur du texte où le texte est stocké sous forme de caractères. Les PDF numérisés qui n'ont pas été traités par OCR stockent le texte sous forme d'images et ne contiennent aucune donnée de caractères que le modèle de recherche puisse rechercher. Exécutez l'OCR sur les PDF numérisés avant de tenter une rédaction basée sur un modèle, en sachant que les erreurs d'OCR entraîneront l'omission de certaines correspondances de modèles.

Le texte stocké sous forme de contours vectoriels plutôt que de codes de caractères, tel que le texte converti en chemins dans un logiciel de conception, est invisible pour la rédaction basée sur des motifs. Le texte ressemble au texte sur la page, mais le PDF contient des instructions de dessin pour chaque forme de caractère, pas les codes de caractère. La rédaction basée sur un modèle ne parvient pas à trouver le texte stocké dans ce format.

Les réglementations PDF Privacy exigent de plus en plus que les organisations démontrent que la rédaction a été effectuée correctement. Un rapport de rédaction basé sur des modèles qui documente quels modèles ont été recherchés, combien de correspondances ont été trouvées, combien ont été appliquées et combien ont été manuellement remplacées, fournit la preuve de la diligence raisonnable dans le processus de rédaction.

Le WukongPDF fournit des outils de rédaction via le navigateur qui peuvent traiter les PDF localement. La rédaction basée sur des modèles recherche dans la couche de texte du document les modèles correspondants et applique des marques de rédaction. L'approche basée sur un navigateur conserve les données de votre document sur votre appareil pendant le processus de rédaction.

Une rédaction partielle est parfois nécessaire pour les modèles où seule une partie du texte correspondant doit être masquée. Un numéro de téléphone dont seuls les quatre derniers chiffres doivent être visibles, ou une adresse e-mail où le domaine doit rester visible. Les outils de rédaction basés sur des modèles qui prennent en charge les groupes de capture vous permettent de définir les parties du modèle correspondant à rédiger et celles à laisser visibles.

Après avoir appliqué une rédaction basée sur un modèle, recherchez dans le document des fragments d'informations rédigées. Une adresse e-mail rédigée sous la forme j***@domain.com peut toujours être identifiable si le domaine est unique. Pour une confidentialité maximale, supprimez l’intégralité du modèle correspondant plutôt que de tenter une suppression partielle.

Dans les documents contenant des instances à la fois textuelles et images du même modèle, comme un PDF avec des pages tapées et numérisées, la rédaction basée sur un modèle gère les instances basées sur le texte tandis que la rédaction basée sur l'image doit être appliquée séparément aux pages numérisées.

La rédaction basée sur des modèles est un élément d’une stratégie globale de nettoyage des documents. D'autres composants incluent la suppression des métadonnées, la suppression du contenu masqué et la suppression des commentaires et des annotations. Un document qui a été soigneusement rédigé mais qui contient toujours le nom de l'auteur et l'organisation dans les métadonnées peut toujours divulguer des informations sensibles.

Pour les documents de découverte légale, la rédaction basée sur des modèles doit être combinée avec une révision manuelle. Un modèle peut trouver des numéros de téléphone, mais il ne peut pas trouver une référence à une conversation téléphonique qui n'incluait pas le numéro de téléphone. L'examen manuel détecte les références contextuelles qui manquent à la correspondance de modèles.

Les bibliothèques de modèles partagées entre les organisations peuvent améliorer la cohérence des rédactions. Un cabinet d'avocats qui gère des centaines de documents de découverte développe une bibliothèque de modèles testés pour les types de données sensibles courants. Le partage de cette bibliothèque au sein du cabinet garantit que chaque document est rédigé selon les mêmes modèles.

Il est essentiel de tester de nouveaux modèles sur un exemple de document avant de les appliquer au document complet. Un modèle qui fonctionne parfaitement lors des tests peut produire des correspondances inattendues dans le document réel en raison de variations de formatage, d'artefacts OCR ou de formats de données inhabituels.

La piste d’audit de rédaction doit être conservée à côté du document rédigé. La piste d'audit documente les modèles utilisés, le nombre de correspondances trouvées par chaque modèle et si des correspondances ont été manuellement remplacées. Cette documentation prend en charge l’assurance qualité et la conformité réglementaire.

Les expressions régulières pour la correspondance de modèles peuvent être testées en dehors de l'outil PDF avant d'exécuter la rédaction. Les testeurs d'expressions régulières en ligne vous permettent de saisir un exemple de texte et de voir quels modèles correspondent. Testez vos modèles de numéro de téléphone, d'e-mail et de SSN par rapport à des échantillons représentatifs du texte du document pour vérifier qu'ils correspondent aux cibles prévues.

Le temps gagné grâce à la rédaction basée sur des modèles par rapport à la rédaction manuelle est considérable. Un document contenant 500 instances de modèles sensibles prend moins d’une minute à un outil basé sur des modèles pour trouver et rédiger. La rédaction manuelle du même document prendrait des heures.

Pour les documents qui seront rédigés de manière récurrente, tels que les rapports mensuels qui contiennent toujours les mêmes types de données sensibles, enregistrez le modèle défini en tant que préréglage. L’application du préréglage à chaque nouveau rapport garantit une rédaction cohérente sans reconfigurer les modèles à chaque fois.

Former le personnel aux techniques de rédaction appropriées est aussi important que de disposer des bons outils. Un outil de rédaction basé sur des modèles entre des mains non formées peut produire un faux sentiment de sécurité. Le personnel doit comprendre ce que l’outil peut et ne peut pas faire, l’importance d’examiner les correspondances et les étapes de vérification après expurgation.

Pour les organisations soumises au RGPD, à la HIPAA ou à des réglementations de confidentialité similaires, la rédaction basée sur des modèles doit faire partie d'un processus documenté de protection des données. Le processus doit spécifier les modèles à rechercher, qui examine les correspondances et comment la rédaction est vérifiée avant la publication du document.

MotifExemple d'expression régulièreRisque de fausse correspondanceConseil de vérification
Téléphone (États-Unis)\(\d{3}\) \d{3}-\d{4}Moyen : correspond aux numéros de factureVérifiez le contexte ; désélectionner les correspondances non téléphoniques
E-mail\S+@\S+\.\S+Faible : @ est distinctifVérifier que le domaine est un vrai domaine de messagerie
Numéro de sécurité sociale\d{3}-\d{2}-\d{4}Élevé : correspond aux codes produitsRévision manuelle essentielle pour les modèles SSN
Carte de crédit\d{4}-\d{4}-\d{4}-\d{4}Faible avec contrôle de LuhnActiver la validation Luhn si disponible
WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →