Tips & Tricks

Comment rédiger du texte à partir de calques spécifiques d'un PDF tout en gardant les autres calques visibles

Pour les illustrateurs techniques et les graphistes qui travaillent avec des PDF en couches comme principal format de livrable, la possibilité de rédiger par calque plutôt que par rectangle visuel modifie fondamentalement le flux de travail de transfert de documents. Un concepteur peut préparer un fichier maître unique avec toutes les informations client sur une couche de métadonnées dédiée, livrer le fichier avec cette couche supprimée pour distribution publique et conserver le fichier maître avec la couche de métadonnées intacte pour référence interne. Cette approche à source unique élimine le risque de non-concordance de version entre les copies internes et publiques du document.

L'approche de rédaction PDF Layers est particulièrement utile pour les projets multipartites où différents réviseurs ont besoin d'accéder à différents ensembles d'informations. Un ingénieur examinant un dessin de construction peut avoir besoin que toutes les couches techniques soient visibles, tandis qu'un estimateur de coûts n'a besoin que des couches de dimensions et de quantités. Un fichier source unique avec une rédaction appliquée aux couches spécifiques aux rôles sert toutes les parties sans obliger l'auteur du document à conserver des versions distinctes.

Pour les organisations soumises à des réglementations sur la protection des données telles que le RGPD, la HIPAA ou le CCPA, la possibilité de rédiger par couche offre un avantage supplémentaire en matière de conformité. Un document peut être distribué avec toutes les couches non sensibles visibles par l'état-major tandis que la couche d'informations sensibles est supprimée ou remplacée. Le même fichier source s'adresse à tous les niveaux d'audience, et la rédaction est appliquée au niveau des couches plutôt qu'en conservant plusieurs copies rédigées distinctes du document. Cela réduit la surcharge de contrôle de version et garantit que tous les destinataires travaillent à partir de la même structure de document sous-jacente, avec un accès uniquement aux couches appropriées à leur niveau d'autorisation.

Un document PDF construit avec plusieurs groupes de contenu facultatifs, communément appelés calques, peut stocker du contenu textuel dans un calque, des images et des photographies dans un autre, des annotations et des commentaires dans un troisième et des éléments d'arrière-plan tels que des filigranes ou des modèles de papeterie dans un quatrième. Lorsque vous devez supprimer ou masquer des informations sensibles qui se trouvent exclusivement dans un calque spécifique tout en gardant tous les autres calques entièrement visibles et interactifs, un outil de rédaction standard qui aplatit tous les calques en une seule image, puis brûle des rectangles noirs opaques sur le résultat aplati ne fonctionnera pas. La structure des couches est détruite et le contenu qui aurait dû rester visible est perdu ainsi que les informations sensibles. Une approche PDF Redaction qui comprend et respecte la structure du groupe de contenu facultatif peut cibler le contenu par couche, en supprimant ou en masquant les données d'un OCG nommé spécifique tout en préservant toutes les autres couches intactes et fonctionnelles.

Ce scénario se présente dans plusieurs contextes professionnels. Les sociétés d'ingénierie utilisent des PDF en couches pour séparer les plans d'étage architecturaux des superpositions d'électricité, de plomberie et de CVC dans un seul fichier. La suppression d'un nom de client confidentiel à partir du calque du cartouche ne doit pas affecter les calques de plan d'étage, de dimension ou d'annotation. Les agences gouvernementales publient des PDF en couches avec des cartes de base sur une couche et des détails d'infrastructure sensibles sur une autre. Les éditeurs multilingues stockent chaque traduction sur sa propre couche. Dans tous les cas, la rédaction doit être chirurgicale : limitée à une seule couche.

How to Redact Text From Specific Layers of a PDF While Keeping Other Layers Visible

Comment les groupes de contenu facultatif PDF stockent le contenu de manière indépendante

Les groupes de contenu facultatifs ont été introduits dans la version PDF 1.5 et sont désormais entièrement intégrés à la norme ISO 32000 (Adobe, « PDF Reference 1.7 », 2006). Chaque OCG est une collection nommée et logiquement indépendante de contenu de page qu'une application de visualisation peut activer ou désactiver à la discrétion de l'utilisateur. Le catalogue de documents contient un dictionnaire OCProperties qui répertorie chaque OCG par nom et mappe chacun d'entre eux aux objets de flux de contenu qui lui appartiennent. Une page peut référencer plusieurs flux de contenu, et chaque flux peut être étiqueté comme appartenant à un ou plusieurs OCG.

Étant donné que le contenu de chaque couche est stocké dans des objets de flux de contenu discrets et identifiables au sein de la structure d'objet PDF, il est techniquement possible d'éditer, de modifier ou de supprimer complètement le contenu d'une couche sans affecter les données stockées dans une autre couche. Un outil PDF Redaction qui comprend l'architecture OCG peut localiser les flux de contenu associés à une couche cible par leur nom et supprimer ou remplacer uniquement ces flux spécifiques. Cependant, les outils de rédaction standard qui ignorent les limites OCG aplatissent généralement tous les calques visibles en une seule image bitmap rendue avant d'appliquer des marques de rédaction. Cette étape d’aplatissement fusionne définitivement tous les calques et détruit l’organisation des calques d’origine.

WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Identifier quelle couche contient les informations à expurger

Avant d'effectuer toute rédaction, vous devez déterminer exactement quel nom ou identifiant OCG contient le contenu à supprimer. Ouvrez le PDF dans n'importe quelle visionneuse qui expose le panneau Calques dans son interface utilisateur. Adobe Acrobat Pro, Foxit PDF Editor, Bluebeam Revu et plusieurs visionneuses PDF open source affichent une liste de calques basculable, généralement dans un panneau de barre latérale de gauche. Désactivez chaque calque un par un tout en observant quel contenu disparaît de l'affichage de la page. Mappez chaque nom de calque à son contenu visuel. Enregistrez la chaîne exacte du nom OCG telle qu'elle apparaît dans le panneau, y compris les majuscules, les espaces et tous les caractères spéciaux.

Pour l'identification programmatique, utilisez un outil d'inspection de structure PDF tel que « pdfinfo » avec l'indicateur « -struct » ou un script Python utilisant la bibliothèque pikepdf. Le dictionnaire OCProperties du catalogue de documents mappe chaque nom d'OCG à la liste des références d'objets de flux de contenu appartenant à cette couche. Le code « pdf.Root.OCProperties » dans pikepdf renvoie la structure OCG complète, que vous pouvez ensuite parcourir pour faire correspondre les noms de couches à leurs flux de contenu associés.

Caviarder en supprimant les flux de contenu de la couche cible de chaque page

La méthode la plus précise consiste à supprimer uniquement les objets de flux de contenu appartenant à l'OCG cible du tableau de contenu de la page. Cette approche nécessite un outil ou un script capable de lire le mappage OCG-contenu à partir du catalogue de documents, d'identifier chaque référence d'objet de flux de contenu associée au nom de la couche cible et de supprimer ces références d'objet spécifiques de la liste de flux de contenu de chaque page. Tous les autres flux de contenu restent intacts et continuent de s'afficher normalement. La bibliothèque pikepdf de Python prend en charge nativement cette manipulation au niveau des objets, tout comme la bibliothèque Apache PDFBox basée sur Java.

Le tableau ci-dessous compare les approches de rédaction disponibles pour les PDF en couches :

MéthodePréserve les calquesPrécision de retraitNiveau de compétence requis
pikepdf / Script PythonOui, toutes les autres couches intactesSuppression chirurgicale et individuelle du flux de contenuProgrammation Python intermédiaire
Panneau des calques Adobe Acrobat ProOui, si la suppression de calque est utiliséeBien, supprime par nom de calque via l'interface graphiqueInterface de base, pointer-cliquer
Aplatir et rédiger (outils standards)Non, détruit toutes les couches d'organisationMauvais, brûle tout le contenu en une seule image aplatieBasique mais destructeur pour la structure

Caviarder en remplaçant le contenu du calque cible par un masque opaque

Dans les situations où la suppression complète du calque perturberait les flux de travail en aval qui dépendent d'un nombre de calques spécifique ou d'une convention de dénomination, une technique alternative remplace le contenu du calque cible par un rectangle opaque de mêmes dimensions. L'objet de remplacement reste à l'intérieur du même OCG nommé, de sorte que le basculement de calque fonctionne toujours dans la visionneuse, mais le contenu sensible qui était stocké dans ce calque a été remplacé par un masque vide. Aucune superposition de boîte noire qu'un spectateur ultérieur pourrait supprimer n'est utilisée. Les données de contenu originales sont définitivement supprimées du flux de contenu et remplacées.

Cette approche est particulièrement efficace pour les documents d'ingénierie et d'architecture pour lesquels les logiciels de CAO ou BIM attendent un ensemble fixe de couches portant des noms spécifiques. La suppression complète d'un calque entraînerait des erreurs ou des avertissements lors de la réouverture du fichier dans l'application de création. Remplacer le contenu sensible au sein de la couche tout en gardant le conteneur de couche lui-même présent satisfait à la fois aux exigences de sécurité et aux exigences de compatibilité logicielle.

Vérifiez qu'aucun contenu sensible n'a été divulgué dans d'autres couches

Le balisage du contenu dans les PDF réels est rarement aussi propre que le suggère le panneau des calques. Une application de création peut avoir écrit un objet texte qui appartient logiquement à la couche d'annotations dans le flux de contenu par défaut au lieu du flux de contenu spécifique aux annotations. Avant de finaliser le document expurgé, désactivez tous les calques à l'exception du calque de rédaction cible et confirmez que le contenu sensible disparaît complètement de la vue. Recherchez ensuite le contenu textuel brut de l'intégralité du PDF à l'aide d'un outil d'extraction de texte ou d'une commande telle que « grep » par rapport aux données PDF non compressées. Si un fragment de la chaîne de texte sensible apparaît dans les résultats de la recherche, ces données existent quelque part en dehors de la couche cible et nécessitent une passe de rédaction supplémentaire distincte.

L'outil PDF Redaction du WukongPDF fonctionne au niveau du flux de contenu et peut cibler des groupes de contenu facultatifs spécifiques par leur nom lorsque la structure des couches est identifiée dans le document. La rédaction est appliquée uniquement au calque sélectionné, préservant ainsi la visibilité et l'interactivité de tous les autres calques du document de sortie.

Pour les documents ayant des implications juridiques, réglementaires ou en matière de confidentialité, vérifiez également que le contenu supprimé est absent des flux de métadonnées du document, du dictionnaire d'informations fragmentaires et de toutes les vignettes ou images d'aperçu de page intégrées. Une passe de vérification complète comprend la vérification de ces cinq emplacements de stockage. Les PDF qui combinent du contenu en couches avec des exigences de rédaction nécessitent des outils qui fonctionnent au niveau du modèle objet, et non au niveau du pixel rendu. Identifier l'OCG cible correct par son nom, supprimer ou remplacer uniquement les flux de contenu de cette couche, puis vérifier de manière exhaustive qu'aucune donnée résiduelle ne persiste en dehors de la couche cible produit un PDF rédigé dans lequel toutes les couches restantes restent entièrement fonctionnelles, interactives et visibles.

WukongPDF

Essayez de rédiger un PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →