Un PDF atterrit sur votre bureau dans le cadre d’une réponse judiciaire. Le panneau des propriétés du document est vide. Les champs auteur, date de création et historique des modifications ont été volontairement ou accidentellement supprimés. Vous devez établir quand ce document a été créé et par qui. Les métadonnées qui répondent normalement à ces questions ont disparu, mais le PDF peut toujours contenir des preuves récupérables de son origine.
La suppression des métadonnées PDF est courante lorsque les documents passent par des outils de nettoyage conçus pour supprimer les informations potentiellement sensibles avant de les partager. Ces outils suppriment le dictionnaire d'informations sur le document, les champs de métadonnées standard et souvent le flux de métadonnées XMP. Le contenu visible de la page est préservé. Le contexte documentaire est supprimé.

Où les métadonnées peuvent se cacher après la suppression
Le dictionnaire d'informations sur le document, où sont stockés l'auteur, le titre, le sujet, les mots-clés, le créateur, le producteur, la date de création et la date de modification, est la cible principale de la suppression des métadonnées. Après suppression, ces champs renvoient des valeurs vides ou par défaut lorsqu'ils sont interrogés.
Les métadonnées XMP, stockées dans un flux séparé au sein du PDF, sont souvent manquées par les outils de suppression de métadonnées de base qui ciblent uniquement le dictionnaire d'informations. XMP peut contenir les mêmes champs ainsi que des propriétés personnalisées. Un outil d'inspection Repair PDF qui examine la structure complète du fichier peut révéler les métadonnées XMP qui ont survécu à la suppression.
Les métadonnées au niveau de la page, y compris les dimensions de la page d'origine, le logiciel qui a généré chaque page et les horodatages de modification intégrés dans les flux de contenu de la page, sont rarement supprimées, car les outils de suppression n'inspectent pas le contenu de la page à la recherche de données de type métadonnées.
Essayez de réparer le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Méthodes techniques de récupération des métadonnées supprimées
Examinez le fichier PDF dans un éditeur de texte capable de gérer les fichiers binaires. Recherchez les chaînes Creator et Producer dans l’en-tête du fichier et dans les flux d’objets individuels. Ces chaînes identifient le logiciel qui a initialement créé le PDF et le logiciel qui l'a modifié en dernier. Les chaînes persistent même lorsque le dictionnaire d'informations sur le document a été vidé.
Inspectez les métadonnées de police intégrées. Les polices intégrées dans le PDF conservent leurs propres métadonnées, y compris les dates de création des polices et le logiciel utilisé pour créer ou modifier les fichiers de polices. Ces dates fournissent un terminus post quem, le document ne peut pas avoir été créé avant que ses polices intégrées n'existent.
WukongPDF fournit une inspection PDF Version Control via le navigateur qui peut examiner les propriétés du document et identifier les éléments de métadonnées récupérables dans la structure du fichier.
Ce que la récupération de métadonnées peut et ne peut pas révéler
Les métadonnées récupérables peuvent identifier le logiciel de création, le système d'exploitation et souvent la plage de dates de création. Un PDF créé par Microsoft Word 2016 sur Windows 10 à l'été 2023 réduit considérablement l'origine. Les métadonnées récupérables ne peuvent pas identifier l'utilisateur spécifique qui a créé le document ou l'ordinateur spécifique sur lequel il a été créé, à moins que ces informations n'aient été stockées dans des champs de métadonnées personnalisés.
L'historique des modifications est plus difficile à récupérer que les informations de création. Chaque opération de sauvegarde effectuée par certains éditeurs PDF écrit une nouvelle date de modification mais ne conserve pas les dates précédentes. L'historique des modifications qui peut être récupéré est l'historique des sauvegardes effectuées par les éditeurs qui ont conservé les informations de sauvegarde incrémentielles.
Prévenir la perte de métadonnées dans les futurs documents
Avant de partager des PDF en externe, examinez les métadonnées pour déterminer si elles doivent être conservées ou supprimées. La suppression de toutes les métadonnées supprime le contexte documentaire qui pourrait être nécessaire ultérieurement. La préservation des métadonnées partage des informations qui peuvent être confidentielles. La décision doit être délibérée.
Tenez à jour un registre de documents en dehors du PDF qui enregistre les dates de création, les auteurs et l'historique des versions des documents importants. Le registre externe n'est pas affecté par les opérations de métadonnées PDF et fournit un enregistrement indépendant de la provenance documentaire.
Les métadonnées du système de fichiers PDF, les dates de création et de modification stockées par le système d'exploitation sur le fichier lui-même, sont indépendantes des métadonnées internes du PDF. Même lorsque la date de création interne du PDF a été supprimée, le système de fichiers peut toujours enregistrer la date à laquelle le fichier a été enregistré pour la première fois dans son emplacement de stockage actuel.
Les pièces jointes aux e-mails conservent la date de l'e-mail dans les métadonnées du système de messagerie. Si le PDF a été reçu en pièce jointe à un e-mail, la date de l'e-mail fournit une dernière date de création possible pour le document. Le PDF ne peut pas avoir été créé après son envoi par courrier électronique.
Les systèmes de gestion de documents qui suivent l'historique des documents indépendamment des métadonnées du fichier peuvent avoir enregistré la date de création, l'auteur et les événements de modification d'origine avant la suppression des métadonnées. La recherche dans le système de gestion de documents de l'ID du document ou du nom de fichier peut récupérer les métadonnées de pré-suppression.
La structure de sauvegarde incrémentielle PDF, si le fichier a été enregistré de manière incrémentielle plutôt que entièrement réécrite, préserve les versions précédentes du dictionnaire d'informations sur le document. Un examen approfondi des données de sauvegarde incrémentielles peut révéler des valeurs de métadonnées qui étaient présentes dans les versions antérieures mais écrasées dans la version actuelle.
Les polices intégrées dans le PDF portent leurs propres dates de création et de modification dans les métadonnées du fichier de polices. Ces dates ne sont pas affectées par la suppression des métadonnées PDF. La date de police la plus récente fournit une limite inférieure pour la date de création du document.
Les images intégrées dans le PDF contiennent des métadonnées EXIF des fichiers d'images d'origine, y compris les dates de capture, les informations sur l'appareil photo et les logiciels utilisés pour l'édition. Les données EXIF incorporées dans les images PDF ne sont pas affectées par les opérations de suppression des métadonnées PDF.
Les métadonnées récupérées doivent être documentées avec la méthode de récupération et une évaluation de la confiance. Les métadonnées récupérées à partir des horodatages du système de fichiers sont moins fiables que les métadonnées récupérées à partir des dates de création de polices intégrées. La documentation permet aux futurs utilisateurs d'évaluer la fiabilité des informations récupérées.
La récupération de métadonnées à partir d'un PDF supprimé est un exercice médico-légal qui combine un examen technique de la structure du fichier avec une recherche contextuelle sur l'origine du document, et les informations récupérées sont généralement partielles plutôt que complètes.
La décision de supprimer les métadonnées d'un PDF avant le partage doit être prise en sachant que les informations supprimées peuvent être nécessaires ultérieurement et que les options de récupération sont limitées et incertaines.
La récupération des métadonnées à partir d'un PDF supprimé combine l'analyse technique avec la recherche contextuelle pour reconstruire l'histoire d'origine du document.
Les horodatages du système de fichiers sur le fichier PDF lui-même sont indépendants des métadonnées PDF internes.
La récupération des métadonnées d'un PDF supprimé nécessite d'examiner à la fois la structure du fichier et les sources externes.
La récupération de métadonnées est un processus d'enquête qui combine analyse technique et contextuelle.
Le champ Producteur PDF dans le dictionnaire d'informations sur le document identifie le logiciel qui a créé le fichier, informations qui survivent à la plupart des suppressions de métadonnées.
L'examen du fichier PDF brut avec un éditeur hexadécimal peut révéler des fragments de métadonnées auxquels le dictionnaire d'informations sur le document ne fait plus référence.
La date de création intégrée dans les fichiers de polices du PDF fournit un terminus post quem pour la création du document.
Les flux de métadonnées XMP dans le PDF sont distincts du dictionnaire d'informations sur le document et peuvent survivre à la suppression si l'outil cible uniquement le dictionnaire.
L'historique des modifications d'un PDF peut parfois être reconstitué à partir des sections de sauvegarde incrémentielle qui s'accumulent à chaque modification.
Les données d'image EXIF incorporées dans le PDF préservent les dates de capture d'image d'origine quelles que soient les opérations de métadonnées PDF.
Les journaux du système de gestion de documents peuvent enregistrer les valeurs originales des métadonnées avant que le PDF ne soit traité pour distribution.
Les en-têtes d'e-mail du message qui a livré le PDF peuvent fournir une date de création la plus récente possible pour le document.
Le nombre de pages et les dimensions des pages peuvent aider à identifier le logiciel de création, car différentes applications ont des tailles de page par défaut différentes.
Le numéro de version PDF, 1.4, 1.7, 2.0, indique quelles fonctionnalités de spécification étaient disponibles lors de la création du document.
L'analyse des tables de correspondance peut révéler l'ordre dans lequel les objets ont été ajoutés au fichier, fournissant ainsi une chronologie relative.
La numérotation des objets dans le PDF est séquentielle et les objets portant un numéro inférieur ont généralement été créés avant ceux portant un numéro supérieur.
Le paramètre de langue du document dans le catalogue PDF peut indiquer la langue et les paramètres régionaux de l'auteur d'origine.
Les champs de métadonnées personnalisés définis par l'organisation créatrice peuvent utiliser des conventions de dénomination qui identifient la source du document.
L'intention de sortie PDF, le cas échéant, identifie la condition d'impression cible et peut indiquer l'utilisation prévue du document.
Les profils de couleurs intégrés fournissent des informations sur l'environnement de gestion des couleurs dans lequel le document a été créé.
Les paramètres d'affichage initial de la mise en page peuvent indiquer si le document a été conçu pour une visualisation sur écran ou sur impression.
Les annotations et les commentaires dans le PDF portent leurs propres dates de création et informations sur l'auteur dans les propriétés de l'annotation.
Les champs de formulaire dans les PDF interactifs peuvent contenir des valeurs par défaut ou du JavaScript faisant référence à des systèmes organisationnels ou à des dates.
Le titre du document affiché dans la barre de titre de la visionneuse PDF peut être défini différemment du champ de titre des métadonnées.
Les signets et le plan du document préservent la structure des sections même lorsque les métadonnées sont supprimées.
Les hyperliens dans le document peuvent faire référence à des URL contenant des informations de date ou des identifiants organisationnels.
La liste des polices utilisées dans le document est récupérable à partir des flux de contenu de la page et peut indiquer le logiciel créateur.
Les étiquettes de page, les numéros de page logiques affichés dans la visionneuse PDF, peuvent différer des numéros de page physiques et révéler la structure du document.
Le texte du filigrane incorporé dans le contenu de la page peut contenir des informations sur la date ou l'auteur qui ont été appliquées lors de la création du document.
La somme de contrôle ou le hachage du document peut être comparé à des fichiers connus pour identifier la source d'origine.
Les modèles de taille de fichier, les grandes images, les nombreuses polices, les graphiques vectoriels complexes peuvent indiquer le type de document et le logiciel de création.
La présence de fonctionnalités PDF spécifiques, de couches, de portfolios, de médias riches, indique quelle version du logiciel a été utilisée.
L'extraction de texte du document peut révéler du texte d'en-tête et de pied de page comprenant des dates, des identifiants de document ou des noms d'auteurs.
La méthode de cryptage du document, si elle est protégée par mot de passe, indique les capacités de sécurité du logiciel créateur.
Les métadonnées sur le format du papier et l'orientation de chaque page peuvent indiquer si le document a été créé dans une région de mesure métrique ou impériale.
La plate-forme de création de documents, Windows, Mac ou Linux, peut souvent être identifiée à partir de la chaîne du producteur PDF.
L’assemblage de ces indices médico-légaux peut produire une image raisonnablement complète de l’origine d’un document, même après une suppression délibérée des métadonnées.
La récupération des métadonnées supprimées nécessite d'examiner à la fois la structure interne du PDF et les sources contextuelles externes.
| Source des preuves | Ce qu'il révèle | Fiabilité | Résistance au dénudage |
|---|---|---|---|
| Flux de métadonnées XMP | Auteur, dates, champs personnalisés | Haut | Souvent manqué par les strip-teaseuses de base |
| Dates de police intégrées | Date de création de la police | Moyen | Très élevé (dans le fichier de police) |
| Données EXIF des images | Date de capture, appareil photo, logiciel | Moyen | Très élevé (dans les données d'image) |
| Horodatages du système de fichiers | Création/modification de fichier | Faible | N/A (externe au PDF) |
Essayez de réparer le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
