Un PDF llega a su escritorio como parte de una respuesta de descubrimiento legal. El panel de propiedades del documento está vacío. Los campos de autor, fecha de creación e historial de modificaciones se han eliminado deliberada o incidentalmente. Debe establecer cuándo se creó este documento y quién lo creó. Los metadatos que normalmente responden a estas preguntas ya no están, pero es posible que el PDF aún contenga evidencia recuperable de su origen.
La eliminación de PDF Metadatos es común cuando los documentos pasan por herramientas de desinfección diseñadas para eliminar información potencialmente confidencial antes de compartirlos. Estas herramientas eliminan el diccionario de información del documento, los campos de metadatos estándar y, a menudo, el flujo de metadatos XMP. Se conserva el contenido visible de la página. Se elimina el contexto documental.

Dónde se pueden ocultar los metadatos después de la eliminación
El diccionario de información del documento, donde se almacenan Autor, Título, Asunto, Palabras clave, Creador, Productor, Fecha de creación y Fecha de modificación, es el objetivo principal de la eliminación de metadatos. Después de la eliminación, estos campos devuelven valores vacíos o predeterminados cuando se consultan.
Los metadatos XMP, almacenados en una secuencia separada dentro del PDF, a menudo pasan desapercibidos para los eliminadores de metadatos básicos que solo apuntan al diccionario de información. XMP puede contener los mismos campos más propiedades personalizadas. Una herramienta de inspección Repair PDF que examina la estructura completa del archivo puede revelar metadatos XMP que sobrevivieron a la eliminación.
Los metadatos a nivel de página, incluidas las dimensiones de la página original, el software que generó cada página y las marcas de tiempo de modificación incrustadas en los flujos de contenido de la página, rara vez se eliminan porque las herramientas de eliminación no inspeccionan el contenido de la página en busca de datos similares a metadatos.
Pruebe reparar PDF
No se necesita instalación. Funciona directamente en su navegador.
Métodos técnicos para recuperar metadatos eliminados
Examine el archivo PDF en un editor de texto que pueda manejar archivos binarios. Busque cadenas de Creador y Productor en el encabezado del archivo y en secuencias de objetos individuales. Estas cadenas identifican el software que creó originalmente el PDF y el software que lo modificó por última vez. Las cadenas persisten incluso cuando se ha vaciado el diccionario de información del documento.
Inspeccione los metadatos de fuentes incrustados. Las fuentes incrustadas en el PDF conservan sus propios metadatos, incluidas las fechas de creación de las fuentes y el software utilizado para crear o modificar los archivos de fuentes. Estas fechas proporcionan un término post quem, el documento no puede haber sido creado antes de que existieran las fuentes incrustadas.
WukongPDF proporciona Control de versiones de PDF inspección a través del navegador que puede examinar las propiedades del documento e identificar elementos de metadatos recuperables dentro de la estructura del archivo.
Lo que la recuperación de metadatos puede y no puede revelar
Los metadatos recuperables pueden identificar el software de creación, el sistema operativo y, a menudo, el intervalo de fechas de creación. Un PDF creado por Microsoft Word 2016 en Windows 10 en el verano de 2023 reduce significativamente el origen. Los metadatos recuperables no pueden identificar al usuario específico que creó el documento o la computadora específica en la que se creó a menos que esa información se haya almacenado en campos de metadatos personalizados.
El historial de modificaciones es más difícil de recuperar que la información de creación. Cada operación de guardado realizada por algunos editores de PDF escribe una nueva fecha de modificación pero no conserva las fechas anteriores. El historial de modificaciones que se puede recuperar es el historial de guardados realizados por editores que conservaron información de guardado incremental.
Prevención de la pérdida de metadatos en documentos futuros
Antes de compartir archivos PDF externamente, revise los metadatos para determinar si deben conservarse o eliminarse. Eliminar todos los metadatos elimina el contexto documental que puede ser necesario más adelante. La preservación de metadatos comparte información que puede ser confidencial. La decisión debe ser deliberada.
Mantenga un registro de documentos fuera del PDF que registre las fechas de creación, los autores y el historial de versiones de documentos importantes. El registro externo no se ve afectado por las operaciones de metadatos PDF y proporciona un registro independiente de procedencia documental.
Los metadatos del sistema de archivos PDF, las fechas de creación y modificación almacenadas por el sistema operativo en el archivo, son independientes de los metadatos internos del PDF. Incluso cuando se haya eliminado la fecha de creación interna del PDF, el sistema de archivos aún puede registrar cuándo se guardó el archivo por primera vez en su ubicación de almacenamiento actual.
Los archivos adjuntos de correo electrónico conservan la fecha del correo electrónico en los metadatos del sistema de correo electrónico. Si el PDF se recibió como archivo adjunto de correo electrónico, la fecha del correo electrónico proporciona la última fecha posible de creación del documento. El PDF no se puede haber creado después de enviarlo por correo electrónico.
Los sistemas de gestión de documentos que rastrean el historial del documento independientemente de los metadatos del archivo pueden haber registrado la fecha de creación original, el autor y los eventos de modificación antes de que se eliminaran los metadatos. La búsqueda en el sistema de gestión de documentos del ID del documento o del nombre del archivo puede recuperar los metadatos previos a la eliminación.
La estructura de guardado incremental de PDF, si el archivo se guardó de forma incremental en lugar de reescribirse por completo, conserva las versiones anteriores del diccionario de información del documento. Un examen forense de los datos guardados incrementales puede revelar valores de metadatos que estaban presentes en versiones anteriores pero que se sobrescribieron en la versión actual.
Las fuentes incrustadas en el PDF llevan sus propias fechas de creación y modificación en los metadatos del archivo de fuentes. Estas fechas no se ven afectadas por la eliminación de metadatos de PDF. La fecha de fuente más reciente proporciona un límite inferior para la fecha de creación del documento.
Las imágenes incrustadas en el PDF contienen metadatos EXIF de los archivos de imagen originales, incluidas fechas de captura, información de la cámara y software utilizado para la edición. Los datos EXIF incrustados en imágenes PDF no se ven afectados por las operaciones de eliminación de metadatos de PDF.
Los metadatos recuperados deben documentarse con el método de recuperación y una evaluación de confianza. Los metadatos recuperados de las marcas de tiempo del sistema de archivos tienen menor confianza que los metadatos recuperados de las fechas de creación de fuentes incrustadas. La documentación permite a futuros usuarios evaluar la confiabilidad de la información recuperada.
La recuperación de metadatos de un PDF eliminado es un ejercicio forense que combina el examen técnico de la estructura del archivo con una investigación contextual sobre el origen del documento, y la información recuperada suele ser parcial en lugar de completa.
La decisión de eliminar los metadatos de un PDF antes de compartirlos debe tomarse sabiendo que la información eliminada puede ser necesaria más adelante y que las opciones de recuperación son limitadas e inciertas.
La recuperación de metadatos de un PDF eliminado combina el análisis técnico con la investigación contextual para reconstruir la historia del origen del documento.
Las marcas de tiempo del sistema de archivos en el archivo PDF son independientes de los metadatos internos del PDF.
Recuperar metadatos de un PDF eliminado requiere examinar tanto la estructura del archivo como las fuentes externas.
La recuperación de metadatos es un proceso de investigación que combina análisis técnico y contextual.
El campo productor de PDF en el diccionario de información del documento identifica el software que creó el archivo, información que sobrevive a la mayor parte de la eliminación de metadatos.
El examen del archivo PDF sin formato con un editor hexadecimal puede revelar fragmentos de metadatos a los que el diccionario de información del documento ya no hace referencia.
La fecha de creación incrustada en los archivos de fuentes dentro del PDF proporciona un término posterior a la creación del documento.
Los flujos de metadatos XMP en el PDF están separados del diccionario de información del documento y pueden sobrevivir a la eliminación si la herramienta se dirige únicamente al diccionario.
El historial de modificaciones de un PDF a veces se puede reconstruir a partir de las secciones de guardado incrementales que se acumulan con cada edición.
Los datos EXIF de imagen incrustados en el PDF conservan las fechas de captura de la imagen original independientemente de las operaciones de metadatos del PDF.
Los registros del sistema de gestión de documentos pueden registrar los valores de metadatos originales antes de que se procesara el PDF para su distribución.
Los encabezados de correo electrónico del mensaje que entregó el PDF pueden proporcionar la última fecha posible de creación del documento.
El recuento de páginas y las dimensiones de las páginas pueden ayudar a identificar el software creador, ya que diferentes aplicaciones tienen diferentes tamaños de página predeterminados.
El número de versión del PDF, 1.4, 1.7, 2.0, indica qué características de especificación estaban disponibles cuando se creó el documento.
El análisis de tablas de referencias cruzadas puede revelar la secuencia en la que se agregaron objetos al archivo, proporcionando una cronología relativa.
La numeración de objetos en el PDF es secuencial y los objetos con números más bajos normalmente se creaban antes que los con números más altos.
La configuración del idioma del documento en el catálogo PDF puede indicar el idioma y la configuración regional del autor original.
Los campos de metadatos personalizados definidos por la organización creadora pueden utilizar convenciones de nomenclatura que identifiquen el origen del documento.
La intención de salida del PDF, si está presente, identifica la condición de impresión de destino y puede indicar el uso previsto del documento.
Los perfiles de color integrados proporcionan información sobre el entorno de gestión del color en el que se creó el documento.
La configuración de vista inicial del diseño de página puede indicar si el documento fue diseñado para visualización en pantalla o impresión.
Las anotaciones y comentarios en el PDF llevan sus propias fechas de creación e información del autor en las propiedades de anotación.
Los campos de formulario en archivos PDF interactivos pueden contener valores predeterminados o JavaScript que hacen referencia a sistemas organizativos o fechas.
El título del documento que se muestra en la barra de título del visor de PDF puede configurarse de manera diferente al campo de título de metadatos.
Los marcadores y el esquema del documento conservan la estructura de la sección incluso cuando se eliminan los metadatos.
Los hipervínculos en el documento pueden hacer referencia a URL que contienen información de fecha o identificadores de organización.
La lista de fuentes utilizadas en el documento se puede recuperar de los flujos de contenido de la página y puede indicar el software de creación.
Las etiquetas de página, los números de página lógicos que se muestran en el visor de PDF, pueden diferir de los números de página físicos y revelar la estructura del documento.
El texto de la marca de agua incrustado en el contenido de la página puede contener la fecha o la información del autor que se aplicó durante la creación del documento.
La suma de comprobación o hash del documento se puede comparar con archivos conocidos para identificar la fuente original.
Los patrones de tamaño de archivos, imágenes grandes, muchas fuentes, gráficos vectoriales complejos, pueden indicar el tipo de documento y el software de creación.
La presencia de funciones, capas, carteras y medios enriquecidos específicos de PDF indica qué versión de software se utilizó.
La extracción de texto del documento puede revelar texto de encabezado y pie de página que incluye fechas, ID de documentos o nombres de autores.
El método de cifrado del documento, si está protegido con contraseña, indica las capacidades de seguridad del software de creación.
Los metadatos de tamaño y orientación del papel de cada página pueden indicar si el documento se creó en una región de medición métrica o imperial.
La plataforma de creación del documento, Windows, Mac o Linux, a menudo se puede identificar a partir de la cadena del productor de PDF.
Unir estas pistas forenses puede producir una imagen razonablemente completa del origen de un documento, incluso después de una eliminación deliberada de metadatos.
La recuperación de metadatos eliminados requiere examinar tanto la estructura interna del PDF como las fuentes contextuales externas.
| Fuente de evidencia | Lo que revela | Fiabilidad | Resistencia al pelado |
|---|---|---|---|
| Flujo de metadatos XMP | Autor, fechas, campos personalizados | Alto | A menudo pasado por alto por strippers básicos |
| Fechas de fuentes incrustadas | Fecha de creación de la fuente | Medio | Muy alto (en archivo de fuente) |
| Datos EXIF de la imagen | Fecha de captura, cámara, software. | Medio | Muy alto (en datos de imagen) |
| Marcas de tiempo del sistema de archivos | Creación/modificación de archivos | Bajo | N/A (externo a PDF) |
Pruebe reparar PDF
No se necesita instalación. Funciona directamente en su navegador.
