Others

Você pode recuperar a data de criação original do PDF e o histórico de modificações após a remoção dos metadados

Um PDF chega à sua mesa como parte de uma resposta de descoberta legal. O painel de propriedades do documento está vazio. Os campos autor, data de criação e histórico de modificações foram removidos deliberada ou acidentalmente. Você precisa estabelecer quando este documento foi criado e por quem. Os metadados que normalmente respondem a essas perguntas desapareceram, mas o PDF ainda pode conter evidências recuperáveis de sua origem.

Metadados PDF A remoção é comum quando os documentos passam por ferramentas de higienização projetadas para remover informações potencialmente confidenciais antes do compartilhamento. Essas ferramentas excluem o dicionário de informações do documento, os campos de metadados padrão e, muitas vezes, o fluxo de metadados XMP. O conteúdo visível da página é preservado. O contexto documental é removido.

Can You Recover a PDF Original Creation Date and Modification History After Metadata Has Been Stripped

Onde os metadados podem ser ocultados após a remoção

O dicionário de informações do documento, onde Autor, Título, Assunto, Palavras-chave, Criador, Produtor, CreationDate e ModDate são armazenados, é o principal alvo da remoção de metadados. Após a remoção, esses campos retornam valores vazios ou padrão quando consultados.

Os metadados XMP, armazenados em um fluxo separado dentro do PDF, muitas vezes são perdidos por removedores de metadados básicos que visam apenas o dicionário de informações. O XMP pode conter os mesmos campos mais propriedades personalizadas. Uma ferramenta de inspeção Repair PDF que examina toda a estrutura do arquivo pode revelar metadados XMP que sobreviveram à remoção.

Os metadados no nível da página, incluindo as dimensões originais da página, o software que gerou cada página e os carimbos de data e hora de modificação incorporados nos fluxos de conteúdo da página, raramente são removidos porque as ferramentas de remoção não inspecionam o conteúdo da página em busca de dados semelhantes a metadados.

WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Métodos técnicos para recuperar metadados removidos

Examine o arquivo PDF em um editor de texto que possa lidar com arquivos binários. Pesquise strings de Criador e Produtor no cabeçalho do arquivo e em fluxos de objetos individuais. Essas strings identificam o software que criou originalmente o PDF e o software que o modificou pela última vez. As strings persistem mesmo quando o dicionário de informações do documento é esvaziado.

Inspecione os metadados da fonte incorporada. As fontes incorporadas no PDF retêm seus próprios metadados, incluindo as datas de criação das fontes e o software usado para criar ou modificar os arquivos de fontes. Essas datas fornecem um terminus post quem, o documento não pode ter sido criado antes de existirem suas fontes incorporadas.

WukongPDF fornece inspeção Controle de versão de PDF através do navegador que pode examinar as propriedades do documento e identificar elementos de metadados recuperáveis dentro da estrutura do arquivo.

O que a recuperação de metadados pode ou não revelar

Os metadados recuperáveis podem identificar o software de criação, o sistema operacional e, muitas vezes, o intervalo de datas de criação. Um PDF criado pelo Microsoft Word 2016 no Windows 10 no verão de 2023 restringe significativamente a origem. Os metadados recuperáveis não podem identificar o usuário específico que criou o documento ou o computador específico em que ele foi criado, a menos que essas informações tenham sido armazenadas em campos de metadados personalizados.

O histórico de modificações é mais difícil de recuperar do que as informações de criação. Cada operação de salvamento realizada por alguns editores de PDF grava uma nova data de modificação, mas não retém as datas anteriores. O histórico de modificações que pode ser recuperado é o histórico de salvamentos por editores que preservaram informações incrementais de salvamento.

Prevenindo a perda de metadados em documentos futuros

Antes de compartilhar PDFs externamente, revise os metadados para determinar se eles devem ser preservados ou removidos. A remoção de todos os metadados remove o contexto documental que pode ser necessário posteriormente. A preservação de metadados compartilha informações que podem ser confidenciais. A decisão deve ser deliberada.

Mantenha um registro de documentos fora do PDF que registre datas de criação, autores e histórico de versões de documentos importantes. O registo externo não é afetado pelas operações de metadados PDF e fornece um registo independente da proveniência documental.

Os metadados do sistema de arquivos PDF, as datas de criação e modificação armazenadas pelo sistema operacional no próprio arquivo, são independentes dos metadados internos do PDF. Mesmo quando a data de criação interna do PDF for eliminada, o sistema de arquivos ainda poderá registrar quando o arquivo foi salvo pela primeira vez em seu local de armazenamento atual.

Os anexos de email retêm a data do email nos metadados do sistema de email. Se o PDF foi recebido como anexo de e-mail, a data do e-mail fornece a última data de criação possível para o documento. O PDF não pode ter sido criado depois de enviado por e-mail.

Os sistemas de gerenciamento de documentos que rastreiam o histórico do documento independentemente dos metadados do arquivo podem ter registrado a data de criação original, o autor e os eventos de modificação antes dos metadados serem removidos. Pesquisar no sistema de gerenciamento de documentos o ID do documento ou nome do arquivo pode recuperar os metadados pré-remoção.

A estrutura de salvamento incremental do PDF, se o arquivo tiver sido salvo de forma incremental em vez de totalmente reescrito, preserva as versões anteriores do dicionário de informações do documento. Um exame forense dos dados salvos incrementais pode revelar valores de metadados que estavam presentes em versões anteriores, mas substituídos na versão atual.

As fontes incorporadas no PDF carregam suas próprias datas de criação e modificação nos metadados do arquivo de fontes. Essas datas não são afetadas pela remoção de metadados do PDF. A data da fonte mais recente fornece um limite inferior para a data de criação do documento.

As imagens incorporadas no PDF carregam metadados EXIF dos arquivos de imagem originais, incluindo datas de captura, informações da câmera e software usado para edição. Os dados EXIF incorporados em imagens PDF não são afetados pelas operações de remoção de metadados de PDF.

Os metadados recuperados devem ser documentados com o método de recuperação e uma avaliação de confiança. Os metadados recuperados de carimbos de data/hora do sistema de arquivos têm menor confiança do que os metadados recuperados de datas de criação de fontes incorporadas. A documentação permite que futuros usuários avaliem a confiabilidade das informações recuperadas.

A recuperação de metadados de um PDF despojado é um exercício forense que combina o exame técnico da estrutura do arquivo com a pesquisa contextual sobre a origem do documento, e as informações recuperadas são normalmente parciais e não completas.

A decisão de retirar metadados de um PDF antes do compartilhamento deve ser tomada com a consciência de que as informações retiradas podem ser necessárias posteriormente e que as opções de recuperação são limitadas e incertas.

A recuperação de metadados de um PDF despojado combina análise técnica com pesquisa contextual para reconstruir a história da origem do documento.

Os carimbos de data/hora do sistema de arquivos no próprio arquivo PDF são independentes dos metadados internos do PDF.

A recuperação de metadados de um PDF removido requer o exame da estrutura do arquivo e das fontes externas.

A recuperação de metadados é um processo investigativo que combina análise técnica e contextual.

O campo produtor de PDF no dicionário de informações do documento identifica o software que criou o arquivo, informação que sobrevive à maior parte da remoção de metadados.

O exame do arquivo PDF bruto com um editor hexadecimal pode revelar fragmentos de metadados aos quais o dicionário de informações do documento não faz mais referência.

A data de criação incorporada nos arquivos de fontes do PDF fornece um termino post quem para a criação do documento.

Os fluxos de metadados XMP no PDF são separados do dicionário de informações do documento e podem sobreviver à eliminação se a ferramenta tiver como alvo apenas o dicionário.

O histórico de modificações de um PDF às vezes pode ser reconstruído a partir das seções salvas incrementais que se acumulam a cada edição.

Os dados EXIF da imagem incorporados no PDF preservam as datas originais de captura da imagem, independentemente das operações de metadados do PDF.

Os logs do sistema de gerenciamento de documentos podem registrar os valores originais dos metadados antes do PDF ser processado para distribuição.

Os cabeçalhos de e-mail da mensagem que entregou o PDF podem fornecer a última data de criação possível para o documento.

A contagem e as dimensões das páginas podem ajudar a identificar o software de criação, pois diferentes aplicativos têm diferentes tamanhos de página padrão.

O número da versão do PDF, 1.4, 1.7, 2.0, indica quais recursos de especificação estavam disponíveis quando o documento foi criado.

A análise da tabela de referência cruzada pode revelar a sequência em que os objetos foram adicionados ao arquivo, fornecendo uma cronologia relativa.

A numeração dos objetos no PDF é sequencial e os objetos com numeração mais baixa normalmente eram criados antes dos de numeração mais alta.

A configuração de idioma do documento no catálogo PDF pode indicar o idioma e localidade do autor original.

Os campos de metadados personalizados definidos pela organização criadora podem usar convenções de nomenclatura que identificam a origem do documento.

A intenção de saída do PDF, se presente, identifica a condição de impressão desejada e pode indicar o uso pretendido do documento.

Os perfis de cores incorporados fornecem informações sobre o ambiente de gerenciamento de cores no qual o documento foi criado.

As configurações de visualização inicial do layout da página podem indicar se o documento foi projetado para visualização em tela ou impressão.

As anotações e comentários no PDF trazem suas próprias datas de criação e informações do autor nas propriedades da anotação.

Os campos de formulário em PDFs interativos podem conter valores padrão ou JavaScript que fazem referência a sistemas organizacionais ou datas.

O título do documento exibido na barra de título do visualizador de PDF pode ser definido de forma diferente do campo de título dos metadados.

Os marcadores e o contorno do documento preservam a estrutura da seção mesmo quando os metadados são removidos.

Os hiperlinks no documento podem fazer referência a URLs que contêm informações de data ou identificadores organizacionais.

A lista de fontes utilizadas no documento é recuperável dos fluxos de conteúdo da página e pode indicar o software de criação.

Os rótulos das páginas, os números lógicos das páginas exibidos no visualizador de PDF, podem diferir dos números das páginas físicas e revelar a estrutura do documento.

O texto da marca d'água incorporado no conteúdo da página pode conter informações de data ou autor que foram aplicadas durante a criação do documento.

A soma de verificação ou hash do documento pode ser comparada com arquivos conhecidos para identificar a fonte original.

Padrões de tamanho de arquivo, imagens grandes, muitas fontes, gráficos vetoriais complexos podem indicar o tipo de documento e o software de criação.

A presença de recursos específicos do PDF, camadas, portfólios, rich media, indica qual versão do software foi utilizada.

A extração de texto do documento pode revelar texto de cabeçalho e rodapé que inclui datas, IDs de documentos ou nomes de autores.

O método de criptografia de documentos, se protegido por senha, indica a criação de recursos de segurança de software.

Os metadados de tamanho e orientação do papel de cada página podem indicar se o documento foi criado em uma região de medição métrica ou imperial.

A plataforma de criação do documento, Windows, Mac ou Linux, muitas vezes pode ser identificada na string do produtor de PDF.

Unir essas pistas forenses pode produzir uma imagem razoavelmente completa da origem de um documento, mesmo após a remoção deliberada dos metadados.

A recuperação de metadados removidos requer o exame da estrutura interna do PDF e das fontes contextuais externas.

Fonte de evidênciasO que revelaConfiabilidadeResistência ao descascamento
Fluxo de metadados XMPAutor, datas, campos personalizadosAltoMuitas vezes esquecido por strippers básicos
Datas de fontes incorporadasData de criação da fonteMédioMuito alto (no arquivo de fonte)
Dados EXIF da imagemData de captura, câmera, softwareMédioMuito alto (em dados de imagem)
Carimbos de data e hora do sistema de arquivosCriação/modificação de arquivoBaixoN/A (externo ao PDF)
WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →