Un PDF arriva sulla tua scrivania come parte di una risposta di accertamento legale. Il pannello delle proprietà del documento è vuoto. I campi dell'autore, della data di creazione e della cronologia delle modifiche sono stati rimossi deliberatamente o accidentalmente. È necessario stabilire quando è stato creato questo documento e da chi. I metadati che normalmente rispondono a queste domande sono scomparsi, ma il PDF potrebbe ancora contenere prove recuperabili della sua origine.
Metadati PDF Lo stripping è comune quando i documenti passano attraverso strumenti di sanificazione progettati per rimuovere informazioni potenzialmente sensibili prima della condivisione. Questi strumenti eliminano il dizionario delle informazioni del documento, i campi di metadati standard e spesso il flusso di metadati XMP. Il contenuto della pagina visibile viene preservato. Il contesto documentario viene rimosso.

Dove i metadati possono nascondersi dopo essere stati rimossi
Il dizionario delle informazioni del documento, in cui sono archiviati Autore, Titolo, Oggetto, Parole chiave, Creatore, Produttore, Data di creazione e Data Mod, è l'obiettivo principale dell'eliminazione dei metadati. Dopo la rimozione, questi campi restituiscono valori vuoti o predefiniti quando vengono interrogati.
I metadati XMP, archiviati in un flusso separato all'interno del PDF, spesso non vengono rilevati dagli estrattori di metadati di base che prendono di mira solo il dizionario delle informazioni. XMP può contenere gli stessi campi più proprietà personalizzate. Uno strumento di ispezione Ripara PDF che esamina l'intera struttura del file può rivelare metadati XMP sopravvissuti alla rimozione.
I metadati a livello di pagina, comprese le dimensioni della pagina originale, il software che ha generato ciascuna pagina e i timestamp di modifica incorporati nei flussi di contenuto della pagina, vengono raramente rimossi perché gli strumenti di rimozione non controllano il contenuto della pagina per rilevare dati simili ai metadati.
Prova a riparare PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
Metodi tecnici per il recupero dei metadati rimossi
Esaminare il file PDF in un editor di testo in grado di gestire file binari. Cerca le stringhe Creator e Producer nell'intestazione del file e nei singoli flussi di oggetti. Queste stringhe identificano il software che ha creato originariamente il PDF e il software che lo ha modificato per ultimo. Le stringhe persistono anche quando il dizionario delle informazioni del documento è stato svuotato.
Esamina i metadati dei caratteri incorporati. I caratteri incorporati nel PDF conservano i propri metadati, comprese le date di creazione dei caratteri e il software utilizzato per creare o modificare i file dei caratteri. Queste date forniscono un termine post quem, il documento non può essere stato creato prima che esistessero i suoi caratteri incorporati.
WukongPDF fornisce l'ispezione Controllo della versione PDF tramite il browser in grado di esaminare le proprietà del documento e identificare gli elementi di metadati recuperabili all'interno della struttura del file.
Cosa può e non può rivelare il recupero dei metadati
I metadati recuperabili possono identificare il software di creazione, il sistema operativo e spesso l'intervallo di date di creazione. Un PDF creato da Microsoft Word 2016 su Windows 10 nell'estate del 2023 restringe significativamente l'origine. I metadati recuperabili non possono identificare l'utente specifico che ha creato il documento o il computer specifico su cui è stato creato a meno che tali informazioni non siano state archiviate in campi di metadati personalizzati.
La cronologia delle modifiche è più difficile da recuperare rispetto alle informazioni sulla creazione. Ogni operazione di salvataggio eseguita da alcuni editor PDF scrive una nuova data di modifica ma non conserva le date precedenti. La cronologia delle modifiche che può essere recuperata è la cronologia dei salvataggi effettuati dagli editor che hanno conservato le informazioni di salvataggio incrementale.
Prevenire la perdita di metadati nei documenti futuri
Prima di condividere i PDF esternamente, esamina i metadati per determinare se devono essere conservati o eliminati. L'eliminazione di tutti i metadati rimuove il contesto documentario che potrebbe essere necessario in seguito. La conservazione dei metadati condivide informazioni che potrebbero essere riservate. La decisione dovrebbe essere deliberata.
Mantieni un registro dei documenti al di fuori del PDF che registra le date di creazione, gli autori e la cronologia delle versioni per i documenti importanti. Il registro esterno non è influenzato dalle operazioni sui metadati PDF e fornisce una registrazione indipendente della provenienza documentale.
I metadati del file system PDF, ovvero le date di creazione e modifica memorizzate dal sistema operativo sul file stesso, sono indipendenti dai metadati interni del PDF. Anche quando la data di creazione interna del PDF è stata rimossa, il file system potrebbe comunque registrare il momento in cui il file è stato salvato per la prima volta nella posizione di archiviazione corrente.
Gli allegati e-mail mantengono la data dell'e-mail nei metadati del sistema di posta elettronica. Se il PDF è stato ricevuto come allegato e-mail, la data e-mail fornisce l'ultima data di creazione possibile per il documento. Il PDF non può essere stato creato dopo essere stato inviato via email.
I sistemi di gestione dei documenti che tengono traccia della cronologia del documento indipendentemente dai metadati del file potrebbero aver registrato la data di creazione originale, l'autore e gli eventi di modifica prima che i metadati venissero rimossi. La ricerca nel sistema di gestione dei documenti dell'ID del documento o del nome del file può recuperare i metadati di pre-rimozione.
La struttura di salvataggio incrementale del PDF, se il file è stato salvato in modo incrementale anziché riscritto completamente, conserva le versioni precedenti del dizionario delle informazioni del documento. Un esame forense dei dati di salvataggio incrementali può rivelare valori di metadati presenti nelle versioni precedenti ma sovrascritti nella versione corrente.
I caratteri incorporati nel PDF riportano le proprie date di creazione e modifica nei metadati del file dei caratteri. Queste date non sono influenzate dall'eliminazione dei metadati del PDF. La data del carattere più recente fornisce un limite inferiore per la data di creazione del documento.
Le immagini incorporate nel PDF contengono metadati EXIF dai file di immagine originali, comprese le date di acquisizione, le informazioni sulla fotocamera e il software utilizzato per la modifica. I dati EXIF incorporati nelle immagini PDF non sono influenzati dalle operazioni di eliminazione dei metadati PDF.
I metadati recuperati devono essere documentati con il metodo di recupero e una valutazione di confidenza. I metadati recuperati dai timestamp del file system hanno una sicurezza inferiore rispetto ai metadati recuperati dalle date di creazione dei caratteri incorporati. La documentazione consente ai futuri utenti di valutare l'affidabilità delle informazioni recuperate.
Il recupero dei metadati da un PDF rimosso è un esercizio forense che combina l'esame tecnico della struttura del file con la ricerca contestuale sull'origine del documento e le informazioni recuperate sono generalmente parziali anziché complete.
La decisione di eliminare i metadati da un PDF prima della condivisione dovrebbe essere presa con la consapevolezza che le informazioni eliminate potrebbero essere necessarie in seguito e che le opzioni di ripristino sono limitate e incerte.
Il recupero dei metadati da un PDF rimosso combina l'analisi tecnica con la ricerca contestuale per ricostruire la storia dell'origine del documento.
I timestamp del file system sul file PDF stesso sono indipendenti dai metadati PDF interni.
Il recupero dei metadati da un PDF rimosso richiede l'esame sia della struttura del file che delle fonti esterne.
Il recupero dei metadati è un processo investigativo che combina analisi tecnica e contestuale.
Il campo del produttore PDF nel dizionario delle informazioni del documento identifica il software che ha creato il file, informazioni che sopravvivono alla maggior parte dell'eliminazione dei metadati.
L'esame del file PDF non elaborato con un editor esadecimale può rivelare frammenti di metadati a cui il dizionario delle informazioni del documento non fa più riferimento.
La data di creazione incorporata nei file di caratteri all'interno del PDF fornisce un termine post quem per la creazione del documento.
I flussi di metadati XMP nel PDF sono separati dal dizionario delle informazioni del documento e potrebbero sopravvivere alla rimozione se lo strumento prendeva di mira solo il dizionario.
La cronologia delle modifiche di un PDF a volte può essere ricostruita dalle sezioni di salvataggio incrementali che si accumulano con ogni modifica.
I dati EXIF immagine incorporati nel PDF conservano le date di acquisizione dell'immagine originale indipendentemente dalle operazioni sui metadati PDF.
I registri del sistema di gestione dei documenti possono registrare i valori dei metadati originali prima che il PDF venga elaborato per la distribuzione.
Le intestazioni e-mail del messaggio che ha consegnato il PDF possono fornire la data di creazione più recente possibile per il documento.
Il conteggio delle pagine e le dimensioni della pagina possono aiutare a identificare il software di creazione, poiché diverse applicazioni hanno dimensioni di pagina predefinite diverse.
Il numero di versione PDF, 1.4, 1.7, 2.0, indica quali funzionalità delle specifiche erano disponibili al momento della creazione del documento.
L'analisi della tabella dei riferimenti incrociati può rivelare la sequenza in cui gli oggetti sono stati aggiunti al file, fornendo una relativa cronologia.
La numerazione degli oggetti nel PDF è sequenziale e gli oggetti con numeri più bassi venivano generalmente creati prima di quelli con numeri più alti.
L'impostazione della lingua del documento nel catalogo PDF può indicare la lingua e le impostazioni internazionali dell'autore originale.
I campi di metadati personalizzati definiti dall'organizzazione creatrice possono utilizzare convenzioni di denominazione che identificano l'origine del documento.
L'intento di output del PDF, se presente, identifica la condizione di stampa di destinazione e può indicare l'uso previsto del documento.
I profili colore incorporati forniscono informazioni sull'ambiente di gestione del colore in cui è stato creato il documento.
Le impostazioni di visualizzazione iniziale del layout di pagina possono indicare se il documento è stato progettato per la visualizzazione su schermo o stampata.
Annotazioni e commenti nel PDF riportano le proprie date di creazione e informazioni sull'autore nelle proprietà dell'annotazione.
I campi modulo nei PDF interattivi possono contenere valori predefiniti o JavaScript che fanno riferimento a date o sistemi organizzativi.
Il titolo del documento visualizzato nella barra del titolo del visualizzatore PDF potrebbe essere impostato in modo diverso dal campo del titolo dei metadati.
I segnalibri e la struttura del documento preservano la struttura della sezione anche quando i metadati vengono eliminati.
I collegamenti ipertestuali nel documento possono fare riferimento a URL che contengono informazioni sulla data o identificatori organizzativi.
L'elenco dei caratteri utilizzati nel documento è recuperabile dai flussi di contenuto della pagina e può indicare il software di creazione.
Le etichette delle pagine, i numeri di pagina logici visualizzati nel visualizzatore PDF, potrebbero differire dai numeri di pagina fisici e rivelare la struttura del documento.
Il testo della filigrana incorporato nel contenuto della pagina può contenere informazioni sulla data o sull'autore applicate durante la creazione del documento.
Il checksum o l'hash del documento può essere confrontato con file noti per identificare la fonte originale.
Modelli di dimensioni dei file, immagini di grandi dimensioni, molti caratteri, grafica vettoriale complessa possono indicare il tipo di documento e il software di creazione.
La presenza di funzionalità PDF specifiche, livelli, portfolio, rich media, indica quale versione del software è stata utilizzata.
L'estrazione del testo dal documento può rivelare testo di intestazione e piè di pagina che include date, ID documento o nomi di autori.
Il metodo di crittografia del documento, se protetto da password, indica le funzionalità di sicurezza del software di creazione.
I metadati del formato carta e dell'orientamento di ciascuna pagina possono indicare se il documento è stato creato in un'area di misurazione metrica o imperiale.
La piattaforma di creazione del documento, Windows, Mac o Linux, può spesso essere identificata dalla stringa del produttore del PDF.
Mettendo insieme questi indizi forensi è possibile produrre un quadro ragionevolmente completo dell’origine di un documento, anche dopo la deliberata rimozione dei metadati.
Il recupero dei metadati rimossi richiede l'esame sia della struttura interna del PDF che delle fonti contestuali esterne.
| Fonte della prova | Cosa rivela | Affidabilità | Resistenza allo spellamento |
|---|---|---|---|
| Flusso di metadati XMP | Autore, date, campi personalizzati | Alto | Spesso mancato agli spogliarellisti di base |
| Date dei caratteri incorporati | Data di creazione del carattere | Medio | Molto alto (nel file dei caratteri) |
| Dati EXIF dell'immagine | Data di acquisizione, fotocamera, software | Medio | Molto alto (nei dati immagine) |
| Timestamp del file system | Creazione/modifica file | Basso | N/D (esterno al PDF) |
Prova a riparare PDF
Nessuna installazione necessaria. Funziona direttamente nel tuo browser.
