Er komt een pdf op uw bureau terecht als onderdeel van een juridische ontdekkingsreactie. Het documenteigenschappenvenster is leeg. De velden auteur, aanmaakdatum en wijzigingsgeschiedenis zijn opzettelijk of incidenteel verwijderd. U moet vaststellen wanneer dit document is gemaakt en door wie. De metagegevens die normaal gesproken deze vragen beantwoorden, zijn verdwenen, maar de pdf kan nog steeds herstelbaar bewijs van de oorsprong ervan bevatten.
Het strippen van PDF-metagegevens komt vaak voor wanneer documenten door saneringstools gaan die zijn ontworpen om potentieel gevoelige informatie te verwijderen voordat ze worden gedeeld. Deze tools verwijderen het documentinformatiewoordenboek, de standaard metadatavelden en vaak de XMP-metagegevensstroom. De zichtbare pagina-inhoud blijft behouden. De documentaire context wordt verwijderd.

Waar metadata zich kunnen verbergen na het strippen
Het documentinformatiewoordenboek, waarin Auteur, Titel, Onderwerp, Trefwoorden, Maker, Producent, Creatiedatum en ModDate zijn opgeslagen, is het primaire doel van het verwijderen van metagegevens. Na het strippen retourneren deze velden lege of standaardwaarden wanneer ze worden opgevraagd.
XMP-metagegevens, opgeslagen in een aparte stroom binnen de PDF, worden vaak gemist door eenvoudige metadata-strippers die zich alleen op het informatiewoordenboek richten. XMP kan dezelfde velden plus aangepaste eigenschappen bevatten. Een Repair PDF-inspectietool die de volledige bestandsstructuur onderzoekt, kan XMP-metagegevens onthullen die het strippen hebben overleefd.
Metagegevens op paginaniveau, inclusief de oorspronkelijke paginaafmetingen, de software die elke pagina heeft gegenereerd en tijdstempels voor wijzigingen die zijn ingebed in pagina-inhoudsstromen, worden zelden verwijderd omdat striptools de pagina-inhoud niet inspecteren op metagegevensachtige gegevens.
Probeer PDF repareren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Technische methoden voor het herstellen van gestripte metadata
Bestudeer het PDF-bestand in een teksteditor die overweg kan met binaire bestanden. Zoek naar de tekenreeksen Creator en Producer in de bestandskop en in afzonderlijke objectstreams. Deze tekenreeksen identificeren de software die de PDF oorspronkelijk heeft gemaakt en de software die deze het laatst heeft gewijzigd. De tekenreeksen blijven bestaan, zelfs als het documentinformatiewoordenboek is geleegd.
Inspecteer de metagegevens van het ingesloten lettertype. Lettertypen die in de PDF zijn ingesloten, behouden hun eigen metagegevens, inclusief de aanmaakdatums van de lettertypen en de software die wordt gebruikt om de lettertypebestanden te maken of te wijzigen. Deze data bieden een terminus post quem; het document kan niet zijn gemaakt voordat de ingebedde lettertypen bestonden.
WukongPDF biedt PDF-versiebeheer-inspectie via de browser die documenteigenschappen kan onderzoeken en herstelbare metadata-elementen binnen de bestandsstructuur kan identificeren.
Wat metadataherstel wel en niet kan onthullen
Herstelbare metagegevens kunnen de gemaakte software, het besturingssysteem en vaak ook de aanmaakdatum identificeren. Een PDF gemaakt door Microsoft Word 2016 op Windows 10 in de zomer van 2023 verkleint de oorsprong aanzienlijk. Herstelbare metagegevens kunnen de specifieke gebruiker die het document heeft gemaakt of de specifieke computer waarop het is gemaakt niet identificeren, tenzij die informatie is opgeslagen in aangepaste metagegevensvelden.
De wijzigingsgeschiedenis is moeilijker te herstellen dan creatie-informatie. Elke opslagbewerking door sommige PDF-editors schrijft een nieuwe wijzigingsdatum, maar behoudt de vorige datums niet. De wijzigingsgeschiedenis die kan worden hersteld, is de geschiedenis van opslagbewerkingen door editors die incrementele opslaginformatie hebben bewaard.
Voorkomen van verlies van metadata in toekomstige documenten
Voordat u PDF's extern deelt, controleert u de metagegevens om te bepalen of deze moeten worden bewaard of verwijderd. Door alle metadata te verwijderen, wordt de documentaire context verwijderd die later mogelijk nodig is. Door metagegevens te bewaren, wordt informatie gedeeld die mogelijk vertrouwelijk is. De beslissing moet weloverwogen zijn.
Houd buiten de PDF een documentregister bij waarin de aanmaakdatums, auteurs en versiegeschiedenis van belangrijke documenten worden vastgelegd. Het externe register wordt niet beïnvloed door PDF-metagegevensbewerkingen en biedt een onafhankelijk document over de documentaire herkomst.
De metagegevens van het PDF-bestandssysteem, de aanmaak- en wijzigingsdatums die door het besturingssysteem in het bestand zelf zijn opgeslagen, zijn onafhankelijk van de interne PDF-metagegevens. Zelfs als de interne aanmaakdatum van de PDF is verwijderd, kan het bestandssysteem nog steeds opnemen wanneer het bestand voor het eerst werd opgeslagen op de huidige opslaglocatie.
E-mailbijlagen behouden de e-maildatum in de metagegevens van het e-mailsysteem. Als de PDF als e-mailbijlage is ontvangen, geeft de e-maildatum de laatst mogelijke aanmaakdatum voor het document weer. De PDF kan niet zijn gemaakt nadat deze per e-mail is verzonden.
Documentbeheersystemen die de documentgeschiedenis bijhouden, onafhankelijk van de metagegevens van het bestand, hebben mogelijk de oorspronkelijke aanmaakdatum, auteur en wijzigingsgebeurtenissen vastgelegd voordat de metagegevens werden verwijderd. Door in het documentbeheersysteem te zoeken naar de document-ID of bestandsnaam kunnen de pre-stripping-metagegevens worden hersteld.
Als het bestand incrementeel is opgeslagen in plaats van volledig herschreven, behoudt de PDF-incrementele opslagstructuur eerdere versies van het documentinformatiewoordenboek. Een forensisch onderzoek van de incrementele opslaggegevens kan metadatawaarden aan het licht brengen die aanwezig waren in eerdere versies, maar overschreven in de huidige versie.
De lettertypen die in de PDF zijn ingesloten, hebben hun eigen aanmaak- en wijzigingsdatums in de metagegevens van het lettertypebestand. Deze datums worden niet beïnvloed door het verwijderen van PDF-metagegevens. De meest recente lettertypedatum biedt een ondergrens voor de aanmaakdatum van het document.
Afbeeldingen die in de PDF zijn ingesloten, bevatten EXIF-metagegevens van de originele afbeeldingsbestanden, inclusief opnamedatums, camera-informatie en software die voor bewerking wordt gebruikt. EXIF-gegevens die in PDF-afbeeldingen zijn ingesloten, worden niet beïnvloed door het verwijderen van PDF-metagegevens.
Herstelde metadata moeten worden gedocumenteerd met de herstelmethode en een betrouwbaarheidsbeoordeling. Metagegevens die zijn hersteld van tijdstempels van bestandssystemen hebben een lagere betrouwbaarheid dan metagegevens die zijn hersteld van de aanmaakdatums van ingebedde lettertypen. Dankzij de documentatie kunnen toekomstige gebruikers de betrouwbaarheid van de herstelde informatie evalueren.
Het herstellen van metadata uit een gestripte PDF is een forensische oefening die technisch onderzoek van de bestandsstructuur combineert met contextueel onderzoek naar de oorsprong van het document, en de herstelde informatie is doorgaans eerder gedeeltelijk dan volledig.
De beslissing om metagegevens uit een PDF te verwijderen voordat deze wordt gedeeld, moet worden genomen in het besef dat de verwijderde informatie later nodig kan zijn en dat de herstelopties beperkt en onzeker zijn.
Metadataherstel uit een gestripte PDF combineert technische analyse met contextueel onderzoek om het verhaal over de oorsprong van het document te reconstrueren.
Tijdstempels van het bestandssysteem op het PDF-bestand zelf zijn onafhankelijk van de interne PDF-metagegevens.
Om metagegevens uit een gestripte PDF te herstellen, moet zowel de bestandsstructuur als externe bronnen worden onderzocht.
Metadataherstel is een onderzoeksproces dat technische en contextuele analyse combineert.
Het PDF-producentveld in het documentinformatiewoordenboek identificeert de software die het bestand heeft gemaakt, informatie die de meeste verwijdering van metagegevens overleeft.
Onderzoek van het onbewerkte PDF-bestand met een hex-editor kan metagegevensfragmenten onthullen waarnaar het documentinformatiewoordenboek niet langer verwijst.
De aanmaakdatum die is ingebed in lettertypebestanden in de PDF vormt een eindpunt voor het maken van het document.
XMP-metagegevensstromen in de PDF staan los van het documentinformatiewoordenboek en kunnen het verwijderen overleven als het hulpprogramma zich alleen op het woordenboek richt.
De wijzigingsgeschiedenis van een PDF kan soms worden gereconstrueerd op basis van de incrementele opslagsecties die bij elke bewerking worden opgebouwd.
EXIF-gegevens van afbeeldingen die in de PDF zijn ingesloten, behouden de oorspronkelijke opnamedatums van de afbeeldingen, ongeacht bewerkingen met PDF-metagegevens.
In documentbeheersysteemlogboeken kunnen de oorspronkelijke metagegevenswaarden worden vastgelegd voordat de PDF werd verwerkt voor distributie.
E-mailkoppen uit het bericht dat de PDF heeft afgeleverd, kunnen een laatst mogelijke aanmaakdatum voor het document weergeven.
Het aantal pagina's en de pagina-afmetingen kunnen helpen bij het identificeren van de software die wordt gemaakt, omdat verschillende toepassingen verschillende standaardpaginaformaten hebben.
Het PDF-versienummer, 1.4, 1.7, 2.0, geeft aan welke specificatiefuncties beschikbaar waren toen het document werd gemaakt.
Analyse van kruisverwijzingen kan de volgorde onthullen waarin objecten aan het bestand zijn toegevoegd, waardoor een relatieve chronologie ontstaat.
De objectnummering in de PDF is opeenvolgend, en objecten met een lager nummer werden doorgaans vóór objecten met een hoger nummer gemaakt.
De documenttaalinstelling in de PDF-catalogus kan de oorspronkelijke taal en landinstelling van de auteur aangeven.
Aangepaste metagegevensvelden die door de creërende organisatie zijn gedefinieerd, kunnen naamgevingsconventies gebruiken die de documentbron identificeren.
De PDF-uitvoerintentie, indien aanwezig, identificeert de doelafdrukconditie en kan het beoogde gebruik van het document aangeven.
Ingebedde kleurprofielen bieden informatie over de kleurbeheeromgeving waarin het document is gemaakt.
De instellingen voor de initiële weergave van de pagina-indeling kunnen aangeven of het document is ontworpen voor scherm- of afdrukweergave.
Annotaties en opmerkingen in de PDF hebben hun eigen aanmaakdatums en auteursinformatie in de annotatie-eigenschappen.
Formuliervelden in interactieve PDF's kunnen standaardwaarden of JavaScript bevatten die verwijzen naar organisatiesystemen of datums.
De documenttitel die wordt weergegeven in de titelbalk van de PDF-viewer kan anders zijn ingesteld dan het titelveld van de metagegevens.
Bladwijzers en de documentomtrek behouden de sectiestructuur, zelfs als de metagegevens worden verwijderd.
Hyperlinks in het document kunnen verwijzen naar URL's die datuminformatie of organisatie-ID's bevatten.
De lijst met lettertypen die in het document worden gebruikt, kan worden hersteld via de pagina-inhoudsstromen en kan de gemaakte software aangeven.
Paginalabels, de logische paginanummers die in de PDF-viewer worden weergegeven, kunnen verschillen van fysieke paginanummers en de documentstructuur onthullen.
Watermerktekst die in de pagina-inhoud is ingesloten, kan datum- of auteursinformatie bevatten die is toegepast tijdens het maken van het document.
De documentcontrolesom of hash kan worden vergeleken met bekende bestanden om de originele bron te identificeren.
Patronen van bestandsgrootte, grote afbeeldingen, veel lettertypen, complexe vectorafbeeldingen kunnen het documenttype en het maken van software aangeven.
De aanwezigheid van specifieke PDF-functies, lagen, portfolio's, rich media geeft aan welke softwareversie werd gebruikt.
Tekstextractie uit het document kan kop- en voettekst onthullen die datums, document-ID's of auteursnamen bevat.
De documentversleutelingsmethode geeft, indien beveiligd met een wachtwoord, de creërende softwarebeveiligingsmogelijkheden aan.
Metagegevens over het papierformaat en de richting van elke pagina kunnen aangeven of het document in een metrisch of imperiaal meetgebied is gemaakt.
Het platform voor het maken van documenten, Windows, Mac of Linux, kan vaak worden geïdentificeerd aan de hand van de PDF-producentreeks.
Het samenvoegen van deze forensische aanwijzingen kan een redelijk compleet beeld opleveren van de oorsprong van een document, zelfs na het opzettelijk verwijderen van metagegevens.
Het herstel van gestripte metadata vereist onderzoek naar zowel de interne PDF-structuur als externe contextuele bronnen.
| Bewijsbron | Wat het onthult | Betrouwbaarheid | stripweerstand |
|---|---|---|---|
| XMP-metagegevensstroom | Auteur, datums, aangepaste velden | Hoog | Vaak gemist door basisstrippers |
| Datums van ingesloten lettertypen | Aanmaakdatum van lettertype | Medium | Zeer hoog (in lettertypebestand) |
| Afbeelding EXIF-gegevens | Vastlegdatum, camera, software | Medium | Zeer hoog (in beeldgegevens) |
| Tijdstempels van bestandssysteem | Bestanden maken/wijzigen | Laag | N.v.t. (extern naar PDF) |
Probeer PDF repareren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
