Others

Czy można odzyskać datę utworzenia oryginalnego pliku PDF i historię modyfikacji po usunięciu metadanych?

Plik PDF ląduje na Twoim biurku w ramach odpowiedzi na pytanie prawne. Panel właściwości dokumentu jest pusty. Pola autora, daty utworzenia i historii modyfikacji zostały celowo lub przypadkowo usunięte. Należy ustalić, kiedy i przez kogo ten dokument został utworzony. Metadane, które zwykle odpowiadają na te pytania, zniknęły, ale plik PDF może nadal zawierać możliwe do odzyskania dowody ich pochodzenia.

Metadane PDF usuwanie jest powszechne, gdy dokumenty przechodzą przez narzędzia do czyszczenia, których zadaniem jest usuwanie potencjalnie wrażliwych informacji przed udostępnieniem. Narzędzia te usuwają słownik informacji o dokumencie, standardowe pola metadanych i często strumień metadanych XMP. Widoczna zawartość strony zostaje zachowana. Kontekst dokumentalny został usunięty.

Can You Recover a PDF Original Creation Date and Modification History After Metadata Has Been Stripped

Gdzie metadane mogą się ukryć po usunięciu

Głównym celem usuwania metadanych jest słownik informacji o dokumencie, w którym przechowywane są autor, tytuł, temat, słowa kluczowe, twórca, producent, data utworzenia i data modyfikacji. Po usunięciu te pola zwracają wartości puste lub domyślne.

Metadane XMP, przechowywane w oddzielnym strumieniu w pliku PDF, często są pomijane w przypadku podstawowych narzędzi do usuwania metadanych, których celem jest wyłącznie słownik informacji. XMP może zawierać te same pola i niestandardowe właściwości. Narzędzie inspekcyjne Napraw PDF, które sprawdza pełną strukturę pliku, może ujawnić metadane XMP, które przetrwały usuwanie.

Metadane na poziomie strony, w tym oryginalne wymiary strony, oprogramowanie, które wygenerowało każdą stronę oraz znaczniki czasu modyfikacji osadzone w strumieniach zawartości strony, są rzadko usuwane, ponieważ narzędzia do usuwania nie sprawdzają zawartości strony pod kątem danych podobnych do metadanych.

WukongPDF

Spróbuj naprawić plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Techniczne metody odzyskiwania usuniętych metadanych

Sprawdź plik PDF w edytorze tekstu obsługującym pliki binarne. Wyszukaj ciągi twórców i producentów w nagłówku pliku i poszczególnych strumieniach obiektów. Te ciągi identyfikują oprogramowanie, które pierwotnie utworzyło plik PDF, oraz oprogramowanie, które go ostatnio zmodyfikowało. Ciągi znaków pozostają nawet po opróżnieniu słownika informacji o dokumencie.

Sprawdź metadane osadzonej czcionki. Czcionki osadzone w pliku PDF zachowują własne metadane, w tym daty utworzenia czcionek i oprogramowanie użyte do tworzenia lub modyfikowania plików czcionek. Daty te stanowią terminus post quem, dokument nie mógł zostać utworzony przed pojawieniem się osadzonych w nim czcionek.

WukongPDF zapewnia kontrolę Kontrola wersji PDF za pośrednictwem przeglądarki, która może zbadać właściwości dokumentu i zidentyfikować możliwe do odzyskania elementy metadanych w strukturze pliku.

Co odzyskiwanie metadanych może, a czego nie może ujawnić

Odzyskiwalne metadane mogą identyfikować tworzone oprogramowanie, system operacyjny i często zakres dat utworzenia. Plik PDF utworzony w programie Microsoft Word 2016 w systemie Windows 10 latem 2023 r. znacznie zawęża pochodzenie. Odzyskiwalne metadane nie mogą zidentyfikować konkretnego użytkownika, który utworzył dokument, ani konkretnego komputera, na którym został on utworzony, chyba że informacje te były przechowywane w niestandardowych polach metadanych.

Historię modyfikacji trudniej jest odzyskać niż informacje o utworzeniu. Każda operacja zapisywania wykonywana przez niektóre edytory PDF zapisuje nową datę modyfikacji, ale nie zachowuje poprzednich dat. Historia modyfikacji, którą można odzyskać, to historia zapisów dokonanych przez redaktorów, którzy zachowali informacje o zapisie przyrostowym.

Zapobieganie utracie metadanych w przyszłych dokumentach

Przed udostępnieniem plików PDF na zewnątrz przejrzyj metadane, aby określić, czy należy je zachować, czy usunąć. Usunięcie wszystkich metadanych usuwa kontekst dokumentacyjny, który może być potrzebny później. Zachowywanie metadanych udostępnia informacje, które mogą być poufne. Decyzja powinna być przemyślana.

Prowadź rejestr dokumentów poza plikiem PDF, w którym rejestrowane są daty utworzenia, autorzy i historia wersji ważnych dokumentów. Na zewnętrzny rejestr nie mają wpływu operacje na metadanych w formacie PDF i zapewnia on niezależny zapis pochodzenia dokumentalnego.

Metadane systemu plików PDF, daty utworzenia i modyfikacji przechowywane przez system operacyjny w samym pliku, są niezależne od wewnętrznych metadanych PDF. Nawet jeśli wewnętrzna data utworzenia pliku PDF została usunięta, system plików może nadal rejestrować datę pierwszego zapisania pliku w jego bieżącej lokalizacji.

Załączniki wiadomości e-mail zachowują datę wiadomości e-mail w metadanych systemu poczty elektronicznej. Jeśli plik PDF otrzymano jako załącznik do wiadomości e-mail, data wiadomości e-mail wskazuje najpóźniejszą możliwą datę utworzenia dokumentu. Nie można utworzyć pliku PDF po wysłaniu go pocztą elektroniczną.

Systemy zarządzania dokumentami, które śledzą historię dokumentu niezależnie od metadanych pliku, mogły zarejestrować pierwotną datę utworzenia, autora i zdarzenia modyfikacji przed usunięciem metadanych. Wyszukiwanie w systemie zarządzania dokumentami identyfikatora dokumentu lub nazwy pliku może przywrócić metadane sprzed usuwania.

Struktura przyrostowego zapisu PDF, jeśli plik został zapisany przyrostowo, a nie całkowicie przepisany, zachowuje poprzednie wersje słownika informacji o dokumencie. Badanie kryminalistyczne danych zapisu przyrostowego może ujawnić wartości metadanych, które występowały we wcześniejszych wersjach, ale zostały nadpisane w wersji bieżącej.

Czcionki osadzone w pliku PDF mają swoje własne daty utworzenia i modyfikacji w metadanych pliku czcionek. Usuwanie metadanych PDF nie ma wpływu na te daty. Najnowsza data czcionki stanowi dolną granicę daty utworzenia dokumentu.

Obrazy osadzone w pliku PDF zawierają metadane EXIF z oryginalnych plików obrazów, w tym daty wykonania, informacje o aparacie i oprogramowaniu używanym do edycji. Operacje usuwania metadanych PDF nie mają wpływu na dane EXIF osadzone w obrazach PDF.

Odzyskane metadane należy udokumentować metodą odzyskiwania i oceną wiarygodności. Metadane odzyskane ze znaczników czasu systemu plików mają niższą pewność niż metadane odzyskane z dat utworzenia osadzonych czcionek. Dokumentacja pozwala przyszłym użytkownikom ocenić wiarygodność odzyskanych informacji.

Odzyskiwanie metadanych z usuniętego pliku PDF to operacja kryminalistyczna, która łączy techniczne badanie struktury pliku z badaniem kontekstowym dotyczącym pochodzenia dokumentu, a odzyskane informacje są zazwyczaj raczej częściowe niż kompletne.

Decyzję o usunięciu metadanych z pliku PDF przed udostępnieniem należy podjąć ze świadomością, że usunięte informacje mogą być potrzebne później, a możliwości ich odzyskania są ograniczone i niepewne.

Odzyskiwanie metadanych z pozbawionego formatu pliku PDF łączy analizę techniczną z badaniami kontekstowymi w celu zrekonstruowania historii pochodzenia dokumentu.

Sygnatury czasowe systemu plików w samym pliku PDF są niezależne od wewnętrznych metadanych PDF.

Odzyskiwanie metadanych z usuniętego pliku PDF wymaga sprawdzenia zarówno struktury pliku, jak i źródeł zewnętrznych.

Odzyskiwanie metadanych to proces dochodzeniowy łączący analizę techniczną i kontekstową.

Pole producenta pliku PDF w słowniku informacji o dokumencie identyfikuje oprogramowanie, które utworzyło plik, czyli informacje, które przetrwają większość usuwania metadanych.

Badanie surowego pliku PDF za pomocą edytora szesnastkowego może ujawnić fragmenty metadanych, do których nie ma już odniesień w słowniku informacji o dokumencie.

Data utworzenia osadzona w plikach czcionek w pliku PDF stanowi terminus post quem dla utworzenia dokumentu.

Strumienie metadanych XMP w pliku PDF są oddzielone od słownika informacji o dokumencie i mogą przetrwać usunięcie, jeśli narzędzie będzie kierowane tylko na słownik.

Historię modyfikacji pliku PDF można czasami zrekonstruować na podstawie sekcji zapisu przyrostowego, które kumulują się przy każdej edycji.

Dane EXIF obrazu osadzone w pliku PDF zachowują daty wykonania oryginalnego obrazu niezależnie od operacji na metadanych PDF.

Dzienniki systemu zarządzania dokumentami mogą rejestrować oryginalne wartości metadanych przed przetworzeniem pliku PDF w celu dystrybucji.

Nagłówki wiadomości e-mail z wiadomości dostarczającej plik PDF mogą zawierać najpóźniejszą możliwą datę utworzenia dokumentu.

Liczba stron i wymiary strony mogą pomóc w identyfikacji oprogramowania do tworzenia, ponieważ różne aplikacje mają różne domyślne rozmiary stron.

Numer wersji pliku PDF, 1.4, 1.7, 2.0, wskazuje, które funkcje specyfikacji były dostępne w momencie tworzenia dokumentu.

Analiza tabeli powiązań może ujawnić kolejność dodawania obiektów do pliku, zapewniając względną chronologię.

Numeracja obiektów w pliku PDF jest sekwencyjna, a obiekty o niższych numerach były zwykle tworzone przed obiektami o wyższych numerach.

Ustawienie języka dokumentu w katalogu PDF może wskazywać oryginalny język autora i ustawienia regionalne.

Niestandardowe pola metadanych zdefiniowane przez organizację tworzącą mogą wykorzystywać konwencje nazewnictwa identyfikujące źródło dokumentu.

Zamiar wyjściowy pliku PDF, jeśli jest obecny, identyfikuje docelowy stan drukowania i może wskazywać zamierzone zastosowanie dokumentu.

Osadzone profile kolorów dostarczają informacji o środowisku zarządzania kolorami, w którym dokument został utworzony.

Ustawienia początkowego widoku układu strony mogą wskazywać, czy dokument został zaprojektowany do przeglądania na ekranie, czy do wydruku.

Adnotacje i komentarze w pliku PDF mają własną datę utworzenia i informacje o autorze we właściwościach adnotacji.

Pola formularzy w interaktywnych plikach PDF mogą zawierać wartości domyślne lub kod JavaScript odnoszący się do systemów organizacyjnych lub dat.

Tytuł dokumentu wyświetlany na pasku tytułu przeglądarki plików PDF może być inny niż w polu tytułu metadanych.

Zakładki i konspekt dokumentu zachowują strukturę sekcji nawet po usunięciu metadanych.

Hiperłącza w dokumencie mogą odwoływać się do adresów URL zawierających informacje o dacie lub identyfikatory organizacji.

Listę czcionek użytych w dokumencie można odzyskać ze strumieni treści strony i może ona wskazywać oprogramowanie tworzące.

Etykiety stron, czyli logiczne numery stron wyświetlane w przeglądarce plików PDF, mogą różnić się od fizycznych numerów stron i ujawniać strukturę dokumentu.

Tekst znaku wodnego osadzony w treści strony może zawierać datę lub informacje o autorze zastosowane podczas tworzenia dokumentu.

Sumę kontrolną lub skrót dokumentu można porównać ze znanymi plikami, aby zidentyfikować oryginalne źródło.

Wzorce rozmiaru pliku, duże obrazy, wiele czcionek, złożona grafika wektorowa, mogą wskazywać na typ dokumentu i oprogramowanie do tworzenia.

Obecność określonych funkcji PDF, warstw, portfolio i multimediów wskazuje, która wersja oprogramowania została użyta.

Wyodrębnienie tekstu z dokumentu może ujawnić tekst nagłówka i stopki zawierający daty, identyfikatory dokumentów lub nazwiska autorów.

Metoda szyfrowania dokumentu, jeśli jest chroniona hasłem, wskazuje na tworzenie możliwości bezpieczeństwa oprogramowania.

Metadane dotyczące rozmiaru i orientacji papieru z każdej strony mogą wskazywać, czy dokument został utworzony w obszarze miar metrycznych czy imperialnych.

Platformę do tworzenia dokumentów — Windows, Mac lub Linux — można często rozpoznać na podstawie ciągu znaków producenta pliku PDF.

Połączenie tych wskazówek kryminalistycznych może dać w miarę pełny obraz pochodzenia dokumentu, nawet po celowym usunięciu metadanych.

Odzyskiwanie usuniętych metadanych wymaga sprawdzenia zarówno wewnętrznej struktury pliku PDF, jak i zewnętrznych źródeł kontekstowych.

Źródło dowodoweCo ujawniaNiezawodnośćOdporność na zdzieranie
Strumień metadanych XMPAutor, daty, pola niestandardoweWysokiCzęsto pomijane przez zwykłe striptizerki
Wbudowane daty czcionekData utworzenia czcionkiŚredniBardzo wysoka (w pliku czcionki)
Dane EXIF obrazuData przechwycenia, aparat, oprogramowanieŚredniBardzo wysoka (w danych obrazu)
Sygnatury czasowe systemu plikówTworzenie/modyfikacja plikówNiskiNie dotyczy (zewnętrzne do pliku PDF)
WukongPDF

Spróbuj naprawić plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →