Others

Dlaczego rozmiar pliku PDF zwiększa się za każdym razem, gdy go edytujesz i zapisujesz, nawet jeśli usuwasz tylko zawartość?

Otwierasz plik PDF, usuwasz kilka stron, usuwasz niektóre obrazy i zapisujesz. Plik powinien być mniejszy. Właśnie usunąłeś treść. Ale kiedy sprawdzisz rozmiar pliku, urósł. Dokument, który przed edycją zajmował 2 megabajty, po usunięciu ma teraz 2,3 megabajta. To sprzeczne z intuicją zachowanie nie jest błędem. Jest to konsekwencja sposobu, w jaki format PDF zarządza przyrostowymi zmianami, i dzieje się tak w przypadku prawie każdego edytora PDF, łącznie z najbardziej znanymi aplikacjami komputerowymi. Zrozumienie przyczyny wyjaśnia nie tylko tajemnicę rosnącego pliku, ale także sposób zapobiegania temu zjawisku w dokumentach.

Why Does a PDF File Size Increase Every Time You Edit and Save It Even When Only Removing Content

Jak edytory PDF zapisują zmiany: aktualizacje przyrostowe a pełne przepisanie

Wybór ma większe znaczenie niż myślisz.

Kiedy edytujesz i zapisujesz plik PDF, aplikacja ma dwie możliwości zapisania zmian na dysku. Pierwsza metoda, zwana zapisem przyrostowym, dołącza zmodyfikowane obiekty na końcu istniejącego pliku bez zmiany oryginalnej zawartości. Oryginalne strony, obrazy i tekst pozostają w pliku dokładnie tak, jak były. Nowe obiekty odwołują się do starych i zastępują je za pomocą mechanizmu zwanego tabelami odniesień. Druga metoda, zwana pełnym przepisaniem lub zapisaniem jako, wczytuje cały dokument do pamięci, stosuje wszystkie zmiany i zapisuje zupełnie nowy plik od zera, odrzucając wszelkie dane, do których nie ma już odniesień.

Większość edytorów PDF domyślnie zapisuje przyrostowo ze względu na wydajność. Dołączenie kilku kilobajtów zmian na końcu pliku zajmuje ułamek sekundy. Przepisanie od podstaw 50-megabajtowego pliku zajmuje zauważalnie więcej czasu, szczególnie na mechanicznych dyskach twardych lub udziałach sieciowych. Doświadczenie użytkownika jest lepsze w przypadku zapisywania przyrostowego: zapisywanie odbywa się niemal natychmiast, a ryzyko uszkodzenia w wyniku przerwanego zapisu jest mniejsze, ponieważ oryginalne dane nigdy nie są modyfikowane. Kompromis polega na tym, że usunięta treść nie jest w rzeczywistości usuwana. Jest on oznaczony jako nieużywany w tabeli odsyłaczy, ale pozostaje fizycznie obecny w pliku (Adobe, „Odniesienie do pliku PDF: aktualizacje przyrostowe i struktura dokumentu”, 2023).

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Akumulacja osieroconych danych podczas wielu sesji edycyjnych

Za każdym razem, gdy otwierasz plik PDF, wprowadzasz zmiany i wykonujesz zapis przyrostowy, dodajesz nową warstwę modyfikacji na końcu pliku. Po dziesięciu sesjach edycji plik zawiera oryginalną treść plus dziesięć warstw zmian. Niektóre z tych zmian mogą być ze sobą sprzeczne. Obraz dodany w sesji trzeciej i usunięty w sesji siódmej zajmuje miejsce w pliku dwukrotnie: raz w przypadku instrukcji dodania i raz w przypadku instrukcji usunięcia. Usunięcie nie przywraca miejsca zajmowanego przez dodanie. Mówi jedynie czytnikowi PDF, aby zignorował ten obraz podczas renderowania dokumentu.

To nagromadzenie osieroconych danych powiększa plik przy każdym zapisie, nawet gdy widoczna zawartość się zmniejsza. Usunięcie dużego obrazu z pliku PDF i zapisanie przyrostowe powoduje usunięcie obrazu z renderowanego wyniku, ale dodaje kilka kilobajtów metadanych w celu zarejestrowania usunięcia. Same dane obrazu pozostają w pliku, bez odniesień, ale zajmują miejsce. Po wielu cyklach edycji dokument, którego rozmiar zaczynał się od 1 megabajta, może urosnąć do 3 lub 4 megabajtów, przy czym połowa tego rozmiaru to dane, które nie są już częścią widocznego dokumentu.

Ukryte typy danych, które przetrwają usunięcie treści

Oprócz oczywistych osieroconych obrazów i stron, podczas zapisu przyrostowego gromadzi się kilka rodzajów ukrytych danych. Czcionki osadzone są głównym czynnikiem przyczyniającym się do tego. Kiedy edytujesz tekst w pliku PDF i zmieniasz czcionkę, oryginalny podzbiór czcionek często pozostaje w pliku, nawet jeśli nie jest już używany żaden widoczny tekst. Dokument, który został trzykrotnie przeformatowany przy użyciu trzech różnych czcionek, może zawierać wszystkie trzy podzbiory czcionek, z których każdy zajmuje setki kilobajtów. Czytnik plików PDF korzysta tylko z podzbioru, do którego odwoływano się ostatnio, ale stare pozostają w danych pliku.

Metadane i właściwości dokumentu mają ten sam wzorzec. Każdy zapis przyrostowy może aktualizować datę modyfikacji i dodawać nowe wpisy do strumienia metadanych dokumentu. Starsze wpisy metadanych nie są usuwane. Elementy napowietrzne dokumentu, takie jak etykiety stron, nazwane miejsca docelowe łączy wewnętrznych i struktury zakładek mogą również gromadzić zduplikowane lub nieaktualne wpisy w wielu zapisach. Skumulowany efekt jest taki, że plik PDF, który był wielokrotnie edytowany i zapisywany, niesie ze sobą coraz większe obciążenie ukrytymi danymi, które w bieżącej wersji dokumentu nie służą żadnemu celowi.

Jak odzyskać rozmiar pliku po edycji

Rozwiązaniem problemu nagromadzonych osieroconych danych jest pełne ponowne zapisanie pliku PDF, co większość aplikacji nazywa Zapisz jako, Optymalizuj lub Zmniejsz rozmiar pliku. Pełne przepisanie odczytuje bieżący stan dokumentu, łącznie ze wszystkimi aktualizacjami przyrostowymi, rozpoznaje ostateczną widoczną treść i zapisuje tylko tę treść do nowego pliku. Osierocone obrazy, nieużywane czcionki, przestarzałe metadane i nieaktualne wpisy odsyłaczy są odrzucane, ponieważ nie odnosi się do nich ostateczny stan dokumentu. Wynikowy plik jest zwykle mniejszy niż oryginał, zwłaszcza jeśli podczas edycji usunięto znaczną zawartość.

Narzędzie Edytuj PDF WukongPDF skutecznie przetwarza dokument, a kolejne edycje za pomocą funkcji kompresji Rozmiar pliku PDF usuwają zgromadzone osierocone dane w jednej operacji. Połączenie edycji, późniejszego zapisu z optymalizacją sprawia, że udostępniany innym plik zawiera wyłącznie dane potrzebne do wyświetlenia aktualnej wersji dokumentu. W przypadku dokumentów poddawanych częstej edycji wykonanie pełnego przepisania w ramach procedury końcowego zapisywania przed udostępnieniem, archiwizacją lub przesłaniem zapobiega gromadzeniu się rozmiaru pliku w całym cyklu życia dokumentu.

Praktyki zapobiegawcze mające na celu kontrolowanie rozmiarów plików PDF

Jeśli często edytujesz plik PDF, na przykład szablon raportu cotygodniowego lub dokument recenzowany wspólnie, zaplanuj okresowe pełne przepisanie, zamiast polegać wyłącznie na zapisywaniu przyrostowym. Raz w miesiącu lub co dziesiątą sesję edycyjną użyj funkcji Zapisz jako lub równoważnej funkcji optymalizacyjnej, aby utworzyć czystą kopię. Zachowaj oryginał do czasu sprawdzenia, czy zoptymalizowana kopia otwiera się prawidłowo i wyświetla całą zawartość zgodnie z oczekiwaniami, a następnie zastąp oryginał wersją zoptymalizowaną. Ta praktyka umożliwia zarządzanie rozmiarami plików bez poświęcania wygody szybkiego, przyrostowego zapisywania podczas aktywnych sesji edycyjnych.

W przypadku dokumentów, które będą archiwizowane długoterminowo, jako ostatni krok przed archiwizacją wykonaj pełne przepisanie. Zarchiwizowane dokumenty mogą leżeć latami, zanim zostaną ponownie otwarte, a struktura aktualizacji przyrostowych, która była wygodna podczas aktywnej edycji, staje się problemem podczas długotrwałego przechowywania. Czysty plik o prostej strukturze wewnętrznej jest mniej podatny na problemy ze zgodnością z przyszłymi czytnikami plików PDF i jest mniejszy do przechowywania i tworzenia kopii zapasowych. Kilka sekund potrzebnych na zapisanie zoptymalizowanej kopii przed archiwizacją to opłacalna inwestycja w długoterminową kondycję dokumentów.

Rozpoznawanie, kiedy wzrost rozmiaru pliku wskazuje na głębszy problem

Chociaż większość przypadków zwiększenia rozmiaru pliku PDF po edycji można wytłumaczyć przyrostowym zapisem i osieroconymi danymi, plik, który gwałtownie rośnie po pojedynczej niewielkiej edycji, może wskazywać na inny problem. Dodanie adnotacji tekstowej składającej się z jednego zdania nie powinno zwiększać rozmiaru pliku o wiele megabajtów. Jeśli widzisz ten wzorzec, plik PDF może zawierać uszkodzenia strukturalne, które powodują niezamierzone zduplikowanie dużych sekcji dokumentu podczas operacji zapisywania. W takich przypadkach pełne ponowne zapisanie przy użyciu funkcji Zapisz jako to nie tylko etap czyszczenia, ale konieczna naprawa. Jeśli zoptymalizowany plik jest znacznie mniejszy, w oryginale zgromadziły się znaczne ukryte dane, których nigdy nie można było odzyskać w drodze normalnego zapisu przyrostowego.

Regularni użytkownicy plików PDF do celów zawodowych powinni wyrobić sobie pojęcie o rozsądnym rozmiarze pliku w przypadku typowych dokumentów. Dwustronicowy plik PDF zawierający wyłącznie tekst powinien mieć mniej niż 100 kilobajtów. Dwudziestostronicowy dokument z osadzonymi obrazami może mieć od 2 do 5 megabajtów. Jeśli plik znacznie przekracza te normy dla swojego typu zawartości, warto to sprawdzić. Plik może zawierać lata osieroconych danych pochodzących z zapisów przyrostowych. Pojedynczy przebieg Optymalizacja PDF może często zmniejszyć liczbę takich plików o pięćdziesiąt procent lub więcej, odzyskując miejsce na dysku i poprawiając wydajność podczas otwierania, udostępniania lub przesyłania pliku.

Zjawisko rosnącego rozmiaru plików stanowi ważną lekcję na temat działania plików PDF pod maską. To, co wydaje się prostym formatem dokumentu, jest w rzeczywistości złożonym pojemnikiem, w którym przy każdej edycji może gromadzić się ukryta historia. Zrozumienie tego pomoże wyjaśnić inne zachowania plików PDF, które w przeciwnym razie mogłyby wydawać się niewytłumaczalne: dlaczego plik PDF wyświetlający cztery strony może zawierać dane z sześciu, dlaczego plik zmodyfikowany dzisiaj może zawierać datę utworzenia sprzed trzech lat i dlaczego dwa pliki PDF, które wyglądają identycznie, mogą mieć drastycznie różne rozmiary plików. Mechanizm zapisu przyrostowego nie jest wadą. Jest to kompromis projektowy, w którym priorytetem jest szybkość edycji i bezpieczeństwo danych nad wydajnością przechowywania, a świadomość istnienia kompromisu pozwala na celowe zarządzanie nim poprzez okresowe pełne przepisywanie, dzięki czemu Twoje dokumenty będą schludne, czyste i wydajne.

Następnym razem, gdy usuniesz zawartość pliku PDF i zobaczysz, że rozmiar pliku zwiększa się, a nie zmniejsza, będziesz dokładnie wiedział, co się dzieje. Osierocone dane z Twojej edycji zostały dołączone do pliku, a pełne przepisanie je usunie. To, co kiedyś było zawiłą tajemnicą techniczną, staje się rutynowym zadaniem konserwacyjnym.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →