Others

Dlaczego plik PDF nadal zawiera stary tekst po jego usunięciu i nadpisaniu

Otwierasz plik PDF, zaznaczasz akapit tekstu, naciskasz klawisz Delete, wpiszesz w jego miejsce nowy tekst i zapiszesz plik. Nowy tekst pojawi się na ekranie. Wysyłasz dokument. Odbiorca przeszukuje plik PDF pod kątem terminu, który pojawił się tylko w starym tekście, i wyszukiwanie go znajdzie. Stary tekst, który myślałeś, że usunąłeś, nadal znajduje się w pliku, ukryty za nowym tekstem, niewidoczny na ekranie, ale w pełni obecny w danych dokumentu. To niepokojące doświadczenie ujawnia podstawową prawdę o edytowaniu plików PDF: to, co widzisz, to nie wszystko.

Narzędzia Edytor PDF dostępne w przeglądarkach i podstawowych aplikacjach komputerowych zazwyczaj dodają treść do pliku PDF, zamiast ją faktycznie zastępować. Kiedy usuniesz akapit i wpiszesz nowy tekst, edytor rysuje biały prostokąt nad starym tekstem i umieszcza nowy tekst na górze. Stary tekst pozostaje w warstwie danych pliku. Każdy, kto wyodrębni tekst, przeszuka dokument lub skonwertuje go na inny format, może odzyskać to, co myślałeś, że zostało usunięte.

Why Does a PDF Still Contain Old Text After You Delete and Overwrite It

Jak faktycznie działa edycja plików PDF: nakładka, a nie wymiana

Pliki PDF nie są przeznaczone do edycji. Format powstał jako ostateczny format wyjściowy, cyfrowy odpowiednik drukowanej strony. Kiedy edytor PDF modyfikuje dokument, nie zapisuje na nowo oryginalnych obiektów tekstowych. Dodaje nowe obiekty, które czerpią ze starych. Oryginalne obiekty tekstowe pozostają w pliku, ponieważ ich usunięcie wymagałoby odbudowania strumienia treści strony, co jest operacją znacznie bardziej złożoną niż dodanie nakładki.

Takie podejście do nakładania ma istotne konsekwencje dla bezpieczeństwa dokumentów i integralności Format PDF. Rozmiar dokumentu rośnie z każdą edycją, ponieważ stara treść nigdy nie jest usuwana, a jedynie zakrywana. Plik PDF edytowany dziesięciokrotnie zawiera oryginalną treść plus dziewięć warstw zmian. Rozmiar pliku zwiększa się z każdą wersją, mimo że liczba widocznych stron i widoczna treść pozostają takie same.

Metoda nakładek zamienia jakość edycji na szybkość edycji, a kompromis jest niewidoczny, dopóki ukryta treść nie pojawi się ponownie.

Problem z nakładką jest najbardziej dotkliwy w przypadku edycji tekstu. Edytor może narysować biały prostokąt, aby ukryć stary tekst i umieścić nowy tekst w oddzielnym obiekcie tekstowym. Biały prostokąt zakrywa wizualnie stary tekst, ale stary tekst nadal znajduje się w warstwie tekstowej. Czytnik ekranu odczytuje zarówno stary, jak i nowy tekst. Wyszukiwanie pozwala znaleźć jedno i drugie. Narzędzie do wyodrębniania tekstu zapewnia jedno i drugie. Zmiana była kosmetyczna.

Prawidłowo zaimplementowane narzędzie redakcyjne Edytor PDF usuwa treść z warstwy tekstowej. Narzędzie do edycji tekstu ogólnego przeznaczenia w tej samej aplikacji może nie. Użytkownicy zasadnie oczekują, że usunięcie oznacza usunięcie, ale format PDF sprawia, że usuwanie jest trudniejsze niż dodawanie i wielu redaktorów wybiera łatwiejszą ścieżkę.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Kiedy stary tekst może pojawić się ponownie

Stary tekst ukryty za nakładkami może pojawić się ponownie w kilku typowych sytuacjach. Konwersja pliku PDF na inny format, taki jak Word lub zwykły tekst, powoduje wyodrębnienie całego tekstu z dokumentu, w tym starego, ukrytego tekstu. Narzędzie do konwersji odczytuje bezpośrednio warstwę tekstową PDF i nie widzi białych prostokątów nakładki, ponieważ są to elementy wizualne, a nie treść tekstowa.

Otwarcie pliku PDF w innej przeglądarce może ujawnić ukryty tekst. Przeglądarka, która renderuje stronę w inny sposób, może umieścić biały prostokąt nakładki w niewłaściwym miejscu lub może w ogóle go nie renderować, odsłaniając stary tekst. Przeglądarki oparte na przeglądarce, mobilne aplikacje PDF i starsze przeglądarki na komputery stacjonarne mają swoje własne dziwactwa związane z renderowaniem, które mogą wpływać na położenie nakładki.

Użycie funkcji Znajdź do przeszukiwania dokumentu przeszukuje warstwę tekstową, a nie warstwę wizualną. Wyszukiwanie słowa, które pojawia się w usuniętym tekście, spowoduje jego znalezienie, nawet jeśli słowo to nie jest widoczne na ekranie. W ten sposób odbiorcy odkrywają, że w pliku nadal znajduje się rzekomo usunięta treść.

Czytniki ekranu i narzędzia ułatwień dostępu odczytują warstwę tekstową. Użytkownik z wadą wzroku korzystający z czytnika ekranu słyszy zarówno bieżący, jak i usunięty tekst, często bez wskazania, że część tego, co słyszy, powinna być ukryta. Metadane PDF i struktura mogą również zawierać ślady poprzednich edycji w historii modyfikacji dokumentu.

Jak sprawdzić, czy usunięty tekst naprawdę zniknął

Po edycji pliku PDF sprawdź, czy usunięty tekst rzeczywiście został usunięty, uruchamiając wyodrębnianie tekstu z edytowanego pliku. Skopiuj cały tekst z pliku PDF za pomocą Ctrl+A i wklej go do edytora tekstu. Przeszukaj wklejony tekst pod kątem usuniętych fraz. Jeśli takie frazy się pojawiają, oznacza to, że usunięcie było kosmetyczne. Alternatywnie przekonwertuj edytowany plik PDF na zwykły plik tekstowy i wyszukaj tam usuniętą zawartość.

Druga metoda weryfikacji wykorzystuje funkcję PDF Find. Wyszukaj charakterystyczne słowo lub frazę w usuniętym tekście. Jeśli narzędzie Znajdź go zlokalizuje, tekst nadal będzie znajdować się w warstwie danych dokumentu. Narzędzie Znajdź w większości czytników plików PDF przeszukuje bezpośrednio strumień zawartości tekstowej i nakładki wizualne nie mają na niego wpływu.

W przypadku poufnych dokumentów do usuwania treści użyj dedykowanego narzędzia do redagowania, a nie ogólnego narzędzia do edycji. Narzędzia redakcyjne służą do usuwania tekstu z warstwy danych, a nie tylko do jego wizualnego zakrywania. Różnica między edytowaniem a redagowaniem polega na różnicy między ukrywaniem treści a jej usuwaniem.

Jak poprawnie usunąć tekst z pliku PDF

WukongPDF udostępnia narzędzia redakcyjne oraz ogólne narzędzia redakcyjne. Jeśli chcesz trwale usunąć zawartość z pliku PDF, użyj funkcji redakcji, a nie funkcji edycji tekstu. Redakcja usuwa tekst z warstwy danych i umieszcza na jego miejscu czarny znak lub białą spację. Późniejsze wyodrębnianie, wyszukiwanie i konwersja tekstu nie pozwolą znaleźć zredagowanej treści, ponieważ nie istnieje ona już w pliku.

Jeśli edytowałeś już plik PDF i chcesz mieć pewność, że nie będzie można odzyskać starego tekstu, najbezpieczniejszym podejściem jest wydrukowanie pliku PDF do nowego pliku PDF. Proces drukowania renderuje każdą stronę jako reprezentację przypominającą obraz, odrzucając wszystkie ukryte warstwy tekstowe i nakładki. Wyjściowy plik PDF zawiera tylko to, co jest widoczne na stronie. Kompromis polega na tym, że nowy plik PDF traci możliwość wyszukiwania tekstu, łączy i innych interaktywnych funkcji.

Innym podejściem jest wyodrębnienie tylko widocznych warstw tekstowych i utworzenie z nich nowego pliku PDF, odrzucając ukrytą zawartość. Wymaga to narzędzia, które potrafi rozróżnić widoczne i ukryte obiekty tekstowe i selektywnie eksportować tylko te widoczne. Wynikowy plik PDF jest czysty i zawiera wyłącznie zamierzoną treść.

Zapobieganie przypadkowemu zatrzymywaniu treści

Podczas edytowania plików PDF, które będą udostępniane na zewnątrz, ustal przepływ pracy obejmujący etap weryfikacji zawartości. Po edycji uruchom wyodrębnianie tekstu i wyszukaj treści, które miały zostać usunięte. W przypadku dokumentów zawierających dane prawne, finansowe lub osobiste ten etap weryfikacji powinien być obowiązkowy, zanim plik opuści Twoją kontrolę.

W przypadku dokumentów wymagających obszernej edycji należy rozważyć użycie formatów innych niż PDF. Edytuj dokument w jego oryginalnym formacie (Word, Dokumenty Google, InDesign) i wyeksportuj nowy plik PDF, gdy zawartość będzie ostateczna. Świeży eksport z dokumentu źródłowego nie zawiera historii edycji ani ukrytej zawartości. Plik PDF służy swojemu zamierzonemu celowi jako ostateczny format wyjściowy, a nie jako płótno edycyjne.

Problem nie ogranicza się do tekstu. Obrazy usunięte z pliku PDF za pomocą podstawowego edytora mogą również pozostać w danych pliku. Edytor rysuje biały prostokąt na starym obrazie i umieszcza nowy obraz na wierzchu. Oryginalne dane obrazu są nadal osadzone w pliku PDF, co zwiększa rozmiar pliku i umożliwia ich wyodrębnienie przez każdego, kto otworzy plik za pomocą narzędzia, które może wyliczyć wszystkie osadzone obiekty.

Przechowywanie poufnych informacji w plikach PDF stanowi udokumentowane ryzyko bezpieczeństwa. W 2023 r. Australijska Dyrekcja ds. Sygnałów wydała wytyczne ostrzegające, że redakcja plików PDF przeprowadzona przy użyciu niewyspecjalizowanych narzędzi może spowodować, że zredagowaną treść będzie można odzyskać. W wytycznych wyraźnie wskazano, że rysowanie czarnych skrzynek na tekście lub obrazach nie powoduje usunięcia danych źródłowych i że przekonwertowane dokumenty mogą ujawnić rzekomo usuniętą treść.

Najbezpieczniejszym sposobem udostępnienia edytowanego pliku PDF, który nie może zawierać śladów poprzedniej zawartości, jest odbudowa pliku PDF wyłącznie na podstawie widocznej zawartości. Wydrukuj edytowany dokument do nowego pliku PDF za pomocą sterownika drukarki PDF. Ten proces renderuje każdą stronę tak, jak wygląda na ekranie i zapisuje tylko widoczną zawartość do nowego pliku. Ukryty tekst, usunięte obrazy i historia edycji są odrzucane, ponieważ nie stanowią części renderowanego wyglądu strony.

W przypadku organizacji, które zajmują się dokumentami podlegającymi prawu ujawnienia lub wnioskom o wolność dostępu do informacji, istotne jest zrozumienie różnicy między redagowaniem a redagowaniem. Dokument sporządzony w odpowiedzi na żądanie ujawnienia, zawierający tekst ukryty, ale możliwy do odzyskania, może skutkować poważnymi konsekwencjami prawnymi. Sądy i organy regulacyjne traktują treści ukryte jako treści ujawnione, niezależnie od tego, czy były widoczne na stronie.

Najbezpieczniejszym procesem edycji plików PDF zawierających informacje wrażliwe lub poufne jest edycja dokumentu źródłowego, a nie pliku PDF. Wprowadź zmiany w oryginalnym pliku programu Word, dokumencie Google lub pliku projektu i wyeksportuj nowy plik PDF z edytowanego źródła. Świeży eksport nie zawiera żadnych ukrytych treści, historii edycji ani pozostałości danych z poprzednich wersji, które określony odbiorca mógłby odzyskać.

ScenariuszJak ujawniany jest ukryty tekstPoziom ryzyka
Konwersja plików PDF do WordaKonwerter wyodrębnia cały tekst z warstwy danychWysoki: cały ukryty tekst staje się widoczny
Szukaj w pliku PDFFunkcja Find przeszukuje strumień tekstowy, a nie warstwę wizualnąMedium: ujawnia istnienie ukrytego tekstu
Dostęp do czytnika ekranuOdczytuje warstwę tekstową bezpośrednio, ignorując nakładkiWysoki: czyta razem stary i nowy tekst
Inna przeglądarka plików PDFAlternatywna przeglądarka może nie renderować poprawnie nakładkiŚredni: niespójny dla różnych widzów
Ekstrakcja tekstu / kopiuj-wklejOpcja Wybierz wszystko przechwytuje cały tekst w warstwie danychWysoki: ukryty tekst pojawia się w buforze wklejania
WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →