Others

Czy możesz usunąć informacje z pliku PDF, aby przetrwał konwersję formatu?

Redagujesz numer ubezpieczenia społecznego z pliku PDF za pomocą narzędzia redakcyjnego edytora PDF. Zobaczysz czarną skrzynkę, zapisz plik i wyślij go. Odbiorca konwertuje plik PDF do formatu Word w celu edycji i stwierdza, że numer ubezpieczenia społecznego jest w pełni widoczny w przekonwertowanym dokumencie, tak jakby redakcja nigdy nie miała miejsca. To nie jest błąd. Jest to oczekiwane zachowanie większości narzędzi redakcyjnych podczas konwersji formatu dokumentu, które powoduje rzeczywiste naruszenia bezpieczeństwa danych.

W 2024 r. Biuro brytyjskiego komisarza ds. informacji poinformowało, że niewłaściwa redakcja plików PDF była trzecią najczęstszą przyczyną naruszeń bezpieczeństwa danych związanych z dokumentami rządowymi (ICO, „Data Security Incident Trends”, 2024). Najczęstszą pierwotną przyczyną nie był brak redakcji, ale brak sprawdzenia, czy redakcja przetrwała cały cykl życia dokumentu, łącznie z wszelkimi konwersjami formatów, które mogły przejść w dalszej części procesu.

Can You Redact Information From a PDF So It Survives Format Conversion

Jak działa prawidłowa redakcja plików PDF na poziomie danych

Właściwa redakcja PDF zasadniczo różni się od rysowania czarnej ramki na tekście. Kiedy używasz prawdziwego narzędzia redakcyjnego, dzieją się dwie rzeczy: widoczny tekst zostaje pokryty czarnym prostokątem, a podstawowa treść tekstowa zostaje usunięta z warstwy tekstowej pliku PDF. Same znaki są usuwane ze strumienia danych pliku. Aplikacja czytnika nie ma nic do wyświetlenia pod czarną skrzynką, ponieważ nic tam nie ma.

Kiedy narysujesz czarny prostokąt na tekście za pomocą narzędzi do adnotacji i nazwiesz go redakcją, dokonasz tego, co specjaliści ds. bezpieczeństwa nazywają redakcją kosmetyczną. Tekst nadal znajduje się w warstwie danych pliku PDF, jest w pełni nienaruszony i można go wyodrębnić. Każdy może zaznaczyć tekst, skopiować go, wkleić w innym miejscu i przeczytać każde słowo pod czarną skrzynką. Przekonwertuj plik PDF na dowolny inny format, a narzędzie do konwersji odczyta tekst bazowy, a nie nakładkę wizualną. Redakcja znika, ponieważ w ogóle nigdy nie była prawdziwa.

Rozróżnienie między redakcją rzeczywistą a redakcją kosmetyczną jest tak istotne, że agencje rządowe i kancelarie prawne włączają ją obecnie do obowiązkowych szkoleń dla pracowników mających kontakt z wrażliwymi dokumentami. Pojedyncze niewłaściwie zredagowane zgłoszenie sądowe, odpowiedź FOIA lub zgłoszenie regulacyjne mogą ujawnić dane osobowe na masową skalę, a konsekwencje prawne i reputacyjne znacznie przewyższają kilka dodatkowych sekund potrzebnych na użycie odpowiednich narzędzi redakcyjnych.

Szczególnie niebezpieczny scenariusz ma miejsce, gdy dokument przechodzi przez wiele rąk. Osoba A stosuje właściwą redakcję, Osoba B otwiera plik i widzi czarne skrzynki, zakłada, że redakcja została zakończona i przesyła dalej. Jeśli jednak Osoba A użyła narzędzia do redagowania kosmetyków, nie zdając sobie z tego sprawy, zaufanie Osoby B do czarnych skrzynek jest błędne. Ten problem związany z łańcuchem zaufania powoduje, że organizacje powinny ujednolicić jedno, zweryfikowane narzędzie redakcyjne i przeszkolić wszystkich pracowników w zakresie prawidłowego korzystania z niego.

Szczególnie podstępną odmianą redakcji kosmetycznej jest redakcja białoskrzynkowa. Niektórzy użytkownicy rysują biały prostokąt na tekście, zakładając, że biel na białym tle powoduje, że tekst jest niewidoczny. To się nie udaje, ponieważ wybranie tekstu lub konwersja dokumentu powoduje ujawnienie tekstu znajdującego się pod spodem, a oprogramowanie czytnika ekranu odczytuje go na głos niezależnie od koloru obrazu. Redakcja białoskrzynkowa w ogóle nie jest redakcją.

WukongPDF

Spróbuj zredagować plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Co dzieje się z redakcją podczas konwersji formatu

Konwersja formatu tworzy nowy dokument poprzez odczytanie źródłowego pliku PDF i zapisanie jego zawartości w innym formacie. Narzędzie do konwersji analizuje strukturę pliku PDF i wyodrębnia tekst, obrazy oraz informacje o układzie. W przypadku konwersji Format PDF zasadniczym pytaniem jest, jaką treść tekstową narzędzie do konwersji znajdzie w zredagowanych obszarach.

Jeśli redakcja była autentyczna, a tekst został usunięty ze strumienia zawartości pliku PDF, narzędzie do konwersji nie znajdzie niczego w tych obszarach i nic nie napisze. Dokument wyjściowy nie zawiera tekstu w miejscu, w którym dokonano redakcji. Jeśli redakcja miała charakter kosmetyczny, czyli nałożenie czarnej skrzynki z tekstem znajdującym się pod spodem, narzędzie do konwersji odnajdzie tekst i sumiennie zapisze go w dokumencie wyjściowym. Czarna skrzynka to element wizualny, a nie element danych, a większość narzędzi do konwersji ignoruje nakładki wizualne podczas wyodrębniania treści tekstowej.

WukongPDF zapewnia narzędzie redakcyjne, które usuwa treść na poziomie danych, a nie tylko na poziomie wizualnym. W przypadku zastosowania redakcji za pomocą prawidłowo zaimplementowanego narzędzia PDF Security, które działa na strumieniu tekstu dokumentu, usunięte informacje nie mogą pojawić się ponownie w wyniku konwersji formatu, ponieważ danych po prostu nie ma już w pliku.

Niektóre konwertery plików PDF na Word w szczególności próbują zachować adnotacje, w tym pola komentarzy, wyróżnienia i narysowane kształty. Jeżeli jako adnotację zastosowano kosmetyczną redakcję, konwerter może wiernie odtworzyć czarny prostokąt w postaci kształtu Worda. Ponieważ jednak tekst bazowy nigdy nie został usunięty, w dokumencie programu Word będzie widoczny zarówno czarny prostokąt, jak i tekst znajdujący się pod nim, który można zaznaczyć, skopiować i w pełni widoczny dla każdego, kto przeniesie lub usunie prostokąt.

Konwersja formatu nie jest jedyną drogą, przez którą może wyciekać zredagowana treść. Po prostu zaznaczenie całego tekstu w pliku PDF z kosmetycznymi zmianami i wklejenie do edytora tekstu powoduje wyświetlenie zredagowanej treści. Wyszukiwanie w pliku PDF zredagowanego terminu za pomocą funkcji Znajdź spowoduje jego zlokalizowanie, nawet jeśli jest wizualnie zakryty. Czytniki ekranu i narzędzia ułatwień dostępu odczytują podstawową warstwę tekstową. Wszystkie te alternatywne ścieżki ekstrakcji omijają nakładkę wizualną, na której opiera się redakcja kosmetyczna.

Redakcja oparta na OCR i problem ponownego pojawiania się tekstu

Zeskanowane pliki PDF dodatkowo komplikują redakcję. Zeskanowany dokument to w istocie fotografia kartki papieru. Tekst nie jest przechowywany w postaci znaków, ale w postaci pikseli obrazu. Standardowe narzędzia redakcyjne działające na warstwach tekstowych nie mogą usuwać tekstu z obrazu, dlatego zamiast tego rysują na obrazie czarne ramki. Jest to korekta kosmetyczna z konieczności, a nie z wyboru.

Aby poprawnie zredagować zeskanowany plik PDF, potrzebujesz narzędzia, które modyfikuje rzeczywiste dane obrazu, zastępując wartości pikseli w zredagowanym obszarze jednolitą czernią. Po zmodyfikowaniu obrazu uruchamiasz OCR na dokumencie, aby utworzyć warstwę tekstową tylko dla niezredagowanej treści. Jeśli wykonasz OCR przed redakcją, tekst OCR zredagowanej treści będzie przechowywany w warstwie tekstowej i zostanie wyodrębniony przez dowolne narzędzie do konwersji formatu.

Częstym błędem przy redagowaniu zeskanowanych plików PDF jest najpierw wykonanie OCR w celu umożliwienia przeszukiwania dokumentu, następnie naniesienie znaków redakcyjnych i ponowne zapisanie. Ta sekwencja pozostawia nienaruszoną warstwę tekstową wygenerowaną przez OCR pod znakami redakcji. Każda późniejsza konwersja lub wyodrębnienie tekstu spowoduje odzyskanie zredagowanego tekstu z warstwy OCR. Prawidłowa kolejność to: najpierw zredaguj piksele obrazu, a następnie OCR oczyszczony obraz. Taka kolejność gwarantuje, że warstwa tekstowa nigdy nie będzie zawierała zredagowanej treści.

Jak sprawdzić, czy redakcja przetrwa konwersję

Jedynym sposobem, aby mieć pewność, że Twoja redakcja będzie trwała, jest jej przetestowanie. Po zredagowaniu pliku PDF przekonwertuj go na zwykły plik tekstowy i wyszukaj dowolną zredagowaną treść. Jeśli plik tekstowy zawiera zredagowane dane, oznacza to, że redakcja nie powiodła się. Szybszą weryfikacją jest zaznaczenie całego tekstu w pliku PDF po redakcji i wklejenie go do edytora tekstu. Jeśli bufor wklejania zawiera zredagowany tekst, korekta była kosmetyczna.

W przypadku zeskanowanych plików PDF przekonwertuj stronę do formatu obrazu, np. PNG i wizualnie sprawdź zredagowane obszary przy dużym powiększeniu. Jeśli przez czarną nakładkę widać ślady oryginalnej treści, zwłaszcza na ekranach o dużej jasności lub podczas drukowania, redakcja jest niewystarczająca. Czasami pojedynczy piksel widocznej treści może wystarczyć do odtworzenia oryginalnych informacji.

Utwórz listę kontrolną weryfikacji zawierającą każdy z tych kroków i wymagaj jej w ramach procesu zatwierdzania dokumentów. Kilka minut potrzebnych na weryfikację redakcji jest znikomych w porównaniu z godzinami, dniami lub miesiącami działań naprawczych następujących po naruszeniu danych spowodowanym nieudaną redakcją. Ten krok nie jest opcjonalny w przypadku żadnej organizacji przetwarzającej dane osobowe lub informacje poufne.

Redakcja metadanych: często pomijana warstwa

Nawet jeśli widoczny tekst zostanie odpowiednio zredagowany, plik PDF może nadal powodować wyciek poufnych informacji poprzez metadane. Metadane PDF obejmują tytuł dokumentu, nazwisko autora, datę utworzenia, historię modyfikacji, a czasami nazwiska osób, które przejrzały dokument lub podpisały. Narzędzia do konwersji formatu zazwyczaj zachowują metadane, jeśli to możliwe, więc zredagowane metadane przetrwają konwersję z taką samą pewnością, jak zamierzona treść dokumentu.

W badaniu przeprowadzonym w 2025 r. przez Instytut SANS przeanalizowano 500 publicznie dostępnych, zredagowanych plików PDF ze stron rządowych i stwierdzono, że 12% z nich zawierało poufne informacje w polach metadanych, które nie zostały oczyszczone (Instytut SANS, „Hidden Data in Publicly Released Documents”, 2025). W kilku przypadkach do zredagowanych informacji w treści dokumentu można znaleźć odniesienia i potwierdzić je za pomocą niezredagowanych metadanych. Czyszczenie metadanych przed publikacją jest równie ważne, jak redagowanie widocznej treści.

Tej samej procedurze weryfikacji należy poddać każdy dokument poddawany konwersji, niezależnie od sposobu przeprowadzenia konwersji. Jeśli Twój przepływ pracy obejmuje etap automatycznej konwersji, wbuduj w tę automatyzację kontrolę redakcji, zamiast polegać na ręcznych kontrolach wyrywkowych. Skrypt przeszukujący przekonwertowane dane wyjściowe pod kątem znanych, zredagowanych terminów może wychwycić błędy, które mogłyby zostać przeoczone podczas ręcznego przeglądania.

Włączenie weryfikacji redakcyjnej do standardowej listy kontrolnej przeglądu dokumentów gwarantuje, że ten krytyczny krok bezpieczeństwa nigdy nie zostanie pominięty.

WukongPDF

Spróbuj zredagować plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →