Spłaszczenie pliku PDF powoduje połączenie wszystkich adnotacji, pól formularzy i zawartości warstwowej w jedną warstwę obrazu statycznego. Po spłaszczeniu oryginalna warstwa tekstowa, która istniała przed spłaszczeniem, znika. Znaki tekstowe, które kiedyś można było wybierać, przeszukiwać i wyodrębniać, stają się pikselami spłaszczonego obrazu. Naprawa PDF w przypadku spłaszczonego dokumentu pyta, czy ze spłaszczonego wydruku można odzyskać oryginalną warstwę tekstową.
Krótka odpowiedź zależy od tego, czy plik PDF został spłaszczony z zachowaniem warstwy tekstowej, czy bez. Niektóre operacje spłaszczania zachowują oryginalny tekst za spłaszczonym obrazem jako ukrytą zawartość. Inne operacje spłaszczania całkowicie usuwają tekst i zastępują go wyrenderowanym obrazem. W pierwszym przypadku odzyskanie jest możliwe, a w drugim niemożliwe.
Narzędzia do odzyskiwania PDF Format WukongPDF umożliwiają wykrywanie i wyodrębnianie zachowanych warstw tekstowych ze spłaszczonych dokumentów PDF.

Jak działa spłaszczanie plików PDF i co usuwa
Spłaszczanie łączy wszystkie widoczne warstwy strony PDF w jeden wyrenderowany obraz. Adnotacje, w tym wyróżnienia, notatki i znaczniki rysunków, są scalane z zawartością strony. Pola formularzy są konwertowane z elementów interaktywnych na statyczne wizualne reprezentacje wypełnionych wartości. Efekty przezroczystości są przekształcane w nieprzezroczyste piksele. Rezultatem jest strona, która wygląda identycznie jak oryginał, ale nie ma interaktywnej ani warstwowej struktury.
W praktyce proces spłaszczania może, ale nie musi, zachować oryginalną warstwę tekstową znajdującą się za spłaszczonym obrazem. Jeśli spłaszczanie jest wykonywane za pomocą Podglądu spłaszczania w programie Acrobat Pro lub za pomocą narzędzia Inspekcja wstępna z określonymi ustawieniami, oryginalny tekst może zostać zachowany jako niewidoczna warstwa. W przypadku spłaszczania za pomocą funkcji Drukuj do pliku PDF lub narzędzi innych firm warstwa tekstowa jest zazwyczaj całkowicie odrzucana.
Szybki test sprawdza, czy tekst został zachowany. Otwórz spłaszczony plik PDF i spróbuj zaznaczyć tekst na stronie. Jeśli tekst można zaznaczyć i skopiować, oznacza to, że warstwa tekstowa przetrwała spłaszczenie. Jeśli kliknięcie tekstu nic nie powoduje zaznaczenia lub zaznacza całą stronę jako obraz, warstwa tekstowa została odrzucona i pozostaje tylko wygląd.
Spróbuj naprawić plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Metoda 1: Sprawdzanie ukrytej warstwy tekstu za spłaszczonym obrazem
W programie Acrobat Pro otwórz spłaszczony plik PDF i przejdź do opcji Narzędzia, Edycja treści, Edytuj tekst i obrazy. Kliknij widoczny obszar tekstowy. Jeśli program Acrobat wyświetli ramkę ograniczającą wokół tekstu i umożliwi edycję, za spłaszczonym obrazem znajduje się warstwa tekstowa. Tekst jest obecny w danych pliku, nawet jeśli podczas normalnego przeglądania może nie być widoczny jako tekst do zaznaczenia.
Jeśli tekst jest obecny, wyodrębnij go za pomocą funkcji Eksportuj plik PDF do tekstu programu Acrobat Pro. Wyodrębniony tekst może zawierać oryginalną treść, nawet jeśli strona wizualna wygląda na spłaszczoną. Skopiuj wyodrębniony tekst i porównaj go z próbką oryginalnej treści. Jeśli tekst się zgadza, oznacza to, że oryginalna warstwa tekstowa została pomyślnie odzyskana ze spłaszczonego pliku.
Patrząc na to szerzej, w rzeczywistych scenariuszach, jeśli program Acrobat nie może znaleźć tekstu do edycji, warstwa tekstowa została odrzucona podczas spłaszczania. Tekst wizualny na stronie składa się z pikseli spłaszczonego obrazu, a nie z kodów znaków. Odzyskiwanie poprzez wyodrębnienie tekstu nie jest możliwe, ponieważ nie ma danych tekstowych do wyodrębnienia.
Metoda 2: Użycie OCR do odtworzenia utraconej warstwy tekstowej
Jeśli oryginalna warstwa tekstowa została odrzucona podczas spłaszczania, OCR udostępnia ścieżkę do jej odtworzenia. Uruchom OCR na spłaszczonym pliku PDF, korzystając z funkcji rozpoznawania tekstu programu Acrobat Pro. Silnik OCR analizuje obraz pikselowy każdej strony, identyfikuje kształty znaków i tworzy nową warstwę tekstową z rozpoznanymi znakami.
Rozpatrując to szeroko, w praktyce warstwa tekstowa odtworzona za pomocą OCR nie jest tekstem oryginalnym. OCR wprowadza błędy rozpoznawania, szczególnie w przypadku małego tekstu, nietypowych czcionek lub tekstu na skomplikowanym tle. Odtworzony tekst będzie dokładny w przybliżeniu od 95 do 99 procent w przypadku czystych, standardowych dokumentów i będzie mniej dokładny w przypadku dokumentów o wymagającej typografii lub układzie.
Po OCR porównaj rozpoznany tekst ze znaną próbką oryginalnej treści, jeśli jest dostępna. Popraw ręcznie błędy OCR lub zaakceptuj odtworzoną warstwę tekstową jako przybliżenie oryginału. Wynik OCR można wykorzystać do wyszukiwania i wyodrębniania tekstu, ale może zawierać błędy wymagające weryfikacji przed wykorzystaniem tekstu do celów prawnych, finansowych lub regulacyjnych.
Sprawdzanie tekstu w strukturze pliku PDF
Aby ostatecznie sprawdzić, czy w spłaszczonym pliku PDF znajdują się dane tekstowe, przeanalizuj surową strukturę pliku. Otwórz plik PDF w edytorze tekstu obsługującym pliki binarne, takim jak VS Code lub Notepad++. Wyszukaj rozpoznawalne ciągi tekstowe z oryginalnej treści dokumentu. Jeśli w danych pliku znajdują się ciągi tekstowe, warstwa tekstowa istnieje, nawet jeśli nie jest dostępna za pośrednictwem interfejsu czytnika plików PDF.
To podejście wymaga pewnej znajomości wewnętrznej struktury PDF. Tekst w pliku PDF jest przechowywany w znacznikach BT i ET, które oznaczają początek i koniec obiektów tekstowych. Pomiędzy tymi znacznikami wyświetlane są kody znaków z poleceniami pozycjonowania. Znalezienie znaczników BT i ET zawierających rozpoznawalny tekst wskazuje, że dane tekstowe przetrwały spłaszczenie.
Z praktycznego punktu widzenia, w rzeczywistych scenariuszach, jeśli w danych pliku nie zostaną znalezione żadne ciągi tekstowe, operacja spłaszczania całkowicie zrasteryzowała zawartość. Strony zawierają obrazy i nie zawierają żadnych możliwych do odzyskania informacji tekstowych. OCR to jedyna dostępna ścieżka tworzenia warstwy tekstowej.
Zapobieganie utracie warstwy tekstu w przyszłych operacjach spłaszczania
Podczas spłaszczania pliku PDF, który musi zachować warstwę tekstową, użyj ustawień zachowujących ukryty tekst. W programie Acrobat Pro narzędzie Podgląd spłaszczania zawiera pole wyboru umożliwiające zachowanie informacji o nadruku i kolorach dodatkowych, co pośrednio pomaga zachować dane tekstowe. Narzędzie Preflight oferuje poprawki spłaszczające, które wyraźnie zachowują tekst.
Najbezpieczniejszym podejściem jest zapisanie niespłaszczonej kopii pliku PDF przed spłaszczeniem. Niespłaszczona kopia zachowuje wszystkie elementy interaktywne, adnotacje i warstwy tekstowe. Rozprowadź spłaszczoną wersję. Zarchiwizuj niespłaszczony oryginał. Jeśli kiedykolwiek zajdzie potrzeba odzyskania, oryginał zapewnia pełne dane źródłowe.
Patrząc szerzej, w przypadku dokumentów krytycznych w obiegach dokumentów należy przetestować ustawienia spłaszczania na kopii przed zastosowaniem ich do oryginału. Sprawdź, czy tekst można odzyskać po spłaszczeniu. Dostosuj ustawienia, jeśli odzyskiwanie nie powiedzie się. Etap testowania wydłuża przepływ pracy o kilka minut i zapobiega trwałej utracie tekstu.
Korzystanie z inspekcji wstępnej do wykrywania i wyodrębniania ukrytych warstw tekstu
Narzędzie Acrobat Pro Preflight zawiera profile zaprojektowane specjalnie do analizy struktury treści PDF. Raport Inwentarz zawiera listę wszystkich obiektów tekstowych znajdujących się w pliku, łącznie z tymi, które nie są widoczne podczas normalnego przeglądania. Uruchomienie tego raportu na spłaszczonym pliku PDF pozwala sprawdzić, czy dane tekstowe przetrwały proces spłaszczania.
Jeśli raport inspekcji wstępnej identyfikuje obiekty tekstowe, użyj poprawki Eksportuj cały tekst, aby wyodrębnić je do osobnego pliku. Wyodrębniony tekst można następnie porównać z widoczną zawartością strony, aby określić, jaka część oryginalnego tekstu została zachowana oraz czy jest dokładna i kompletna.
Odzyskiwanie tekstu z częściowo spłaszczonych plików PDF
Niektóre operacje spłaszczania wpływają tylko na określone elementy strony, pozostawiając inne nienaruszone. Pola formularza mogą zostać spłaszczone, a treść pozostaje w postaci znaków do wyboru. Adnotacje mogą zostać spłaszczone, gdy tekst strony podstawowej pozostanie zachowany. Zbadaj każdy typ elementu niezależnie, aby określić, co zostało spłaszczone, a co zachowane.
Pod szerokim kątem, w obiegach dokumentów, w przypadku częściowo spłaszczonych dokumentów wyodrębnij pozostały tekst z niespłaszczonych fragmentów i połącz go z wynikami OCR ze spłaszczonych fragmentów. Podejście hybrydowe maksymalizuje odzyskiwanie tekstu poprzez wykorzystanie oryginalnego tekstu, jeśli jest dostępny, i tekstu zrekonstruowanego za pomocą OCR w przypadku utraty oryginału.
Kiedy uznać, że odzyskanie nie jest możliwe
W takim przypadku, jeśli w strukturze pliku nie ma danych tekstowych, jeśli program Acrobat nie może znaleźć tekstu nadającego się do edycji lub jeśli OCR generuje niedokładne wyniki, nie będzie można odzyskać oryginalnej warstwy tekstowej. Zaakceptuj ten wniosek i zajmij się konserwacją tego, co pozostało, zamiast inwestować więcej czasu w próby naprawy.
Udokumentuj próbę odzyskania zdrowia i jej wynik. Zwróć uwagę na użyte narzędzia, wypróbowane metody i wyciągnięte wnioski. Dokumentacja służy przyszłym opiekunom dokumentów, którzy mogą mieć dostęp do lepszych narzędzi do odzyskiwania danych i powinni rozumieć, jakie próby podjęto wcześniej.
Długoterminowa strategia archiwizacji spłaszczonych dokumentów
Spłaszczone pliki PDF są często tworzone specjalnie do celów archiwalnych, ponieważ usuwają interaktywne zależności. Podczas archiwizowania spłaszczonych dokumentów, jeśli to możliwe, przechowuj niespłaszczony oryginał obok spłaszczonej wersji. Oryginał zachowuje pełną strukturę dokumentu. Wersja spłaszczona zapewnia stabilny format archiwalny.
W przypadku dokumentów, które istnieją tylko w wersji spłaszczonej, uruchom OCR, aby utworzyć warstwę tekstową i osadzić ją w pliku PDF. Tekst OCR może nie jest doskonały, ale umożliwia przyszłe wyszukiwanie i wyodrębnianie tekstu, co w innym przypadku byłoby niemożliwe. Warstwa OCR stanowi pomost pomiędzy spłaszczonym obrazem a przyszłymi potrzebami analizy dokumentu.
Automatyczne wykrywanie spłaszczenia zbiorów dokumentów
Organizacje zarządzające dużymi zbiorami dokumentów korzystają z automatycznego wykrywania spłaszczonych plików PDF. Skrypt otwierający każdy plik PDF, sprawdzający obecność możliwego do wybrania tekstu i oznaczający pliki, w których brakuje tekstu, identyfikuje dokumenty wymagające przetwarzania OCR. Automatyczne skanowanie zapobiega cichemu przedostawaniu się spłaszczonych dokumentów do archiwum bez przeszukiwalnych warstw tekstowych.
Zintegruj wykrywanie spłaszczeń z przepływem pracy przyjmowania dokumentów. Gdy nowy plik PDF trafi do systemu, sprawdź obecność tekstu. Jeśli brakuje tekstu, kieruj dokument do kolejki przetwarzania OCR, zanim dotrze do archiwum. Automatyczne wykrywanie i korygowanie zapewnia możliwość przeszukiwania każdego zarchiwizowanego dokumentu.
Spróbuj naprawić plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
