Tips & Tricks

Jak naprawić plik PDF otwierany z zniekształconym lub zaszyfrowanym tekstem

Plik PDF wyświetlający zniekształcony tekst, losowe symbole, rzędy pustych kwadratów lub ciągi bezsensownych znaków może wyglądać jak uszkodzony plik, którego w praktyce nie da się odzyskać. Dokument otwiera się bez komunikatów o błędach, liczba stron wydaje się prawidłowa, a wszelkie obrazy i grafiki wyświetlają się normalnie, ale same słowa zostały zastąpione czymś całkowicie nieczytelnym. Ten wzorzec zwykle sygnalizuje problem z kodowaniem czcionek, a nie uszkodzenie pliku strukturalnego, co jest dobrą wiadomością, ponieważ problemy z czcionkami często można naprawić bez specjalistycznych narzędzi do odzyskiwania danych lub usług naprawy plików metodą kryminalistyczną. Podstawowa treść może nadal znajdować się w pliku, zakodowana w sposób, którego przeglądarka plików PDF nie może zinterpretować z powodu brakujących lub niedopasowanych danych czcionek.

How to Repair a PDF That Opens With Garbled or Scrambled Text

Diagnozowanie kodowania czcionek a rzeczywistego uszkodzenia pliku

Pierwszym krokiem diagnostycznym jest określenie, czy problem ma swoje źródło w kodowaniu czcionek, czy w samej strukturze pliku PDF. Problem z kodowaniem czcionek powoduje systematyczne i spójne zniekształcenia w całym dokumencie. Każde wystąpienie litery A może stać się pustym kwadratem lub cały tekst konsekwentnie pojawia się jako losowe znaki akcentowane z innego alfabetu, ale wzór się powtarza. Prawdziwe uszkodzenie pliku powoduje niespójne zachowanie: strony, które w ogóle nie są renderowane, komunikaty o błędach podczas próby otwarcia pliku lub sekcje dokumentu, które są całkowicie puste, podczas gdy inne sekcje są wyświetlane poprawnie. Strony, które doskonale renderują obrazy, ale wyświetlają zniekształcony tekst, zdecydowanie wskazują na problemy z czcionkami, a nie na uszkodzenia strukturalne.

Otwórz plik PDF w co najmniej dwóch różnych przeglądarkach, aby potwierdzić diagnozę. Jeśli plik wyświetla się poprawnie w programie Adobe Acrobat Reader, ale nie w przeglądarce opartej na przeglądarce, takiej jak Chrome lub Edge, najprawdopodobniej przeglądarka ta nie obsługuje określonego formatu czcionki osadzonej używanego w pliku PDF. Jeśli plik wyświetla się poprawnie w przeglądarce Chrome, ale nie w Podglądzie na Macu, Podgląd może nie obsługiwać określonego schematu kodowania czcionek. Jeśli w każdej przeglądarce testowanej w różnych systemach operacyjnych plik wyświetla zniekształcony tekst, oznacza to, że dane czcionek w samym pliku PDF są uszkodzone lub ich brakuje i konieczna jest operacja Napraw PDF, która zajmie się zasobami czcionek.

WukongPDF

Spróbuj naprawić plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Ponowne osadzanie brakujących lub uszkodzonych czcionek

Kiedy plik PDF odwołuje się do czcionki, która nie jest osadzona w pliku i nie jest zainstalowana w systemie przeglądania, przeglądarka plików PDF zmuszona jest zastąpić inną dostępną czcionkę. To podstawienie często powoduje nieprawidłowe wyrównanie znaków, ponieważ czcionka zastępcza ma inną szerokość znaków, parametry odstępów i położenie glifów niż czcionka oryginalna. Tekst wygląda jak pomieszane lub losowe symbole, ponieważ kody znaków przechowywane w pliku PDF są odwzorowywane na zupełnie inne glify w czcionce zastępczej niż te, które zamierzył autor dokumentu. Rozwiązaniem jest ponowne osadzenie prawidłowych czcionek w pliku PDF, aby widz nie musiał już zgadywać.

Otwórz plik PDF w narzędziu, które może sprawdzać i modyfikować zasoby czcionek na poziomie dokumentu. Sprawdź spis czcionek, aby zobaczyć, do jakich czcionek odwołuje się dokument i czy każda z nich jest całkowicie osadzona, częściowo osadzona jako podzbiór zawierający tylko użyte znaki, czy też jest wymieniona jako wcale nie osadzona. Jeśli czcionka jest wyświetlana jako nie osadzona, należy albo zainstalować dokładnie tę czcionkę w systemie i ponownie zapisać plik PDF z włączoną opcją osadzania wszystkich czcionek, albo skorzystać z narzędzia PDF Napraw PDF, które może zlokalizować i osadzić wymagane dane czcionek z własnej licencjonowanej biblioteki czcionek. Popularne czcionki systemowe, takie jak Arial, Times New Roman, Helvetica i Courier, są dostępne w większości bibliotek czcionek i można je osadzać bez ograniczeń licencyjnych.

Korzystanie z techniki drukowania do pliku PDF w celu szybkiego odzyskiwania

Jeśli zniekształcony tekst jest spowodowany kodowaniem czcionek, które jedna konkretna przeglądarka obsługuje poprawnie, a inne nie, najszybsze praktyczne rozwiązanie polega na wykorzystaniu tej jednej działającej przeglądarki. Otwórz plik PDF w dowolnej przeglądarce, która poprawnie wyświetla tekst na ekranie. Naciśnij Ctrl-P lub Command-P, aby otworzyć okno dialogowe drukowania i wybierz opcję Microsoft Print to PDF lub Save as PDF jako drukarkę docelową. Potok drukowania rasteryzuje lub ponownie koduje tekst wyświetlany na ekranie i osadza go w zupełnie nowym pliku PDF przy użyciu standardowych, powszechnie obsługiwanych czcionek i kodowania zrozumiałego dla każdej nowoczesnej przeglądarki plików PDF bez konieczności specjalnej obsługi czcionek.

Ta metoda tworzy kopię Napraw plik PDF z czystym, czytelnym tekstem, który jest wyświetlany spójnie wszędzie, ale przed przystąpieniem do tej metody należy zrozumieć ważny kompromis. Wydrukowany plik PDF zazwyczaj traci możliwość zaznaczania tekstu, wyszukiwania i wszelkich interaktywnych elementów formularzy. Tekst skutecznie staje się częścią obrazu strony. W przypadku dokumentu, który wystarczy przeczytać na ekranie i być może raz wydrukować, jest to całkowicie akceptowalne rozwiązanie, które zajmuje kilka sekund. W przypadku dokumentu, który po naprawie musi nadal umożliwiać przeszukiwanie, wybieranie lub edytowanie, wypróbuj najpierw metodę osadzania czcionek i zarezerwuj drukowanie do pliku PDF jako opcję zastępczą.

Konwersja pliku PDF w formacie pośrednim

Gdy osadzanie czcionek nie rozwiąże problemu, a drukowanie do pliku PDF traci zbyt wiele funkcji dokumentu, konwersja pliku PDF na format pośredni może usunąć uszkodzone kodowanie, zachowując tekst jako rzeczywisty. Eksportuj plik PDF do dokumentu programu Word za pomocą konwertera plików PDF na Word. Proces konwersji odczytuje strumień zawartości PDF i wyprowadza rozpoznany tekst do nowego formatu, który wykorzystuje własną obsługę i kodowanie czcionek programu Word, całkowicie niezależnie od tego, co zostało uszkodzone w oryginalnym pliku PDF. Otwórz powstały plik Word, potwierdź, że cały tekst jest poprawnie czytany, wprowadź niezbędne poprawki w formatowaniu, a następnie wyeksportuj go z powrotem do pliku PDF z włączoną funkcją osadzania czcionek.

Obie strony programu Word zastępują zepsute kodowanie czystym, zgodnym ze standardami, ale złożone układy z wieloma kolumnami, precyzyjnym pozycjonowaniem lub osadzoną grafiką wektorową mogą nie przetrwać konwersji idealnie. Poniższa tabela porównuje trzy podejścia do naprawy pod kątem czynników mających znaczenie przy wyborze metody:

MetodaTekst do wyboruUkład zachowanyPrędkość
Ponownie osadź czcionkiTakTakUmiarkowany
Wydrukuj do pliku PDFNIETakSzybko
PDF do Worda do PDFTakCzęściowyPowolny

Radzenie sobie z problemami z kodowaniem czcionek Unicode i CID

W plikach PDF utworzonych w alfabecie innym niż łaciński, takim jak chiński, japoński, koreański, arabski lub cyrylica, czasami wyświetlany jest zniekształcony tekst, szczególnie gdy czcionka korzysta z kodowania CID (identyfikator znaków), a przeglądarka nie może zmapować numerycznych identyfikatorów CID z powrotem na odpowiadające im znaki Unicode. Dzieje się tak często w przypadku starszych plików PDF generowanych przez oprogramowanie do skanowania lub starsze systemy publikowania, w których osadzone są czcionki przy użyciu tabel kodowania wcześniejszych niż Unicode, zaprojektowanych zanim Unicode stał się uniwersalnym standardem. Na przykład plik PDF z japońskiego skanera z 2005 roku może używać czcionki CID, której współczesne przeglądarki nie są w stanie zinterpretować bez oryginalnego pliku CMAP specyficznego dla dostawcy.

Specjalistyczne narzędzia PDF Fix PDF, które wyraźnie obsługują mapowanie CID na Unicode, mogą zrekonstruować prawidłowe powiązania znaków. Narzędzia te odczytują surowe kody CID z danych czcionek i osadzonej tabeli CMAP, jeśli jest obecna, w celu odbudowania mapowania Unicode. Proces ten jest zautomatyzowany w narzędziach przeznaczonych do naprawy czcionek PDF, wymagając jedynie przesłania pliku i pobrania poprawionej wersji. W przypadku plików PDF zawierających języki wschodnioazjatyckie wybierz narzędzie do naprawy, które w swoim zestawie funkcji wyraźnie wymienia obsługę czcionek CJK, ponieważ ogólne narzędzia do naprawy czcionek przeznaczone głównie dla alfabetów łacińskich mogą nie zawierać danych CMAP ani modeli rozpoznawania glifów dla tych systemów pisma.

Zapobieganie zniekształceniom tekstu w tworzonych plikach PDF

Jeśli regularnie tworzysz pliki PDF, które docierają do odbiorców ze zniekształconym tekstem, główną przyczyną prawie zawsze są ustawienia osadzania czcionek w oprogramowaniu generującym plik PDF. Podczas eksportowania z programów Word, PowerPoint, InDesign lub narzędzia do projektowania znajdź okno dialogowe opcji eksportu lub zapisywania pliku PDF i zaznacz pole wyboru Osadź czcionki lub Osadź wszystkie czcionki. Niektóre aplikacje oferują dodatkowe pole wyboru Osadź tylko znaki używane w dokumencie, co powoduje utworzenie mniejszego pliku poprzez podustawienie czcionek, ale może powodować problemy z wyświetlaniem, jeśli plik PDF będzie później edytowany lub łączony z inną zawartością. Aby uzyskać maksymalną kompatybilność między platformami, osadzaj całą czcionkę, a nie jej podzbiór, gdy tylko zwiększenie rozmiaru pliku jest akceptowalne.

Platformy takie jak WukongPDF obsługują konwersję Format PDF z domyślnie włączonym kompleksowym osadzaniem czcionek, co pozwala uniknąć problemów z kodowaniem wynikających z zależności czcionek specyficznych dla systemu, które działają tylko na komputerze twórcy. Podczas wysyłania pliku PDF, który musi poprawnie wyświetlać się w różnych systemach operacyjnych, urządzeniach i aplikacjach przeglądarek, szybki test sprawdzający polega na otwarciu pliku w przeglądarce plików PDF opartej na przeglądarce, ponieważ przeglądarki te nie mają dostępu do lokalnie zainstalowanych czcionek systemowych i natychmiast wykryją wszelkie problemy z osadzaniem czcionek, które w przeciwnym razie pozostałyby niezauważone, dopóki odbiorca nie zgłosi zniekształconego tekstu.

Kiedy zaakceptować fakt, że pliku PDF nie można naprawić

Pomimo zastosowania najlepszych technik naprawy niektóre pliki PDF uległy uszkodzeniom, których w praktyce nie da się odzyskać. Jeśli próbowałeś ponownie osadzić czcionki, wydrukować do nowego pliku PDF z każdej dostępnej przeglądarki i przeprowadzić konwersję w obie strony za pomocą programu Word, a tekst pozostaje zniekształcony, plik może mieć uszkodzenie strukturalne w samym strumieniu zawartości, a nie tylko problem z kodowaniem czcionek. W tym momencie najbardziej produktywnym kursem jest zwykle zlokalizowanie oryginalnego dokumentu źródłowego i wygenerowanie z niego nowego pliku PDF.

Zachowaj uszkodzony plik do celów referencyjnych, ponieważ obrazy i struktura strony mogą nadal być częściowo nienaruszone, nawet jeśli nie można odzyskać tekstu. Jeśli dokument pochodzi ze skanera, ponowne zeskanowanie oryginalnego dokumentu papierowego pozwoli uzyskać czysty plik PDF z prawidłowym kodowaniem tekstu. Jeśli dokument został utworzony na podstawie pliku Word lub aplikacji do projektowania, poproś pierwotnego autora o jego ponowne wyeksportowanie z wyraźnie włączoną funkcją osadzania czcionek. Świeży eksport z dokumentu źródłowego omija wszystkie problemy z kodowaniem występujące w uszkodzonej kopii i pozwala uzyskać czysty plik w czasie krótszym niż przy próbie dalszej naprawy.

WukongPDF

Spróbuj naprawić plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →