Others

Dlaczego nie mogę edytować tekstu w moim pliku PDF

Why Cannot I Edit Text in My PDF

Dlaczego pliku PDF wyglądającego jak tekst nie można edytować

Otwierasz plik PDF, widzisz słowa na ekranie i zakładasz, że możesz je edytować. Kiedy klikniesz tekst i nic się nie stanie, lub gdy spróbujesz wpisać, a kursor się nie pojawi, odkryjesz, że plik PDF wyglądający jak dokument tekstowy w rzeczywistości nie jest dokumentem edytowalnym. To doświadczenie jest frustrująco częste, ponieważ pliki PDF mogą zawierać tekst w zasadniczo różnych formach, z których tylko niektóre można edytować.

Uruchomienie OCR na zeskanowanym pliku PDF dodaje warstwę tekstową z możliwością przeszukiwania i edytowania za każdym obrazem strony w dokumencie.

Konwersja z pliku PDF do formatu edytowalnego i z powrotem jest niezawodnym rozwiązaniem, gdy bezpośrednia edycja nie jest możliwa.

Edytor PDF może modyfikować tekst istniejący jako rzeczywiste obiekty tekstowe w pliku PDF, przy czym każdy znak jest reprezentowany jako wybieralny i modyfikowalny kod znaku. Nazywa się to tekstem natywnym lub tekstem aktywnym. Format PDF może także zawierać tekst, który istnieje jedynie w postaci obrazu, na przykład zeskanowanego dokumentu, którego tekst stanowi część fotografii strony. Tekstu opartego na obrazie nie można zaznaczać, wyszukiwać ani edytować, ponieważ plik PDF nie zawiera danych znakowych, a jedynie piksele, które przypadkowo tworzą kształt liter. Zanim dowiesz się, czy plik PDF można edytować, musisz wiedzieć, jaki typ tekstu zawiera.

Najszybszym testem jest próba zaznaczenia tekstu w pliku PDF. Kliknij i przeciągnij nad słowem. Jeśli tekst zostanie podświetlony podczas przeciągania, jest to tekst natywny i potencjalnie można go edytować. Jeśli nic nie jest podświetlone i kursor się nie zmienia, tekst jest oparty na obrazie i nie można go bezpośrednio edytować. Jeśli tekst jest podświetlony, ale wyróżnienie jest nierówne, oznacza to zaznaczenie niektórych słów i pominięcie innych, plik PDF zawiera mieszankę tekstu natywnego i tekstu, który istnieje tylko jako elementy wizualne, co jest częstą sytuacją w plikach PDF tworzonych przy użyciu starszego oprogramowania lub w wyniku połączenia wielu dokumentów źródłowych.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Częste powody, dla których nie można edytować tekstu w pliku PDF

Najczęstszym powodem jest to, że plik PDF jest dokumentem zeskanowanym. Plik PDF utworzony przez skanowanie stron papierowych za pomocą skanera płaskiego lub aplikacji aparatu w telefonie zawiera obrazy tekstu, a nie rzeczywiste znaki tekstowe. Mimo że możesz przeczytać słowa na ekranie, plik PDF nie zawiera edytowalnych danych tekstowych. Aby umożliwić edycję zeskanowanego pliku PDF, należy najpierw uruchomić funkcję OCR, aby rozpoznać tekst na obrazach i utworzyć niewidoczną warstwę tekstową za każdym obrazem strony. Po OCR tekst można przeszukiwać, a w wielu edytorach plików PDF można go edytować tak, jakby był tekstem natywnym.

Ograniczenia dotyczące haseł lub uprawnień to kolejna częsta przeszkoda w edycji. Plik PDF chroniony hasłem uprawnień można otwierać i przeglądać, ale uprawnienia mogą blokować edycję, kopiowanie lub drukowanie. Jeśli możesz otworzyć plik PDF i widzisz tekst, ale narzędzia edycji są wyszarzone lub wyświetla się komunikat o błędzie, sprawdź ustawienia zabezpieczeń dokumentu. W większości przeglądarek plików PDF panel Właściwości dokumentu lub Zabezpieczenia pokazuje, jakie uprawnienia są ograniczone. Jeśli edycja jest ograniczona i masz hasło uprawnień, możesz usunąć ograniczenia i włączyć edycję.

Plik PDF może zawierać tekst, który podczas tworzenia został przekonwertowany na kontury lub krzywe. Projektanci graficzni czasami konwertują tekst na kontury w aplikacjach takich jak Adobe Illustrator przed utworzeniem pliku PDF, aby zapewnić prawidłowe wyświetlanie czcionek niezależnie od tego, czy odbiorca ma je zainstalowane. Tekst przekonwertowany na kontury wygląda identycznie jak tekst natywny, ale składa się z kształtów wektorowych, a nie danych znakowych. Żadne narzędzie Edytuj PDF] nie umożliwia edycji tekstu z konturami jako tekstu, ponieważ informacje o znakach zostały odrzucone podczas konwersji do konturów.

Problemy z kodowaniem czcionek mogą sprawić, że tekstu nie będzie można edytować, nawet jeśli plik PDF zawiera natywne znaki tekstowe. Niektóre pliki PDF korzystają z niestandardowego kodowania czcionek, które w niestandardowy sposób odwzorowują kody znaków na glify. Narzędzie do edycji widzi kody znaków, ale nie może określić, które znaki reprezentują, więc odmawia ich edycji, aby uniknąć uszkodzenia tekstu. Ten problem występuje najczęściej w przypadku plików PDF generowanych przez specjalistyczne oprogramowanie, starsze systemy lub dokumenty korzystające ze skryptów innych niż łacińskie z niestandardową obsługą czcionek. Ponowny eksport pliku PDF z oryginalnej aplikacji z włączoną funkcją osadzania czcionek często rozwiązuje problem kodowania.

Jak umożliwić edycję zeskanowanego pliku PDF za pomocą OCR

Optyczne rozpoznawanie znaków to proces przekształcający obrazy tekstu w rzeczywisty tekst edytowalny. Nowoczesna technologia OCR zapewnia wysoką dokładność w przypadku czystych, dobrze oświetlonych skanów drukowanego tekstu przy użyciu popularnych czcionek i typowych rozmiarów. Uruchomienie OCR na zeskanowanym pliku PDF dodaje ukrytą warstwę tekstową za każdym obrazem strony, która zawiera rozpoznane znaki. Po zakończeniu OCR możesz wyszukiwać tekst w dokumencie i w większości edytorów PDF edytować rozpoznany tekst tak, jakby był oryginalnie natywny.

Jakość wyniku OCR zależy od jakości zeskanowanych obrazów. Skanowanie w wysokiej rozdzielczości przy 300 DPI przy równomiernym oświetleniu, płaskich stronach i ostrej ostrości zapewnia dokładność OCR przekraczającą 99 procent w przypadku standardowego drukowanego tekstu. Skanowanie w niskiej rozdzielczości przy 150 DPI z cieniami, zakrzywionymi stronami oprawionej książki lub obszarami nieostrymi powoduje niższą dokładność i wymaga większej ręcznej korekty po OCR. Skanowanie dokumentów z myślą o OCR, czyli płaskich stronach, dobrym oświetleniu i odpowiedniej rozdzielczości, sprawia, że proces edycji jest znacznie płynniejszy.

Większość edytorów PDF obsługujących OCR uwzględnia wybór języka w ramach ustawień rozpoznawania. Wybranie prawidłowego języka poprawia dokładność, ponieważ silnik OCR korzysta ze słowników specyficznych dla języka i danych o częstotliwości znaków w celu rozpoznawania niejednoznacznych znaków. Dokument w języku francuskim rozpoznany przy ustawieniu języka francuskiego daje lepsze wyniki niż ten sam dokument rozpoznany przy ustawieniu języka angielskiego. W przypadku dokumentów wielojęzycznych wybierz język podstawowy i ręcznie popraw wszelkie błędy we fragmentach języka dodatkowego.

Narzędzie OCR PDF WukongPDF przetwarza zeskanowane dokumenty w przeglądarce i zwraca plik PDF z przeszukiwalną i edytowalną warstwą tekstową. Silnik OCR obsługuje wiele języków i obsługuje popularne typy dokumentów, w tym listy, formularze, paragony i artykuły. Po OCR zeskanowany plik PDF, którego wcześniej nie można było edytować, staje się edytowalny, a rozpoznany tekst można wybierać, wyszukiwać i modyfikować.

Alternatywne metody, gdy bezpośrednia edycja plików PDF nie jest możliwa

Jeśli pliku PDF nie można bezpośrednio edytować, ponieważ jest to zeskanowany dokument bez dostępu do OCR lub ma ograniczenia bezpieczeństwa, których nie można usunąć, alternatywne przepływy pracy pozwalają osiągnąć ten sam wynik inną ścieżką. Przekonwertuj plik PDF na format edytowalny, taki jak Word lub Dokumenty Google, wprowadź zmiany w tym formacie i przekonwertuj edytowany dokument z powrotem na format PDF. Przeglądanie edytowalnego formatu trwa dłużej niż bezpośrednia edycja, ale działa w przypadku dowolnego pliku PDF, który można otworzyć i wyświetlić.

W przypadku dokumentów, które wymagają jedynie drobnych poprawek, takich jak poprawienie literówki w pojedynczym akapicie, pragmatycznym rozwiązaniem jest użycie narzędzi adnotacji pliku PDF do zakrycia nieprawidłowego tekstu białym prostokątem i wpisanie poprawionego tekstu na górze. Ta metoda tak naprawdę nie edytuje tekstu źródłowego ani struktury dokumentu, więc korekta oparta na adnotacjach jest niewidoczna dla narzędzi wyszukiwania i ułatwień dostępu, ale w przypadku szybkich poprawek wizualnych w dokumencie, który będzie drukowany lub oglądany jako obraz, daje akceptowalne wyniki.

W przypadku dokumentów wymagających obszernej edycji i których nie można edytować bezpośrednio, najbardziej niezawodnym podejściem jest powrót do oryginalnego dokumentu źródłowego, jeśli jest on dostępny.

Dokument programu Word, dokument Google Doc lub plik programu InDesign użyty do utworzenia pliku PDF zawiera edytowalny tekst, który można modyfikować i ponownie eksportować do nowego pliku PDF. Skontaktowanie się z twórcą dokumentu w celu uzyskania pliku źródłowego lub zlokalizowanie pliku źródłowego we własnych aktach jest często szybsze niż trud edytowania pliku PDF, który nie chce współpracować.

W niektórych plikach PDF, które wydają się zawierać tekst natywny, w rzeczywistości jest on przechowywany w taki sposób, że narzędzia do edycji nie mogą go modyfikować, mimo że tekst można przeszukiwać i zaznaczać. Taka sytuacja ma miejsce, gdy plik PDF ma poprawną warstwę tekstową, która umożliwia wyszukiwanie i zaznaczanie, ale kodowanie czcionki uniemożliwia narzędziu do edycji mapowanie edytowanych znaków z powrotem na właściwe glify wizualne. Narzędzie do edycji może odczytać tekst, ale nie może zapisać zmian z powrotem w dokumencie bez potencjalnego uszkodzenia mapowania znaków. Ta obrona przed edycją jest czasami zamierzona ze strony twórcy dokumentu.

Rozpowszechnienie się narzędzi do edycji plików PDF ułatwiło edycję plików PDF jak nigdy dotąd, ale spowodowało także zamieszanie w kwestii tego, czym jest edycja. Dodanie adnotacji tekstowej na górze strony PDF nie jest tym samym, co edytowanie tekstu znajdującego się pod spodem. Zastąpienie obrazu na stronie PDF nie jest tym samym, co edytowanie tekstu opisującego obraz. Zrozumienie różnicy pomiędzy zmianami opartymi na adnotacjach, które nakładają nową treść na istniejącą stronę, a edycją prawdziwego tekstu, która modyfikuje rzeczywistą zawartość tekstu w strukturze pliku PDF, pomaga wybrać odpowiednie narzędzie i właściwe podejście do każdego zadania edycyjnego.

W przypadku dokumentów, które są odporne na wszelkie próby edycji i zawierają informacje, których aktualizacja jest krytyczna, opcją nuklearną jest odtworzenie dokumentu od zera. Użyj pliku PDF jako odniesienia wizualnego i wpisz ponownie treść do edytora tekstu lub aplikacji do projektowania, wprowadzając zmiany w procesie odtwarzania. Takie podejście jest pracochłonne, ale pozwala uzyskać czysty, w pełni edytowalny dokument bez pozostałych problemów z formatowaniem, problemami z czcionkami czy artefaktami konwersji. Odtworzenie dokumentu z pliku PDF zajmuje czas proporcjonalny do długości i złożoności dokumentu, a w przypadku krótkich dokumentów wymagających znacznej edycji może być w rzeczywistości szybsze niż zmaganie się z niechętnymi do współpracy narzędziami do edycji plików PDF.

WukongPDF

Wypróbuj opcję Edytuj plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →