Others

Dlaczego tekstu nie można przeszukiwać po konwersji pliku PDF na Word, a następnie z powrotem na format PDF

Masz plik PDF z możliwością przeszukiwania. Konwertujesz go do programu Word, aby wprowadzić zmiany. Zapisujesz edytowany dokument z powrotem w formacie PDF. Nowy plik PDF wygląda identycznie jak oryginał, ale wyszukiwanie słowa, o którym wiesz, że znajduje się w dokumencie, nie powoduje zwrócenia żadnych wyników. Tekst, który można było przeszukiwać w oryginalnym pliku PDF, jest niewidoczny dla funkcji wyszukiwania w nowym pliku PDF. Podróż w obie strony przez program Word pozbawiła tekst możliwości wyszukiwania.

Konwersja PDF do Word, a następnie ponowna konwersja Word do PDF to typowy proces edycji plików PDF, ale każdy etap konwersji stwarza możliwość uszkodzenia warstwy tekstowej. Tekst powracający w formacie PDF może być przechowywany inaczej niż oryginał, przechowywany w postaci konturów wektorowych zamiast kodów znakowych lub rasteryzowany w obrazy. Każdy z tych wyników tworzy plik PDF, w którym tekst jest widoczny, ale nie można go przeszukiwać.

Why Does Text Become Unsearchable After Converting a PDF to Word and Then Back to PDF

Jak tekst przetrwał lub został utracony podczas konwersji formatu

W oryginalnym pliku PDF z możliwością przeszukiwania tekst jest przechowywany w postaci kodów znaków odwzorowanych na glify czcionek. Znak H jest przechowywany jako kod ASCII 72, który informuje czytnik PDF, aby wyświetlił glif H z osadzonej czcionki. Funkcja wyszukiwania skanuje kody znaków wyszukiwanego hasła i podświetla odpowiednie pozycje na stronie. To przechowywanie oparte na kodzie znaków umożliwia przeszukiwanie tekstu.

Kiedy plik PDF jest konwertowany do formatu Word, konwerter wyodrębnia kody znaków i zapisuje je w dokumencie programu Word jako tekst edytowalny. Tekst w programie Word można przeszukiwać, ponieważ program Word przechowuje go jako kody znaków Unicode. Konwersja z formatu PDF do programu Word zachowuje możliwość wyszukiwania, o ile konwerter prawidłowo wyodrębnia kody znaków.

Kiedy edytowany dokument programu Word zostanie ponownie zapisany w formacie PDF, aparat programu Word PDF musi zdecydować, w jaki sposób zapisać tekst. Domyślne ustawienia przechowują tekst jako kody znaków z osadzonymi czcionkami, zachowując możliwość wyszukiwania. Jednak niektóre funkcje programu Word i ustawienia pliku PDF powodują, że tekst jest zapisywany jako kontury wektorowe lub rasteryzowany jako obrazy.

Efekty tekstowe w programie Word, takie jak cienie tekstu, odbicia, poświata i obrót 3D, powodują, że aparat Word PDF konwertuje zmieniony tekst na obrazy. Tekst wygląda poprawnie wizualnie, ale nie zawiera kodów znaków, które mogłaby znaleźć funkcja wyszukiwania. Właściwość PDF Możliwość wyszukiwania zostanie utracona w przypadku każdego tekstu z zastosowanymi efektami wizualnymi.

WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Jak zachować możliwość wyszukiwania tekstu w obie strony

Przed zapisaniem edytowanego dokumentu Word w formacie PDF sprawdź ustawienia zapisywania. W programie Word otwórz Plik, Opcje, Zapisz i upewnij się, że zaznaczona jest opcja Osadź czcionki w pliku. To ustawienie gwarantuje, że czcionki będą osadzane jako tekst znakowy, a nie konwertowane na kontury lub obrazy.

Unikaj stosowania efektów tekstowych do treści, które muszą pozostać przeszukiwalne. Zamiast efektów cienia, odbicia i blasku używaj pogrubienia, kursywy i formatowania kolorów. Wizualne rozróżnienie można osiągnąć bez poświęcania możliwości wyszukiwania.

WukongPDF udostępnia narzędzia PDF Converter, które mogą przetwarzać pliki PDF w celu optymalizacji przechowywania tekstu. Jeśli plik PDF został utworzony z tekstem, którego nie można przeszukiwać, OCR może dodać warstwę tekstową z możliwością przeszukiwania za istniejącą treścią wizualną.

Weryfikacja możliwości wyszukiwania po ponownej konwersji

Po zapisaniu dokumentu programu Word w formacie PDF otwórz plik PDF i przetestuj funkcję wyszukiwania. Wyszukaj słowo pojawiające się na każdej stronie. Jeśli jakakolwiek strona nie zwraca żadnych wyników dla wyrazu, który jest w widoczny sposób obecny, oznacza to, że na tej stronie znajduje się tekst, którego nie można przeszukać. Test wyszukiwania zajmuje kilka sekund i wychwytuje utratę możliwości wyszukiwania przed dystrybucją dokumentu.

Jeśli utraciłeś możliwość wyszukiwania, uruchom OCR na ponownie przekonwertowanym pliku PDF, aby dodać warstwę tekstową z możliwością przeszukiwania. OCR rozpoznaje widoczny tekst i tworzy za nim kody znaków. Funkcja wyszukiwania może następnie znaleźć tekst za pomocą kodów znaków wygenerowanych przez OCR. Jest to naprawa post-hoc, a nie zapobieganie, ale przywraca możliwość wyszukiwania w nieprzeszukiwalnym pliku PDF.

W przypadku dokumentów wymagających gwarantowanej możliwości wyszukiwania należy całkowicie unikać przesyłania plików PDF do Word do PDF. Edytuj oryginalny dokument źródłowy, plik Word, plik InDesign, dokument Google i eksportuj nowy plik PDF. Pojedynczy eksport ze źródła do formatu PDF zapewnia możliwość wyszukiwania bez pośrednich etapów konwersji.

Tryb zgodności z programem Word wpływa na wydruk w formacie PDF. Dokumenty zapisane w starszym formacie DOC zamiast DOCX mogą wykorzystywać inne metody przechowywania tekstu, które wpływają na możliwość wyszukiwania plików PDF. Zapisz dokumenty w bieżącym formacie DOCX przed eksportem do formatu PDF.

Tekst w polach tekstowych programu Word może być rasteryzowany podczas eksportu do pliku PDF, w zależności od formatowania pola tekstowego. Pola tekstowe z efektami wypełnienia, obrotem lub zmianami kierunku tekstu są częściej rasteryzowane niż zwykłe pola tekstowe.

Kiedy tekst jest rasteryzowany podczas eksportu do pliku PDF, staje się on obrazem tekstu, a nie zakodowanym tekstem. Obraz wyświetla się poprawnie, ale znaki to piksele, a nie kody. OCR może odzyskać tekst, ale tekst OCR może zawierać błędy rozpoznawania.

Opcje eksportu do pliku PDF w programie Word obejmują ustawienie tekstu bitmapowego, jeśli czcionki nie mogą być osadzone. To ustawienie rasteryzuje tekst używający czcionek z ograniczeniami dotyczącymi osadzania. Zapewnienie, że wszystkie czcionki umożliwiają osadzanie, zapobiega wymuszonej rasteryzacji.

Po konwersji w obie strony porównaj rozmiar pliku oryginalnego pliku PDF i ponownie przekonwertowanego pliku PDF. Znacznie większy, ponownie przekonwertowany plik PDF może wskazywać, że tekst został zrasteryzowany w obrazy, które zajmują więcej miejsca w pamięci niż tekst zakodowany.

Niektóre konwertery plików PDF na Word oferują tryb konwersji oparty na OCR dla zeskanowanych plików PDF i tryb wyodrębniania tekstu dla cyfrowych plików PDF. Użycie niewłaściwego trybu daje nieoczekiwane rezultaty. W cyfrowych plikach PDF należy wyodrębniać tekst, a nie OCR, aby zachować oryginalne kodowanie znaków.

W przypadku utraty możliwości wyszukiwania tekstu funkcja Znajdź w przeglądarce plików PDF nie zwraca żadnych wyników dla wyrazów, które są w widoczny sposób obecne. Wyszukiwanie na każdej stronie popularnych słów, takich jak lub i, pozwala szybko sprawdzić, czy cały dokument zawiera tekst, który można przeszukiwać.

W przypadku dokumentów, które muszą zapewniać możliwość przeszukiwania przez wiele cykli edycji, utwórz dokument główny w formacie edytowalnym, programie Word, Dokumentach Google lub InDesign, i traktuj plik PDF jako format dystrybucyjny tylko do odczytu. Wszystkie zmiany odbywają się w modelu głównym, a plik PDF jest odtwarzany na podstawie wzorca po każdym cyklu edycji.

Kontrolery dostępności mogą zweryfikować możliwość wyszukiwania tekstu i zidentyfikować strony zawierające tekst, którego nie można przeszukać. Uruchom kontrolę dostępności ponownie przekonwertowanego pliku PDF, aby upewnić się, że cały tekst jest zakodowany i dostępny.

Standard PDF/UA wymaga, aby cały tekst był zakodowany jako znaki Unicode, co zapewnia możliwość wyszukiwania i dostęp do czytnika ekranu. Eksportowanie do formatu PDF/UA z programu Word wymusza wymagania dotyczące kodowania tekstu, które zapewniają możliwość wyszukiwania.

Wybór konwertera plików PDF na Word wpływa na zachowanie tekstu. Konwertery, dla których wierność wizualna jest ważniejsza od możliwości edycji tekstu, mogą rasteryzować tekst zawierający nietypowe czcionki lub położenie. Konwertery, dla których priorytetem jest możliwość edycji tekstu, mogą generować wyniki, które można przeszukiwać.

Gdy tekst jest przechowywany w pliku PDF w postaci ligatur fi, fl, ffi, konwerter może podzielić ligaturę na osobne znaki lub zachować ją jako pojedynczy znak. Zachowanie funkcji wyszukiwania zależy od sposobu obsługi ligatury podczas konwersji.

Zapobieganie utracie możliwości wyszukiwania w przyszłych konwersjach

Tekst, który pierwotnie był wektorem w źródłowym pliku PDF, może zostać przekonwertowany na obrazy rastrowe podczas eksportu z programu Word do pliku PDF, jeśli dokument programu Word korzysta z takich funkcji, jak WordArt, SmartArt lub osadzone wykresy programu Excel. Funkcje te są renderowane jako obrazy w pliku wyjściowym PDF.

Ustawienia tworzenia plików PDF w programie Word obejmują opcję tworzenia zakładek na podstawie nagłówków. Ta opcja zachowuje strukturę dokumentu, ale nie wpływa na możliwość wyszukiwania tekstu. Zakładki i możliwość wyszukiwania to niezależne funkcje.

Testowanie możliwości wyszukiwania poprzez wyszukiwanie słowa występującego na każdej stronie, na przykład popularnego słowa w języku dokumentu, pozwala szybko zidentyfikować strony zawierające tekst, którego nie można przeszukać. Jeśli jakakolwiek strona nie zwraca żadnych wyników dla popularnego słowa, oznacza to, że na tej stronie występuje problem z kodowaniem tekstu.

Zrozumienie warunków, w których możliwość wyszukiwania tekstu zostaje utracona podczas konwersji z pliku PDF do Word na PDF, umożliwia twórcom dokumentów podejmowanie świadomych wyborów dotyczących przepływu pracy podczas edycji oraz zachowanie dostępności i możliwości znalezienia ich treści.

Zachowanie możliwości przeszukiwania tekstu za pomocą funkcji PDF do Word do PDF wymaga zwrócenia uwagi na ustawienia konwersji na każdym etapie i zrozumienia, które funkcje programu Word powodują rasteryzację tekstu, a nie kodowanie go jako znaki.

W przypadku dokumentów, w przypadku których wymagana jest możliwość wyszukiwania tekstu, ustanowienie przepływu pracy, który zachowuje oryginalnie zakodowany tekst przy każdej konwersji formatu, jest bardziej wydajne niż próba przywrócenia możliwości wyszukiwania po jego utracie.

Możliwość wyszukiwania tekstu to funkcja, którą użytkownicy uważają za oczywistą, dopóki jej nie zabraknie, a przywrócenie możliwości wyszukiwania w nieprzeszukiwalnym pliku PDF wymaga albo ponownego przetworzenia z oryginalnego źródła, albo uruchomienia OCR na stronach, których to dotyczy, w celu odtworzenia warstwy tekstowej.

Przejście z pliku PDF do Word na PDF to powszechny proces edycji, który stwarza wiele możliwości pogorszenia lub utraty kodowania tekstu, a zrozumienie każdego punktu ryzyka pomaga użytkownikom zachować możliwość wyszukiwania w całym procesie.

Możliwość wyszukiwania tekstu nie jest funkcją kosmetyczną, ale podstawową funkcją dokumentu, która wpływa na dostępność, łatwość wyszukiwania oraz możliwość wyodrębniania treści i ponownego jej wykorzystania do innych celów.

Wybór konwertera plików PDF na Word znacząco wpływa na wynik całej operacji, ponieważ konwertery zoptymalizowane pod kątem możliwości edycji tekstu dają więcej wyników umożliwiających przeszukiwanie niż te zoptymalizowane pod kątem wierności wizualnej.

Jeśli w trakcie podróży w obie strony utraci się możliwość wyszukiwania, OCR może przywrócić przeszukiwalną warstwę tekstową, ale tekst OCR będzie zawierał błędy rozpoznawania, które należy poprawić, aby dokument był w pełni wiarygodny.

W przypadku dokumentów, w przypadku których wymagana jest możliwość wyszukiwania, zachowanie oryginalnego pliku źródłowego i eksportowanie nowych plików PDF po każdym cyklu edycji jest bardziej niezawodne niż przeglądanie programu Word w obie strony.

Format PDF zachowuje tekst w zasadniczo inny sposób niż formaty edytorów tekstu, a każde tłumaczenie pomiędzy tymi reprezentacjami stwarza ryzyko utraty informacji w kodowaniu tekstu.

Etap w obie stronyRyzyko przeszukiwaniaŁagodzenie
PDF do Worda (wyodrębnianie)Niski, jeśli używany jest konwerter wyodrębniania tekstuUżyj konwertera z trybem wyodrębniania tekstu
Edycja w WordzieNic; Tekst programu Word zawsze można przeszukiwaćUnikaj efektów tekstowych (cień, poświata, 3D)
Word do pliku PDF (eksport)Średni; efekty powodują rasteryzacjęOsadzaj czcionki; unikaj wpływu na tekst, który można przeszukiwać
Weryfikacja poeksportowaNie dotyczySzukaj popularnych słów na każdej stronie
WukongPDF

Wypróbuj PDF do Worda

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →