Plik PDF wypełniony zdjęciami, wykresami, logo i obrazami dekoracyjnymi w wysokiej rozdzielczości może być niepraktyczny w przypadku obiegów pracy skoncentrowanych na tekście. Jeśli potrzebne są tylko słowa, usunięcie wszystkich Obrazy PDF i wyeksportowanie wersji tekstowej powoduje utworzenie znacznie mniejszego pliku zawierającego samą treść tekstową dokumentu. Pytanie brzmi, czy wynikowy wynik zawierający wyłącznie tekst jest kompletny i nadaje się do zamierzonego celu.
Krótka odpowiedź brzmi „tak” w przypadku tekstowych plików PDF, w których tekst istnieje w postaci wybieralnych znaków. W przypadku zeskanowanych plików PDF, w których tekst jest częścią obrazu, usuwanie obrazów powoduje usunięcie wszystkiego, łącznie z tekstem. Kluczowe rozróżnienie dotyczy plików PDF z natywnym tekstem, w których tekst i obrazy stanowią oddzielne warstwy, oraz plików PDF opartych na obrazach, w których cała strona jest obrazem bez warstwy tekstowej.
Wyodrębnianie PDF do tekstu usuwa obrazy, zachowując jednocześnie treść tekstową. W przypadku dokumentów, w których tekst ma podstawowe znaczenie, a obrazy mają charakter uzupełniający, doskonale sprawdza się wydruk wyłącznie tekstowy. W przypadku dokumentów, w których obrazy przekazują istotne informacje, takich jak skany medyczne lub rysunki architektoniczne, wydruk wyłącznie tekstowy traci krytyczną zawartość.
Narzędzia do przetwarzania plików PDF WukongPDF obejmują usuwanie obrazów i wyodrębnianie tekstu.

Różnica między tekstem natywnym a plikami PDF opartymi na obrazach
Natywny plik PDF przechowuje tekst w postaci kodów znaków umieszczonych na stronie. Obrazy to oddzielne obiekty nałożone lub umieszczone pomiędzy blokami tekstu. Po usunięciu obrazów z natywnego pliku PDF tekst pozostaje nienaruszony i w pełni czytelny. Struktura dokumentu, taka jak nagłówki, akapity i podziały stron, zostaje zachowana. Znikają jedynie obrazy dekoracyjne i ilustracyjne.
Plik PDF oparty na obrazie przechowuje całą stronę jako obraz rastrowy, zwykle pochodzący ze skanera lub zrzutu ekranu. Brak znaków tekstowych do zachowania. Usunięcie obrazów z pliku PDF opartego na obrazach powoduje usunięcie wszystkiego i utworzenie pustego dokumentu. W przypadku zeskanowanych plików PDF poddanych obróbce OCR za obrazem znajduje się niewidoczna warstwa tekstowa. Usuwanie obrazu usuwa widoczną zeskanowaną stronę, ale zachowuje tekst OCR, który może zawierać błędy rozpoznawania.
Aby określić, jaki typ pliku PDF posiadasz, otwórz go w dowolnym czytniku plików PDF i spróbuj zaznaczyć słowo tekstu. Jeśli możesz wybrać pojedyncze znaki, plik PDF będzie tekstem natywnym, a usuwanie obrazu zachowa tekst. Jeśli kliknięcie spowoduje wybranie całej strony jako jednego dużego bloku obrazu, plik PDF będzie oparty na obrazach, a usunięcie obrazów nie pozostawi niczego lub pozostawi jedynie warstwę tekstową OCR.
Wypróbuj opcję Kompresuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Metoda 1: Usuwanie obrazów za pomocą programu Acrobat Pro PDF Optimizer
Otwórz plik PDF w programie Acrobat Pro i przejdź do opcji Plik, Zapisz jako inny, Zoptymalizowany plik PDF. W oknie dialogowym Optymalizatora PDF kliknij opcję Odrzuć obiekty w lewym panelu. Zaznacz pole Odrzuć wszystkie obrazy. W obszarze Czyszczenie zaznacz opcję Usuń nieużywane obiekty. Kliknij OK i zapisz zoptymalizowany plik pod nową nazwą. Acrobat przetwarza plik i usuwa każdy obiekt obrazu rastrowego.
W praktyce wynikające z tego zmniejszenie rozmiaru pliku może być dramatyczne. Plik PDF o wielkości 20 MB zawierający zdjęcia w wysokiej rozdzielczości może zmniejszyć się do poniżej 100 KB, jeśli dokument zawierał głównie tekst z osadzonymi obrazami. Otwórz zoptymalizowany plik i przewiń każdą stronę, aby upewnić się, że cała treść tekstowa jest obecna i czytelna. Sprawdź obszary strony, z których usunięto obrazy. Układ może się nieznacznie przesunąć, ponieważ przestrzeń zajmowana wcześniej przez obrazy jest teraz pusta.
Jeśli wraz z obrazami usunięto jakąkolwiek istotną zawartość, np. wykresy przechowywane jako obrazy, a nie grafikę wektorową, cofnij operację i zastosuj bardziej selektywne podejście. Zamiast odrzucać wszystkie obrazy, mocno je skompresuj lub zastąp tekstem zastępczym opisującym, co zostało usunięte.
Metoda 2: Programowa ekstrakcja tekstu
Biblioteki Pythona, takie jak PyMuPDF i pdfplumber, wyodrębniają tekst, ignorując natywnie obrazy. Ekstrakcja odczytuje tylko warstwę tekstową, tworząc czysty strumień tekstowy bez żadnych danych obrazu. Wyodrębniony tekst można zapisać jako plik .txt do edycji lub wprowadzić do nowego, tekstowego pliku PDF. Podejście programowe umożliwia wykonywanie skryptów, jest powtarzalne i obsługuje przetwarzanie wsadowe wielu plików.
W przypadku zeskanowanych plików PDF zawierających warstwę tekstową OCR funkcja wyodrębniania programowego odczytuje tekst OCR. Jakość zależy całkowicie od dokładności OCR. Czysto zeskanowany dokument za pomocą nowoczesnego OCR może uzyskać tekst dokładny w 99 procentach. Źle zeskanowany dokument przy użyciu starego OCR może spowodować powstanie tekstu wymagającego znacznej ręcznej korekty. Wyodrębnienie obejmie wszelkie błędy OCR występujące w warstwie tekstowej.
Weryfikacja jakości poekstrakcyjnej
Po usunięciu obrazów lub wyodrębnieniu tekstu sprawdź jakość wydruku przed jego użyciem. Porównaj liczbę słów w wyodrębnionym tekście z ręcznym oszacowaniem z oryginalnego dokumentu. Znacząca rozbieżność sugeruje, że treść została utracona. Wyszukaj znane terminy, które pojawiają się w oryginale, aby potwierdzić, że są obecne w wynikach. Przejrzyj pierwszy i ostatni akapit każdej głównej sekcji, aby sprawdzić kompletność.
Jeśli chodzi o obieg dokumentów, w przypadku dokumentów, w których dokładność tekstu ma kluczowe znaczenie, takich jak zgłoszenia prawne lub raporty finansowe, drugi recenzent powinien na miejscu sprawdzić wyodrębniony tekst z oryginalnym plikiem PDF. Nawet 99-procentowa dokładność ekstrakcji oznacza jeden błąd na sto słów, co może być nie do zaakceptowania w przypadku dokumentów precyzyjnych. Karta weryfikacyjna wychwytuje błędy wyodrębniania, które przeoczają automatyczne kontrole jakości.
| Typ dokumentu | Bezpieczne rozebranie? | Alternatywa |
|---|---|---|
| Krótki opis prawny | Tak, tekst jest najważniejszy | Żadne nie jest potrzebne |
| Raport z wykresami | Nie, wykresy zawierają dane | Kompresuj zamiast pasków |
| Zeskanowany dokument | Nie, zeskanuj JEST treścią | Najpierw OCR, potem wyodrębnij tekst |
Usuwanie obrazów z pliku PDF jest wskazane, gdy treść tekstowa jest wartością podstawową, a obrazy mają charakter incydentalny. Wynikowy plik tekstowy jest znacznie mniejszy, w pełni przeszukiwalny i gotowy do analizy tekstu, tłumaczenia lub zmiany przeznaczenia treści. Decyzję o usunięciu obrazów należy podjąć po upewnieniu się, że sam tekst oddaje zasadnicze znaczenie dokumentu.
Jeśli chodzi o obieg dokumentów, w przypadku dokumentów, w których obrazy i tekst współdziałają ze sobą, należy zachować pełny plik PDF i zoptymalizować go poprzez kompresję, a nie usuwanie. Skompresowany plik PDF zachowuje wizualne powiązania między tekstem i obrazami, jednocześnie zmniejszając rozmiar pliku na potrzeby dystrybucji.
Co dzieje się z układem pliku PDF po usunięciu obrazu
Podczas typowych procesów, gdy obrazy są usuwane, miejsce, które zajmowały na stronie, staje się puste. Tekst owinięty wokół obrazów może ponownie wpłynąć w puste miejsce. Tabele zawierające komórki obrazu będą miały puste komórki. Układy stron zaprojektowane z myślą o konkretnym rozmieszczeniu obrazów mogą wyglądać niewygodnie. Pozbawiony plik PDF jest zoptymalizowany pod kątem zawartości, a nie projektu wizualnego.
W przypadku dokumentów, w których liczy się integralność układu, rozważ zastąpienie obrazów tekstem zastępczym, zamiast ich całkowitego usuwania. Podpis taki jak Zdjęcie usunięte: zamiast każdego zdjęcia można wstawić zdjęcie produktu. Symbol zastępczy zachowuje strukturę układu, jednocześnie potwierdzając, że treść wizualna została celowo usunięta.
Używanie OCR do tworzenia warstwy tekstowej przed usuwaniem obrazu
W przypadku przetwarzania dokumentów, w przypadku zeskanowanych plików PDF pozbawionych warstwy tekstowej, uruchomienie OCR przed usuwaniem obrazu powoduje utworzenie danych tekstowych, które są zachowywane w procesie usuwania. OCRmyPDF może dodać warstwę tekstową do zeskanowanych plików PDF za pomocą jednego polecenia. Po przetworzeniu OCR plik PDF zawiera zarówno widoczny zeskanowany obraz, jak i niewidoczną warstwę tekstową. Usuwanie obrazów powoduje następnie usunięcie zeskanowanej strony, zachowując rozpoznany tekst.
W praktyce jakość OCR bezpośrednio determinuje użyteczność pozbawionego sygnału wyjściowego. Dokument z 99-procentową dokładnością OCR generuje użyteczny tekst z okazjonalnymi błędami. W dokumencie z 80-procentową dokładnością powstaje tekst wymagający znacznej ręcznej korekty. Przed przystąpieniem do usuwania obrazu ze zeskanowanych dokumentów uruchom OCR i oceń jakość tekstu na przykładowej stronie.
Kompresowanie obrazów jako alternatywa dla usuwania izolacji
W przypadku dokumentów, w przypadku których całkowite usunięcie obrazów spowodowałoby utratę cennej treści, agresywna kompresja obrazu stanowi rozwiązanie pośrednie. Zmniejszenie rozmiaru obrazów do 72 DPI przy wysokiej kompresji JPEG może zmniejszyć rozmiar pliku PDF o wielkości 20 MB do 2–3 MB, zachowując jednocześnie rozpoznawalność obrazów. Skompresowane obrazy są niskiej jakości, ale nadal przekazują informacje wizualne.
Połączenie kompresji z selektywnym usuwaniem obrazu zapewnia największą elastyczność. Trzymaj obrazy na stronach, gdzie są niezbędne, np. diagramy i fotografie będące centralnym punktem treści, i usuwaj obrazy dekoracyjne ze stron, na których nie służą celom informacyjnym. Podejście hybrydowe wymaga więcej pracy ręcznej, ale zapewnia najlepszą równowagę jakości i rozmiaru.
Eksport plików PDF zawierających tylko tekst służy konkretnym przypadkom użycia: dostarczaniu treści do potoków analizy tekstu, tworzeniu uproszczonych wersji do czytania na urządzeniach mobilnych i przygotowywaniu dokumentów do tłumaczenia, w przypadku których obrazy zwiększałyby koszty bez dodawania wartości. W każdym z tych przypadków tekst oznacza produkt, a obrazy stanowią opakowanie, które można wyrzucić.
Decyzję o usunięciu obrazów należy udokumentować, aby przyszli czytelnicy wersji tekstowej zrozumieli, że treści wizualne zostały celowo usunięte. Krótka notatka we właściwościach dokumentu lub na stronie tytułowej zapobiega nieporozumieniom podczas porównywania wersji tekstowej z oryginałem.
W przypadku większości narzędzi eksport do pliku PDF zawierającego wyłącznie tekst jest narzędziem specjalistycznym spełniającym określone potrzeby. Nie jest to optymalizacja ogólnego przeznaczenia. W przypadku większości dokumentów kompresja jest lepszym pierwszym krokiem niż usuwanie obrazu. Rezerwuj usuwanie obrazów w przypadkach, gdy tekst jest jedyną wartościową treścią, a cel dokumentu spełnia sam tekst.
Zrozumienie możliwości i ograniczeń usuwania obrazów daje pewność, że zostanie ono zastosowane do właściwych dokumentów z właściwych powodów, co umożliwi uzyskanie wyników spełniających zamierzone cele bez niezamierzonej utraty treści. Tekstowy plik PDF dobrze służy konkretnym celom i powinien być stosowany selektywnie w zależności od typu dokumentu i jego przeznaczenia.
Wypróbuj opcję Kompresuj plik PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
