Others

Dlaczego niektóre pliki PDF można przeszukiwać szybciej niż inne?

Dwa pliki PDF znajdują się obok siebie w folderze. W obu przypadkach liczba stron jest taka sama. Obydwa powstały w tym samym roku. W obu przypadkach wpisujesz to samo wyszukiwane hasło. Wyniki zwracane są niemal natychmiast. Drugi robi pauzę, pokazuje obracający się wskaźnik postępu i po kilku sekundach informuje, że dany termin został znaleziony na stronie dwunastej. Różnica w szybkości wyszukiwania między tymi dwoma plikami PDF nie jest przypadkowa. Zależy to od sposobu utworzenia pliku PDF, tego, czy tekst jest osadzony, czy wygenerowany przez OCR, w jaki sposób czcionki są kodowane i czy struktura dokumentu obejmuje funkcje optymalizacji wyszukiwania. Zrozumienie, dlaczego niektóre dokumenty PDF z możliwością przeszukiwania można przeszukiwać szybciej niż inne, pomaga w tworzeniu plików PDF, które przeszukują wydajnie i diagnozują wolno przeszukujące dokumenty, które wymagają uwagi.

Why Are Some PDFs Faster to Search Through Than Others

Jak faktycznie działa wyszukiwanie plików PDF

Podczas wyszukiwania pliku PDF przeglądarka nie skanuje widocznych obrazów stron w poszukiwaniu kształtów znaków. Wysyła zapytanie do strumieni treści tekstowych osadzonych w pliku PDF. Każda strona zawiera jeden lub więcej strumieni treści zawierających listę znaków na stronie, ich położenia i czcionek używanych do ich wyświetlania. Funkcja wyszukiwania odczytuje te strumienie treści sekwencyjnie, znak po znaku, szukając dopasowań do wyszukiwanego hasła. Szybkość tego sekwencyjnego skanowania zależy od sposobu zorganizowania danych tekstowych.

Plik PDF z dobrze zorganizowanymi strumieniami treści, w którym tekst pojawia się w logicznej kolejności odczytu i ze spójnym kodowaniem, można przeszukiwać tak szybko, jak przeglądarka może odczytać dane z dysku. Plik PDF zawierający pofragmentowane strumienie treści, w których tekst pojedynczego akapitu jest rozproszony w wielu obiektach strumieniowych w kolejności niesekwencyjnej, zmusza funkcję wyszukiwania do przeskakiwania między różnymi częściami pliku, ponownie składając tekst w pamięci, zanim będzie można go przeszukać. Struktura Format PDF strumieni treści jest głównym wyznacznikiem szybkości wyszukiwania.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Tekst osadzony a tekst OCR w wydajności wyszukiwania

Tekst osadzony, czyli tekst napisany w edytorze tekstu lub aplikacji układowej i zapisany bezpośrednio w pliku PDF, jest przechowywany jako sekwencja kodów znaków. Każdy znak zajmuje znaną pozycję w strumieniu treści. Funkcja wyszukiwania odczytuje strumień liniowo i skutecznie znajduje dopasowania. OCR PDF tekst, tekst wygenerowany w wyniku optycznego rozpoznawania znaków na podstawie zeskanowanego obrazu strony, jest przechowywany w inny sposób. Mechanizm OCR umieszcza każde rozpoznane słowo w przybliżonym miejscu na stronie, ale kolejność czytania słów w strumieniu treści może nie być ścisła.

Tekst OCR może również zawierać błędy rozpoznawania. Znak, który został błędnie odczytany przez silnik OCR jako inny znak, nie będzie pasował do wyszukiwanego hasła, mimo że znak widoczny na stronie wygląda poprawnie. Wyszukiwanie kontraktu nie spowoduje znalezienia umowy, mimo że silnik OCR błędnie rozpoznał tę umowę i umieścił ją w strumieniu treści. Funkcja wyszukiwania nie widzi obrazu strony. Widzi tylko tekst OCR. Błędy w tym tekście przekładają się bezpośrednio na niepowodzenia wyszukiwania.

Kodowanie czcionek i jego wpływ na wyszukiwanie

Czcionki w plikach PDF można kodować na kilka sposobów, a kodowanie wpływa na szybkość wyszukiwania. Czcionka ze standardowym kodowaniem, takim jak WinAnsiEncoding lub MacRomanEncoding, odwzorowuje kody znaków bezpośrednio na standardowe glify. Funkcja wyszukiwania może szybko przetworzyć ten tekst, ponieważ mapowanie jest proste. Czcionka z niestandardowym kodowaniem, w której kody znaków są przydzielane arbitralnie przez projektanta czcionki, wymaga, aby funkcja wyszukiwania wyszukała każdy kod w tabeli kodowania czcionki w celu ustalenia, jaki znak reprezentuje. To wyszukiwanie zwiększa obciążenie przy każdym porównaniu znaków.

Czcionki CID używane w zestawach znaków wschodnioazjatyckich korzystają z dwupoziomowego kodowania, które odwzorowuje kody znaków na wartości CID, a następnie odwzorowuje wartości CID na Unicode. Wyszukiwanie tekstu czcionką zakodowaną w CID wymaga rozwiązania tego dwupoziomowego mapowania dla każdego znaku. Plik PDF zawierający tekst w języku chińskim, japońskim lub koreańskim zapisany czcionką zakodowaną w formacie CID będzie wyszukiwany wolniej niż plik PDF zawierający tekst w języku angielskim w czcionce zakodowanej standardowo, wyłącznie ze względu na dodatkowy krok rozdzielczości kodowania. Wybór kodowania czcionek PDF dokonany podczas tworzenia pliku PDF wpływa na wydajność wyszukiwania przez cały okres istnienia dokumentu.

Rola drzewa struktury strony w wyszukiwaniu

Oznaczony plik PDF zawiera drzewo struktury, które organizuje zawartość dokumentu w logiczne elementy, takie jak sekcje, akapity i rysunki. Drzewo struktury udostępnia funkcję wyszukiwania wraz z planem działania dokumentu. Zamiast skanować strumienie treści liniowo od początku pliku, funkcja wyszukiwania może poruszać się po drzewie struktury w celu zlokalizowania tekstu w określonych sekcjach dokumentu. Wyszukiwanie w oznakowanym pliku PDF może być szybsze, ponieważ drzewo struktury zapewnia indeksowanie, którego brakuje w płaskim strumieniu treści.

Nieoznaczone pliki PDF, które stanowią większość dostępnych w obiegu plików PDF, nie mają tego drzewa struktury. Funkcja wyszukiwania nie ma innego wyjścia, jak tylko skanować strumienie treści sekwencyjnie. W przypadku krótkich dokumentów różnica jest pomijalna. W przypadku dokumentów składających się z setek lub tysięcy stron obecność lub brak drzewa struktury może zadecydować o niemal natychmiastowych wynikach wyszukiwania i zauważalnym opóźnieniu. Tworzenie oznakowanych plików PDF to najlepsza praktyka w zakresie dostępności, która korzystnie wpływa również na wydajność PDF Searchable.

Osadzone indeksy wyszukiwania w plikach PDF

Niektóre narzędzia do tworzenia plików PDF mogą osadzać indeks wyszukiwania bezpośrednio w pliku PDF. Indeks ten to wstępnie zbudowana tabela odnośników, która przypisuje słowa do stron, na których się pojawiają. Plik PDF z osadzonym indeksem można przeszukiwać niemal natychmiast, ponieważ funkcja wyszukiwania wysyła zapytanie do indeksu, a nie skanuje strumienie treści. Wyszukiwanie indeksowe zwraca numery stron, na których pojawia się słowo, a przeglądarka przeskakuje bezpośrednio do tych stron.

Osadzone indeksy są rzadkością w plikach PDF ogólnego przeznaczenia, ponieważ zwiększają rozmiar pliku i skracają czas tworzenia indeksu. Najczęściej można je znaleźć w dużych plikach referencyjnych PDF, instrukcjach technicznych i zbiorach dokumentów, gdzie szybkość wyszukiwania jest priorytetem. Większość procesów tworzenia plików PDF domyślnie nie obejmuje generowania indeksu. Brak wbudowanego indeksu jest normą. Jeśli napotkasz plik PDF, który przeszukuje zauważalnie szybciej niż inne pliki o podobnym rozmiarze, przyczyną prawdopodobnie jest osadzony indeks.

Co możesz zrobić, aby poprawić szybkość wyszukiwania

Jeśli tworzysz pliki PDF, które będą często przeszukiwane, wygeneruj je jako pliki PDF ze znacznikami i standardowym kodowaniem czcionek. Unikaj niestandardowego kodowania czcionek, chyba że w inny sposób nie można spełnić wymagań projektowych. Jeśli plik PDF będzie zawierał tekst w języku innym niż łaciński, przetestuj wydajność wyszukiwania na próbce, zanim zdecydujesz się na kodowanie całego dokumentu. Niewielka inwestycja w ustawienia tworzenia procentuje w szybszym wyszukiwaniu każdej osoby korzystającej z dokumentu.

W przypadku istniejących plików PDF, które przeszukują powoli, rozważ ponowne OCR tekstu wygenerowanego za pomocą OCR przy użyciu nowoczesnego silnika, który generuje czystsze strumienie treści. Uruchom plik PDF za pomocą narzędzia do analizy struktury, które może dodać znaczniki, jeśli dokument nie jest aktualnie oznaczony. WukongPDF obsługuje ponowne przetwarzanie OCR PDF i oznaczanie dokumentów, co może poprawić wydajność wyszukiwania w istniejących plikach PDF bez odtwarzania ich z dokumentów źródłowych.

Data utworzenia pliku PDF i wersja oprogramowania użytego do jego utworzenia mogą wyjaśniać różnice w szybkości wyszukiwania. Plik PDF utworzony za pomocą nowoczesnej biblioteki PDF w wersji z 2024 r. prawdopodobnie będzie miał czystsze strumienie treści i wydajniejsze kodowanie tekstu niż plik PDF utworzony za pomocą wersji starszego narzędzia z 2008 r. Format PDF ewoluował, a nowsze narzędzia do tworzenia umożliwiają tworzenie plików o lepszej strukturze.

W przypadku plików PDF, które są często przeszukiwane w ramach przepływu pracy związanego z zarządzaniem dokumentami, rozważ wyodrębnienie tekstu i utworzenie zewnętrznego indeksu wyszukiwania. System zarządzania dokumentami z indeksem wyszukiwania pełnotekstowego wysyła zapytania do indeksu, a nie do strumieni treści PDF. Szybkość wyszukiwania staje się niezależna od wewnętrznej struktury pliku PDF.

Liczba czcionek używanych w pliku PDF wpływa na szybkość wyszukiwania, ponieważ każda zmiana czcionki wymaga, aby funkcja wyszukiwania wczytała nową tabelę kodowania. Plik PDF korzystający z dwóch czcionek jest przeszukiwany szybciej niż plik PDF wykorzystujący dwadzieścia czcionek, przy wszystkich pozostałych współczynnikach bez zmian.

Wydajność dokumentu PDF z możliwością wyszukiwania jest określana w czasie tworzenia na podstawie wyborów dotyczących kodowania czcionek, organizacji strumienia treści, oznaczania dokumentów i osadzania indeksu. Te wybory są niewidoczne dla autora dokumentu, ale natychmiast widoczne dla każdego, kto przeszukuje dokument.

W przypadku zbiorów dokumentów, które będą często przeszukiwane, inwestycja w tworzenie dobrze ustrukturyzowanych, oznakowanych plików PDF ze standardowym kodowaniem czcionek opłaca się za każdym razem, gdy użytkownik wpisze zapytanie i otrzyma niemal natychmiastowe wyniki.

W tym artykule omówiono kluczowe techniki i zagadnienia dotyczące pracy z plikami PDF w tym konkretnym scenariuszu. Opisane tutaj metody mają zastosowanie w przypadku różnych narzędzi i platform, dając czytelnikom elastyczność w wyborze podejścia, które najlepiej pasuje do ich przepływu pracy i środowiska technicznego.

Opisane praktyczne kroki zapewniają jasną ścieżkę od początkowego wyzwania do działającego rozwiązania. Każda technika została wybrana ze względu na jej niezawodność i dostępność, dzięki czemu czytelnicy mogą osiągnąć spójne wyniki niezależnie od ich wcześniejszego doświadczenia z narzędziami PDF.

Różnice w szybkości wyszukiwania opisane w tym artykule są bezpośrednim skutkiem wyborów dokonanych podczas tworzenia pliku PDF. Zrozumienie tych czynników umożliwia twórcom dokumentów tworzenie plików PDF zapewniających lepsze możliwości wyszukiwania.

Narzędzia i techniki opisane w tym artykule zapewniają praktyczną ścieżkę od początkowego pytania do działającego rozwiązania, które można zastosować w różnych dokumentach i scenariuszach.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →