Zwei PDFs liegen nebeneinander in einem Ordner. Beide haben die gleiche Seitenanzahl. Beide entstanden im selben Jahr. Sie geben in beide den gleichen Suchbegriff ein. Man liefert fast sofort Ergebnisse. Der andere hält inne, zeigt eine sich drehende Fortschrittsanzeige an und meldet nach einigen Sekunden, dass der Begriff auf Seite zwölf gefunden wurde. Der Unterschied in der Suchgeschwindigkeit zwischen diesen beiden PDFs ist nicht zufällig. Dies hängt davon ab, wie das PDF erstellt wurde, ob der Text eingebettet oder OCR-generiert ist, wie die Schriftarten kodiert sind und ob die Dokumentstruktur Suchoptimierungsfunktionen enthält. Wenn Sie verstehen, warum einige PDF Searchable-Dokumente schneller zu durchsuchen sind als andere, können Sie PDFs erstellen, die eine effiziente Suche ermöglichen, und langsam durchsuchbare Dokumente diagnostizieren, die Aufmerksamkeit erfordern.

Wie die PDF-Suche tatsächlich funktioniert
Wenn Sie eine PDF-Datei durchsuchen, durchsucht der Viewer die sichtbaren Seitenbilder nicht nach Zeichenformen. Es fragt die in der PDF-Datei eingebetteten Textinhaltsströme ab. Jede Seite enthält einen oder mehrere Inhaltsströme, die die Zeichen auf der Seite, ihre Positionen und die zu ihrer Anzeige verwendeten Schriftarten auflisten. Die Suchfunktion durchsucht diese Inhaltsströme nacheinander, Zeichen für Zeichen, und sucht nach Übereinstimmungen mit dem Suchbegriff. Die Geschwindigkeit dieses sequentiellen Scans hängt davon ab, wie die Textdaten organisiert sind.
Ein PDF mit gut strukturierten Inhaltsströmen, in denen der Text in logischer Lesereihenfolge mit konsistenter Kodierung erscheint, kann so schnell durchsucht werden, wie der Betrachter die Daten von der Festplatte lesen kann. Eine PDF-Datei mit fragmentierten Inhaltsströmen, bei der der Text für einen einzelnen Absatz über mehrere Stream-Objekte in nicht sequentieller Reihenfolge verteilt ist, zwingt die Suchfunktion dazu, zwischen verschiedenen Teilen der Datei zu springen und den Text im Speicher neu zusammenzusetzen, bevor er durchsucht werden kann. Die PDF-Format-Struktur der Content-Streams ist der wichtigste Faktor für die Suchgeschwindigkeit.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Eingebetteter Text vs. OCR-Text in der Suchleistung
Eingebetteter Text, also Text, der in einem Textverarbeitungsprogramm oder einer Layoutanwendung erstellt und direkt in die PDF-Datei geschrieben wurde, wird als Folge von Zeichencodes gespeichert. Jedes Zeichen nimmt eine bekannte Position im Inhaltsstrom ein. Die Suchfunktion liest den Stream linear und findet Übereinstimmungen effizient. OCR PDF Text, Text, der durch optische Zeichenerkennung aus einem gescannten Seitenbild generiert wurde, wird anders gespeichert. Die OCR-Engine platziert jedes erkannte Wort an seiner ungefähren Position auf der Seite, aber die Wörter befinden sich im Inhaltsstrom möglicherweise nicht in der strengen Lesereihenfolge.
Auch OCR-Texte können Erkennungsfehler enthalten. Ein Zeichen, das von der OCR-Engine fälschlicherweise als anderes Zeichen gelesen wurde, stimmt nicht mit dem Suchbegriff überein, obwohl das sichtbare Zeichen auf der Seite korrekt aussieht. Bei der Suche nach „contract“ wird „c0ntract“ nicht gefunden, obwohl die OCR-Engine diese Fehlerkennung ausgegeben und in den Content-Stream eingefügt hat. Die Suchfunktion erkennt das Seitenbild nicht. Es sieht nur den OCR-Text. Fehler in diesem Text führen direkt zu Suchfehlern.
Schriftartenkodierung und ihre Auswirkung auf die Suche
Schriftarten in PDFs können auf verschiedene Arten kodiert werden, und die Kodierung wirkt sich auf die Suchgeschwindigkeit aus. Eine Schriftart mit einer Standardkodierung wie WinAnsiEncoding oder MacRomanEncoding ordnet Zeichencodes direkt Standardglyphen zu. Die Suchfunktion kann diesen Text schnell verarbeiten, da die Zuordnung unkompliziert ist. Bei einer Schriftart mit einer benutzerdefinierten Codierung, bei der die Zeichencodes vom Schriftartendesigner willkürlich zugewiesen werden, muss die Suchfunktion jeden Code in der Schriftartencodierungstabelle nachschlagen, um zu bestimmen, welches Zeichen er darstellt. Diese Suche erhöht den Aufwand für jeden Zeichenvergleich.
CID-Schriftarten, die für ostasiatische Zeichensätze verwendet werden, verwenden eine zweistufige Codierung, die Zeichencodes CID-Werten zuordnet und dann CID-Werte Unicode zuordnet. Die Suche nach Text in einer CID-codierten Schriftart erfordert die Auflösung dieser zweistufigen Zuordnung für jedes Zeichen. Eine PDF-Datei mit chinesischem, japanischem oder koreanischem Text in einer CID-codierten Schriftart wird aufgrund des zusätzlichen Codierungsauflösungsschritts langsamer durchsucht als eine PDF-Datei mit englischem Text in einer standardmäßig codierten Schriftart. Die beim Erstellen der PDF-Datei getroffene Kodierungsauswahl für PDF-Schriftarten wirkt sich auf die Suchleistung für die gesamte Lebensdauer des Dokuments aus.
Die Rolle des Seitenstrukturbaums bei der Suche
Ein mit Tags versehenes PDF enthält einen Strukturbaum, der den Dokumentinhalt in logische Elemente wie Abschnitte, Absätze und Abbildungen organisiert. Der Strukturbaum stellt der Suchfunktion eine Roadmap des Dokuments zur Verfügung. Anstatt die Inhaltsströme linear vom Anfang der Datei an zu durchsuchen, kann die Suchfunktion durch den Strukturbaum navigieren, um Text in bestimmten Dokumentabschnitten zu finden. Eine Suche innerhalb einer getaggten PDF-Datei kann schneller erfolgen, da der Strukturbaum eine Indizierung bietet, die einem flachen Inhaltsstrom fehlt.
PDFs ohne Tags, die den Großteil der im Umlauf befindlichen PDFs ausmachen, verfügen nicht über diesen Strukturbaum. Der Suchfunktion bleibt nichts anderes übrig, als die Content-Streams nacheinander zu durchsuchen. Bei kurzen Dokumenten ist der Unterschied vernachlässigbar. Bei Dokumenten mit Hunderten oder Tausenden von Seiten kann das Vorhandensein oder Fehlen eines Strukturbaums den Unterschied zwischen nahezu sofortigen Suchergebnissen und einer spürbaren Verzögerung ausmachen. Das Erstellen getaggter PDFs ist eine Best Practice für die Barrierefreiheit, die sich auch positiv auf die Leistung von PDF Searchable auswirkt.
Eingebettete Suchindizes in PDFs
Einige PDF-Erstellungstools können einen Suchindex direkt in die PDF-Datei einbetten. Bei diesem Index handelt es sich um eine vorgefertigte Nachschlagetabelle, die Wörter den Seiten zuordnet, auf denen sie erscheinen. Eine PDF-Datei mit einem eingebetteten Index kann fast sofort durchsucht werden, da die Suchfunktion den Index abfragt, anstatt die Inhaltsströme zu scannen. Die Indexsuche gibt die Seitenzahlen zurück, auf denen das Wort vorkommt, und der Betrachter springt direkt zu diesen Seiten.
Eingebettete Indizes sind in Allzweck-PDFs unüblich, da sie die Dateigröße und die Indexerstellungszeit erhöhen. Sie sind am häufigsten in großen Referenz-PDFs, technischen Handbüchern und Dokumentensammlungen zu finden, bei denen die Suchgeschwindigkeit Priorität hat. Die meisten Workflows zur PDF-Erstellung beinhalten standardmäßig keine Indexgenerierung. Das Fehlen eines eingebetteten Index ist die Regel. Wenn Sie auf eine PDF-Datei stoßen, die deutlich schneller durchsucht wird als andere mit ähnlicher Größe, ist wahrscheinlich ein eingebetteter Index der Grund.
Was Sie tun können, um die Suchgeschwindigkeit zu verbessern
Wenn Sie PDFs erstellen, die häufig durchsucht werden, generieren Sie sie als getaggte PDFs mit Standardschriftkodierungen. Vermeiden Sie benutzerdefinierte Schriftartenkodierungen, es sei denn, die Designanforderungen können anderweitig nicht erfüllt werden. Wenn die PDF-Datei nicht-lateinischen Text enthält, testen Sie die Suchleistung anhand eines Beispiels, bevor Sie sich für den Codierungsansatz für das gesamte Dokument entscheiden. Eine kleine Investition in die Erstellungseinstellungen zahlt sich durch eine schnellere Suche für jede Person aus, die das Dokument verwendet.
Erwägen Sie bei vorhandenen PDFs, die langsam durchsucht werden, die erneute OCR-Erstellung von OCR-generiertem Text mit einer modernen Engine, die sauberere Inhaltsströme erzeugt. Führen Sie die PDF-Datei durch ein Strukturanalysetool, das Tags hinzufügen kann, wenn das Dokument derzeit nicht mit Tags versehen ist. WukongPDF unterstützt OCR PDF Neuverarbeitung und Dokument-Tagging, wodurch die Suchleistung in vorhandenen PDFs verbessert werden kann, ohne diese aus Quelldokumenten neu zu erstellen.
Das PDF-Erstellungsdatum und die zur Erstellung verwendete Softwareversion können Unterschiede in der Suchgeschwindigkeit erklären. Ein PDF, das mit einer 2024-Version einer modernen PDF-Bibliothek erstellt wurde, verfügt wahrscheinlich über sauberere Inhaltsströme und eine effizientere Textkodierung als ein PDF, das mit einer 2008-Version eines älteren Tools erstellt wurde. Das PDF-Format hat sich weiterentwickelt und neuere Erstellungstools erzeugen besser strukturierte Dateien.
Bei PDFs, die im Rahmen eines Dokumentenverwaltungsworkflows häufig durchsucht werden, sollten Sie erwägen, den Text zu extrahieren und einen externen Suchindex zu erstellen. Ein Dokumentenverwaltungssystem mit einem Volltextsuchindex fragt den Index ab, nicht die PDF-Inhaltsströme. Die Suchgeschwindigkeit wird unabhängig von der PDF-internen Struktur.
Die Anzahl der in einer PDF-Datei verwendeten Schriftarten wirkt sich auf die Suchgeschwindigkeit aus, da bei jeder Änderung der Schriftart die Suchfunktion eine neue Kodierungstabelle laden muss. Eine PDF-Datei, die zwei Schriftarten verwendet, wird schneller durchsucht als eine PDF-Datei, die zwanzig Schriftarten verwendet, wenn alle anderen Faktoren gleich bleiben.
Die PDF Searchable-Leistung eines Dokuments wird zum Zeitpunkt der Erstellung durch Entscheidungen über Schriftartenkodierung, Content-Stream-Organisation, Dokument-Tagging und Indexeinbettung bestimmt. Diese Auswahlmöglichkeiten sind für den Autor des Dokuments unsichtbar, aber für jeden, der das Dokument durchsucht, sofort sichtbar.
Bei Dokumentensammlungen, die häufig durchsucht werden, zahlt sich die Investition in die Erstellung gut strukturierter, getaggter PDFs mit Standardschriftkodierungen jedes Mal aus, wenn ein Benutzer eine Abfrage eingibt und nahezu sofortige Ergebnisse erhält.
In diesem Artikel werden die wichtigsten Techniken und Überlegungen für die Arbeit mit PDFs in diesem speziellen Szenario behandelt. Die hier beschriebenen Methoden gelten für verschiedene Tools und Plattformen und geben den Lesern die Flexibilität, den Ansatz zu wählen, der am besten zu ihrem Arbeitsablauf und ihrer technischen Umgebung passt.
Die beschriebenen praktischen Schritte bieten einen klaren Weg von der ersten Herausforderung bis zu einer funktionierenden Lösung. Jede Technik wurde aufgrund ihrer Zuverlässigkeit und Zugänglichkeit ausgewählt, um sicherzustellen, dass Leser unabhängig von ihrer Vorerfahrung mit PDF-Tools konsistente Ergebnisse erzielen können.
Die in diesem Artikel beschriebenen Unterschiede in der Suchgeschwindigkeit sind das direkte Ergebnis von Entscheidungen, die bei der PDF-Erstellung getroffen wurden. Das Verständnis dieser Faktoren ermöglicht es Dokumenterstellern, PDFs zu erstellen, die ein besseres Sucherlebnis bieten.
Die in diesem Artikel beschriebenen Tools und Techniken bieten einen praktischen Weg von der ersten Frage bis zu einer funktionierenden Lösung, die auf eine Reihe von Dokumenten und Szenarien angewendet werden kann.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
