Others

Waarom zijn sommige PDF's sneller te doorzoeken dan andere?

Twee PDF's staan naast elkaar in een map. Beide hebben hetzelfde aantal pagina's. Beiden zijn in hetzelfde jaar gemaakt. U typt in beide dezelfde zoekterm. Men retourneert vrijwel onmiddellijk resultaten. De andere pauzeert, toont een draaiende voortgangsindicator en meldt na enkele seconden dat de term op pagina twaalf is gevonden. Het verschil in zoeksnelheid tussen deze twee PDF's is niet willekeurig. Dit wordt bepaald door de manier waarop de PDF is gemaakt, of de tekst is ingesloten of door OCR is gegenereerd, hoe de lettertypen zijn gecodeerd en of de documentstructuur functies voor zoekoptimalisatie bevat. Als u begrijpt waarom sommige PDF doorzoekbare-documenten sneller kunnen worden doorzocht dan andere, kunt u PDF's maken die efficiënt zoeken en langzaam zoekende documenten diagnosticeren die aandacht nodig hebben.

Why Are Some PDFs Faster to Search Through Than Others

Hoe PDF-zoeken eigenlijk werkt

Wanneer u in een PDF zoekt, scant de viewer de zichtbare pagina-afbeeldingen niet op zoek naar tekenvormen. Het bevraagt de tekstinhoudsstromen die in het PDF-bestand zijn ingesloten. Elke pagina bevat een of meer inhoudsstromen met een overzicht van de tekens op de pagina, hun posities en de lettertypen die worden gebruikt om ze weer te geven. De zoekfunctie leest deze inhoudsstromen opeenvolgend, karakter voor karakter, op zoek naar overeenkomsten met de zoekterm. De snelheid van deze sequentiële scan hangt af van hoe de tekstgegevens zijn georganiseerd.

Een PDF met goed gestructureerde inhoudsstromen, waarbij de tekst in logische leesvolgorde met consistente codering verschijnt, kan net zo snel worden doorzocht als de kijker de gegevens van schijf kan lezen. Een PDF met gefragmenteerde inhoudsstromen, waarbij de tekst voor een enkele alinea in niet-opeenvolgende volgorde over meerdere stroomobjecten is verspreid, dwingt de zoekfunctie om tussen verschillende delen van het bestand te springen, waardoor de tekst in het geheugen opnieuw wordt samengesteld voordat deze kan worden doorzocht. De PDF Format-structuur van de inhoudsstromen is de belangrijkste bepalende factor voor de zoeksnelheid.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Ingesloten tekst versus OCR-tekst in zoekprestaties

Ingesloten tekst, tekst die is geschreven in een tekstverwerker of lay-outtoepassing en rechtstreeks in de PDF is geschreven, wordt opgeslagen als een reeks tekencodes. Elk personage neemt een bekende positie in de inhoudsstroom in. De zoekfunctie leest de stream lineair en vindt efficiënt overeenkomsten. OCR PDF tekst, tekst die is gegenereerd door optische tekenherkenning uit een gescande paginaafbeelding, wordt anders opgeslagen. De OCR-engine plaatst elk herkend woord op de geschatte positie op de pagina, maar de woorden staan mogelijk niet in de strikte leesvolgorde in de inhoudsstroom.

OCR-tekst kan ook herkenningsfouten bevatten. Een teken dat door de OCR-engine verkeerd is gelezen als een ander teken, komt niet overeen met de zoekterm, ook al ziet het zichtbare teken op de pagina er correct uit. Een zoektocht naar een contract zal geen contract opleveren, ook al heeft de OCR-engine deze fout herkend en in de inhoudsstroom geplaatst. De zoekfunctie ziet de paginaafbeelding niet. Het ziet alleen de OCR-tekst. Fouten in die tekst vertalen zich rechtstreeks in zoekfouten.

Lettertypecodering en het effect ervan op zoeken

Lettertypen in PDF's kunnen op verschillende manieren worden gecodeerd, en de codering heeft invloed op de zoeksnelheid. Een lettertype met een standaardcodering, zoals WinAnsiEncoding of MacRomanEncoding, wijst tekencodes rechtstreeks toe aan standaardglyphs. De zoekfunctie kan deze tekst snel verwerken omdat de mapping eenvoudig is. Een lettertype met een aangepaste codering, waarbij de tekencodes willekeurig worden toegewezen door de lettertypeontwerper, vereist dat de zoekfunctie elke code in de lettertypecoderingstabel opzoekt om te bepalen welk teken deze vertegenwoordigt. Deze zoekopdracht voegt overhead toe aan elke karaktervergelijking.

CID-lettertypen, die worden gebruikt voor Oost-Aziatische tekensets, gebruiken een codering op twee niveaus die tekencodes toewijst aan CID-waarden en vervolgens CID-waarden toewijst aan Unicode. Als u tekst zoekt in een CID-gecodeerd lettertype, moet u deze toewijzing op twee niveaus voor elk teken oplossen. Een PDF met Chinese, Japanse of Koreaanse tekst in een CID-gecodeerd lettertype zal langzamer zoeken dan een PDF met Engelse tekst in een standaardgecodeerd lettertype, puur vanwege de extra coderingsresolutiestap. De coderingskeuze voor PDF-lettertypen die wordt gemaakt bij het maken van de PDF heeft invloed op de zoekprestaties gedurende de gehele levensduur van het document.

De rol van de paginastructuurboom in zoekopdrachten

Een getagde PDF bevat een structuurboom die de documentinhoud in logische elementen organiseert, zoals secties, alinea's en figuren. De structuurboom voorziet de zoekfunctie van een routekaart van het document. In plaats van de inhoudsstromen lineair vanaf het begin van het bestand te scannen, kan de zoekfunctie door de structuurboom navigeren om tekst binnen specifieke documentsecties te lokaliseren. Zoeken binnen een getagde PDF kan sneller gaan omdat de boomstructuur indexering biedt die bij een platte inhoudsstroom ontbreekt.

Niet-getagde PDF's, die de meerderheid van de PDF's in omloop vormen, missen deze structuurboom. De zoekfunctie heeft geen andere keuze dan de inhoudsstromen opeenvolgend te scannen. Voor korte documenten is het verschil verwaarloosbaar. Voor documenten van honderden of duizenden pagina's kan de aan- of afwezigheid van een boomstructuur het verschil maken tussen vrijwel onmiddellijke zoekresultaten en een merkbare vertraging. Het maken van getagde PDF's is een best practice op het gebied van toegankelijkheid die ook de prestaties van PDF Searchable ten goede komt.

Ingebedde zoekindexen in PDF's

Sommige tools voor het maken van PDF's kunnen een zoekindex rechtstreeks in het PDF-bestand insluiten. Deze index is een vooraf gebouwde opzoektabel die woorden toewijst aan de pagina's waarop ze verschijnen. Een PDF met een ingebouwde index kan vrijwel onmiddellijk worden doorzocht, omdat de zoekfunctie de index doorzoekt in plaats van de inhoudsstromen te scannen. De indexzoekopdracht retourneert de paginanummers waar het woord voorkomt, en de kijker springt rechtstreeks naar die pagina's.

Ingesloten indexen zijn ongebruikelijk in PDF's voor algemeen gebruik, omdat ze de bestandsgrootte en de aanmaaktijd van de index vergroten. Ze worden het meest aangetroffen in grote referentie-PDF's, technische handleidingen en documentverzamelingen waar zoeksnelheid een prioriteit is. De meeste workflows voor het maken van PDF's omvatten niet standaard het genereren van indexen. Het ontbreken van een ingebouwde index is de norm. Wanneer u een PDF tegenkomt die merkbaar sneller zoekt dan andere van vergelijkbare grootte, is een ingesloten index waarschijnlijk de reden.

Wat u kunt doen om de zoeksnelheid te verbeteren

Als u PDF's maakt die vaak worden doorzocht, genereer ze dan als getagde PDF's met standaard lettertypecoderingen. Vermijd aangepaste lettertypecoderingen, tenzij op een andere manier niet aan de ontwerpvereisten kan worden voldaan. Als de PDF niet-Latijnse tekst bevat, test u de zoekprestaties op een voorbeeld voordat u de coderingsaanpak voor het volledige document gebruikt. Een kleine investering in de aanmaakinstellingen betaalt zich uit in een snellere zoekactie voor iedereen die het document gebruikt.

Voor bestaande PDF's die langzaam zoeken, kunt u overwegen om OCR-gegenereerde tekst opnieuw te OCRen met een moderne engine die schonere inhoudsstromen produceert. Voer de PDF door een structuuranalysetool die tags kan toevoegen als het document momenteel niet is gecodeerd. WukongPDF ondersteunt OCR PDF herverwerking en documenttagging, waardoor de zoekprestaties in bestaande PDF's kunnen worden verbeterd zonder deze opnieuw te hoeven maken op basis van brondocumenten.

De aanmaakdatum van de PDF en de softwareversie die is gebruikt om de PDF te maken, kunnen de verschillen in zoeksnelheid verklaren. Een PDF die is gemaakt met een versie uit 2024 van een moderne PDF-bibliotheek heeft waarschijnlijk schonere inhoudsstromen en efficiëntere tekstcodering dan een PDF die is gemaakt met een versie uit 2008 van een oudere tool. Het PDF-formaat is geëvolueerd en nieuwere creatietools produceren beter gestructureerde bestanden.

Voor PDF's die vaak worden doorzocht als onderdeel van een documentbeheerworkflow, kunt u overwegen de tekst te extraheren en een externe zoekindex samen te stellen. Een documentbeheersysteem met een volledige tekstzoekindex doorzoekt de index, niet de PDF-inhoudsstromen. De zoeksnelheid wordt onafhankelijk van de interne structuur van de PDF.

Het aantal lettertypen dat in een PDF wordt gebruikt, heeft invloed op de zoeksnelheid, omdat voor elke lettertypewijziging de zoekfunctie een nieuwe coderingstabel moet laden. Een PDF die twee lettertypen gebruikt, zoekt sneller dan een PDF die twintig lettertypen gebruikt, als alle andere factoren gelijk zijn.

De PDF doorzoekbare-prestaties van een document worden tijdens het maken bepaald door keuzes over lettertypecodering, organisatie van de inhoudsstroom, documenttagging en index-insluiting. Deze keuzes zijn onzichtbaar voor de auteur van het document, maar onmiddellijk zichtbaar voor iedereen die het document doorzoekt.

Voor documentverzamelingen die vaak worden doorzocht, betaalt de investering in het maken van goed gestructureerde, getagde PDF's met standaard lettertypecoderingen zich elke keer terug als een gebruiker een zoekopdracht typt en vrijwel onmiddellijk resultaat ontvangt.

Dit artikel behandelt de belangrijkste technieken en overwegingen voor het werken met PDF's in dit specifieke scenario. De hier beschreven methoden zijn van toepassing op verschillende tools en platforms, waardoor lezers de flexibiliteit hebben om de aanpak te kiezen die het beste bij hun workflow en technische omgeving past.

De geschetste praktische stappen bieden een duidelijk pad van de initiële uitdaging naar een werkende oplossing. Elke techniek is geselecteerd vanwege zijn betrouwbaarheid en toegankelijkheid, zodat lezers consistente resultaten kunnen bereiken, ongeacht hun eerdere ervaring met PDF-tools.

De verschillen in zoeksnelheid die in dit artikel worden beschreven, zijn het directe gevolg van keuzes die zijn gemaakt tijdens het maken van PDF's. Door deze factoren te begrijpen, kunnen makers van documenten PDF's maken die een betere zoekervaring bieden.

De tools en technieken die in dit artikel worden beschreven, bieden een praktisch pad van de initiële vraag naar een werkende oplossing die kan worden toegepast in een reeks documenten en scenario's.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →