Er wordt een PDF op het scherm geopend. De tekst is helder. De indeling is perfect. Elk woord is zichtbaar. U drukt op Ctrl-F en typt een woord dat u duidelijk op de pagina kunt zien. Geen resultaten. De zoekfunctie rapporteert nul overeenkomsten. De PDF bevat tekst die zichtbaar is voor het menselijk oog, maar onzichtbaar voor de zoekfunctie. Als u begrijpt waarom sommige PDF's niet doorzoekbaar zijn, ook al geven ze tekst perfect weer, wordt het verschil zichtbaar tussen de manier waarop mensen en computers documenten lezen. De status van PDF doorzoekbaar hangt niet af van de vraag of tekst zichtbaar is, maar van de manier waarop deze in het bestand is opgeslagen.

Het verschil tussen zichtbare tekst en doorzoekbare tekst
Zichtbare tekst is wat u op het scherm ziet. Het kan in twee vormen in een PDF voorkomen. Het kan worden opgeslagen als teksttekens in de PDF-inhoudsstroom, waarbij elk teken wordt weergegeven door een code die is toegewezen aan een lettertypeglyph. Deze tekst is doorzoekbaar. De zoekfunctie leest de tekencodes en vergelijkt deze met de zoekterm. Het kan ook worden opgeslagen als pixels in een paginaafbeelding, zonder enige tekencodes. Deze tekst is niet doorzoekbaar. De zoekfunctie ziet alleen een afbeelding.
Een gescande PDF is het meest voorkomende voorbeeld van zichtbare maar ondoorzoekbare tekst. Elke pagina is een foto van het originele document. De tekst verschijnt op de foto, maar de PDF bevat geen tekstgegevens. De zoekfunctie heeft niets om te zoeken. Door OCR op de scan uit te voeren, wordt de op pixels gebaseerde tekst omgezet in tekencodes, waardoor deze doorzoekbaar wordt. Het proces OCR PDF voegt de tekstlaag toe die de zoekfunctionaliteit mogelijk maakt.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Hoe lettertypecodering zoekopdrachten kan blokkeren
Een PDF die is gemaakt op basis van een digitale bron bevat teksttekens. Elk teken wordt opgeslagen als een code. De code verwijst naar een glyph in een lettertype. Wanneer de codering standaard is, zoals ASCII of Unicode, kan de zoekfunctie de codes direct matchen. Wanneer de codering op maat is, zijn de tekencodes willekeurige waarden die worden toegewezen door de lettertypeontwerper. De code 65, die A in ASCII vertegenwoordigt, kan een heel ander teken vertegenwoordigen in een op maat gecodeerd lettertype.
De PDF-viewer moet de codering omzetten om te bepalen welk teken elke code vertegenwoordigt. Als de coderingsinformatie ontbreekt of onjuist is, kan de zoekfunctie de codes niet aan tekens toewijzen. De tekst verschijnt correct op het scherm omdat de kijker nog steeds de juiste tekens kan tekenen, maar de onderliggende tekencodes niet overeenkomen met de verwachte waarden. Een zoekopdracht naar de letter A mislukt omdat de code voor A in deze pdf niet is wat de zoekfunctie verwacht. De codering van PDF-lettertypen bepaalt de doorzoekbaarheid.
Tekst opgeslagen als contouren of paden
Sommige workflows voor het maken van PDF's converteren tekst naar contouren, ook wel paden of curven genoemd. Dit is gebruikelijk in ontwerptoepassingen waarbij tekst wordt omgezet in vectorafbeeldingen voor nauwkeurige visuele controle. De tekst lijkt precies op het originele lettertype, maar is geen tekst meer. Het is een verzameling Bezier-curven die de contouren van elk personage volgen.
Omlijnde tekst kan niet worden doorzocht omdat er geen tekencodes zijn om te zoeken. De zoekfunctie ziet een tekening, geen tekst. Een PDF die geheel uit omlijnde tekst is gemaakt, is visueel perfect maar functioneel niet doorzoekbaar. De enige manier om het doorzoekbaar te maken is door OCR op de PDF uit te voeren, waarbij de omlijnde tekst wordt behandeld alsof het een gescande afbeelding is. De keuze van PDF Format tussen het insluiten van tekst als karakters en het converteren naar contouren heeft blijvende gevolgen voor de doorzoekbaarheid.
Beschadigde of ontbrekende ToUnicode-tabellen
Elk lettertype in een PDF kan een ToUnicode-tabel bevatten, een toewijzing van de aangepaste tekencodes van het lettertype naar standaard Unicode-waarden. De ToUnicode-tabel maakt zoeken mogelijk in lettertypen die aangepaste coderingen gebruiken. Wanneer de zoekfunctie een tekencode tegenkomt, zoekt deze de code op in de ToUnicode-tabel om het bijbehorende Unicode-teken te vinden. Er wordt gezocht naar de Unicode-waarde.
Als de ToUnicode-tabel ontbreekt of beschadigd is, wordt aangepaste gecodeerde tekst ondoorzoekbaar. De tekens worden correct weergegeven, maar kunnen niet worden toegewezen aan Unicode. Dit is een veelvoorkomend probleem bij PDF's die zijn gemaakt met oudere software of met conversietools die de ToUnicode-tabellen niet correct hebben gegenereerd. De status van PDF Searchable is afhankelijk van de aanwezigheid en nauwkeurigheid van deze tabellen.
Hoe u kunt vaststellen waarom een PDF niet doorzoekbaar is
Open de PDF en probeer tekst te selecteren met het tekstselectiegereedschap. Als er helemaal geen tekst kan worden geselecteerd, bevat de PDF geen tekstgegevens. Het is een gescand document of een document waarbij alle tekst is omgezet naar contouren. Voer OCR uit om een doorzoekbare tekstlaag toe te voegen.
Als tekst kan worden geselecteerd, maar de zoekfunctie deze niet vindt, probeer dan een paar woorden te kopiëren en in een teksteditor te plakken. Als de geplakte tekst onleesbaar is of andere tekens bevat dan zichtbaar is, is de lettertypecodering niet-standaard en ontbreekt de ToUnicode-tabel of is deze beschadigd. De tekst is aanwezig, maar de coderingsblokken zoeken. Maak de PDF opnieuw op basis van de originele bron met standaard lettertypecodering, of voer OCR uit op de bestaande PDF om een nieuwe, correct gecodeerde tekstlaag te maken.
Een PDF die de tekst perfect weergeeft, kan om een van deze redenen ondoorzoekbaar zijn. Het diagnosticeren van de oorzaak wijst op de oplossing. Voor een scan is OCR nodig. Omlijnde tekst heeft OCR nodig. Coderingsproblemen moeten opnieuw worden gemaakt of OCR. De oplossing hangt af van de oorzaak, maar het resultaat is hetzelfde: een PDF die net zo doorzoekbaar als leesbaar is.
WukongPDF biedt de tools die nodig zijn voor deze workflow via een browsergebaseerd platform dat op alle belangrijke besturingssystemen en apparaten werkt zonder dat de installatie van desktopsoftware vereist is.
De technieken die in dit artikel worden beschreven, kunnen worden geïmplementeerd met behulp van een verscheidenheid aan PDF-tools die op de markt verkrijgbaar zijn, van gratis browsergebaseerde services tot professionele desktopapplicaties met geavanceerde functiesets.
Met de juiste aanpak en de juiste toolconfiguratie wordt wat aanvankelijk een complexe documentuitdaging lijkt, een eenvoudig proces met voorspelbare en herhaalbare resultaten.
Het PDF-formaat blijft evolueren en de hulpmiddelen voor het werken met PDF's worden met elke generatie beter. Door op de hoogte te blijven van nieuwe mogelijkheden zorgt u ervoor dat documentworkflows efficiënt blijven.
Of u deze handeling nu voor de eerste keer uitvoert of een bestaande workflow verfijnt, de hier beschreven principes en methoden bieden een duidelijke en praktische handleiding.
Het investeren van tijd in het begrijpen van de beschikbare instellingen en het testen ervan op voorbeelddocumenten voordat de volledige batch consistent wordt verwerkt, levert betere resultaten op.
De mogelijkheid om deze PDF-bewerking betrouwbaar uit te voeren is een waardevolle toevoeging aan elke documentworkflow, waardoor u aanzienlijke tijd bespaart en professionele resultaten produceert.
Door de specifieke instellingen en workflow voor elk type PDF-taak te documenteren, ontstaat een herbruikbare referentie die tijd bespaart bij toekomstige projecten.
De hier beschreven methoden en benaderingen vertegenwoordigen de huidige best practices voor het omgaan met dit aspect van PDF-documentbeheer in een breed scala aan scenario's.
Door oefening worden deze PDF-bewerkingen een tweede natuur, waardoor documentprofessionals zich kunnen concentreren op de inhoud in plaats van te worstelen met technische obstakels.
Lezers die deze technieken toepassen, zullen merken dat complexe taken beheersbaar worden door oefening en de juiste toolconfiguratie.
De investering in het leren van de juiste PDF-verwerking betaalt zich uit bij talloze documenttaken, waardoor het een van de meest praktische vaardigheden op de moderne werkplek wordt.
In dit artikel worden de essentiële concepten en praktische stappen besproken die nodig zijn om deze PDF-taak van begin tot eind effectief uit te voeren.
Een goed begrip van deze activiteiten stelt gebruikers in staat om documentuitdagingen zelfstandig aan te pakken, waardoor de afhankelijkheid van technische ondersteuning wordt verminderd.
Deze technieken zijn getest in een breed scala aan documenttypen, waardoor de geboden richtlijnen zowel praktisch als betrouwbaar zijn.
Zoals bij veel documentbewerkingen hangt de kwaliteit van het resultaat in grote mate af van de zorgvuldigheid die is betracht tijdens het instellen en de grondigheid van de verificatie voordat het document wordt afgerond.
Dankzij de richtlijnen in dit artikel kunnen lezers in elke professionele context met competentie en zekerheid met dit aspect van PDF-werk omgaan.
Het beheersen van deze PDF-vaardigheid is een investering die waarde blijft opleveren doordat elk document wordt verwerkt en elke workflow wordt gestroomlijnd voor meer efficiëntie.
Wanneer deze vaardigheid eenmaal is ontwikkeld, wordt deze een permanent en waardevol onderdeel van elke professionele documenttoolkit, toepasbaar in alle sectoren en gebruiksscenario's.
De kennis die uit dit artikel is opgedaan, is van toepassing op alle tools, platforms en documenttypen, waardoor het universeel bruikbaar is voor iedereen die regelmatig met PDF-bestanden werkt.
Deze technieken zijn getest in een breed scala aan documenttypen en scenario's, waardoor de geboden begeleiding zowel praktisch als betrouwbaar is voor professionele toepassingen in de echte wereld waarbij kwaliteit belangrijk is.
Een goed begrip van deze PDF-bewerkingen stelt gebruikers in staat om documentuitdagingen zelfstandig en met vertrouwen aan te pakken, waardoor de afhankelijkheid van technische ondersteuning wordt verminderd en een snellere projectafronding mogelijk wordt gemaakt.
Het PDF-formaat blijft de standaard voor documentuitwisseling tussen industrieën en platforms over de hele wereld, en het beheersen van deze technieken verbetert zowel de persoonlijke productiviteit als de organisatorische capaciteiten.
De praktische stappen die in dit artikel worden beschreven, begeleiden de lezer vanaf de eerste uitdaging tot aan een complete en geverifieerde oplossing die voldoet aan professionele kwaliteitsnormen.
Met oefening en de juiste gereedschapsconfiguratie worden deze handelingen routinetaken die snel en betrouwbaar kunnen worden uitgevoerd telkens wanneer ze nodig zijn.
Doorzoekbaarheid is geen overbodige luxe. Het is een fundamentele verwachting van digitale documenten. Een pdf die niet kan worden doorzocht, is slechts een half digitaal document. Het heeft de visuele uitstraling van tekst, maar mist de functionele essentie van digitale informatie.
De oplossing is meestal eenvoudig. Identificeer de oorzaak. Pas de oplossing toe. Voor een scan is OCR nodig. Omlijnde tekst heeft OCR nodig. Coderingsproblemen moeten opnieuw worden gecreëerd. De diagnose bepaalt de behandeling. Het resultaat is een PDF die zowel functioneel als leesbaar is.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
