Je hebt een doorzoekbare PDF. Je converteert het naar Word om bewerkingen uit te voeren. U slaat het bewerkte document weer op in PDF. De nieuwe PDF ziet er identiek uit aan het origineel, maar wanneer u zoekt naar een woord waarvan u weet dat het in het document voorkomt, levert de zoekopdracht geen resultaten op. De tekst die in de originele PDF doorzoekbaar was, is onzichtbaar voor de zoekfunctie in de nieuwe PDF. De rondreis door Word ontnam de doorzoekbaarheid van de tekst.
De conversie van PDF naar Word, gevolgd door de herconversie van Word naar PDF, is een gebruikelijke workflow voor het bewerken van PDF's, maar elke conversiestap introduceert mogelijkheden voor corruptie van tekstlagen. De tekst die terugkomt in PDF-formaat kan anders worden opgeslagen dan het origineel, opgeslagen als vectorcontouren in plaats van tekencodes, of gerasterd tot afbeeldingen. Elk van deze uitkomsten levert een PDF op waarin de tekst zichtbaar maar niet doorzoekbaar is.

Hoe tekst overleeft of verloren gaat tijdens formaatconversie
In de originele doorzoekbare PDF wordt tekst opgeslagen als tekencodes die zijn toegewezen aan lettertypeglyphs. Het teken H wordt opgeslagen als de ASCII-code 72, die de PDF-lezer vertelt de glyph voor H uit het ingesloten lettertype weer te geven. De zoekfunctie scant de tekencodes voor de zoekterm en markeert de overeenkomstige posities op de pagina. Deze op tekencodes gebaseerde opslag maakt tekst doorzoekbaar.
Wanneer de PDF naar Word wordt geconverteerd, extraheert de converter de tekencodes en schrijft deze als bewerkbare tekst in het Word-document. De tekst in Word is doorzoekbaar omdat Word deze opslaat als Unicode-tekencodes. De conversie van PDF naar Word behoudt de doorzoekbaarheid zolang de converter de tekencodes correct extraheert.
Wanneer het bewerkte Word-document weer als PDF wordt opgeslagen, moet de Word PDF-engine beslissen hoe de tekst moet worden opgeslagen. De standaardinstellingen slaan tekst op als tekencodes met ingesloten lettertypen, waardoor de doorzoekbaarheid behouden blijft. Bepaalde Word-functies en PDF-instellingen zorgen er echter voor dat tekst wordt opgeslagen als vectorcontouren of wordt gerasterd als afbeeldingen.
Teksteffecten in Word, zoals tekstschaduwen, reflecties, gloed en 3D-rotatie, zorgen ervoor dat de Word PDF-engine de betreffende tekst naar afbeeldingen converteert. De tekst ziet er visueel correct uit, maar bevat geen tekencodes die de zoekfunctie kan vinden. De eigenschap PDF Searchable gaat verloren voor tekst waarop visuele effecten zijn toegepast.
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Hoe u de doorzoekbaarheid van tekst tijdens de retour kunt behouden
Controleer de opslaginstellingen voordat u het bewerkte Word-document naar PDF opslaat. Open in Word Bestand, Opties, Opslaan en zorg ervoor dat Lettertypen insluiten in het bestand is aangevinkt. Deze instelling zorgt ervoor dat lettertypen worden ingesloten als op tekens gebaseerde tekst en niet worden omgezet in contouren of afbeeldingen.
Vermijd het toepassen van teksteffecten op inhoud die doorzoekbaar moet blijven. Gebruik vetgedrukte, cursieve en kleuropmaak in plaats van schaduw-, reflectie- en glanseffecten. Het visuele onderscheid kan worden bereikt zonder dat dit ten koste gaat van de doorzoekbaarheid.
WukongPDF biedt PDF Converter tools waarmee PDF's kunnen worden verwerkt om de tekstopslag te optimaliseren. Als een PDF is gemaakt met niet-doorzoekbare tekst, kan OCR een doorzoekbare tekstlaag toevoegen achter de bestaande visuele inhoud.
Doorzoekbaarheid na herconversie verifiëren
Nadat u het Word-document als PDF hebt opgeslagen, opent u de PDF en test u de zoekfunctie. Zoek naar een woord dat op elke pagina voorkomt. Als een pagina geen resultaten oplevert voor een woord dat zichtbaar aanwezig is, bevat die pagina ondoorzoekbare tekst. De zoektest duurt enkele seconden en signaleert zoekbaarheidsverlies voordat het document wordt gedistribueerd.
Als de doorzoekbaarheid verloren is gegaan, voert u OCR uit op de opnieuw geconverteerde PDF om een doorzoekbare tekstlaag toe te voegen. De OCR herkent de zichtbare tekst en creëert daarachter tekencodes. De zoekfunctie kan de tekst vervolgens vinden via de door OCR gegenereerde tekencodes. Dit is een post-hoc oplossing, geen preventie, maar herstelt de doorzoekbaarheid van een ondoorzoekbare PDF.
Voor documenten die een gegarandeerde doorzoekbaarheid vereisen, kunt u de heen- en terugreis van PDF naar Word naar PDF volledig vermijden. Bewerk het originele brondocument, het Word-bestand, het InDesign-bestand, het Google-document en exporteer een nieuwe PDF. Door de enkele export van bron naar PDF blijft de doorzoekbaarheid behouden zonder tussenliggende conversiestappen.
De Word-compatibiliteitsmodus heeft invloed op de PDF-uitvoer. Documenten die zijn opgeslagen in het oudere DOC-formaat in plaats van DOCX, kunnen andere tekstopslagmethoden gebruiken die de doorzoekbaarheid van PDF's beïnvloeden. Sla documenten op in het huidige DOCX-formaat voordat u ze naar PDF exporteert.
Tekst in Word-tekstvakken kan tijdens de PDF-export gerasterd worden, afhankelijk van de opmaak van het tekstvak. Tekstvakken met opvuleffecten, rotatie of veranderingen in de tekstrichting worden vaker gerasterd dan gewone tekstvakken.
Wanneer tekst tijdens de PDF-export wordt gerasterd, wordt deze een afbeelding van tekst in plaats van gecodeerde tekst. De afbeelding wordt correct weergegeven, maar de tekens zijn pixels en geen codes. OCR kan de tekst herstellen, maar de OCR-tekst kan herkenningsfouten bevatten.
De PDF-exportopties in Word omvatten de instelling Bitmaptekst wanneer lettertypen mogelijk niet zijn ingesloten. Met deze instelling wordt tekst gerasterd waarin lettertypen met insluitingsbeperkingen worden gebruikt. Door ervoor te zorgen dat alle lettertypen kunnen worden ingesloten, wordt deze geforceerde rastering voorkomen.
Vergelijk na de retourconversie de bestandsgrootte van de originele PDF en de opnieuw geconverteerde PDF. Een aanzienlijk grotere, opnieuw geconverteerde PDF kan erop wijzen dat tekst is gerasterd naar afbeeldingen, die meer opslagruimte in beslag nemen dan gecodeerde tekst.
Sommige PDF-naar-Word-converters bieden een op OCR gebaseerde conversiemodus voor gescande PDF's en een tekstextractiemodus voor digitale PDF's. Het gebruik van de verkeerde modus levert onverwachte resultaten op. Digitale PDF's moeten gebruik maken van tekstextractie, en niet van OCR, om de originele tekencodering te behouden.
Wanneer de doorzoekbaarheid van tekst verloren gaat, retourneert de functie Zoeken in de PDF-viewer geen resultaten voor woorden die zichtbaar aanwezig zijn. Als u op elke pagina zoekt naar veelgebruikte woorden zoals de of en, kunt u snel bevestigen of het hele document doorzoekbare tekst bevat.
Voor documenten die doorzoekbaarheid moeten behouden via meerdere bewerkingscycli, maakt u een hoofddocument in een bewerkbaar formaat, Word, Google Docs of InDesign, en behandelt u de PDF als een alleen-lezen distributieformaat. Alle bewerkingen vinden plaats in de master en de PDF wordt na elke bewerkingscyclus opnieuw gegenereerd op basis van de master.
Toegankelijkheidscontroles kunnen de doorzoekbaarheid van tekst verifiëren en pagina's met ondoorzoekbare tekst identificeren. Voer een toegankelijkheidscontrole uit op de opnieuw geconverteerde PDF om te bevestigen dat alle tekst gecodeerd en toegankelijk is.
De PDF/UA-standaard vereist dat alle tekst wordt gecodeerd als Unicode-tekens, waardoor doorzoekbaarheid en toegang tot schermlezers worden gegarandeerd. Bij het exporteren naar PDF/UA vanuit Word worden vereisten voor tekstcodering afgedwongen die de doorzoekbaarheid behouden.
De keuze van de PDF naar Word-converter heeft invloed op het behoud van de tekst. Converters die voorrang geven aan visuele getrouwheid boven tekstbewerkbaarheid, kunnen tekst rasteren die ongebruikelijke lettertypen of positionering gebruikt. Converters die prioriteit geven aan de bewerkbaarheid van tekst, kunnen beter doorzoekbare uitvoer produceren.
Wanneer tekst in de PDF wordt opgeslagen als ligaturen, fi, fl, ffi, kan de converter de ligatuur opsplitsen in afzonderlijke tekens of deze als één teken behouden. Het gedrag van de zoekfunctie is afhankelijk van hoe de ligatuur tijdens de conversie is afgehandeld.
Verlies van zoekbaarheid bij toekomstige conversies voorkomen
Tekst die oorspronkelijk op vectoren was gebaseerd in de bron-PDF, kan tijdens de export van Word naar PDF worden geconverteerd naar rasterafbeeldingen als het Word-document functies gebruikt zoals WordArt, SmartArt of ingesloten Excel-diagrammen. Deze functies worden weergegeven als afbeeldingen in de PDF-uitvoer.
De instellingen voor het maken van PDF's in Word omvatten een optie om bladwijzers van koppen te maken. Deze optie behoudt de documentstructuur, maar heeft geen invloed op de doorzoekbaarheid van tekst. Bladwijzers en doorzoekbaarheid zijn onafhankelijke functies.
Door de doorzoekbaarheid te testen door te zoeken naar een woord dat op elke pagina voorkomt, zoals een veel voorkomend woord in de documenttaal, worden pagina's met ondoorzoekbare tekst snel geïdentificeerd. Als een pagina geen resultaten retourneert voor een veelvoorkomend woord, heeft die pagina een probleem met de tekstcodering.
Door de omstandigheden te begrijpen waaronder de doorzoekbaarheid van tekst verloren gaat tijdens de heen- en terugreis van PDF naar Word naar PDF, kunnen documentmakers weloverwogen keuzes maken over hun bewerkingsworkflow en de toegankelijkheid en vindbaarheid van hun inhoud behouden.
Het behouden van de doorzoekbaarheid van tekst via de heen- en terugreis van PDF naar Word naar PDF vereist aandacht voor de conversie-instellingen bij elke stap en inzicht in welke Word-functies ervoor zorgen dat tekst wordt gerasterd in plaats van gecodeerd als tekens.
Voor documenten waarbij doorzoekbaarheid van tekst een vereiste is, is het opzetten van een workflow die de originele gecodeerde tekst bij elke formaatconversie behoudt efficiënter dan proberen de doorzoekbaarheid te herstellen nadat deze verloren is gegaan.
Doorzoekbaarheid van tekst is een functie die gebruikers als vanzelfsprekend beschouwen totdat deze afwezig is, en het herstellen van de doorzoekbaarheid naar een ondoorzoekbare PDF vereist herverwerking vanuit de oorspronkelijke bron of het uitvoeren van OCR op de betreffende pagina's om de tekstlaag opnieuw te creëren.
De heen- en terugreis van PDF naar Word naar PDF is een gebruikelijke bewerkingsworkflow die meerdere mogelijkheden biedt om tekstcodering te verslechteren of verloren te laten gaan. Door elk risicopunt te begrijpen, kunnen gebruikers de doorzoekbaarheid tijdens het proces behouden.
Doorzoekbaarheid van tekst is geen cosmetische functie, maar een fundamentele documentmogelijkheid die van invloed is op de toegankelijkheid, vindbaarheid en de mogelijkheid om inhoud te extraheren en opnieuw te gebruiken voor ander gebruik.
De keuze voor een PDF naar Word-converter heeft een aanzienlijke invloed op de uitkomst van de heen- en terugreis, waarbij converters die zijn geoptimaliseerd voor tekstbewerkbaarheid een beter doorzoekbare uitvoer produceren dan die welke zijn geoptimaliseerd voor visuele getrouwheid.
Wanneer de doorzoekbaarheid tijdens de rondreis verloren gaat, kan OCR een doorzoekbare tekstlaag herstellen, maar de OCR-tekst bevat herkenningsfouten die moeten worden gecorrigeerd om het document volledig betrouwbaar te maken.
Voor documenten waarbij doorzoekbaarheid een vereiste is, is het behouden van het originele bronbestand en het exporteren van nieuwe PDF's na elke bewerkingscyclus betrouwbaarder dan heen en weer bladeren door Word.
Het PDF-formaat bewaart tekst op een fundamenteel andere manier dan tekstverwerkingsformaten, en elke vertaling tussen deze representaties brengt het risico van informatieverlies in de tekstcodering met zich mee.
| Retouretappe | Doorzoekbaarheidsrisico | Mitigatie |
|---|---|---|
| PDF naar Word (extractie) | Laag bij gebruik van een conversieprogramma voor tekstextractie | Gebruik een converter met tekstextractiemodus |
| Bewerken in Word | Geen; Word-tekst is altijd doorzoekbaar | Vermijd teksteffecten (schaduw, gloed, 3D) |
| Word naar PDF (exporteren) | Medium; effecten veroorzaken rasterisatie | Lettertypen insluiten; vermijd effecten op doorzoekbare tekst |
| Verificatie na export | N.v.t | Zoek op elke pagina naar veelvoorkomende woorden |
Probeer PDF naar Word
Geen installatie nodig. Werkt rechtstreeks in uw browser.
