Tips & Tricks

Een gescande PDF OCR maken om deze doorzoekbaar te maken

How to OCR a Scanned PDF to Make It Searchable

Wat OCR doet met een gescande PDF

Optische tekenherkenning transformeert een Gescande PDF, een verzameling pagina-afbeeldingen, in een doorzoekbaar document.

Het proces OCR PDF analyseert elke paginaafbeelding, identificeert de vorm van tekens en creëert een onzichtbare tekstlaag achter de paginaafbeelding. Na OCR kunt u zoeken naar woorden in het document, tekst selecteren en kopiëren en schermlezers gebruiken om het document voor te lezen.

OCR transformeert een passief beeld van tekst in een actief, doorzoekbaar document dat tekstselectie en schermlezers ondersteunt.

De nauwkeurigheid van OCR hangt rechtstreeks af van de kwaliteit van de originele scan, waarbij schone 300 DPI-scans de beste resultaten opleveren.

Een gescande PDF zonder OCR is als een fotoalbum met tekst. Je kunt naar de woorden kijken, maar je kunt er geen interactie mee hebben. U kunt niet op een specifieke term zoeken. Je kunt een alinea niet kopiëren om deze te citeren. U kunt geen schermlezer gebruiken. OCR voegt de interactieve mogelijkheden toe die digitale documenten nuttiger maken dan alleen bekijken.

De nauwkeurigheid van OCR hangt af van de kwaliteit van de originele scan. Een zuivere scan met hoge resolutie bij 300 DPI met gelijkmatige belichting en scherpe focus produceert een OCR-nauwkeurigheid van meer dan 99 procent voor standaard afgedrukte tekst. Een scan met een lage resolutie, een foto van een document dat onder een hoek is genomen, of een scan van een gekreukeld of bevlekt origineel levert een lagere nauwkeurigheid op. De kwaliteit van de scan bepaalt rechtstreeks de kwaliteit van de OCR-uitvoer.

De door OCR toegevoegde tekstlaag PDF Doorzoekbaar staat los van de paginaafbeelding. Het visuele uiterlijk van de PDF verandert niet na OCR. De pagina ziet er nog steeds uit als een gescande afbeelding. Achter dat beeld bestaat de herkende tekst als onzichtbare tekengegevens waartoe zoekmachines, schermlezers en tekstselectietools toegang hebben.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

OCR uitvoeren op een gescande PDF op verschillende apparaten

In Windows kan Adobe Acrobat Pro OCR uitvoeren op gescande PDF's. Open de PDF, selecteer de tool Scannen en OCR en kies Tekst herkennen. Acrobat verwerkt elke pagina, herkent de tekst en voegt de doorzoekbare tekstlaag toe. Sla het bestand op. De PDF ondersteunt nu zoeken en tekstselectie. Acrobat Pro biedt de meest nauwkeurige OCR op Windows.

Op Mac bevat de ingebouwde Preview-applicatie geen OCR. Verschillende Mac PDF-tools van derden bieden OCR-mogelijkheden. PDF Expert en PDFpen bevatten beide OCR-engines die gescande PDF's verwerken en doorzoekbare tekstlagen toevoegen. De OCR-kwaliteit is vergelijkbaar met Windows-tools voor standaarddocumenten.

De browsergebaseerde OCR-tool van WukongPDF werkt op elk besturingssysteem. Upload de gescande PDF, selecteer de documenttaal voor de OCR-engine en voer de herkenning uit. Download de doorzoekbare PDF wanneer de verwerking is voltooid. De browsergebaseerde aanpak maakt OCR toegankelijk zonder software te installeren.

Voor iPhone en Android verwerken scanner-apps die OCR bevatten de scan tijdens het vastleggen. Adobe Scan, Microsoft Lens en de ingebouwde scanner in de iPhone Notes-app voeren allemaal automatisch OCR uit bij het scannen van documenten. De resulterende PDF is direct na het scannen doorzoekbaar, zonder een aparte OCR-verwerkingsstap.

Verbetering van de OCR-nauwkeurigheid voor uitdagende documenten

Selecteer de juiste documenttaal voordat u OCR uitvoert. De OCR-engine maakt gebruik van taalspecifieke woordenboeken en tekenfrequentiegegevens om dubbelzinnige tekens op te lossen. Het uitvoeren van OCR op een Frans document met de Franse taalinstelling levert betere resultaten op dan het gebruik van de Engelse instelling. Voor meertalige documenten selecteert u de primaire taal en corrigeert u handmatig fouten in passages van de secundaire taal.

Maak de gescande pagina's recht vóór OCR. Gescande pagina's die enigszins zijn gedraaid, zelfs een of twee graden, verminderen de OCR-nauwkeurigheid omdat de OCR-engine verwacht dat tekstregels horizontaal zijn. De meeste scansoftware bevat een functie voor automatisch rechtzetten. Als de scan tijdens het vastleggen niet rechtgezet is, moet u de PDF-pagina's rechtzetten voordat u OCR uitvoert.

Verhoog de scanresolutie voor documenten met kleine tekst of complexe lay-outs. Tekst onder de 10 punten vereist een hogere scanresolutie voor nauwkeurige OCR. Voor de meeste documenten is een scan op 300 DPI voldoende. Voor documenten met 8-punts tekst of kleiner scant u met 400 of 600 DPI om de OCR-engine voldoende pixelgegevens te geven om afzonderlijke tekens te onderscheiden.

Voor documenten met gemengde inhoudstypen, zoals pagina's die tekst combineren met foto's of illustraties, moet de OCR-engine worden geconfigureerd om alleen tekstzones te herkennen. Als u probeert tekst uit afbeeldingsgebieden te herkennen, levert dat waardeloze tekens op. De meeste OCR-hulpmiddelen bevatten een zoneselectiefunctie waarmee u kunt opgeven welke paginagebieden tekst bevatten.

OCR-uitvoer verifiëren en corrigeren

Nadat de OCR is voltooid, verifieert u de uitvoer door te zoeken naar een paar woorden die u op de pagina kunt zien. Als de zoekopdracht ze vindt, is de OCR succesvol. Als bij de zoekopdracht voor de hand liggende woorden ontbreken, is de OCR-nauwkeurigheid mogelijk onvoldoende voor het specifieke lettertype, de lay-out of de afbeeldingskwaliteit van die pagina.

Voor documenten waarbij de nauwkeurigheid van de OCR van cruciaal belang is, zoals juridische of medische dossiers die volledig doorzoekbaar moeten zijn, kunt u de herkende tekst handmatig bekijken. Met sommige PDF-hulpmiddelen kunt u de verborgen tekstlaag bekijken en bewerken. Corrigeer herkenningsfouten, vooral in eigennamen, cijfers en technische termen die de OCR-engine waarschijnlijk verkeerd herkent.

De meest voorkomende OCR-fouten zijn karakterverwarring. De letter l en het cijfer 1 lijken in veel lettertypen op elkaar. De letters rn samen kunnen op de letter m lijken.

De letters cl kunnen op de letter d lijken. Deze karakterverwarringen produceren woorden die visueel lijken op het origineel, maar tekstueel verkeerd zijn. Handmatige beoordeling van kritieke secties spoort deze fouten op.

Nadat u de OCR-uitvoer heeft gecontroleerd, slaat u het document op met een bestandsnaam die aangeeft dat het met OCR is verwerkt. Een bestandsnaam zoals Report-OCR.pdf of Report-Searchable.pdf onderscheidt de doorzoekbare versie van de originele scan met alleen afbeeldingen.

Het praktische voordeel van een doorzoekbare gescande PDF wordt duidelijk de eerste keer dat u een specifiek stukje informatie in een groot document moet zoeken. Voor een gescand contract van 200 pagina's zonder OCR moet elke pagina handmatig worden doorgelezen om een specifieke clausule te vinden. Een doorzoekbare versie vindt de clausule binnen enkele seconden. Voor elk document waarvan u verwacht dat u er meerdere keren naar zult verwijzen, betaalt de OCR-investering zichzelf terug.

Met OCR verwerkte PDF's zijn ook toegankelijk voor schermlezers, waardoor ze bruikbaar zijn voor mensen met een visuele beperking die afhankelijk zijn van ondersteunende technologie om documenten te lezen. Een gescande PDF zonder OCR is volledig ontoegankelijk voor schermlezers omdat er geen tekst is om voor te lezen. Door OCR toe te voegen, wordt het document toegankelijk, wat vereist is door toegankelijkheidsnormen, waaronder Section 508 en WCAG.

Voor documenten in andere talen dan Engels selecteert u vóór verwerking de juiste OCR-taal. OCR-engines gebruiken taalspecifieke tekenherkenningsmodellen. Een document in het Japans dat wordt herkend met het Japanse model levert veel betere resultaten op dan hetzelfde document dat wordt herkend met een Engels model.

OCR maakt ook tekstextractie mogelijk voor hergebruik in andere documenten. Wanneer u in uw eigen rapport een passage uit een gescand document moet citeren, maakt OCR de tekst kopieerbaar. Zonder OCR zou u de passage handmatig opnieuw moeten typen. De tijd die wordt bespaard door te kunnen kopiëren en plakken vanuit OCR-verwerkte documenten, loopt aanzienlijk op.

Voor gescande documenten die worden gearchiveerd, is OCR een essentiële bewaarstap. Een met alleen afbeeldingen gescande PDF die vandaag wordt gearchiveerd, biedt geen zoekmogelijkheid voor toekomstige onderzoekers. Een doorzoekbare PDF biedt toegang tot de documentinhoud via tekstzoekopdrachten, waardoor de bruikbaarheid van het document voor toekomstige gebruikers aanzienlijk wordt vergroot.

De bestandsgrootte van de PDF verandert niet significant na OCR. De OCR-gegevens voegen een kleine hoeveelheid tekstgegevens toe aan elke pagina, doorgaans een paar kilobytes per pagina. De originele paginaafbeeldingen blijven ongewijzigd. De toename van de bestandsgrootte is verwaarloosbaar in verhouding tot de functionele verbetering die de doorzoekbare tekstlaag biedt.

De doorzoekbare tekstlaag die door OCR wordt toegevoegd, staat los van de visuele paginaafbeelding. Wanneer u naar een woord zoekt in een met OCR verwerkte PDF, komt de zoekopdracht overeen met de tekstlaag en niet met de afbeelding. Het zoekresultaat markeert het gebied op de paginaafbeelding waar de tekst is gevonden.

Met OCR verwerkte PDF's ondersteunen het lezen van tekst naar spraak, waardoor ze toegankelijk zijn voor mensen met een visuele beperking en voor iedereen die liever naar documenten luistert dan ze leest. Deze toegankelijkheidsfunctie is een belangrijk voordeel van OCR naast de eenvoudige doorzoekbaarheid.

Bij grote OCR-projecten waarbij honderden of duizenden gescande pagina's betrokken zijn, bespaart batch-OCR-verwerking veel tijd. Configureer de OCR-instellingen eenmalig en pas deze toe op de gehele documentbatch. Controleer een voorbeeld van de pagina's op nauwkeurigheid in plaats van elke pagina te beoordelen.

De OCR-tekstlaag kan worden geëxporteerd als een gewoon tekstbestand, waardoor de documentinhoud in andere toepassingen kan worden gebruikt. Exporteer de herkende tekst, open deze in een teksteditor of tekstverwerker en gebruik deze als basis voor een nieuw document.

De langetermijnwaarde van een met OCR verwerkte PDF wordt gerealiseerd telkens wanneer u informatie in het document moet zoeken. Een doorzoekbare PDF van een contract, een handleiding of een referentiedocument wordt een hulpmiddel dat u kunt doorzoeken in plaats van een statisch bestand dat u handmatig moet lezen.

Het implementeren van OCR als standaardstap in uw documentscanworkflow zorgt ervoor dat elk document dat u digitaliseert, doorzoekbaar is vanaf het moment dat het uw digitale bibliotheek binnenkomt. De paar extra seconden OCR-verwerking tijdens het scannen werpen hun vruchten af elke keer dat u informatie moet zoeken in een document dat u ooit hebt gescand.

Voor iedereen die een digitale documentenbibliotheek beheert, is OCR de meest impactvolle verwerkingsstap die u op gescande PDF's kunt toepassen. Het transformeert passieve beeldbestanden in actieve, doorzoekbare, toegankelijke documenten.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →