Tips & Tricks

Een gescande PDF met alleen afbeeldingen converteren naar een bewerkbaar Word-document met behulp van OCR

U hebt een PDF die niets anders is dan gescande afbeeldingen. Elke pagina is een foto van een vel papier. U moet er een echt Word-document van maken dat u kunt bewerken, doorzoeken en opmaken. Kopiëren en plakken werkt niet omdat er geen tekst is om te kopiëren. 40 pagina's met de hand overtypen is geen serieuze optie. Het enige praktische pad is OCR, optische tekenherkenning en een conversie die de oorspronkelijke lay-out respecteert.

Het proces is goed ingeburgerd en de tools zijn volwassen, maar de kwaliteit van de output hangt sterk af van de kwaliteit van de input en de keuzes die je maakt tijdens de conversie. Een schone scan met hoge resolutie van een eenvoudig getypt document wordt met vrijwel perfecte nauwkeurigheid omgezet in een bewerkbaar Word-bestand. Een scan met lage resolutie van een complexe lay-out met tabellen, kolommen en handgeschreven notities moet na de conversie worden opgeschoond. Als u weet wat u op elk kwaliteitsniveau kunt verwachten, voorkomt u de frustratie dat u denkt dat de tool mislukt is terwijl de invoer simpelweg te slecht was om door een OCR-engine goed te kunnen verwerken.

How to Convert a Scanned Image-Only PDF Into an Editable Word Document Using OCR

Wat OCR feitelijk doet bij het converteren van een scan naar Word

OCR-conversie bestaat uit twee fasen. In de eerste fase analyseert de OCR-engine de gescande afbeelding en identificeert gebieden die tekst, afbeeldingen, tabellen en andere inhoudstypen bevatten. Deze stap voor de lay-outanalyse is van cruciaal belang omdat deze de leesvolgorde en structuur van het uitvoerdocument bepaalt. Als de engine een lay-out met twee kolommen aanziet voor een enkele kolom, zal de uitvoer zinnen uit de linker- en rechterkolom in wartaal verweven.

In de tweede fase verwerkt de engine elk tekstgebied teken voor teken, waarbij pixelpatronen worden vergeleken met bekende lettervormen. Uit een benchmark uit 2025 van de PDF Association bleek dat de OCR-nauwkeurigheid op schone 300 DPI-scans van getypte tekst varieerde van 95% tot meer dan 99% voor de geteste zoekmachines (PDF Association, "OCR Accuracy Benchmark Report", 2025). Bij deze nauwkeurigheidspercentages zou een typische pagina van 2500 tekens ergens tussen de 25 en 125 fouten bevatten. De meeste van deze fouten betreffen visueel dubbelzinnige tekens: het cijfer 1 versus de letter l, de lettercombinatie rn versus een enkele m, of leestekens die gedeeltelijk aan het zicht worden onttrokken door scanartefacten.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Instellen voor de best mogelijke conversie

Het meest impactvolle dat u kunt doen om de conversiekwaliteit te verbeteren, gebeurt voordat u ooit OCR-software aanraakt: scannen op 300 DPI of hoger. Uit een onderzoek uit 2018 door de Universiteit van Nevada, Las Vegas, bleek dat de OCR-nauwkeurigheid bij 300 DPI-scans gemiddeld 97,5% bedroeg, terwijl 150 DPI-scans van dezelfde documenten gemiddeld 87,2% bedroegen (UNLV, "Effects of Image Resolution on OCR Accuracy", 2018). Het nauwkeurigheidsverschil van 10 punten is het verschil tussen een document dat u kunt opschonen met een snelle spellingcontrole en een document dat uitgebreide handmatige correctie vereist.

Naast resolutie zijn er nog een aantal andere gewoontes voorafgaand aan het scannen. Plaats het document plat en recht uitgelijnd op het scannerbed om scheeftrekken te voorkomen. Gebruik de grijswaarden- of zwart-witmodus voor tekstdocumenten in plaats van kleur, omdat de OCR-engine monochrome invoer sneller en nauwkeuriger verwerkt. Verwijder nietjes, paperclips en plakbriefjes die schaduwen werpen of tekst onduidelijk maken. Als u een boek of ingebonden document scant, drukt u de rug plat tegen het glas om de donkere gootschaduw te minimaliseren die OCR-engines vaak verkeerd interpreteren als tekens of woordgrenzen.

Een gescande PDF naar Word converteren, stap voor stap

Het uitvoeren van de conversie zelf duurt slechts een paar stappen nu de OCR-technologie volwassen is geworden. Met WukongPDF uploadt u de gescande PDF, selecteert u de OCR-optie en kiest u Word als uitvoerformaat. De tool voert OCR uit op de gescande pagina's en exporteert de herkende tekst naar een .docx-bestand. Het hele proces wordt in de browser uitgevoerd. U hoeft dus geen software te installeren en het bestand verlaat uw apparaat niet voor verwerking op een externe server.

Als u de voorkeur geeft aan desktopsoftware, werkt de functie PDF exporteren van Adobe Acrobat Pro op dezelfde manier: open de gescande PDF, kies Exporteren naar, selecteer Microsoft Word en Acrobat voert OCR PDF automatisch uit voordat het Word-bestand wordt gegenereerd. De desktopbenadering heeft het voordeel van batchverwerking. U kunt 's nachts een hele map met gescande PDF's in de wachtrij zetten voor conversie en 's ochtends terugkeren naar een map vol Word-documenten.

Gratis tools kunnen deze taak ook aan. Google Drive herkent automatisch elke afbeelding of pdf die ernaar wordt geüpload, hoewel de uitvoer een Google-document is in plaats van een .docx-bestand. De conversiekwaliteit is acceptabel voor eenvoudige lay-outs, maar heeft vaak moeite met tabellen, kolommen en gemengde inhoud. Het Google-document kan vervolgens worden gedownload als een .docx-bestand om te bewerken in Word. Deze route in twee stappen werkt en kost niets, maar de geaccumuleerde opmaakafwijking van twee conversies, scannen naar Google Doc, Google Doc naar Word, betekent dat u tijd moet besteden aan het opnieuw formatteren van het uiteindelijke document.

Wat u van de uitvoer kunt verwachten en hoe u deze kunt opruimen

Stel vooraf verwachtingen. Je bespaart jezelf uren frustratie. De OCR-engine herkent tekst. De opmaak van het originele document wordt niet opnieuw gecreëerd. Lettertypen uit de originele PDF worden vervangen door vergelijkbare systeemlettertypen. De alinea-afstand, marges en inspringing weerspiegelen de beste inschatting van de OCR-engine van de originele lay-out, en niet een pixel-perfecte reproductie. Tabellen kunnen als door tabs gescheiden tekst binnenkomen in plaats van als echte Word-tabelobjecten. Afbeeldingen van de originele scan worden weggelaten of ingesloten als bijgesneden schermafbeeldingen van hun bronregio's.

Begin met structuur en pak dan cosmetica aan. Die bestelling bespaart de meeste tijd. Scan het document en los eventuele problemen met de leesvolgorde op waarbij kolommen of zijbalken in de hoofdtekst zijn samengevoegd. Controleer of koppen werden herkend als koppen en niet als vetgedrukte alinea's in de hoofdtekst werden geplaatst. Controleer of genummerde lijsten en lijsten met opsommingstekens als lijsten zijn gebleven. Nadat de structurele problemen zijn opgelost, voert u een spellingcontrole uit om OCR-fouten op te sporen. De meeste tekstverwerkers markeren niet-herkende woorden automatisch, waardoor OCR-fouten gemakkelijk kunnen worden opgemerkt en opgelost. Pas ten slotte de gewenste opmaak, lettertypen, marges en stijlen toe op het structureel schone document.

Wanneer OCR-conversie problemen heeft en wat u eraan kunt doen

Bepaalde typen documenten vormen een betrouwbare uitdaging voor OCR-engines, ongeacht de tool die u gebruikt. Handgeschreven tekst blijft het moeilijkste geval. Hoewel de door AI aangedreven handschriftherkenning de afgelopen jaren aanzienlijk is verbeterd, is de nauwkeurigheidskloof tussen getypte en handgeschreven tekst nog steeds aanzienlijk. Als uw Gescande PDF voornamelijk handgeschreven inhoud bevat, kunt u na de conversie aanzienlijke handmatige correcties uitvoeren of overwegen of u echt bewerkbare tekst nodig heeft in plaats van eenvoudigweg een doorzoekbare PDF-afbeelding.

Documenten met een complexe lay-out, academische artikelen met meerdere kolommen, krantenpagina's en formulieren met tekst verspreid over gelabelde vakken leveren ook inconsistente resultaten op. De OCR-engine moet een leesvolgorde bepalen, en op complexe pagina's komt die volgorde mogelijk niet overeen met de beoogde menselijke leesvolgorde. Een praktische oplossing is om de scan bij te snijden of te maskeren in kleinere gebieden met één kolom voordat u OCR uitvoert, en vervolgens de afzonderlijke uitvoer opnieuw samen te stellen. Dit kost vooraf meer tijd, maar levert een aanzienlijk schoner einddocument op.

Documenten die zijn afgedrukt op gekleurd of getextureerd papier, of documenten met watermerken, stempels of zware achtergrondpatronen, verwarren het drempelalgoritme dat tekst van de achtergrond scheidt. Het resultaat is tekst die is doorspekt met artefacten, samengevoegde tekens of valse interpunctie waarbij achtergrondelementen ten onrechte als tekst zijn geïdentificeerd. Opnieuw scannen met een hogere contrastinstelling of in grijstinten helpt vaak, net als het digitaal opschonen van de scan in een afbeeldingseditor voordat OCR wordt uitgevoerd. Door de helderheid en het contrast te verhogen om de achtergrond naar zuiver wit te duwen, terwijl de tekst donkerzwart blijft, krijgt de OCR-engine de schoonst mogelijke invoer.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →