Tips & Tricks

Een document OCR maken dat zowel handgeschreven notities als getypte tekst bevat

Je scant een papieren formulier dat iemand met de hand heeft ingevuld. De afgedrukte tekst op het formulier is duidelijk. De handgeschreven antwoorden in de vakjes zijn rommelig maar leesbaar voor een mens. U voert OCR uit op de scan, in de hoop dat het formulier doorzoekbaar wordt en de handgeschreven antwoorden als tekst kunnen worden geëxtraheerd. Het OCR-resultaat voor de afgedrukte tekst is vrijwel perfect. Het OCR-resultaat voor het handschrift is onzin. De herkenningsengine, getraind op gedrukte lettertypen, kan de variabele, onregelmatige vormen van het menselijk handschrift niet begrijpen.

Documenten die zowel getypte als handgeschreven tekst bevatten vormen een dubbele uitdaging voor OCR PDF-engines. De afgedrukte tekst heeft standaard OCR nodig, wat goed werkt. Het handschrift heeft gespecialiseerde handschriftherkenning nodig, die minder nauwkeurig is en andere instellingen vereist. Om beide in één document te kunnen verwerken, is een strategie nodig die elk inhoudstype op de juiste manier behandelt.

How to OCR a Document That Contains Both Handwritten Notes and Typed Text Together

Waarom handschrift zoveel moeilijker is voor OCR-engines

OCR voor gedrukte tekst werkt door tekenvormen af te stemmen op bekende lettertypepatronen. De letter "a" in 12-punts Times New Roman ziet er elke keer dat het verschijnt vrijwel identiek uit. De OCR-engine slaat een model op van hoe Times New Roman-letters eruit zien en vergelijkt dit met dat model. Handschrift kent zo'n model niet. De "een" van ieder persoon ziet er anders uit. Zelfs de 'a' van dezelfde persoon varieert van gebeurtenis tot gebeurtenis, afhankelijk van de omringende letters, schrijfsnelheid, penhoek en vermoeidheid. Er is geen vast patroon waar je tegenaan kunt lopen.

Handschriftherkenning maakt gebruik van machine learning-modellen die zijn getraind op duizenden of miljoenen handschriftvoorbeelden. Deze modellen leren de statistische patronen van hoe handgeschreven letters variëren en kunnen tekens herkennen, zelfs als ze aanzienlijk afwijken van een enkel sjabloon. De nauwkeurigheid van handschriftherkenning is dankzij deep learning dramatisch verbeterd, maar blijft nog steeds aanzienlijk achter bij de herkenning van gedrukte tekst. Uit een benchmark uit 2025 van de PDF Association bleek dat de OCR-nauwkeurigheid van afgedrukte tekst op schone scans boven de 97% lag. De nauwkeurigheid van handschriftherkenning op dezelfde benchmark was ongeveer 80% tot 85%, wat betekent dat ongeveer één op de vijf tot zes handgeschreven woorden een fout bevat (PDF Association, "OCR Accuracy Benchmark Report", 2025).

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Strategieën voor OCR op gemengd getypte en handgeschreven documenten

De meest effectieve strategie is om het document op te delen in getypte en handgeschreven regio's en elk document te verwerken met de juiste herkenningsengine. Deze scheiding kan handmatig worden gedaan door het document in secties bij te snijden of te maskeren, of automatisch door een herkenningsengine die het inhoudstype per regio detecteert.

De OCR-tool van WukongPDF detecteert of elk tekstgedeelte op de pagina gedrukt of met de hand geschreven is en past het juiste herkenningsmodel toe. Op een formulier met afgedrukte labels en handgeschreven antwoorden worden de labels met hoge nauwkeurigheid herkend met het gedrukte tekstmodel. De handgeschreven antwoorden worden met het handschriftmodel verwerkt met de nauwkeurigheid die de handschriftkwaliteit toelaat. De uitvoer is een enkele tekstlaag die beide herkenningsresultaten combineert.

De nauwkeurigheid van handschrift-OCR verbeteren door beter scannen

De scankwaliteit heeft een grotere impact op de handschriftherkenning dan op de herkenning van gedrukte tekst. Scannen met minimaal 300 DPI. Een hogere resolutie geeft de herkenningsengine meer pixels per teken om te analyseren. Gebruik de grijswaarden- of kleurmodus in plaats van puur zwart-wit. De subtiele grijze variaties in een handgeschreven lijn bevatten informatie over lettervormen die door pure zwart-witdrempels wordt weggegooid. Een handgeschreven "e" waarbij de lus gedeeltelijk is opgevuld, kan in grijstinten herkenbaar zijn, maar wordt een niet te onderscheiden klodder wanneer de drempel naar zwart en wit wordt gezet.

Zorg ervoor dat het handschrift zo donker en consistent mogelijk is. Een potloodhandschrift is moeilijker te herkennen dan een pen, omdat het grafiet een zwakkere, meer variabele lijn produceert. Blauwe of zwarte inkt op wit papier geeft het beste contrast. Rode inkt, groene inkt of gekleurd papier verminderen het contrast en de nauwkeurigheid. Als u het formulierinvulproces beheert, geef dan aan dat formulieren met zwarte inkt moeten worden ingevuld voor de beste OCR-resultaten. Deze kleine instructie op het formulier zelf kan de nauwkeurigheid van de gegevensextractie stroomafwaarts met 10 tot 15 procentpunten verbeteren.

Handschrift-OCR-uitvoer bekijken en corrigeren

Na OCR zal de tekstlaag Gescande PDF fouten bevatten die geconcentreerd zijn in de handgeschreven gebieden. De afgedrukte tekst zal bijna perfect zijn. Concentreer uw beoordeling op de handgeschreven antwoorden. Open de pdf en zoek naar veelvoorkomende handschrift-OCR-fouten. Het cijfer 1 wordt vaak herkend als de letter l. Het cijfer 0 wordt vaak herkend als de letter O. De lettercombinatie "th" wordt vaak herkend als "+h" omdat de dwarsbalk van de t overgaat in de h.

Voor formuliergegevens die in een database of spreadsheet moeten worden geëxtraheerd, is handmatige beoordeling van de handgeschreven velden essentieel. De herkenningsengine geeft een beste schatting. Een mens moet die gok verifiëren aan de hand van het originele handschrift. Bij deze verificatiestap wordt de tijdbesparing van OCR gedeeltelijk gecompenseerd door de behoefte aan menselijke kwaliteitscontrole. De nettobesparing is afhankelijk van het volume. Voor tien formulieren kan handmatige gegevensinvoer sneller zijn dan OCR plus controle. Voor 500 formulieren is OCR plus beoordeling aanzienlijk sneller omdat de beoordelingsstap beperkt is tot de velden waar de OCR-betrouwbaarheid laag is. De OCR-uitvoer van WukongPDF bevat een betrouwbaarheidsscore voor elk herkend tekstblok, zodat u kunt sorteren op betrouwbaarheid en alleen de resultaten met weinig vertrouwen kunt bekijken.

Voor formulieren die in grote volumes worden verwerkt, zoals medische intakeformulieren, verzekeringsclaims of overheidsaanvragen, kan het formulierontwerp zelf de OCR-nauwkeurigheid van handschriften verbeteren. Ontwerp het formulier met afzonderlijke tekenvakken, één vak per letter, in plaats van één lange regel voor een naam of adres. Individuele tekenvakken dwingen de schrijver om de letters te scheiden, wat de herkenningsnauwkeurigheid aanzienlijk verbetert, omdat de OCR-engine elk teken kan isoleren voordat de herkenning wordt geprobeerd. Dit is hetzelfde principe dat wereldwijd wordt gebruikt door belastingformulieren en immigratiedocumenten. De vakjes zijn enigszins onhandig voor de persoon die het formulier invult, maar ze maken geautomatiseerde data-extractie op grote schaal mogelijk, wat de afweging is die de verwerking van grote hoeveelheden formulieren vereist.

Een praktisch kwaliteitscontrolepunt na OCR op gemengde documenten: voer een zoekopdracht uit naar veelvoorkomende OCR-foutpatronen die erop wijzen dat de engine handschrift verwart met gedrukte tekst. Zoek naar "cl" en verifieer dat het niet de bedoeling was dat het "d." was. Zoeken naar "0" en controleer of elke instantie feitelijk een nul is en geen hoofdletter O. Zoek naar "1" en verifieer dat het een één is en geen kleine letter L of hoofdletter I. Deze drie zoekopdrachten vangen de meeste OCR-fouten op tekenniveau op in zowel gedrukte als handgeschreven herkenning. Herstel de gevonden fouten en voer vervolgens nog een zoekopdracht uit naar de specifieke namen, nummers of datums die cruciaal zijn voor het doel van het document. Een formulier waarbij de gedrukte instructies een typefout bevatten, is vervelend. Een formulier waarbij de handgeschreven medicatiedosering verkeerd is, is gevaarlijk.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →