Tips & Tricks

Handgeschreven notities in een gescande PDF converteren naar bewerkbare getypte tekst

Een pagina met vergadernotities die met de hand in een notitieboekje zijn geschreven, met een telefoon zijn gefotografeerd en als gescande PDF zijn opgeslagen, bevatten waardevolle informatie die volledig ontoegankelijk is voor zoeken, kopiëren en plakken en schermlezers. De woorden zijn zichtbaar voor het menselijk oog, maar zijn voor de computer slechts vormen in een afbeelding. Door deze handgeschreven notities om te zetten in bewerkbare getypte tekst, kunnen ze doorzoekbaar, kopieerbaar en bruikbaar worden in elk document of elke toepassing.

Handschriftherkenning is moeilijker dan herkenning van gedrukte tekst, omdat ieders handschrift uniek is. De vormen van letters variëren veel meer van persoon tot persoon dan gedrukte lettertypen, en de herkenningsmachine moet met deze variabiliteit omgaan.

Voor het omzetten van handgeschreven notities in een gescand OCR PDF-document naar bewerkbare getypte tekst is een OCR-engine nodig die cursief en gedrukt handschrift kan herkennen, en een workflow die het hogere foutenpercentage van handschriftherkenning afhandelt in vergelijking met OCR voor gedrukte tekst. De Gescande PDF- en OCR-tools van WukongPDF ondersteunen tekstherkenning, en de onderstaande richtlijnen behandelen het maximaliseren van de nauwkeurigheid van handschriftherkenning.

How to Convert Handwritten Notes in a Scanned PDF Into Editable Typed Text

Waarom handschriftherkenning aanzienlijk moeilijker is dan OCR in gedrukte tekst

OCR voor gedrukte tekst werkt door tekenvormen af te stemmen op bekende lettertypepatronen. De letter A in Times New Roman ziet er hetzelfde uit, of ik hem nu typ, jij typt hem of een machine drukt hem af. De herkenningsengine heeft een duidelijk, consistent sjabloon voor elk teken in elk gangbaar lettertype. Handschriftherkenning kent dergelijke sjablonen niet, omdat de letter A van elke persoon er anders uitziet. De engine moet de statistische patronen van handgeschreven karakters herkennen in de enorme variatie in vorm, grootte, helling en verbinding tussen letters.

Cursief handschrift, waarbij letters binnen een woord met elkaar verbonden zijn, voegt een extra laag complexiteit toe. De herkenningsengine moet verbonden letters in afzonderlijke tekens segmenteren voordat ze elk kunnen herkennen. Onjuiste segmentatie, het splitsen van een letter m in r en n, of het samenvoegen van twee letters tot één, is een belangrijke bron van handschriftherkenningsfouten. Gedrukt handschrift, waarbij elke letter afzonderlijk wordt geschreven, is aanzienlijk gemakkelijker te verwerken door herkenningsengines en levert nauwkeurigere resultaten op.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Het gescande beeld voorbereiden voor handschriftherkenning

De kwaliteit van de bronafbeelding is de grootste factor in de nauwkeurigheid van handschriftherkenning, belangrijker dan de keuze van de herkenningsengine. Scan of fotografeer de handgeschreven pagina met minimaal 300 DPI, waarbij 600 DPI wordt aanbevolen voor klein of compact handschrift. Zorg voor een gelijkmatige, schaduwvrije verlichting over de hele pagina. Houd de camera of telefoon parallel aan de pagina om perspectiefvervorming te minimaliseren. Hoe beter het bronbeeld, hoe nauwkeuriger de herkenning.

Verbeter de gescande afbeelding voordat u de herkenning uitvoert. Verhoog het contrast om de inkt donkerder te maken en de achtergrond van het papier lichter te maken. Pas een verscherpingsfilter toe om de randen van handgeschreven streken scherper te maken. Converteer de afbeelding naar grijstinten of puur zwart-wit met behulp van adaptieve drempelwaarde, die beter met ongelijkmatige verlichting omgaat dan een globale drempelwaarde. Het verbeterde beeld presenteert schonere, duidelijkere karaktervormen aan de herkenningsengine.

Handschriftcompatibele OCR-engines gebruiken

Algemene OCR-engines zoals Tesseract bevatten handschriftherkenningsmodi die kunnen worden ingeschakeld via configuratie-instellingen. Geef in Tesseract het taalmodel op dat handschriftondersteuning omvat en stel de paginasegmentatiemodus zo in dat de afbeelding als één enkel tekstblok wordt behandeld. Google Cloud Vision API en Microsoft Azure Computer Vision bevatten mogelijkheden voor handschriftherkenning in hun cloudgebaseerde OCR-services.

Speciale toepassingen voor handschriftherkenning, zoals Nebo, GoodNotes of de inkt-naar-tekstfunctie van Microsoft OneNote, zijn specifiek geoptimaliseerd voor handschrift en leveren vaak betere resultaten op dan algemene OCR-engines die in de handschriftservice worden gebruikt. Exporteer de herkende tekst uit de handschriftapp en integreer deze indien nodig opnieuw met de origineel gescande PDF.

FactorEffect op nauwkeurigheidAanbeveling
ScanresolutieEen hogere resolutie zorgt voor meer details per tekenMinimaal 300 DPI, 600 DPI voor klein handschrift
VerlichtingSchaduwen en ongelijkmatige verlichting verdoezelen de karakterrandenDiffuse, gelijkmatige verlichting; vermijd cameraflits
HandschriftstijlHandschrift afdrukken is gemakkelijker dan cursiefAls u de bron beheert, schrijf dan in gedrukte vorm voor betere resultaten
BeeldverbeteringSchonere input zorgt voor schonere herkenningVerhoog het contrast, verscherp en pas adaptieve drempels toe

De herkende tekst bekijken en corrigeren

Handschriftherkenning levert altijd fouten op, doorgaans een tekenfoutpercentage van 5-20%, afhankelijk van de kwaliteit van het handschrift en de beeldomstandigheden. Vergelijk de herkende tekst met de originele handgeschreven pagina en corrigeer verkeerd herkende woorden. De correctiestap kost tijd, maar is essentieel om de uitvoer bruikbaar te maken voor zoeken, kopiëren en plakken of verder bewerken.

Voor documenten waarbij perfecte nauwkeurigheid vereist is, zoals juridische dossiers of medische notities, dient u de herkende tekst te beschouwen als een zoekindex in plaats van als vervanging van het originele handschrift. Bewaar de originele gescande afbeelding als gezaghebbend document. Gebruik de herkende tekst om te zoeken op trefwoorden, zodat de relevante pagina in de originele scan wordt gevonden. De combinatie van doorzoekbare herkende tekst en de originele afbeelding biedt het beste van beide: vindbaarheid vanuit de tekst, betrouwbaarheid vanuit de afbeelding.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →