Tips & Tricks

Hoe u een PDF kunt OCReren voor het importeren en indexeren van databases

Als u OCR PDF op een gescand document uitvoert, wordt herkende tekst weergegeven. Voor de meeste gebruikers is het doel een doorzoekbare PDF. Maar wanneer de herkende tekst in een database moet worden geïmporteerd, door een zoekmachine moet worden geïndexeerd of door een toepassing moet worden opgevraagd, zijn de standaard OCR-uitvoerformaten niet ideaal. Door OCR-resultaten te exporteren in een gestructureerd formaat dat is geoptimaliseerd voor het importeren en indexeren van databases, wordt een gescand documentarchief omgezet in opvraagbare gegevens die kunnen worden geïntegreerd met bedrijfssystemen.

Belangrijkste punten

Database-ready OCR-uitvoerformaten omvatten CSV voor tabelgegevens, JSON voor gestructureerde documentinhoud en XML voor documenten die de hiërarchische structuur moeten behouden. Het belangrijkste verschil met standaard OCR-uitvoer is dat database-georiënteerde formaten consistente veldtoewijzing, gegevenstype-indicatoren en foutafhandeling omvatten voor herkenningsresultaten met weinig vertrouwen. Het voorbereiden van de PDF vóór OCR, inclusief rechtzetten, contrastverbetering en resolutie-aanpassing, verbetert de kwaliteit van de geëxporteerde gegevens aanzienlijk.

How to OCR a PDF for Database Import and Indexing

Kies het juiste uitvoerformaat voor uw database

CSV-uitvoer is ideaal voor gescande formulieren en tabellen waarbij elk document overeenkomt met één rij in een database. Elk formulierveld wordt een kolom en elk gescand document wordt een rij. CSV importeert rechtstreeks in spreadsheetapplicaties en relationele databases zonder conversie. De beperking is dat CSV geen hiërarchische gegevens kan vertegenwoordigen. Als het gescande document geneste structuren heeft, zoals een factuur met meerdere regelitems, dwingt CSV u om de structuur plat te maken of de uitvoer over meerdere bestanden te verdelen.

JSON-uitvoer verwerkt op natuurlijke wijze geneste en variabele structuren. Een factuur met een koptekstsectie en meerdere regelitems wordt weergegeven als een JSON-object met een headerarray en een regelitemarray. JSON importeert in documentdatabases zoals MongoDB, zoekindexen zoals Elasticsearch en de meeste moderne applicatieplatforms. De pijplijn Extract PDF Data van OCR naar JSON naar database is de meest gebruikelijke architectuur voor toepassingen voor het begrijpen van documenten in 2025. De JSON-structuur behoudt ook OCR-betrouwbaarheidsscores, waardoor de databasequery resultaten met weinig vertrouwen automatisch kan filteren.

XML-uitvoer heeft de voorkeur wanneer de gescande documenten moeten voldoen aan een industriestandaardschema. Voor de verwerking van juridische, medische en overheidsdocumenten is vaak XML-uitvoer vereist die valideert aan de hand van een specifieke documenttypedefinitie. Het XML-formaat ondersteunt zowel de structuur als de metadata in één enkel bestand en is het vereiste invoerformaat voor veel enterprise content management-systemen. De OCR-tool van WukongPDF ondersteunt CSV-, JSON- en XML-uitvoerformaten, zodat u zonder nabewerking het formaat kunt selecteren dat overeenkomt met uw database-importpijplijn.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Gescande PDF's voorbewerken voor betere OCR-nauwkeurigheid

Voor documenten die oorspronkelijk op gekleurd papier zijn afgedrukt of door de jaren heen vergeeld zijn, kan het converteren van de scan naar puur zwart-wit vóór OCR de herkenningsnauwkeurigheid aanzienlijk verbeteren. De OCR-engine heeft moeite om tekst te scheiden van een gekleurde of gestructureerde achtergrond. Het converteren naar zwart-wit met een drempelwaarde die de tekst behoudt terwijl de achtergrond wordt verwijderd, geeft de OCR-engine een schone invoer. De meeste scansoftware en beeldeditors bevatten een zwart-witconversie met een instelbare drempel. Test een paar pagina's met verschillende drempels om de instelling te vinden die de schoonste tekst oplevert.

Database-import versterkt OCR-fouten. Een verkeerd gelezen teken in een doorzoekbare PDF is een klein ongemak. Dezelfde fout in een databaseveld kan ervoor zorgen dat een record onvindbaar is, verkeerd wordt gecategoriseerd of aan de verkeerde entiteit wordt gekoppeld. Door tijd te investeren in het voorbewerken van gescande documenten vóór OCR, wordt het foutenpercentage aanzienlijk verlaagd. De drie meest impactvolle voorbewerkingsstappen zijn het rechtzetten van pagina's die zelfs maar een paar graden zijn gedraaid, het verhogen van het contrast zodat de tekst scherp afsteekt tegen de achtergrond en het garanderen dat de scanresolutie minimaal 300 DPI is.

Rechtzetten corrigeert pagina's die onder een kleine hoek zijn gescand. Zelfs een rotatie van twee graden kan ervoor zorgen dat OCR-engines tekens aan de randen van regels verkeerd lezen. De meeste OCR-tools omvatten automatisch rechtzetten, maar het is de moeite waard om te controleren of dit correct is geactiveerd in uw documenten. Open een paar OCR-verwerkte pagina's en controleer of de herkende tekstvakken zijn uitgelijnd met de zichtbare tekst. Verkeerd uitgelijnde vakjes duiden op een fout bij het rechtzetten, waardoor er ongewenste gegevens in de database terechtkomen. Contrastverbetering is vooral belangrijk voor documenten die zijn gescand van oud of vergeeld papier. Door het contrast tussen tekst en achtergrond vóór OCR te vergroten, kan de herkenningsnauwkeurigheid bij uitdagende scans met 10 tot 20 procent worden verbeterd.

OCR-uitvoervelden toewijzen aan databasekolommen

Voor documenten waarbij de veldposities aanzienlijk variëren van pagina tot pagina, zijn trefwoordankers betrouwbaarder dan vaste coördinaten. Definieer extractieregels op basis van de tekst die voorafgaat aan of volgt op de doelgegevens, en niet op basis van de positie ervan. Een regel als 'haal het nummer achter het label Factuurtotaal' werkt ongeacht waar dat label op de pagina verschijnt. Op trefwoorden gebaseerde extractie vereist dat de OCR-uitvoer de volledige herkende tekst bevat met de oorspronkelijke ruimtelijke volgorde, waarbij de JSON-uitvoer behouden blijft en de CSV-uitvoer doorgaans niet.

De kloof tussen OCR-uitvoer en database-import is het in kaart brengen van velden. OCR produceert tekst geordend op paginapositie. De database verwacht tekst geordend op veldnaam. Om deze kloof te overbruggen, moet je een mapping definiëren die zegt dat de tekst in de rechterbovenhoek van pagina één het factuurnummer is, en dat deze in de kolom factuurnummer komt te staan. Voor gestructureerde formulieren waarbij de lay-out consistent is voor alle documenten, definieert u de toewijzing één keer met behulp van positionele coördinaten of trefwoordankers.

Voor semi-gestructureerde documenten waarvan de lay-out varieert, gebruikt u trefwoordgebaseerde mapping in plaats van positionele mapping. Definieer regels zoals "het nummer dat volgt op de tekst Factuurnr. is het factuurnummer, ongeacht de positie op de pagina." Op trefwoorden gebaseerde mapping is betrouwbaarder voor alle lay-outvariaties, maar vereist dat de OCR-uitvoer de herkende tekst met positionele metagegevens bevat. Dit is nog een reden om JSON- of XML-uitvoer te verkiezen boven CSV voor documenten met een variabele lay-out. De positionele metadata in JSON en XML maken trefwoordgebaseerde veldextractie mogelijk. Voor grootschalige database-importprojecten bevat de Scanned PDF OCR-pijplijn van WukongPDF configureerbare veldtoewijzingen die een consistent gestructureerd CSV- of JSON-bestand opleveren, klaar voor directe database-opname.

Omgaan met OCR-betrouwbaarheidsscores bij het importeren van databases

Voor databasetoepassingen waarbij nauwkeurigheid van cruciaal belang is, implementeert u een OCR-workflow met twee doorgangen. De eerste doorgang verwerkt alle documenten op standaardinstellingen. Documenten met een betrouwbaarheidsscore onder de drempelwaarde worden gemarkeerd en opnieuw verwerkt met verbeterde instellingen, zoals een hogere resolutie, rechtzetten en contrastaanpassing. Bij de tweegangenaanpak wordt de extra verwerkingstijd gericht op de documenten die deze nodig hebben, in plaats van dat de hele batch wordt vertraagd.

Elk OCR-resultaat heeft een betrouwbaarheidsscore, meestal een getal van 0 tot 100, dat de zekerheid van de engine aangeeft dat de herkende tekst overeenkomt met wat er op de pagina staat. Wanneer u OCR-resultaten in een database importeert, moet u een betrouwbaarheidsdrempel bepalen. Resultaten boven de drempelwaarde worden automatisch geïmporteerd. Resultaten onder de drempelwaarde worden gemarkeerd voor beoordeling door mensen. De drempelwaarde is afhankelijk van de kosten van fouten in uw toepassing. Een zoekindex kan een lagere drempel tolereren omdat gebruikers resultaten kunnen doorbladeren en slechte overeenkomsten kunnen negeren. Een financiële database waarin cijfers rechtstreeks in berekeningen worden meegenomen, heeft een hoge drempel nodig, doorgaans 95 of hoger.

Bewaar de betrouwbaarheidsscore naast de herkende tekst in de database. Een veld als factuur_totaal met een waarde van 250,00 en een betrouwbaarheid van 98 is betrouwbaar. Dezelfde waarde met een betrouwbaarheid van 62 moet als voorlopig worden beschouwd. Applicaties die de database doorzoeken, kunnen de betrouwbaarheidsscore gebruiken om waarden met een laag vertrouwen weer te geven met een visuele indicator, zoals een gele markering of een waarschuwingspictogram, waardoor gebruikers worden gewaarschuwd de gegevens te verifiëren voordat ze erop vertrouwen. De betrouwbaarheidsscore voegt een dimensie aan de gegevenskwaliteit toe die platte tekstuitvoer niet kan bieden.

Veelgestelde vragen

Hoe moet ik omgaan met PDF's waarin gescande pagina's worden gecombineerd met oorspronkelijke digitale pagina's bij het voorbereiden van de database-import? Verwerk de gescande pagina's via OCR en de digitale pagina's via tekstextractie afzonderlijk en combineer vervolgens de resultaten. Digitale pagina's hebben geen OCR nodig en het uitvoeren van OCR kan de tekstkwaliteit zelfs verslechteren door herkenningsfouten te introduceren waarbij de originele digitale tekst volkomen accuraat was. De meeste tools voor batchverwerking kunnen detecteren welke pagina's worden gescand en welke digitaal zijn, en sturen deze automatisch naar het juiste verwerkingspad.

Hoeveel gescande pagina's kan ik in één batch verwerken voor database-import?

Moderne OCR-engines kunnen duizenden pagina's per uur verwerken op standaardhardware. De praktische limiet is niet de OCR-snelheid, maar de validatietijd. Reserveer tijd om een voorbeeld van de uitvoer te beoordelen voordat u de volledige batch in een productiedatabase importeert. Bij een willekeurige steekproefbeoordeling van 5 procent worden systematische OCR-fouten ontdekt die van invloed kunnen zijn op de hele batch.

Moet ik de originele gescande PDF naast de geëxtraheerde gegevens in de database opslaan?

Ja, wanneer de database dit ondersteunt. Het opslaan van de bron-PDF gekoppeld aan de geëxtraheerde gegevens zorgt voor een audittrail. Wanneer zich een vraag over de gegevenskwaliteit voordoet, kunnen gebruikers de originele scan openen en de geëxtraheerde waarde verifiëren aan de hand van het brondocument. Deze koppeling tussen de geëxtraheerde gegevens en het brondocument is vereist voor naleving in veel gereguleerde sectoren.

Kan OCR handgeschreven tekst verwerken voor het importeren van databases?

De handschriftherkenning is aanzienlijk verbeterd, maar blijft minder nauwkeurig dan de herkenning van gedrukte tekst. Bij het importeren uit een database moeten handgeschreven velden worden doorgestuurd naar menselijke beoordeling in plaats van automatisch te worden geïmporteerd, tenzij het handschrift beperkt is, zoals getallen die in afzonderlijke vakken op een formulier zijn geschreven. Handschrift in vrije vorm op ongestructureerde documenten is in de meeste toepassingen niet betrouwbaar genoeg voor automatische database-import.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →