Tips & Tricks

OCR-resultaten exporteren van een PDF naar JSON

Het uitvoeren van OCR PDF op een gescand document produceert herkende tekst, maar de meeste OCR-tools voeren die tekst uit als een plat tekstbestand of sluiten deze weer in de PDF in. Door OCR-resultaten rechtstreeks naar JSON te exporteren, beschikt u over gestructureerde, machinaal leesbare gegevens die kunnen worden ingevoerd in databases, zoekindexen, contentmanagementsystemen en geautomatiseerde workflows. Uit een onderzoek van AIIM International uit 2025 bleek dat 43 procent van de organisaties nu de voorkeur geeft aan gestructureerde gegevensformaten zoals JSON voor uit documenten afgeleide tekst, omdat deze gemakkelijker integreren met moderne cloudapplicaties en AI-pijplijnen (AIIM, "State of Intelligent Information Management", 2025).

Belangrijkste punten

Bij het exporteren van OCR-resultaten naar JSON blijft de structuur van de herkende tekst behouden, inclusief paginanummers, woordcoördinaten en betrouwbaarheidsscores, die verloren gaat bij het exporteren naar platte tekst. De meeste moderne OCR-engines ondersteunen native JSON-uitvoer, maar de functie moet mogelijk worden ingeschakeld in de instellingen of worden geselecteerd in een menu met exportformaten. Het resulterende JSON-bestand kan worden gebruikt voor zoeken in volledige tekst, pijplijnen voor gegevensextractie en het trainen van machine learning-modellen op documentinhoud.

Voor ontwikkelaars die OCR JSON in applicaties integreren, bevatten de meeste JSON-uitvoerformaten een versieveld dat de schemaversie identificeert. Controleer dit veld altijd vóór het parseren om te voorkomen dat wijzigingen kapot gaan wanneer de OCR-engine het uitvoerformaat bijwerkt. Een eenvoudige versiebewaking aan het begin van uw parseercode voorkomt cryptische fouten wanneer de JSON-structuur tussen engineversies verandert.

How to Export OCR Results From a PDF to JSON

Waarom JSON-uitvoer beter is dan gewone tekst voor OCR-resultaten

Uitvoer van platte tekst via OCR verwijdert alles behalve de tekens zelf. U krijgt de woorden, maar verliest het paginanummer waar elk woord verscheen, de coördinaten van het selectiekader die u vertellen waar op de pagina de tekst staat, de betrouwbaarheidsscore die aangeeft hoe zeker de OCR-engine over elk teken is, en alle structurele informatie zoals alinea-einden en kolomindelingen. JSON bewaart dit allemaal. Een JSON Gescande PDF OCR-uitvoerbestand bevat doorgaans een reeks pagina-objecten, elk met een reeks tekstblokobjecten, die elk de herkende tekst bevatten plus de metagegevens over de positie, grootte en betrouwbaarheid ervan.

Deze structuur maakt downstream-automatisering mogelijk die met platte tekst onmogelijk is. Een script kan het JSON-bestand lezen en alleen tekst uit een specifiek gebied van elke pagina extraheren, zoals het kopgebied of een zijbalkkolom. Het kan OCR-resultaten met weinig vertrouwen wegfilteren om te voorkomen dat een zoekindex wordt vervuild met onleesbare tekst. Het kan de leesvolgorde van een lay-out met meerdere kolommen reconstrueren door tekstblokken te sorteren op hun Y- en X-coördinaten. Geen van deze bewerkingen is mogelijk met een plat tekstbestand van OCR.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Stap voor stap: OCR-resultaten exporteren naar JSON

Controleer de afbeeldingsresolutie van de gescande PDF voordat u OCR uitvoert. De meeste OCR-engines presteren het beste wanneer de afbeeldingen op de invoerpagina 300 DPI hebben. Onder de 200 DPI neemt de herkenningsnauwkeurigheid merkbaar af. Boven de 400 DPI neemt de verwerkingstijd toe zonder dat er sprake is van een noemenswaardige verbetering van de nauwkeurigheid. Als uw gescande PDF paginaafbeeldingen met een lage resolutie bevat, kunt u overwegen deze op te schalen naar 300 DPI voordat u OCR met JSON-uitvoer uitvoert. De extra voorbewerkingsstap verbetert de kwaliteit van de JSON-data merkbaar.

Open uw gescande PDF in een OCR-tool die gestructureerde uitvoer ondersteunt. Tesseract, de meest gebruikte open-source OCR-engine, ondersteunt JSON-uitvoer via de opdrachtregelinterface en via de meeste applicaties die deze bundelen. In Tesseract produceert het toevoegen van de uitvoerformaatvlag een JSON-bestand naast de herkende tekst. Commerciële OCR API's van Google Cloud Vision, Amazon Textract en Microsoft Azure Form Recognizer retourneren standaard allemaal JSON, waarbij de herkende tekst is geordend op pagina, blok, alinea, regel en woord.

Nadat u OCR hebt uitgevoerd terwijl JSON-uitvoer is ingeschakeld, opent u het resulterende bestand in een teksteditor om de structuur ervan te begrijpen. De JSON bevat arrays van pagina-objecten. Elk paginaobject bevat de paginaafmetingen en arrays van blokobjecten. Elk blok bevat de herkende tekst, een betrouwbaarheidsscore die doorgaans tussen 0 en 100 ligt, en coördinaten van het selectiekader die de positie van het blok op de pagina beschrijven. Als u bekend bent met deze structuur, kunt u eenvoudige scripts schrijven om precies de gegevens te extraheren die u nodig hebt. De OCR-tool van WukongPDF bevat een JSON-exportoptie die herkende tekst ordent met paginanummers, betrouwbaarheidsscores en positionele gegevens, zodat u geen aparte OCR-engine hoeft te configureren om gestructureerde uitvoer te krijgen.

Gemeenschappelijke JSON-structuren voor OCR-uitvoer

De meeste JSON Gescande PDF OCR-uitvoer bevat ook een sectie met algemene metagegevens bovenaan het bestand, waarin de naam van de OCR-engine, de versie, de verwerkingsdatum en de taal of talen die in het document zijn gedetecteerd, worden vastgelegd. Deze metagegevens zijn waardevol voor audittrails en voor het opsporen van fouten in de OCR-kwaliteit. Als u documenten uit meerdere bronnen verwerkt, vertellen de metadata u welke engine welk resultaat heeft opgeleverd en of de engineversie tussen batches is gewijzigd, wat verschillen in herkenningskwaliteit kan verklaren.

VeldBeschrijvingVoorbeeldwaarde
paginaPaginanummer in het originele document3
tekstHerkende tekstinhoud"Factuur #4521"
vertrouwenOCR-betrouwbaarheid 0 tot 10094,7
bboxGrenzend kader [x, y, breedte, hoogte] in pixels[120, 340, 400, 28]
bloktypeType inhoudsblok"paragraaf" of "tafel" of "lijn"
taalGedetecteerde taal van de tekst"nl"

OCR JSON-gegevens gebruiken in geautomatiseerde workflows

Het afhandelen van fouten is de moeite waard om vooraf te plannen. Een OCR-uitvoering op een pagina met een zeer slechte beeldkwaliteit kan voor de meeste herkende woorden een betrouwbaarheidsscore van minder dan 50 procent opleveren. Uw workflow moet een minimale betrouwbaarheidsdrempel definiëren waaronder de resultaten worden gemarkeerd voor menselijke beoordeling in plaats van automatisch te worden opgenomen in een database of zoekindex. Het met weinig vertrouwen verzenden van Gescande PDF OCR-uitvoer rechtstreeks naar een productiesysteem vervuilt de gegevens met fouten die veel duurder zijn om later op te ruimen dan om op het moment van extractie te markeren voor beoordeling.

Zodra de OCR-resultaten in JSON staan, breiden de automatiseringsmogelijkheden aanzienlijk uit. Een veel voorkomend patroon is het schrijven van een script dat in een map zoekt naar nieuwe gescande PDF's, OCR uitvoert met JSON-uitvoer, de JSON parseert om specifieke velden zoals factuurnummers of datums uit bekende posities op de pagina te extraheren, en die waarden in een database of spreadsheet invoegt. Omdat de JSON positionele coördinaten bevat, kan het extractiescript tekst in specifieke delen van de pagina targeten, ongeacht de algemene inhoud van het document.

Voor zoektoepassingen kan de JSON-uitvoer worden ingevoerd in een zoekindex zoals Elasticsearch of Algolia. Elke pagina wordt een doorzoekbaar document met het paginanummer als metadataveld. Met de betrouwbaarheidsscores kunt u de zoekrelevantie afstemmen door meer gewicht te geven aan betrouwbare OCR-tekst. Gebruikers die naar een term zoeken, zien de resultaten gerangschikt op basis van de zekerheid van de OCR-engine dat de term daadwerkelijk op de pagina verschijnt, waardoor valse overeenkomsten door verkeerd herkende tekens worden verminderd.

Voor AI- en machine learning-pijplijnen is gestructureerde Gescande PDF OCR-uitvoer in JSON het standaardinvoerformaat. Grote taalmodellen en systemen voor het begrijpen van documenten gebruiken JSON-representaties van

Veelgestelde vragen

Hoe moet ik OCR JSON-bestanden naast de originele PDF's opslaan voor langdurige toegang? Sla de JSON-bestanden op in dezelfde map als de PDF's met overeenkomende bestandsnamen. Bijvoorbeeld rapport-2025.pdf en rapport-2025.ocr.json. Deze naamgevingsconventie maakt het voor scripts triviaal om de Gescande PDF OCR-uitvoer voor een bepaalde PDF te vinden. Voor grote archieven kunt u overwegen de JSON op te slaan in een documentdatabase die zoeken in volledige tekst ondersteunt, in plaats van als platte bestanden.

Vergroot JSON-uitvoer van OCR de bestandsgrootte vergeleken met platte tekst?

Ja, meestal met een factor 3 tot 5 keer. Een gescand document van 10 pagina's dat 15 KB platte tekst produceert, kan een JSON-bestand van 50 tot 75 KB opleveren. De extra omvang komt van de structurele metadata: paginanummers, selectiekaders en betrouwbaarheidsscores voor elk herkend woord. Voor de meeste toepassingen is deze maatvergroting verwaarloosbaar. Alleen op zeer grote schaal, zoals miljoenen pagina's, wordt het een opslagoverweging die de moeite waard is om te plannen.

Kan ik bestaande platte tekst converteren Gescande PDF OCR-uitvoer naar JSON?

Niet zinvol. Zodra de OCR-resultaten zijn afgevlakt tot platte tekst, gaan de positionele gegevens en betrouwbaarheidsscores verloren en kunnen ze niet meer worden gereconstrueerd op basis van de tekst alleen. Als u gestructureerde OCR-gegevens uit eerder verwerkte documenten nodig heeft, is de meest betrouwbare aanpak het opnieuw uitvoeren van OCR op de origineel gescande PDF's met JSON-uitvoer ingeschakeld.

Welke OCR-engines produceren de nuttigste JSON-uitvoer?

Cloudgebaseerde OCR-services van Google, Amazon en Microsoft produceren over het algemeen de meest gedetailleerde JSON-uitvoer, met grensvakken op woordniveau en betrouwbaarheidsscores. Tesseract produceert solide JSON op regel- en woordniveau. De beste keuze hangt af van uw volume, budget en of de privacyvereisten het verzenden van documenten naar een cloudservice toestaan.

Kan ik OCR JSON-uitvoer terug converteren naar een doorzoekbare PDF? Ja, hoewel het proces een bibliotheek voor het genereren van PDF's vereist die tekstobjecten op specifieke coördinaten kan plaatsen. De gegevens van het selectiekader in de JSON-uitvoer vertellen u precies waar elk woord op de pagina thuishoort. Dit is het omgekeerde van het extractieproces en is handig wanneer u een doorzoekbare PDF moet maken van gecorrigeerde OCR-tekst nadat u herkenningsfouten in de JSON-gegevens heeft verholpen.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →