Tips & Tricks

Hoe u een PDF-ontvangstbewijs of factuur kunt OCReren en de regelitems rechtstreeks naar een spreadsheet kunt exporteren

Een schoenendoos met bonnetjes. Een map met factuur-pdf's. Een jaar vol zakelijke uitgaven die in een spreadsheet moeten worden ingevoerd voor belastingvoorbereiding, onkostendeclaratie of budgetanalyse. Het handmatig typen van elk regelitem van elke kassabon in Excel is traag, foutgevoelig en geestdodend. Een betere workflow gebruikt OCR om de ontvangsttekst te lezen en exporteert de herkende regelitems rechtstreeks naar een gestructureerd spreadsheet.

De pijplijn van OCR PDF naar spreadsheets is aanzienlijk volwassener geworden. Moderne OCR-engines kunnen ontvangstbewijzen herkennen, regelitems identificeren aan de hand van hun positie en opmaakpatronen, en gestructureerde gegevens exporteren die minimale opschoning vereisen. Wat ooit uren aan handmatige gegevensinvoer kostte, kost nu minuten aan geautomatiseerde verwerking met een korte verificatiestap.

How to OCR a PDF Receipt or Invoice and Export the Line Items Directly to a Spreadsheet

Ontvangstbewijzen en facturen voorbereiden voor OCR

De beeldkwaliteit van de bronafbeelding bepaalt de nauwkeurigheid van de OCR-uitvoer, en bepaalt de hoeveelheid opschoning die u moet doen. Scan of fotografeer bonnen op een vlak, donker oppervlak met gelijkmatige verlichting. Zorg ervoor dat de bon plat is en niet verfrommeld of gevouwen. Leg de volledige kassabon vast, inclusief de winkelnaam bovenaan en het totaal onderaan. Als de winkelnaam ontbreekt, betekent dit dat de OCR-uitvoer geen leveranciersidentificatie heeft.

Voor thermisch papieren bonnen die vervaagd zijn, verbetert u het contrast voordat u OCR uitvoert. Een vervaagd ontvangstbewijs waarbij de tekst nauwelijks zichtbaar is voor het menselijk oog, is in wezen onzichtbaar voor OCR. Gebruik een afbeeldingseditor of een scanapp met contrastverbetering om de tekst donkerder en de achtergrond lichter te maken. Het verbeterde beeld ziet er voor het menselijk oog misschien onnatuurlijk uit, maar levert aanzienlijk betere OCR-resultaten op.

Groepeer ontvangsten op type voordat ze worden verwerkt. Ontvangsten uit dezelfde winkel hebben vaak vergelijkbare lay-outs, en door ze samen te verwerken, kan de OCR-engine het lay-outpatroon leren kennen en de nauwkeurigheid voor de hele batch verbeteren. Door bonnen uit verschillende winkels te combineren, wordt de OCR-engine gedwongen elke bon als een unieke lay-out te behandelen.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

OCR configureren voor extractie van ontvangstgegevens

Selecteer OCR-instellingen die zijn geoptimaliseerd voor bonnen. Op ontvangstbewijzen worden doorgaans kleine lettertypen, smal papier en thermisch afdrukken gebruikt, waardoor tekens met een inconsistente inktdichtheid ontstaan. Voor ontvangstbonnen geoptimaliseerde OCR-instellingen omvatten scannen met een hogere resolutie, minimaal 300 DPI en grijstinten in plaats van zwart-wituitvoer om de subtiele variaties in tekendichtheid te behouden.

WukongPDF biedt OCR-verwerking via de browser, zodat u bonnen kunt scannen of uploaden en tekst kunt extraheren. De browsergebaseerde OCR verwerkt bestanden lokaal, waardoor uw financiële documenten op uw apparaat blijven staan.

Voor PDF-gegevens extraheren uit bonnen moet de OCR-engine onderscheid maken tussen artikelbeschrijvingen, hoeveelheden, eenheidsprijzen en regeltotalen. De engine gebruikt positieaanwijzingen om dit onderscheid te maken. Artikelen staan doorgaans aan de linkerkant, hoeveelheden en prijzen aan de rechterkant, en regeltotalen in de meest rechtse kolom. Hoe consistenter de lay-out van de ontvangstbewijzen, hoe nauwkeuriger de veldidentificatie.

OCR-gegevens exporteren naar spreadsheetformaat

Nadat de OCR is voltooid, exporteert u de herkende gegevens naar CSV- of Excel-formaat. Bij de export moet de veldscheiding behouden blijven die tijdens de OCR is geïdentificeerd: de naam van de leverancier in de ene kolom, de datum in een andere, de beschrijving van elk regelitem, het aantal, de eenheidsprijs en het regeltotaal in hun eigen kolommen. De meeste OCR-tools bevatten een exportoptie van ontvangstbewijs naar spreadsheet.

De conversie van Gescande PDF naar spreadsheet is niet perfect. Verwacht per ontvangstbewijs vijf tot tien minuten te besteden aan verificatie en opschoning. Vergelijk de spreadsheetuitvoer met de originele bonafbeelding. Controleer of de regelitems optellen tot het ontvangsttotaal. Controleer of de belasting correct is geïdentificeerd en gescheiden van de artikelprijzen. Met de verificatiestap worden OCR-fouten opgespoord voordat deze in uw onkostendeclaraties worden weergegeven.

Voor terugkerende ontvangstverwerking slaat u de OCR-instellingen op en exporteert u de configuratie als een voorinstelling. Elke volgende batch bonnen wordt met dezelfde instellingen verwerkt, waardoor een consistente uitvoer ontstaat. De vooraf ingestelde aanpak is met name waardevol voor bedrijfseigenaren die maandelijkse onkostendeclaraties van dezelfde groep leveranciers verwerken.

Facturen van meerdere pagina's en complexe ontvangstbewijzen verwerken

Facturen die uit meerdere pagina's bestaan, vereisen een speciale behandeling, omdat regelitems over de paginagrenzen heen kunnen doorlopen. De OCR-engine moet herkennen dat de items op pagina twee een voortzetting zijn van de items op pagina één, en niet een nieuwe reeks items. De meeste OCR-tools gaan hier correct mee om als de factuurpagina's als één document worden verwerkt.

Restaurantbonnen met handgeschreven fooibedragen voegen een handmatige verificatiestap toe. De OCR kan de afgedrukte bedragen lezen, maar heeft moeite met handschrift, vooral met handschrift dat is toegevoegd nadat de bon is afgedrukt en waarbij de pen mogelijk de afgedrukte tekst heeft overschreden. Het fooibedrag en het aangepaste totaal moeten worden geverifieerd en handmatig worden ingevoerd als de OCR ze niet kan lezen.

Na het exporteren naar een spreadsheet gebruikt u de spreadsheethulpmiddelen om uitgaven te categoriseren. Voeg een categoriekolom toe en wijs elk regelitem toe aan een onkostencategorie op basis van de leverancier of de itembeschrijving. Categoriseren tijdens het OCR-beoordelingsproces is efficiënter dan categoriseren nadat alle bonnen zijn verwerkt.

Voor dubbelzijdig bedrukte bonnen, die om milieuredenen steeds vaker voorkomen, scant u beide zijden en verwerkt u ze als één document. De OCR-engine leest de voor- en achterkant als opeenvolgende pagina's. Regelitems die van de voorkant naar de achterkant van de kassabon doorlopen, moeten als één transactie worden behandeld als de winkel een vervolgmelding op de voorkant afdrukt.

Valutasymbolen en decimale scheidingstekens verschillen per regio. Op een kassabon van een Europese winkel wordt het eurosymbool en een komma als decimaalteken gebruikt. Configureer de OCR-engine voor de juiste landinstelling voordat u deze verwerkt. Het nabewerken van de spreadsheet om de valutaformaten voor bonnen uit verschillende landen te standaardiseren, zorgt voor consistente financiële rapportage.

Het datumformaat op bonnen varieert sterk. MM/DD/JJJJ in de Verenigde Staten, DD/MM/JJJJ in Europa, JJJJ/MM/DD in delen van Azië. De OCR exporteert de datum als herkende tekst. Het spreadsheet moet de datum correct interpreteren op basis van de herkomst van het ontvangstbewijs. Het toevoegen van een landkolom voor ontvangstbewijzen helpt bij de interpretatie van de datum tijdens de opschoonfase.

Voor onkostendeclaratie kan de OCR-spreadsheetuitvoer rechtstreeks in boekhoudsoftware of onkostenbeheerplatforms worden geïmporteerd. De meeste platforms accepteren CSV-importen met standaardkolommen: datum, leverancier, beschrijving, bedrag, categorie en betalingsmethode. Het toewijzen van de OCR-uitvoerkolommen aan de verwachte platformkolommen is de laatste stap in de pijplijn van ontvangst naar rapport.

Bewaar de originele kassabon-pdf naast de OCR-spreadsheetuitvoer. De PDF fungeert als het gezaghebbende record. Het spreadsheet dient als werkgegevens. Als er vragen rijzen over een specifieke transactie, kan de originele ontvangst-pdf worden geraadpleegd om de OCR-interpretatie te verifiëren.

Voor terugkerende leveranciers met consistente ontvangstbewijzen verbetert de OCR-nauwkeurigheid in de loop van de tijd naarmate de engine de lay-out leert. Het eerste ontvangstbewijs van een nieuwe leverancier vergt mogelijk meer handmatige opschoning dan het tiende ontvangstbewijs. Het opslaan van de gecorrigeerde uitvoer als trainingsvoorbeeld voor de OCR-engine versnelt dit leerproces.

De belastingtarieven op bonnen variëren per locatie en producttype. De OCR herkent mogelijk het belastingbedrag, maar niet het belastingtarief. Door het belastingtarief te berekenen op basis van het belastingbedrag en het subtotaal, kunt u de nauwkeurigheid van de OCR verifiëren. Als het berekende tarief niet overeenkomt met een bekend belastingtarief voor de aankooplocatie, heeft de OCR de bedragen verkeerd gelezen of bevat de bon zowel belastbare als niet-belastbare artikelen.

Voor zakelijke uitgaven die zijn betaald met een combinatie van persoonlijke en zakelijke middelen, zoals een zakenlunch waarbij één persoon de hele tafel heeft betaald, moet op de bon het zakelijke gedeelte worden vermeld. De annotatie moet na OCR aan het spreadsheet worden toegevoegd, en niet aan de pdf van de kassabon, om de originele kassabon voor auditdoeleinden te behouden.

Het rendement op de investering voor ontvangst-OCR wordt na ongeveer vijftig ontvangsten positief, vergeleken met handmatige gegevensinvoer. Voor bedrijven die maandelijks honderden bonnen verwerken, vertaalt de tijdbesparing zich in een meetbare verlaging van de arbeidskosten en snellere onkostendeclaratiecycli.

Cloudgebaseerde platforms voor ontvangstbeheer combineren OCR met mobiele apps die ontvangstfoto's maken op het moment van ontvangst. De ontvangstgegevens vloeien rechtstreeks naar onkostendeclaraties zonder tussenstap van het opslaan en later verwerken van PDF-bestanden, waardoor de workflow verder wordt gestroomlijnd.

De IRS en andere belastingautoriteiten accepteren digitale kopieën van kwitanties, op voorwaarde dat de digitale afbeelding leesbaar is en het origineel nauwkeurig weergeeft. De OCR-spreadsheetuitvoer, gecombineerd met de originele PDF met ontvangstbewijzen, voldoet aan de vereisten voor archivering en maakt de gegevens veel nuttiger voor belastingvoorbereiding.

Voor bedrijven die bonnen uit meerdere landen verwerken, moet het OCR-systeem verschillende talen, valuta's, datumformaten en belastingstructuren verwerken. Een bon uit Frankrijk ziet er anders uit dan een bon uit Japan en het OCR-systeem moet voor elk regionaal formaat worden geconfigureerd.

De langetermijnwaarde van gedigitaliseerde bonnen gaat verder dan de onmiddellijke behoefte aan onkostendeclaraties. Historische ontvangstgegevens kunnen worden geanalyseerd op bestedingspatronen, leveranciersonderhandelingen en budgetprognoses; inzichten die niet toegankelijk zijn wanneer ontvangstbewijzen in papieren vorm of als ondoorzoekbare PDF's blijven.

De combinatie van OCR-technologie en spreadsheetexport transformeert ontvangstbewijzen van statische records in analyseerbare gegevens die het financieel beheer, de belastingnaleving en business intelligence ondersteunen.

De overgang van papieren bonnen naar OCR-verwerkte digitale gegevens vertegenwoordigt een van de meest praktische toepassingen van documentautomatisering voor kleine bedrijven en particulieren die hun financiën beheren.

OCR-ontvangstverwerking zet de vervelende en foutgevoelige taak van handmatige gegevensinvoer om in een snelle, geautomatiseerde workflow die zichzelf terugbetaalt in tijdbesparing na de eerste enkele tientallen ontvangsten.

OntvangstveldOCR-herkenningstipKolom exporteren
WinkelnaamMeestal bovenaan; grootste lettertypeLeverancier
DatumZoek naar datumpatronen bovenaanDatum
RegelitemsLinks uitgelijnde tekstblokkenBeschrijving, aantal, eenheidsprijs
SubtotaalVóór belasting; vaak geëtiketteerdSubtotaal
BelastingNa subtotaal; percentage of vastBelasting
TotaalGrootste bedrag; vaak gewaagdTotaal
WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →