Een stapel van vijftig facturen plaats je op een documentscanner met automatische documentinvoer. De scanner produceert één PDF met alle vijftig pagina's achter elkaar. Nu heeft u elke factuur nodig als een afzonderlijk PDF-bestand, vermeld op factuurnummer. Het handmatig opsplitsen van een pdf van vijftig pagina's in vijftig afzonderlijke bestanden, het openen van elk bestand en het opslaan onder de juiste naam kost een uur saai werk. Een tool voor het splitsen van batches die documentgrenzen detecteert en de uitvoerbestanden een naam geeft, doet binnen enkele seconden automatisch hetzelfde werk.
Het probleem Split PDF bij gescande batches is dat de scanner individuele pagina's ziet, en geen individuele documenten. Een factuur van tien pagina's ziet er op de scanner precies zo uit als tien afzonderlijke facturen van één pagina. De splitstool moet de pagina-inhoud analyseren om te bepalen waar het ene document eindigt en het volgende begint. Bij deze analyse wordt gebruik gemaakt van pagina-inhoudspatronen, lege scheidingspagina's, streepjescodes of consistente paginatellingen om documentgrenzen te identificeren.

Hoe batchscanners PDF's met meerdere documenten produceren
Automatische documentinvoer verwerkt pagina's opeenvolgend. Elke pagina gaat door de scanner en wordt toegevoegd aan een enkele uitvoer-PDF. De scanner weet niet of kan het niet schelen dat pagina's één tot en met drie factuur A zijn, pagina's vier tot en met vijf factuur B en pagina's zes tot en met acht factuur C. De scanner produceert alleen pagina's één tot en met acht in één enkel bestand.
Sommige scanners ondersteunen scheidingsvellen, blanco pagina's die tussen documenten worden ingevoegd en die de scanner aangeven een nieuwe PDF te starten. Maar bij de meeste scanworkflows worden scheidingsvellen overgeslagen omdat ze het scanproces vertragen. Het resultaat is één enkel PDF Batch-bestand met meerdere aaneengeschakelde documenten.
Deze methode verandert uren handmatig werk in seconden geautomatiseerde verwerking.
Het probleem wordt groter bij dubbelzijdig scannen. Een dubbelzijdig gescand document van tien pagina's levert twintig PDF-pagina's op, waarbij elke fysieke pagina twee PDF-pagina's wordt. De splitstool moet begrijpen dat pagina's één en twee tot hetzelfde document behoren, ook al verschijnen ze als afzonderlijke PDF-pagina's.
Probeer PDF splitsen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Methoden voor het detecteren van documentgrenzen in een gescande batch
Consistentie van het aantal pagina's is de eenvoudigste detectiemethode. Als elk document in de batch hetzelfde aantal pagina's heeft, deelt de splitstool het totale aantal pagina's door het aantal pagina's van het document en wordt het gesplitst op die grenzen. Facturen van dezelfde leverancier hebben vaak een consistent aantal pagina's. Deze methode vereist geen inhoudsanalyse.
Detectie van blanco pagina's identificeert scheidingspagina's die opzettelijk tussen documenten zijn ingevoegd. Een blanco pagina in de gescande batch duidt op een documentgrens. De splitstool verwijdert de lege scheidingspagina's en splitst de resterende pagina's in afzonderlijke documenten op de lege paginaposities.
Detectie van inhoudspatronen is de meest geavanceerde methode. De splitstool zoekt naar terugkerende patronen die het begin van een nieuw document aangeven. Een factuur begint doorgaans met het leverancierslogo, het adres en het factuurnummer. Een formulier begint met een titel- en datumveld. Een rapport begint met een voorblad. De tool identificeert deze patronen en markeert elke gebeurtenis als documentgrens.
Barcodedetectie identificeert scheidingspagina's met afgedrukte streepjescodes. Een streepjescode bovenaan de eerste pagina van elk document codeert de document-ID. De splitstool leest de streepjescode, geeft het uitvoerbestand een naam met de gecodeerde waarde en splitst bij elke streepjescode. Deze methode is populair in de gezondheidszorg, juridische en financiële documentverwerking.
Splitstools gebruiken met mogelijkheden voor documentdetectie
WukongPDF biedt verwerking van Gescande PDF via de browser, inclusief de mogelijkheid om gescande batches van meerdere documenten op te splitsen in afzonderlijke bestanden. De splitstool kan documentgrenzen detecteren met behulp van inhoudspatronen of gespecificeerde paginaaantallen.
Voordat u gaat splitsen, kunt u een voorbeeld van de batch bekijken om de paginavolgorde en -richting te verifiëren. Pagina's die ondersteboven of in de verkeerde volgorde zijn gescand, produceren onjuist geordende uitvoerbestanden. De meeste splitstools bevatten een paginavoorbeeld en een functie voor het opnieuw ordenen van scanfouten voordat ze worden gesplitst.
Configureer de naamgeving van het uitvoerbestand op basis van gedetecteerde inhoud. Als de splitstool het factuurnummer of document-ID van de eerste pagina van elk document kan lezen, gebruik dan die waarde als de uitvoerbestandsnaam. Als op inhoud gebaseerde naamgeving niet beschikbaar is, gebruik dan opeenvolgende nummering met een beschrijvend voorvoegsel.
Nauwkeurigheid van de splitsing verifiëren
Controleer na het splitsen de eerste en laatste paar uitvoerbestanden. Open het eerste uitvoerbestand en controleer of het de juiste pagina's bevat. Open het laatste uitvoerbestand en bevestig dat dit de laatste pagina's van de batch bevat. Controleer een bestand vanaf het midden van de batch. Met deze controles worden grensdetectiefouten opgespoord voordat de bestanden worden gedistribueerd.
Vergelijk het totale aantal pagina's van alle uitvoerbestanden met het oorspronkelijke aantal batchpagina's. Als de som overeenkomt, is elke pagina toegewezen aan een uitvoerbestand. Als de som lager is, zijn pagina's verloren gegaan tijdens het splitsen. Als de som hoger is, zijn pagina's gedupliceerd.
Batches waarbij documentgrenzen dubbelzinnig zijn, voeren de splitsing uit met conservatieve instellingen die sterker grensbewijs vereisen. Bij een conservatieve splitsing kunnen sommige documenten gecombineerd blijven in plaats van een enkel document onjuist in meerdere bestanden te splitsen. De gecombineerde documenten kunnen handmatig worden gesplitst, met minder risico dan fragmenten van één enkel document.
Automatisering van de split-and-name-workflow
Automatiseer de workflow voor terugkerend batchscannen en splitsen. Sla de splitsingsinstellingen, de grensdetectiemethode en de naamgevingsconventie voor uitvoer op als een profiel. Elke volgende batch wordt met hetzelfde profiel verwerkt, waardoor een consistente output ontstaat. De initiële insteltijd wordt hersteld na de tweede batch.
Integreer de gesplitste uitvoer met documentbeheersystemen door de naamgeving van de uitvoer zo te configureren dat deze overeenkomt met het verwachte systeemformaat. Een tijdens het splitsen geëxtraheerde document-ID die overeenkomt met de naamgevingsconventie van het documentbeheersysteem maakt automatische opname mogelijk zonder handmatig hernoemen.
Het scheiden van documenten in gescande batches is een veel voorkomende behoefte in industrieën die papieren documenten in grote hoeveelheden verwerken: de gezondheidszorg verwerkt patiëntendossiers, juridische processen zaakdossiers, boekhoudkundige processen, facturen en overheidsprocessen. Elke branche heeft zijn eigen documenttypen, paginaaantallen en grenspatronen.
Scheidingsvellen met streepjescodes zijn de meest betrouwbare methode voor scanbewerkingen met grote volumes. Druk een streepjescode af vanuit het documentbeheersysteem, plaats dit bovenop elk document voordat u het scant, en de splitstool leest de streepjescode om de documentgrenzen te identificeren en de uitvoerbestanden een naam te geven. De streepjescode elimineert onduidelijkheid over waar documenten beginnen en eindigen.
Optische markeringsherkenning kan selectievakjes of gevulde cirkels op de eerste pagina van elk document identificeren die het documenttype of de prioriteit aangeven. De splitstool leest deze markeringen en stuurt documenten naar verschillende uitvoermappen op basis van het herkende type.
De nauwkeurigheid van de geautomatiseerde documentscheiding moet worden gemeten en bewaakt. Een batch van 500 documenten met een scheidingsnauwkeurigheid van 99% levert nog steeds 5 verkeerd gesplitste documenten op die handmatige correctie vereisen. Volg het foutenpercentage in de loop van de tijd om documenttypen of scanomstandigheden te identificeren die hogere foutpercentages veroorzaken.
Voor batches waarbij de documentgrenzen inconsistent zijn, worden met een menselijke controlestap tussen het scannen en het splitsen grensfouten opgespoord die bij automatische detectie over het hoofd worden gezien. De revisor scant de batch in een paginaviewer, bevestigt of past de gedetecteerde grenzen aan en activeert vervolgens de automatische splitsing.
Het uitvoerbestandsformaat na het splitsen kan bestaan uit PDF/A voor archivering, gecomprimeerde PDF voor distributie of TIFF voor verdere beeldverwerking. Configureer het uitvoerformaat op basis van het downstreamgebruik van de gescheiden documenten.
Door de gesplitste workflow te integreren met een documentbeheersysteem ontstaat een naadloze pijplijn van papier naar doorzoekbaar archief. De scanner produceert een batch-PDF, de splitter verdeelt deze in afzonderlijke documenten, OCR maakt ze doorzoekbaar en het documentbeheersysteem indexeert ze zodat ze kunnen worden opgehaald.
Cloudgebaseerde splitservices bieden dezelfde mogelijkheden als desktoptools, met het voordeel dat ze vanaf elk apparaat toegankelijk zijn. De gescande batch-PDF wordt geüpload, verwerkt en de afzonderlijke documenten worden als afzonderlijke bestanden geretourneerd. Overwegingen op het gebied van gegevensprivacy zijn van toepassing bij het gebruik van cloudservices voor gevoelige documenten.
De naamgevingsconventie voor gesplitste uitvoerbestanden moet consistent en sorteerbaar zijn. Een indeling als JJJJ-MM-DD_DocumentType_SequentialNumber produceert bestandsnamen die chronologisch worden gesorteerd en gegroepeerd op documenttype. Consistente naamgeving maakt geautomatiseerde verwerking door downstream-systemen mogelijk.
Bij het splitsen van batches die gemengde documenttypen bevatten, kan de splitstool verschillende documenttypen naar verschillende uitvoermappen routeren op basis van inhoudsherkenning. Facturen gaan naar de map Boekhouding, contracten gaan naar de map Juridisch en correspondentie gaat naar de map Records.
De resolutie van de gescande pagina's heeft invloed op de nauwkeurigheid van de OCR als OCR wordt uitgevoerd op de gesplitste documenten. Scan met minimaal 300 DPI voor documenten die na het splitsen via OCR worden verwerkt.
Sommige splittools kunnen naast de gesplitste uitvoer een manifestbestand genereren. Het manifest vermeldt elke uitvoerbestandsnaam, het bronpaginabereik en alle metagegevens die tijdens het splitsen zijn geëxtraheerd. Het manifest ondersteunt kwaliteitsborging en documenttracering.
De tijdsbesparing door het automatisch splitsen van batches in vergelijking met handmatig splitsen is evenredig aan de batchgrootte. Een batch van 50 handmatig gesplitste documenten vergt ongeveer 50 minuten repetitief werk. Het geautomatiseerd splitsen van dezelfde batch vergt ongeveer 30 seconden aan configuratie- en verwerkingstijd.
De scanresolutie heeft invloed op zowel de nauwkeurigheid van de splitsing als de kwaliteit van het uitgevoerde document. Scans met een hogere resolutie produceren duidelijkere tekst die de op inhoud gebaseerde grensdetectie verbetert. Het nadeel is een grotere bestandsgrootte tijdens de verwerking. Voor splitsdoeleinden is 200 DPI meestal voldoende voor nauwkeurige grensdetectie.
| Detectiemethode | Hoe het werkt | Beste voor | Nauwkeurigheid |
|---|---|---|---|
| Consistentie van het aantal pagina's | Verdeel het totale aantal pagina's op basis van de bekende documentlengte | Uniforme documenten van dezelfde bron | Hoog voor bekende paginaaantallen |
| Detectie van blanco pagina's | Identificeer lege scheidingspagina's | Gescande batches met scheidingstekens | Hoog als blanco pagina's echt leeg zijn |
| Inhoud patroon | Herken terugkerende koptekstpatronen | Facturen, formulieren, rapporten | Middelhoog; hangt af van patroonconsistentie |
| Herkenning van streepjescodes | Lees de streepjescode op de eerste pagina van elk document | Gezondheidszorg, juridische, financiële documenten | Zeer hoog; streepjescode is ondubbelzinnig |
Probeer PDF splitsen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
