Tips & Tricks

So teilen Sie ein gescanntes Stapel-PDF auf, sodass jedes physische Dokument zu einer eigenen separaten Datei wird

Sie legen einen Stapel von fünfzig Rechnungen auf einen Dokumentenscanner mit automatischem Dokumenteneinzug. Der Scanner erstellt ein einzelnes PDF, das alle fünfzig Seiten nacheinander enthält. Jetzt benötigen Sie jede Rechnung als separate PDF-Datei, benannt nach Rechnungsnummer. Ein fünfzigseitiges PDF manuell in fünfzig einzelne Dateien aufzuteilen, jede einzelne zu öffnen und unter dem richtigen Namen zu speichern, erfordert eine Stunde mühsamer Arbeit. Ein Batch-Splitting-Tool, das Dokumentgrenzen erkennt und die Ausgabedateien automatisch benennt, erledigt die gleiche Aufgabe in Sekundenschnelle.

Die Herausforderung PDF aufteilen bei gescannten Stapeln besteht darin, dass der Scanner einzelne Seiten erkennt, nicht einzelne Dokumente. Eine zehnseitige Rechnung sieht für den Scanner genauso aus wie zehn einzelne einseitige Rechnungen. Das Split-Tool muss den Seiteninhalt analysieren, um festzustellen, wo ein Dokument endet und das nächste beginnt. Diese Analyse verwendet Seiteninhaltsmuster, leere Trennseiten, Barcodes oder konsistente Seitenzahlen, um Dokumentgrenzen zu identifizieren.

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

Wie Stapelscanner PDFs mit mehreren Dokumenten erstellen

Automatische Dokumentenzuführungen verarbeiten die Seiten nacheinander. Jede Seite durchläuft den Scanner und wird an ein einzelnes Ausgabe-PDF angehängt. Der Scanner weiß nicht, dass es sich bei den Seiten eins bis drei um Rechnung A, bei den Seiten vier bis fünf um Rechnung B und bei den Seiten sechs bis acht um Rechnung C handelt. Er erstellt lediglich die Seiten eins bis acht in einer einzigen Datei.

Einige Scanner unterstützen Trennblätter, leere Seiten zwischen Dokumenten, die dem Scanner signalisieren, eine neue PDF-Datei zu erstellen. Bei den meisten Scan-Workflows werden jedoch Trennblätter übersprungen, da sie den Scanvorgang verlangsamen. Das Ergebnis ist eine einzelne PDF-Batch-Datei, die mehrere miteinander verkettete Dokumente enthält.

Diese Methode verwandelt Stunden manueller Arbeit in Sekunden automatisierter Verarbeitung.

Das Problem wird durch beidseitiges Scannen noch verstärkt. Ein im Duplexmodus gescanntes zehnseitiges Dokument erzeugt zwanzig PDF-Seiten, wobei jede physische Seite zu zwei PDF-Seiten wird. Das Split-Tool muss verstehen, dass die Seiten eins und zwei zum selben Dokument gehören, auch wenn sie als separate PDF-Seiten erscheinen.

WukongPDF

Probieren Sie Split PDF aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →

Methoden zum Erkennen von Dokumentgrenzen in einem gescannten Stapel

Die Konsistenz der Seitenanzahl ist die einfachste Erkennungsmethode. Wenn jedes Dokument im Stapel die gleiche Anzahl an Seiten hat, dividiert das Teilungstool die Gesamtseitenzahl durch die Seitenzahl des Dokuments und teilt es an diesen Grenzen. Rechnungen desselben Anbieters haben häufig eine einheitliche Seitenzahl. Diese Methode erfordert keine Inhaltsanalyse.

Die Erkennung leerer Seiten identifiziert Trennseiten, die absichtlich zwischen Dokumenten eingefügt wurden. Eine leere Seite im gescannten Stapel weist auf eine Dokumentgrenze hin. Das Teilungstool entfernt die leeren Trennseiten und teilt die verbleibenden Seiten an den Leerseitenpositionen in einzelne Dokumente auf.

Die Erkennung von Inhaltsmustern ist die ausgefeilteste Methode. Das Split-Tool sucht nach wiederkehrenden Mustern, die auf den Beginn eines neuen Dokuments hinweisen. Eine Rechnung beginnt normalerweise mit dem Logo, der Adresse und der Rechnungsnummer des Anbieters. Ein Formular beginnt mit einem Titel- und Datumsfeld. Ein Bericht beginnt mit einem Deckblatt. Das Tool identifiziert diese Muster und markiert jedes Vorkommen als Dokumentgrenze.

Die Barcode-Erkennung identifiziert Trennseiten mit aufgedruckten Barcodes. Ein Barcode oben auf der ersten Seite jedes Dokuments kodiert die Dokument-ID. Das Split-Tool liest den Barcode, benennt die Ausgabedatei mit dem codierten Wert und teilt ihn bei jedem Vorkommen des Barcodes auf. Diese Methode ist im Gesundheitswesen, bei der Rechts- und Finanzdokumentverarbeitung beliebt.

Verwenden von Split-Tools mit Dokumentenerkennungsfunktionen

WukongPDF ermöglicht die Verarbeitung gescannter PDF über den Browser, einschließlich der Möglichkeit, gescannte Stapel mit mehreren Dokumenten in einzelne Dateien aufzuteilen. Das Split-Tool kann Dokumentgrenzen anhand von Inhaltsmustern oder angegebenen Seitenzahlen erkennen.

Sehen Sie sich vor dem Teilen eine Vorschau des Stapels an, um die Seitenreihenfolge und -ausrichtung zu überprüfen. Seiten, die verkehrt herum oder in der falschen Reihenfolge gescannt wurden, führen zu falsch sortierten Ausgabedateien. Die meisten Split-Tools verfügen über eine Seitenvorschau und eine Neuordnungsfunktion zur Korrektur von Scanfehlern vor dem Teilen.

Konfigurieren Sie die Benennung der Ausgabedatei basierend auf dem erkannten Inhalt. Wenn das Split-Tool die Rechnungsnummer oder Dokument-ID von der ersten Seite jedes Dokuments lesen kann, verwenden Sie diesen Wert als Ausgabedateinamen. Wenn eine inhaltsbasierte Benennung nicht möglich ist, verwenden Sie eine fortlaufende Nummerierung mit einem beschreibenden Präfix.

Überprüfung der Split-Genauigkeit

Überprüfen Sie nach der Aufteilung die ersten und letzten Ausgabedateien. Öffnen Sie die erste Ausgabedatei und bestätigen Sie, dass sie die richtigen Seiten enthält. Öffnen Sie die letzte Ausgabedatei und bestätigen Sie, dass sie die letzten Seiten des Stapels enthält. Überprüfen Sie eine Datei ab der Mitte des Stapels stichprobenartig. Diese Prüfungen erkennen Grenzerkennungsfehler, bevor die Dateien verteilt werden.

Vergleichen Sie die Gesamtseitenzahl aller Ausgabedateien mit der ursprünglichen Stapelseitenzahl. Stimmt die Summe überein, wurde jede Seite einer Ausgabedatei zugeordnet. Liegt die Summe darunter, gingen bei der Aufteilung Seiten verloren. Ist die Summe höher, wurden Seiten dupliziert.

Bei Stapeln, bei denen die Dokumentgrenzen nicht eindeutig sind, führen Sie die Aufteilung mit konservativen Einstellungen durch, die einen stärkeren Grenznachweis erfordern. Bei einer konservativen Aufteilung bleiben möglicherweise einige Dokumente zusammengefasst, anstatt ein einzelnes Dokument fälschlicherweise in mehrere Dateien aufzuteilen. Die kombinierten Dokumente können manuell mit geringerem Risiko aufgeteilt werden als Fragmente eines einzelnen Dokuments.

Automatisierung des Split-and-Name-Workflows

Automatisieren Sie den Arbeitsablauf für wiederkehrende Stapelscans und -aufteilungen. Speichern Sie die Aufteilungseinstellungen, die Grenzerkennungsmethode und die Ausgabebenennungskonvention als Profil. Jeder nachfolgende Stapel wird mit demselben Profil verarbeitet, wodurch eine konsistente Ausgabe entsteht. Die anfängliche Rüstzeit wird nach der zweiten Charge wiederhergestellt.

Integrieren Sie die geteilte Ausgabe in Dokumentenverwaltungssysteme, indem Sie die Ausgabebenennung so konfigurieren, dass sie dem vom System erwarteten Format entspricht. Eine während der Aufteilung extrahierte Dokument-ID, die der Namenskonvention des Dokumentenverwaltungssystems entspricht, ermöglicht die automatische Erfassung ohne manuelles Umbenennen.

Die Trennung von Dokumenten in gescannten Stapeln ist ein häufiger Bedarf in Branchen, die Papierdokumente in großen Mengen verarbeiten: im Gesundheitswesen werden Patientenakten verarbeitet, in der Rechtsabteilung werden Fallakten verarbeitet, in der Buchhaltung werden Rechnungen verarbeitet und bei der Regierung werden Anträge verarbeitet. Jede Branche hat ihre eigenen Dokumenttypen, Seitenzahlen und Grenzmuster.

Barcode-Trennblätter sind die zuverlässigste Methode für Scanvorgänge mit hohem Volumen. Drucken Sie ein Barcode-Blatt aus dem Dokumentenmanagementsystem, legen Sie es vor dem Scannen auf jedes Dokument und das Split-Tool liest den Barcode, um Dokumentgrenzen zu identifizieren und Ausgabedateien zu benennen. Der Barcode beseitigt Unklarheiten darüber, wo Dokumente beginnen und enden.

Die optische Markierungserkennung kann Kontrollkästchen oder ausgefüllte Kreise auf der ersten Seite jedes Dokuments identifizieren, die den Dokumenttyp oder die Priorität angeben. Das Split-Tool liest diese Markierungen und leitet Dokumente basierend auf dem erkannten Typ an verschiedene Ausgabeordner weiter.

Die Genauigkeit der automatisierten Dokumententrennung sollte gemessen und überwacht werden. Ein Stapel von 500 Dokumenten mit einer Trenngenauigkeit von 99 % führt immer noch zu 5 falsch aufgeteilten Dokumenten, die manuell korrigiert werden müssen. Verfolgen Sie die Fehlerrate im Laufe der Zeit, um Dokumenttypen oder Scanbedingungen zu identifizieren, die zu höheren Fehlerraten führen.

Bei Stapeln, bei denen die Dokumentgrenzen inkonsistent sind, erkennt ein menschlicher Überprüfungsschritt zwischen Scannen und Teilen Grenzfehler, die bei der automatischen Erkennung übersehen werden. Der Prüfer durchsucht den Stapel in einem Seitenbetrachter, bestätigt oder passt die erkannten Grenzen an und löst dann die automatische Aufteilung aus.

Das Ausgabedateiformat nach der Aufteilung kann PDF/A zur Archivierung, komprimiertes PDF zur Verteilung oder TIFF zur weiteren Bildverarbeitung umfassen. Konfigurieren Sie das Ausgabeformat basierend auf der nachgelagerten Verwendung der getrennten Dokumente.

Durch die Integration des Split-Workflows in ein Dokumentenmanagementsystem entsteht eine nahtlose Pipeline vom Papier zum durchsuchbaren Archiv. Der Scanner erstellt ein Stapel-PDF, der Splitter trennt es in einzelne Dokumente, OCR macht sie durchsuchbar und das Dokumentenverwaltungssystem indiziert sie zum Abruf.

Cloudbasierte Split-Dienste bieten die gleichen Funktionen wie Desktop-Tools, haben jedoch den Vorteil, dass sie von jedem Gerät aus zugänglich sind. Das gescannte Batch-PDF wird hochgeladen, verarbeitet und die einzelnen Dokumente werden als separate Dateien zurückgegeben. Bei der Nutzung von Cloud-Diensten für sensible Dokumente gelten Datenschutzaspekte.

Die Namenskonvention für geteilte Ausgabedateien sollte konsistent und sortierbar sein. Ein Format wie YYYY-MM-DD_DocumentType_SequentialNumber erzeugt Dateinamen, die chronologisch sortiert und nach Dokumenttyp gruppiert werden. Eine einheitliche Benennung ermöglicht eine automatisierte Verarbeitung durch nachgelagerte Systeme.

Beim Teilen von Stapeln, die gemischte Dokumenttypen enthalten, kann das Split-Tool verschiedene Dokumenttypen basierend auf der Inhaltserkennung an verschiedene Ausgabeordner weiterleiten. Rechnungen werden in den Ordner „Buchhaltung“ verschoben, Verträge in den Ordner „Recht“ und Korrespondenz in den Ordner „Datensätze“.

Die Auflösung der gescannten Seiten wirkt sich auf die OCR-Genauigkeit aus, wenn OCR auf den geteilten Dokumenten ausgeführt wird. Scannen Sie mit mindestens 300 DPI nach Dokumenten, die nach der Aufteilung einer OCR-Verarbeitung unterzogen werden.

Einige Split-Tools können neben der Split-Ausgabe auch eine Manifestdatei generieren. Das Manifest listet jeden Ausgabedateinamen, den Quellseitenbereich und alle während der Aufteilung extrahierten Metadaten auf. Das Manifest unterstützt die Qualitätssicherung und Dokumentenverfolgung.

Die Zeitersparnis durch die automatische Chargenaufteilung im Vergleich zur manuellen Aufteilung ist proportional zur Chargengröße. Ein Stapel von 50 manuell aufgeteilten Dokumenten erfordert etwa 50 Minuten sich wiederholender Arbeit. Die automatische Aufteilung derselben Charge erfordert etwa 30 Sekunden Konfigurations- und Verarbeitungszeit.

Die Scanauflösung beeinflusst sowohl die Teilungsgenauigkeit als auch die Qualität des Ausgabedokuments. Scans mit höherer Auflösung erzeugen klareren Text, der die inhaltsbasierte Grenzerkennung verbessert. Der Nachteil sind größere Dateigrößen während der Verarbeitung. Für Aufteilungszwecke reichen normalerweise 200 DPI für eine genaue Grenzerkennung aus.

ErkennungsmethodeWie es funktioniertAm besten fürGenauigkeit
Konsistenz der SeitenanzahlTeilen Sie die Gesamtseitenzahl durch die bekannte DokumentlängeEinheitliche Dokumente aus derselben QuelleHoch für bekannte Seitenzahlen
Erkennung leerer SeitenIdentifizieren Sie leere TrennseitenGescannte Stapel mit TrennzeichenHoch, wenn leere Seiten wirklich leer sind
InhaltsmusterErkennen Sie wiederkehrende Header-MusterRechnungen, Formulare, BerichteMittelhoch; hängt von der Musterkonsistenz ab
Barcode-ErkennungLesen Sie den Barcode auf der ersten Seite jedes DokumentsGesundheits-, Rechts- und FinanzdokumenteSehr hoch; Barcode ist eindeutig
WukongPDF

Probieren Sie Split PDF aus

Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.

Jetzt starten →