Tips & Tricks

Come dividere un PDF batch scansionato in modo che ogni documento fisico diventi un file separato

Metti una pila di cinquanta fatture su uno scanner per documenti con un alimentatore automatico di documenti. Lo scanner produce un unico PDF contenente tutte le cinquanta pagine in sequenza. Ora hai bisogno di ciascuna fattura come file PDF separato denominato in base al numero di fattura. Dividere manualmente un PDF di cinquanta pagine in cinquanta file singoli, aprirli ciascuno e salvarlo con il nome corretto, richiede un'ora di lavoro noioso. Uno strumento di suddivisione in batch che rileva i limiti dei documenti e nomina i file di output esegue automaticamente lo stesso lavoro in pochi secondi.

Il problema PDF diviso con i batch scansionati è che lo scanner vede singole pagine, non singoli documenti. Allo scanner una fattura di dieci pagine appare esattamente come dieci fatture separate di una pagina. Lo strumento di divisione deve analizzare il contenuto della pagina per determinare dove finisce un documento e inizia quello successivo. Questa analisi utilizza modelli di contenuto della pagina, pagine divisorie vuote, codici a barre o conteggi di pagine coerenti per identificare i limiti del documento.

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

Come gli scanner batch producono PDF multi-documento

Gli alimentatori automatici di documenti elaborano le pagine in sequenza. Ogni pagina passa attraverso lo scanner e viene aggiunta a un singolo PDF di output. Lo scanner non sa né si preoccupa del fatto che le pagine da uno a tre siano la Fattura A, le pagine da quattro a cinque siano la Fattura B e le pagine da sei a otto siano la Fattura C. Produce semplicemente le pagine da uno a otto in un unico file.

Alcuni scanner supportano i fogli separatori, pagine bianche inserite tra i documenti che segnalano allo scanner di avviare un nuovo PDF. Tuttavia, la maggior parte dei flussi di lavoro di scansione ignora i fogli separatori perché rallentano il processo di scansione. Il risultato è un singolo file PDF Batch contenente più documenti concatenati insieme.

Questo metodo trasforma ore di lavoro manuale in secondi di elaborazione automatizzata.

Il problema si aggrava con la scansione fronte-retro. Un documento scansionato fronte/retro di dieci pagine produce venti pagine PDF, dove ciascuna pagina fisica diventa due pagine PDF. Lo strumento di divisione deve comprendere che le pagine uno e due appartengono allo stesso documento, anche se appaiono come pagine PDF separate.

WukongPDF

Prova Dividi PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Metodi per rilevare i confini dei documenti in un batch scansionato

La coerenza del conteggio delle pagine è il metodo di rilevamento più semplice. Se ogni documento nel batch ha lo stesso numero di pagine, lo strumento di divisione divide il conteggio totale delle pagine per il conteggio delle pagine del documento e divide in corrispondenza di tali limiti. Le fatture dello stesso fornitore spesso hanno un numero di pagine coerente. Questo metodo non richiede l'analisi del contenuto.

Il rilevamento delle pagine vuote identifica le pagine separatore inserite intenzionalmente tra i documenti. Una pagina vuota nel batch scansionato segnala un confine del documento. Lo strumento Dividi rimuove le pagine vuote del separatore e divide le pagine rimanenti in singoli documenti nelle posizioni delle pagine vuote.

Il rilevamento del modello di contenuto è il metodo più sofisticato. Lo strumento di divisione cerca modelli ricorrenti che indicano l'inizio di un nuovo documento. Una fattura in genere inizia con il logo del fornitore, l'indirizzo e il numero della fattura. Un modulo inizia con un campo titolo e data. Un report inizia con una copertina. Lo strumento identifica questi modelli e contrassegna ogni occorrenza come confine del documento.

Il rilevamento dei codici a barre identifica le pagine separatore con codici a barre stampati. Un codice a barre nella parte superiore della prima pagina di ciascun documento codifica l'ID del documento. Lo strumento di divisione legge il codice a barre, nomina il file di output con il valore codificato e lo divide a ogni occorrenza del codice a barre. Questo metodo è popolare nell'elaborazione di documenti sanitari, legali e finanziari.

Utilizzo di strumenti divisi con funzionalità di rilevamento dei documenti

WukongPDF fornisce l'elaborazione PDF scansionati tramite il browser, inclusa la possibilità di dividere batch di più documenti scansionati in singoli file. Lo strumento di divisione è in grado di rilevare i limiti del documento utilizzando modelli di contenuto o conteggi di pagine specificati.

Prima di dividere, visualizzare l'anteprima del batch per verificare l'ordine e l'orientamento delle pagine. Le pagine scansionate capovolte o fuori ordine produrranno file di output ordinati in modo errato. La maggior parte degli strumenti di divisione includono un'anteprima della pagina e una funzione di riordino per correggere gli errori di scansione prima della divisione.

Configura la denominazione del file di output in base al contenuto rilevato. Se lo strumento di suddivisione è in grado di leggere il numero della fattura o l'ID del documento dalla prima pagina di ciascun documento, utilizzare tale valore come nome del file di output. Se la denominazione basata sul contenuto non è disponibile, utilizzare la numerazione sequenziale con un prefisso descrittivo.

Verifica della precisione della divisione

Dopo la divisione, verifica i primi e gli ultimi file di output. Apri il primo file di output e verifica che contenga le pagine corrette. Apri l'ultimo file di output e conferma che contiene le pagine finali del batch. Controllare a campione un file dalla metà del batch. Questi controlli rilevano gli errori di rilevamento dei confini prima che i file vengano distribuiti.

Confronta il conteggio totale delle pagine di tutti i file di output con il conteggio delle pagine batch originali. Se la somma corrisponde, ogni pagina è stata assegnata a un file di output. Se la somma è inferiore, le pagine sono andate perse durante la divisione. Se la somma è maggiore, le pagine sono state duplicate.

I batch in cui i confini del documento sono ambigui, eseguono la suddivisione con impostazioni prudenti che richiedono prove dei confini più forti. Una divisione conservativa potrebbe lasciare alcuni documenti combinati anziché dividere erroneamente un singolo documento in più file. I documenti combinati possono essere divisi manualmente con un rischio inferiore rispetto ai frammenti di un singolo documento.

Automatizzazione del flusso di lavoro di divisione e nome

Per scansioni e suddivisioni ricorrenti in batch, automatizza il flusso di lavoro. Salvare le impostazioni di suddivisione, il metodo di rilevamento dei confini e la convenzione di denominazione dell'output come profilo. Ogni batch successivo viene elaborato con lo stesso profilo, producendo un output coerente. Il tempo di impostazione iniziale viene recuperato dopo il secondo lotto.

Integra l'output diviso con i sistemi di gestione dei documenti configurando la denominazione dell'output in modo che corrisponda al formato previsto dal sistema. Un ID documento estratto durante la suddivisione che corrisponde alla convenzione di denominazione del sistema di gestione dei documenti consente l'inserimento automatico senza ridenominazione manuale.

La separazione dei documenti in batch scansionati è un'esigenza comune nei settori che elaborano grandi volumi di documenti cartacei: elaborazioni sanitarie, cartelle cliniche, fascicoli legali, fatture, processi contabili e applicazioni governative. Ogni settore ha i propri tipi di documenti, conteggi di pagine e modelli di confine.

I fogli separatori di codici a barre rappresentano il metodo più affidabile per le operazioni di scansione di volumi elevati. Stampa un foglio con codici a barre dal sistema di gestione dei documenti, posizionalo sopra ciascun documento prima della scansione e lo strumento di divisione legge il codice a barre per identificare i limiti del documento e denominare i file di output. Il codice a barre elimina l'ambiguità su dove iniziano e finiscono i documenti.

Il riconoscimento ottico dei segni può identificare caselle di controllo o cerchi pieni sulla prima pagina di ciascun documento che indicano il tipo o la priorità del documento. Lo strumento di suddivisione legge questi contrassegni e instrada i documenti in cartelle di output diverse in base al tipo riconosciuto.

L'accuratezza della separazione automatizzata dei documenti dovrebbe essere misurata e monitorata. Un batch di 500 documenti con una precisione di separazione del 99% produce ancora 5 documenti divisi erroneamente che necessitano di correzione manuale. Tieni traccia del tasso di errore nel tempo per identificare i tipi di documenti o le condizioni di scansione che producono tassi di errore più elevati.

Per i batch in cui i confini dei documenti non sono coerenti, una fase di revisione umana tra la scansione e la divisione rileva gli errori di confine che il rilevamento automatico non rileva. Il revisore esegue la scansione del batch in un visualizzatore di pagine, conferma o regola i limiti rilevati e quindi attiva la suddivisione automatica.

Il formato del file di output dopo la divisione può includere PDF/A per l'archiviazione, PDF compresso per la distribuzione o TIFF per l'ulteriore elaborazione delle immagini. Configurare il formato di output in base all'utilizzo a valle dei documenti separati.

L'integrazione del flusso di lavoro suddiviso con un sistema di gestione dei documenti crea un flusso continuo dal documento cartaceo all'archivio ricercabile. Lo scanner produce un PDF batch, lo splitter lo separa in singoli documenti, l'OCR li rende ricercabili e il sistema di gestione dei documenti li indicizza per il recupero.

I servizi suddivisi basati su cloud offrono le stesse funzionalità degli strumenti desktop con il vantaggio dell'accessibilità da qualsiasi dispositivo. Il PDF batch scansionato viene caricato, elaborato e i singoli documenti vengono restituiti come file separati. Le considerazioni sulla privacy dei dati si applicano quando si utilizzano servizi cloud per documenti sensibili.

La convenzione di denominazione per i file di output divisi deve essere coerente e ordinabile. Un formato come AAAA-MM-GG_DocumentType_SequentialNumber produce nomi di file ordinati cronologicamente e raggruppati per tipo di documento. La denominazione coerente consente l'elaborazione automatizzata da parte dei sistemi a valle.

Quando si dividono batch che contengono tipi di documenti misti, lo strumento di divisione può instradare diversi tipi di documenti a cartelle di output diverse in base al riconoscimento del contenuto. Le fatture vanno nella cartella Contabilità, i contratti vanno nella cartella Legale e la corrispondenza va nella cartella Documenti.

La risoluzione delle pagine scansionate influisce sulla precisione dell'OCR se l'OCR verrà eseguito sui documenti divisi. Scansione a un minimo di 300 DPI per i documenti che verranno elaborati tramite OCR dopo la divisione.

Alcuni strumenti di suddivisione possono generare un file manifest insieme all'output suddiviso. Il manifest elenca ciascun nome file di output, l'intervallo di pagine di origine e tutti i metadati estratti durante la divisione. Il manifest supporta il controllo qualità e il monitoraggio dei documenti.

Il risparmio di tempo derivante dalla suddivisione batch automatizzata rispetto alla suddivisione manuale è proporzionale alla dimensione del batch. Un batch di 50 documenti suddivisi manualmente richiede circa 50 minuti di lavoro ripetitivo. La suddivisione automatizzata dello stesso lotto richiede circa 30 secondi di configurazione ed elaborazione.

La risoluzione della scansione influisce sia sulla precisione della divisione che sulla qualità del documento di output. Le scansioni a risoluzione più elevata producono testo più chiaro che migliora il rilevamento dei confini basato sul contenuto. Il compromesso è rappresentato dalle dimensioni dei file più grandi durante l'elaborazione. Per scopi di suddivisione, 200 DPI sono generalmente sufficienti per un rilevamento accurato dei confini.

Metodo di rilevamentoCome funzionaIdeale perPrecisione
Coerenza del conteggio delle pagineDividi le pagine totali per la lunghezza nota del documentoDocumenti uniformi dalla stessa fonteAlto per i conteggi di pagine conosciute
Rilevamento delle pagine vuoteIdentificare le pagine separatore vuoteLotti scansionati con separatoriAlto se le pagine bianche sono veramente vuote
Modello di contenutoRiconoscere i modelli di intestazione ricorrentiFatture, moduli, reportMedio-Alto; depends on pattern consistency
Riconoscimento dei codici a barreLeggi il codice a barre sulla prima pagina di ogni documentoDocumenti sanitari, legali e finanziariMolto alto; il codice a barre è inequivocabile
WukongPDF

Prova Dividi PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →