Tips & Tricks

Comment diviser un PDF par lots numérisé afin que chaque document physique devienne son propre fichier distinct

Vous placez une pile de cinquante factures sur un scanner de documents équipé d'un chargeur automatique de documents. Le scanner produit un seul PDF contenant les cinquante pages en séquence. Vous avez désormais besoin de chaque facture sous forme de fichier PDF distinct nommé par numéro de facture. Diviser manuellement un PDF de cinquante pages en cinquante fichiers individuels, ouvrir chacun d'eux et l'enregistrer sous le nom correct prend une heure de travail fastidieux. Un outil de fractionnement par lots qui détecte les limites des documents et nomme les fichiers de sortie effectue automatiquement le même travail en quelques secondes.

Le défi Split PDF avec les lots numérisés est que le scanner voit des pages individuelles, pas des documents individuels. Une facture de dix pages ressemble exactement à dix factures distinctes d’une page au scanner. L'outil de fractionnement doit analyser le contenu de la page pour déterminer où se termine un document et où commence le suivant. Cette analyse utilise des modèles de contenu de page, des pages de séparation vierges, des codes-barres ou un nombre de pages cohérent pour identifier les limites du document.

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

Comment les scanners par lots produisent des PDF multi-documents

Les chargeurs automatiques de documents traitent les pages de manière séquentielle. Chaque page passe par le scanner et est ajoutée à un seul PDF de sortie. Le scanner ne sait pas et ne se soucie pas du fait que les pages un à trois sont la facture A, les pages quatre à cinq sont la facture B et les pages six à huit sont la facture C. Il produit simplement les pages un à huit dans un seul fichier.

Certains scanners prennent en charge des feuilles de séparation, des pages vierges insérées entre les documents qui signalent au scanner de démarrer un nouveau PDF. Mais la plupart des flux de travail de numérisation ignorent les feuilles de séparation car elles ralentissent le processus de numérisation. Le résultat est un seul fichier PDF Batch contenant plusieurs documents concaténés ensemble.

Cette méthode transforme des heures de travail manuel en secondes de traitement automatisé.

Le problème s’aggrave avec la numérisation recto verso. Un document numérisé recto verso de dix pages produit vingt pages PDF, chaque page physique devenant deux pages PDF. L'outil de fractionnement doit comprendre que les pages un et deux appartiennent au même document, même si elles apparaissent comme des pages PDF distinctes.

WukongPDF

Essayez de diviser le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →

Méthodes de détection des limites d'un document dans un lot numérisé

La cohérence du nombre de pages est la méthode de détection la plus simple. Si chaque document du lot comporte le même nombre de pages, l'outil de fractionnement divise le nombre total de pages par le nombre de pages du document et le divise selon ces limites. Les factures du même fournisseur ont souvent un nombre de pages cohérent. Cette méthode ne nécessite aucune analyse de contenu.

La détection des pages vierges identifie les pages de séparation intentionnellement insérées entre les documents. Une page vierge dans le lot numérisé signale une limite de document. L'outil de fractionnement supprime les pages de séparation vierges et divise les pages restantes en documents individuels aux positions des pages vierges.

La détection des modèles de contenu est la méthode la plus sophistiquée. L'outil de fractionnement recherche des modèles récurrents qui indiquent le début d'un nouveau document. Une facture commence généralement par le logo du fournisseur, son adresse et son numéro de facture. Un formulaire commence par un champ de titre et de date. Un rapport commence par une page de garde. L'outil identifie ces modèles et marque chaque occurrence comme limite du document.

La détection des codes-barres identifie les pages de séparation avec les codes-barres imprimés. Un code-barres en haut de la première page de chaque document code l'ID du document. L'outil de fractionnement lit le code-barres, nomme le fichier de sortie avec la valeur codée et le divise à chaque occurrence de code-barres. Cette méthode est populaire dans le traitement des documents de santé, juridiques et financiers.

Utilisation d'outils fractionnés avec des capacités de détection de documents

WukongPDF fournit le traitement PDF numérisé via le navigateur, y compris la possibilité de diviser des lots numérisés de plusieurs documents en fichiers individuels. L'outil de fractionnement peut détecter les limites du document à l'aide de modèles de contenu ou d'un nombre de pages spécifié.

Avant de diviser, prévisualisez le lot pour vérifier l’ordre et l’orientation des pages. Les pages numérisées à l’envers ou dans le désordre produiront des fichiers de sortie mal ordonnés. La plupart des outils de fractionnement incluent une fonction d'aperçu des pages et de réorganisation pour corriger les erreurs de numérisation avant le fractionnement.

Configurez le nom du fichier de sortie en fonction du contenu détecté. Si l'outil de fractionnement peut lire le numéro de facture ou l'ID du document sur la première page de chaque document, utilisez cette valeur comme nom de fichier de sortie. Si la dénomination basée sur le contenu n'est pas disponible, utilisez une numérotation séquentielle avec un préfixe descriptif.

Vérification de la précision du fractionnement

Après le fractionnement, vérifiez les premiers et derniers fichiers de sortie. Ouvrez le premier fichier de sortie et confirmez qu'il contient les bonnes pages. Ouvrez le dernier fichier de sortie et confirmez qu'il contient les dernières pages du lot. Vérifiez ponctuellement un fichier au milieu du lot. Ces vérifications détectent les erreurs de détection des limites avant que les fichiers ne soient distribués.

Comparez le nombre total de pages de tous les fichiers de sortie avec le nombre de pages du lot d'origine. Si la somme correspond, chaque page a été affectée à un fichier de sortie. Si la somme est inférieure, des pages ont été perdues lors du fractionnement. Si la somme est supérieure, les pages ont été dupliquées.

Les lots dans lesquels les limites du document sont ambiguës exécutent la division avec des paramètres conservateurs qui nécessitent des preuves de limites plus solides. Une division conservatrice peut laisser certains documents combinés plutôt que de diviser incorrectement un seul document en plusieurs fichiers. Les documents combinés peuvent être divisés manuellement avec moins de risques que les fragments d'un seul document.

Automatisation du flux de travail de fractionnement et de nom

Pour l'analyse et le fractionnement récurrents de lots, automatisez le flux de travail. Enregistrez les paramètres de fractionnement, la méthode de détection des limites et la convention de dénomination des sorties en tant que profil. Chaque lot suivant est traité avec le même profil, produisant un résultat cohérent. Le temps de préparation initial est récupéré après le deuxième lot.

Intégrez la sortie fractionnée aux systèmes de gestion de documents en configurant le nom de la sortie pour qu'elle corresponde au format attendu du système. Un ID de document extrait lors du fractionnement qui correspond à la convention de dénomination du système de gestion de documents permet une ingestion automatique sans renommage manuel.

La séparation des documents en lots numérisés est un besoin courant dans les secteurs qui traitent des documents papier en volume : les soins de santé traitent les dossiers des patients, les dossiers de procédures juridiques, les factures de traitement comptable et les applications de processus gouvernementaux. Chaque secteur a ses propres types de documents, nombre de pages et modèles de limites.

Les feuilles séparatrices de codes-barres constituent la méthode la plus fiable pour les opérations de numérisation de gros volumes. Imprimez une feuille de codes-barres à partir du système de gestion de documents, placez-la au-dessus de chaque document avant de le numériser, et l'outil de fractionnement lit le code-barres pour identifier les limites du document et nommer les fichiers de sortie. Le code-barres élimine toute ambiguïté quant au début et à la fin des documents.

La reconnaissance optique des marques peut identifier des cases à cocher ou des cercles pleins sur la première page de chaque document qui indiquent le type ou la priorité du document. L'outil de fractionnement lit ces marques et achemine les documents vers différents dossiers de sortie en fonction du type reconnu.

La précision de la séparation automatisée des documents doit être mesurée et surveillée. Un lot de 500 documents avec une précision de séparation de 99 % produit toujours 5 documents mal divisés qui nécessitent une correction manuelle. Suivez le taux d'erreur au fil du temps pour identifier les types de documents ou les conditions de numérisation qui produisent des taux d'erreur plus élevés.

Pour les lots où les limites des documents sont incohérentes, une étape de révision humaine entre la numérisation et le fractionnement détecte les erreurs de limites qui n'ont pas été détectées automatiquement. Le réviseur parcourt le lot dans une visionneuse de pages, confirme ou ajuste les limites détectées, puis déclenche la division automatisée.

Le format de fichier de sortie après fractionnement peut inclure PDF/A pour l'archivage, PDF compressé pour la distribution ou TIFF pour un traitement ultérieur de l'image. Configurez le format de sortie en fonction de l'utilisation en aval des documents séparés.

L'intégration du flux de travail fractionné à un système de gestion de documents crée un pipeline transparent depuis le papier jusqu'aux archives consultables. Le scanner produit un PDF par lots, le séparateur le sépare en documents individuels, l'OCR les rend consultables et le système de gestion de documents les indexe pour les récupérer.

Les services partagés basés sur le cloud offrent les mêmes fonctionnalités que les outils de bureau avec l'avantage d'être accessibles depuis n'importe quel appareil. Le PDF par lots numérisé est téléchargé, traité et les documents individuels sont renvoyés sous forme de fichiers séparés. Des considérations relatives à la confidentialité des données s'appliquent lors de l'utilisation de services cloud pour des documents sensibles.

La convention de dénomination des fichiers de sortie fractionnés doit être cohérente et triable. Un format tel que AAAA-MM-JJ_DocumentType_SequentialNumber produit des noms de fichiers triés par ordre chronologique et regroupés par type de document. Une dénomination cohérente permet un traitement automatisé par les systèmes en aval.

Lors du fractionnement de lots contenant des types de documents mixtes, l'outil de fractionnement peut acheminer différents types de documents vers différents dossiers de sortie en fonction de la reconnaissance du contenu. Les factures vont dans le dossier Comptabilité, les contrats dans le dossier Juridique et la correspondance dans le dossier Records.

La résolution des pages numérisées affecte la précision de l'OCR si l'OCR est exécutée sur les documents fractionnés. Numérisez à au moins 300 DPI pour les documents qui seront traités par OCR après leur fractionnement.

Certains outils de fractionnement peuvent générer un fichier manifeste avec la sortie fractionnée. Le manifeste répertorie chaque nom de fichier de sortie, la plage de pages source et toutes les métadonnées extraites lors du fractionnement. Le manifeste prend en charge l’assurance qualité et le suivi des documents.

Le gain de temps grâce au fractionnement automatisé des lots par rapport au fractionnement manuel est proportionnel à la taille du lot. Un lot de 50 documents fractionnés manuellement nécessite environ 50 minutes de travail répétitif. Le fractionnement automatisé d’un même lot nécessite environ 30 secondes de temps de configuration et de traitement.

La résolution de numérisation affecte à la fois la précision de la division et la qualité du document de sortie. Les numérisations à plus haute résolution produisent un texte plus clair qui améliore la détection des limites basées sur le contenu. Le compromis est une taille de fichier plus grande pendant le traitement. À des fins de fractionnement, 200 DPI suffisent généralement pour une détection précise des limites.

Méthode de détectionComment ça marcheMeilleur pourPrécision
Cohérence du nombre de pagesDivisez le nombre total de pages par la longueur connue du documentDocuments uniformes de même sourceÉlevé pour le nombre de pages connu
Détection des pages blanchesIdentifier les pages de séparation videsLots scannés avec séparateursÉlevé si les pages blanches sont vraiment vides
Modèle de contenuReconnaître les modèles d'en-tête récurrentsFactures, formulaires, rapportsMoyen-élevé ; dépend de la cohérence du modèle
Reconnaissance de codes-barresLire le code-barres sur la première page de chaque documentDocuments sanitaires, juridiques, financiersTrès élevé ; le code à barres est sans ambiguïté
WukongPDF

Essayez de diviser le PDF

Aucune installation nécessaire. Fonctionne directement dans votre navigateur.

Commencer →