Vous numérisez un livre ouvert ou un rapport relié sur un scanner à plat. Chaque numérisation capture deux pages côte à côte, la page de gauche et la page de droite, sous la forme d'une seule image large. Lorsque vous affichez le PDF résultant, chaque feuille est une double page. Le texte de la page de gauche se retrouve dans le texte de la page de droite. La recherche d’une phrase qui traverse le caniveau entre les deux pages ne renvoie rien. Le PDF est visuellement fidèle au livre original, mais il est pratiquement inutilisable comme document de lecture.
Séparer une double page numérisée en fichiers PDF individuels d'une seule page est un besoin courant pour quiconque numérise des livres, des rapports reliés ou des magazines. Le processus consiste à diviser chaque page double largeur au milieu et à réorganiser les moitiés en un document séquentiel d'une seule page. Avec la bonne approche, une numérisation de livre de 100 pages, 50 planches, devient un PDF de 200 pages qui se lit correctement du début à la fin.

Comprendre le problème des pages doubles
Lorsqu'un livre est numérisé sur un plateau, le scanner capture toute la surface vitrée en une seule image. Si les deux pages d'un livre ouvert tiennent sur la vitre, le scan montre deux pages côte à côte. Le PDF traite cela comme une seule page orientée paysage. Les dimensions de la page peuvent être de 11 x 8,5 pouces, soit plus larges que hautes. Chaque page du livre original occupe environ la moitié de la zone numérisée. Le défi consiste à diviser cette large page en deux pages orientées portrait, chacune contenant une page de livre.
Une simple division au centre exact permet d'obtenir des numérisations parfaitement alignées, mais les numérisations de livres sont rarement parfaites. La colonne vertébrale peut créer une distorsion incurvée près de la gouttière. Les pages gauche et droite peuvent ne pas avoir la même largeur. Le livre peut avoir légèrement bougé entre les numérisations, ce qui fait varier le point de partage d'une page à l'autre. Une bonne approche Split PDF pour les numérisations de livres doit gérer ces incohérences.
Essayez de diviser le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Méthode 1 : Recadrer chaque propagation en moitiés gauche et droite
La méthode la plus fiable est un processus en deux étapes : recadrez chaque page pour extraire la page de gauche, puis recadrez à nouveau pour extraire la page de droite. Ouvrez le PDF numérisé. Utilisez l'outil de recadrage pour sélectionner la moitié gauche de chaque page. Appliquez le recadrage, qui cache tout ce qui se trouve en dehors de la zone de recadrage. Enregistrez le fichier en tant que version de la page de gauche. Ensuite, rouvrez l'original, recadrez-le dans la moitié droite et enregistrez-le en tant que version de la page de droite. Enfin, entrelacez les deux fichiers : page 1 du fichier de gauche, page 1 du fichier de droite, page 2 du fichier de gauche, page 2 du fichier de droite, et ainsi de suite.
L'outil de recadrage prend en charge l'enregistrement des régions de recadrage en tant que préréglages nommés, de sorte que vous pouvez définir la moitié gauche et la moitié droite une fois et les appliquer à toutes les pages en un seul clic. L'outil prend également en charge l'application par lots d'un recadrage à toutes les pages paires ou impaires, ce qui est utile lorsque toutes les planches partagent une mise en page cohérente.
Méthode 2 : Diviser par dimensions de page
Si chaque planche a exactement la même largeur, ce qui est courant pour les numérisations effectuées avec un chargeur automatique de documents ou un scanner de livres dédié, une division basée sur les dimensions est plus rapide qu'un recadrage manuel. Divisez la largeur de la page par deux et définissez le point de partage à cette coordonnée. Un écart de 11 pouces de large se divise en 5,5 pouces. Appliquez la division à toutes les pages uniformément. Cette méthode est rapide, elle nécessite une seule opération pour l'ensemble du document, mais elle échoue lorsque les planches ne sont pas parfaitement centrées ou lorsque le livre se déplace entre les numérisations.
Pour les documents numérisés sur un plateau où chaque planche a été placée manuellement, la division basée sur les dimensions produit souvent des résultats acceptables si l'opérateur est raisonnablement cohérent. Pour vérifier, divisez les premières pages et vérifiez qu'aucun texte n'est coupé au niveau de la ligne divisée. Si la division coupe systématiquement le contenu d'un côté, ajustez les coordonnées de division et réessayez. Une fois le point de partage vérifié sur un échantillon, appliquez-le à toutes les pages.
Méthode 3 : Utilisation de l'OCR pour détecter la gouttière et la division automatique
Certains logiciels d'analyse avancés incluent une détection automatique de la propagation. Le logiciel analyse chaque page numérisée, identifie la bande verticale sombre de la gouttière du livre et divise la page le long de cette ligne. Cela produit la répartition la plus précise car elle s'adapte au contenu réel de chaque page plutôt que d'utiliser une coordonnée fixe. La gouttière est généralement la région verticale la plus sombre de la page et est détectée de manière fiable par les algorithmes d'analyse d'image.
Le traitement Scanned PDF de WukongPDF inclut la détection automatique des gouttières pour la numérisation de livres. Téléchargez la numérisation et l'outil identifie l'ombre du dos sur chaque page, calcule la ligne de division optimale et génère un PDF d'une seule page avec les pages dans le bon ordre de lecture. L'examen manuel des résultats de fractionnement est recommandé, en particulier pour les pages comportant des images à fond perdu qui traversent la gouttière, où la détection automatique peut placer la ligne de fractionnement au milieu de l'image plutôt qu'au niveau de la gouttière.
Réorganisation des pages après fractionnement
Le fractionnement d'une planche numérisée produit des pages qui doivent être réorganisées dans l'ordre de lecture. Un livre numérisé sous forme de planches produit des pages dans cet ordre : planche 1 à gauche, planche 1 à droite, planche 2 à gauche, planche 2 à droite. L’ordre de lecture correct est le suivant : propagation 1 à droite, diffusion 2 à gauche, diffusion 2 à droite, diffusion 3 à gauche. La première page de gauche est souvent la couverture intérieure ou une page blanche précédant la page de titre, vérifiez donc la séquence prévue par rapport au livre physique.
L’étape de réorganisation est manuelle mais simple. Ouvrez le PDF divisé dans une visionneuse qui affiche les vignettes des pages. Faites glisser les pages dans le bon ordre. L'outil de réorganisation des pages du WukongPDF affiche toutes les pages sous forme de grille de vignettes, ce qui facilite la visualisation et la correction de la séquence. Un livre de 200 pages prend 10 à 15 minutes pour être réorganisé correctement. Le temps est bien dépensé car un PDF correctement ordonné d'un livre numérisé se lit naturellement du début à la fin, tandis qu'un PDF mal ordonné oblige le lecteur à passer d'une page à l'autre, ce qui est exactement le problème que la division était censée résoudre.
Après le fractionnement et la réorganisation, exécutez l'OCR sur le PDF final d'une seule page. Le texte de chaque page est désormais correctement orienté et isolé, ce qui améliore la précision de l'OCR par rapport à l'exécution de l'OCR sur des doubles pages. L'OCR sur une seule page produit également une couche de texte dans laquelle l'ordre de lecture correspond à la séquence des pages, de sorte que la recherche d'une phrase renvoie les résultats dans l'ordre correct des pages. Les PDF Pages transformées sont désormais un livre numérique correctement séquencé et consultable plutôt qu'une pile d'images de double page illisibles.
Pour les numérisations de livres avec des points de séparation inégaux où les pages gauche et droite n'ont pas la même largeur sur l'ensemble du document, un recadrage manuel page par page vaut le temps pour les documents auxquels vous référencerez à plusieurs reprises. La détection automatique des gouttières traite correctement 80 % des pages. Les 20 % restants nécessitent une attention individuelle, généralement des pages au début et à la fin des chapitres où la mise en page change, ou des pages avec des illustrations à fond perdu qui s'étendent sur toute la gouttière. Sur ces pages, la division automatique peut couper le milieu d'une image ou laisser visible un éclat de la page opposée. L'ouverture de la vignette de chaque page après le fractionnement et la vérification des premiers mots et des derniers mots de chaque ligne confirme qu'aucun contenu n'a été perdu au niveau de la limite de fractionnement. La passe de vérification prend environ 30 secondes par page et transforme une répartition qui est généralement correcte en une répartition parfaitement correcte.
Essayez de diviser le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
