La numérisation d'un volume relié tel qu'un livre, une thèse, un journal ou un grand livre produit un PDF où les pages alternent entre l'orientation portrait et paysage. Les pages de gauche du livre ouvert sont numérisées dans une orientation et les pages de droite dans une autre, ou le livre entier est numérisé avec des rotations de page alternées car l'opérateur du scanner a retourné le livre pour chaque page sans faire pivoter l'image numérisée. Le résultat est un PDF dans lequel une page sur deux apparaît pivotée de 90 ou 180 degrés lorsqu'elle est affichée à l'écran. L'exécution de l'OCR sur ce document sans normaliser au préalable les orientations de la page produit un texte qui alterne entre correctement orienté et pivoté, rendant le texte reconnu inutilisable pour la recherche ou l'extraction. La solution nécessite une étape de prétraitement qui détecte et corrige l'orientation de chaque page avant que l'OCR ne la traite.

Pourquoi la numérisation de volumes reliés produit des orientations de page alternées
Lors de la numérisation d'un volume relié, chaque page double place deux pages face vers le bas sur le lit du scanner. La page de gauche du livre apparaît sur le côté droit du lit du scanner et la page de droite apparaît sur le côté gauche, pivotées de 180 degrés l'une par rapport à l'autre. Si l'opérateur du scanner ne corrige pas cette rotation pour chaque page individuelle, le PDF numérisé contient des pages dont une page sur deux est à l'envers. Un livre de 200 pages produit un PDF de 200 pages dont 100 sont correctement orientées et 100 pivotées de 180 degrés. Le modèle est régulier et prévisible : toutes les pages impaires peuvent être correctement orientées et toutes les pages paires pivotées, ou vice versa.
Certains volumes reliés sont numérisés en plaçant le livre ouvert sur le scanner avec le texte horizontal, produisant une seule image contenant à la fois les pages de gauche et de droite. Cette image est ensuite divisée en deux pages distinctes, mais le processus de division ne fait pas toujours pivoter la page de droite pour correspondre à l'orientation de la page de gauche. Le résultat est un PDF dans lequel les pages de gauche sont correctement orientées et les pages de droite pivotent de 90 degrés, ou vice versa. Le moteur OCR, qui s'attend à ce que le texte s'exécute horizontalement de gauche à droite sur la page, ne peut pas reconnaître le texte sur les pages pivotées car le texte s'exécute verticalement ou à l'envers.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Détection de l'orientation de la page avant le traitement OCR
Avant d'exécuter l'OCR, inspectez les vignettes des pages dans la visionneuse PDF. L’orientation alternée est immédiatement visible dans le panneau des vignettes, où une vignette sur deux apparaît pivotée. Comptez le modèle d'orientation : les pages impaires correctes et les pages paires pivotées sont le modèle le plus courant, mais l'inverse est également possible. Si le modèle est cohérent, une opération de rotation par lots peut corriger toutes les pages concernées en une seule commande. La plupart des visionneuses PDF permettent de sélectionner plusieurs pages dans le panneau des vignettes et d'appliquer simultanément une rotation à toutes les pages sélectionnées. Sélectionnez toutes les pages paires, faites-les pivoter de 180 degrés ou 90 degrés selon vos besoins et enregistrez le document. Le panneau de vignettes affiche désormais toutes les pages dans la bonne orientation.
L'outil OCR PDF de WukongPDF traite chaque page indépendamment, mais il suppose que le texte est orienté horizontalement. Si la page est tournée, le moteur OCR ne parvient à reconnaître aucun texte ou produit une sortie tronquée car il essaie de lire le texte vertical ou à l'envers comme s'il était horizontal. La correction de l'orientation de la page avant l'OCR est une étape de prétraitement obligatoire. Après avoir fait pivoter les pages concernées et enregistré le document, exécutez l'OCR sur le PDF normalisé. La précision de la reconnaissance sera cohérente sur toutes les pages, car chaque page présente désormais le texte dans l'orientation attendue par le moteur OCR.
Gestion des modèles d'orientation incohérents dans le document
Tous les volumes reliés ne produisent pas un motif alterné propre. Un livre numérisé par deux opérateurs différents, un ensemble de plusieurs volumes numérisé à des moments différents ou un document partiellement renumérisé après la numérisation initiale peuvent présenter des modèles d'orientation irréguliers. Les pages 1 à 50 peuvent suivre le modèle alterné, les pages 51 à 80 peuvent toutes être correctement orientées car elles ont été renumérisées avec une rotation appropriée, et les pages 81 à 200 peuvent revenir au modèle alterné. La détection et la correction doivent être effectuées section par section plutôt qu'avec une seule opération par lots.
Pour les modèles d'orientation irréguliers, l'approche manuelle consistant à faire défiler les vignettes et à faire pivoter des pages ou des plages de pages individuelles est la méthode la plus fiable. Commencez à la première page et parcourez les vignettes. Lorsque vous rencontrez une page pivotée, déterminez combien de pages consécutives partagent cette orientation. Sélectionnez la plage et appliquez la rotation. Continuez à parcourir le document jusqu'à ce que chaque page soit correctement orientée. Le processus prend une à deux secondes par page, donc un document de 200 pages nécessite environ cinq minutes. Le temps est bien dépensé car la précision de l'OCR sur les pages correctement orientées est considérablement plus élevée que sur les pages pivotées.
Automatisation de la détection d'orientation pour les projets à grand volume
Pour les projets de numérisation impliquant des centaines ou des milliers de pages, la vérification manuelle de l'orientation page par page devient peu pratique. Les outils automatisés de détection d'orientation peuvent identifier les pages pivotées en analysant la direction du texte. Ces outils échantillonnent les caractères du texte sur la page et déterminent l'orientation dominante en reconnaissant quelle rotation produit des mots valides dans la langue attendue. Une page sur laquelle la reconnaissance de texte réussit à 0 degré mais échoue à 90, 180 et 270 degrés est correctement orientée. Une page où la reconnaissance réussit à 180 degrés mais échoue à 0 est à l'envers et nécessite une rotation. La détection automatisée traite rapidement de grands ensembles de documents et une vérification manuelle ponctuelle des résultats confirme que l'automatisation a fonctionné correctement avant le début de l'OCR.
Vérification de la sortie OCR dans des orientations alternées
Après avoir corrigé l'orientation des pages et exécuté l'OCR, vérifiez que la qualité de la reconnaissance est cohérente dans l'ensemble du document. Recherchez le texte qui apparaît à la fois sur les pages initialement correctes et sur les pages pivotées à l'origine. La recherche doit trouver des instances sur les deux types de pages avec une fiabilité égale. Si le texte sur les pages pivotées à l'origine est introuvable, la correction de rotation n'a peut-être pas été appliquée correctement ou le moteur OCR a peut-être traité certaines pages avant que la rotation ne soit enregistrée. Rouvrez le document, vérifiez que toutes les orientations de page sont correctes dans le panneau des vignettes et réexécutez l'OCR si nécessaire.
Pour les volumes reliés où la qualité de numérisation originale varie d'une page à l'autre, comme un livre dont certaines pages ont été pressées à plat contre la vitre du scanner et d'autres présentent une courbure près du dos, la précision de l'OCR varie en conséquence. La correction de l'orientation résout le problème de rotation mais ne compense pas les autres problèmes de qualité de numérisation. Les pages présentant une courbure importante devront peut-être être numérisées à nouveau ou prétraitées avec un filtre de correction de déformation avant que l'OCR puisse atteindre une précision acceptable. Le pipeline PDF numérisé vers texte consultable fonctionne mieux lorsque les images source sont aussi propres et uniformément orientées que possible. La correction de l’orientation est la première étape et la plus efficace. La correction de la déformation, l'ajustement du contraste et la suppression des taches sont les étapes de suivi qui améliorent encore la précision de la reconnaissance sur les analyses difficiles à volume lié.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
