Un PDF numérisé assemblé à partir de sources mixtes contient souvent des pages en orientation portrait et paysage. Les feuilles de calcul financières apparaissent sous forme de pages paysage. Les documents texte qui les accompagnent apparaissent sous forme de pages portrait. L'exécution de l'OCR sur un tel document sans tenir compte des orientations mixtes produit un texte reconnu dans lequel les mots des pages en mode paysage sont brouillés, pivotés ou complètement manqués parce que le moteur OCR a traité ces pages dans la mauvaise orientation.
Les moteurs OCR PDF analysent les lignes de texte pour déterminer la position des caractères et l'ordre de lecture. Lorsqu'une page pivote de 90 degrés par rapport à ce que le moteur attend, les lignes de texte s'affichent verticalement plutôt qu'horizontalement. Le moteur ne parvient pas à reconnaître entièrement le texte ou tente de le lire verticalement, produisant un résultat absurde. Les documents à orientation mixte nécessitent une détection d'orientation par page avant le traitement OCR.
Les outils OCR Scanned PDF de WukongPDF gèrent les orientations de page mixtes avec détection automatique de la rotation pour chaque page pendant le processus de reconnaissance.
Pourquoi l'orientation des pages est importante pour la précision de l'OCR
Les moteurs OCR fonctionnent en détectant des rangées de caractères et en analysant les formes dans chaque rangée. Une page en orientation portrait comporte des lignes de texte horizontales, que le moteur traite naturellement. Une page en orientation paysage, lorsqu'elle est affichée sans correction de rotation, comporte des lignes de texte verticales du point de vue du moteur OCR. Le moteur attend du texte horizontal et ne peut pas lire du texte vertical.
La solution consiste à détecter l'orientation de chaque page avant l'OCR et à faire pivoter les pages paysage en orientation portrait avant le traitement. Après l'OCR, les pages peuvent être pivotées vers leur orientation d'origine avec le calque de texte reconnu correctement positionné. La rotation lors du traitement ne modifie pas définitivement le document ; cela change uniquement la façon dont le moteur OCR voit la page.
La plupart des outils OCR automatisés supposent que toutes les pages partagent la même orientation, car c'est le cas courant pour les documents produits par un seul scanner en une seule session. Les documents à orientation mixte, souvent créés en combinant des numérisations provenant de différentes sources, nécessitent une configuration explicite pour gérer correctement la variation par page.
Méthode 1 : Acrobat Pro avec détection de rotation par page
La fonctionnalité OCR d'Acrobat Pro peut traiter des documents à orientation mixte lorsqu'elle est configurée de manière appropriée. Ouvrez le PDF numérisé dans Acrobat Pro et accédez à Outils, Numérisation et OCR, Reconnaître le texte, Dans ce fichier. Dans la boîte de dialogue Paramètres de reconnaissance du texte, assurez-vous que la langue OCR correcte est sélectionnée pour la langue principale du document. Dans la section Paramètres, activez l’option Redresser et redresser, qui aide Acrobat à détecter la rotation des pages.
Acrobat traite chaque page individuellement et tente de détecter l'orientation dominante du texte. Pour les pages où la détection est correcte, la sortie OCR est précise et lisible. Pour les pages où la détection échoue, comme celles contenant peu de texte ou des arrière-plans visuels complexes, la sortie OCR peut être brouillée ou totalement absente. Après le traitement OCR, examinez spécifiquement les pages paysage. Recherchez du texte que vous pouvez voir visuellement sur ces pages. Si la recherche ne trouve rien, Acrobat a probablement mal identifié l’orientation.
Pour les pages mal identifiées, faites-les pivoter manuellement dans l'outil Organiser les pages et réexécutez l'OCR uniquement sur ces pages. L'intervention manuelle ne prend qu'un instant par page affectée et garantit que chaque page apporte un texte reconnu précis à la sortie du document consultable.
Méthode 2 : Pré-traitement avec OCRmyPDF
OCRmyPDF, un outil de ligne de commande open source basé sur Tesseract OCR, gère les pages à orientation mixte grâce à sa fonction de redressement intégrée. La commande ocrmypdf --deskew input.pdf output.pdf détecte l'orientation du texte sur chaque page, fait pivoter les pages si nécessaire, exécute l'OCR avec Tesseract et génère un PDF consultable. L'indicateur de redressement est le paramètre essentiel pour le traitement de documents à orientation mixte.
OCRmyPDF traite les pages de manière séquentielle et applique automatiquement une correction d'orientation par page. Pour les documents avec une rotation extrême ou les pages contenant du texte horizontal et vertical, l'algorithme de réalignement oriente la page en fonction de la direction dominante du texte, ce qui fournit les meilleurs résultats OCR pour la majorité du contenu de la page. L'orientation du texte minoritaire peut avoir une précision légèrement réduite, mais elle est généralement toujours reconnue.
Dans les flux de travail documentaires, pour le traitement par lots de gros volumes de documents à orientation mixte, OCRmyPDF combiné à un script shell qui traite tous les PDF d'un dossier fournit une OCR entièrement automatisée sans configuration manuelle par document. L'automatisation gère le traitement de routine et seuls les cas exceptionnels nécessitent un examen humain.
Vérification de la sortie OCR sur les pages paysage en particulier
Après le traitement OCR, vérifiez la sortie sur les pages paysage en tant que contrôle ciblé distinct. Sélectionnez le texte sur une page paysage dans le PDF de sortie et copiez-le dans un éditeur de texte brut. Le texte copié doit être lu dans le bon ordre, en correspondant au contenu visuel de la page de haut en bas et de gauche à droite. Si les mots sont brouillés, dans le désordre ou apparaissent dans des séquences absurdes, la détection de l'orientation a échoué pour cette page.
Recherchez des termes connus spécifiques qui apparaissent sur les pages en mode paysage. Un tableau financier sur une page paysage peut contenir des codes de compte spécifiques, des noms de département ou des valeurs numériques que vous pouvez rechercher dans la sortie OCR. Si la recherche ne trouve aucune correspondance sur les pages en mode paysage mais trouve des correspondances sur les pages en portrait du même document, le moteur OCR a probablement complètement manqué le contenu en mode paysage. Ces pages doivent être retraitées avec une orientation manuelle spécifiée.
Dans les flux de travail documentaires, pour les documents qui serviront d'archives consultables, l'étape de vérification est un contrôle de qualité qui détecte les problèmes d'OCR liés à l'orientation avant que le document n'entre dans la collection permanente. Une sortie OCR non vérifiée qui manque silencieusement des pages entières de contenu compromet l'objectif de création d'archives consultables.
Traitement par lots des collections numérisées à orientation mixte
Pour les grandes collections de documents numérisés avec des orientations mixtes, la vérification manuelle par page n'est pas pratique. Automatisez le processus avec OCRmyPDF et l'indicateur de redressement, puis exécutez un script de vérification qui vérifie chaque page de sortie pour la présence de texte consultable. Les pages ne contenant aucun caractère de texte reconnu ou très peu de caractères sont marquées pour une révision manuelle et un retraitement potentiel.
Le script de vérification lit chaque PDF traité par OCR, extrait la couche de texte page par page et compte le nombre de caractères reconnus sur chaque page. Toute page inférieure à un seuil minimum de caractères, par exemple dix caractères, est signalée comme potentiellement non traitée ou mal orientée. Les pages signalées sont compilées dans un rapport qui guide l'effort de révision manuelle uniquement vers les pages qui nécessitent réellement une attention humaine, plutôt que d'exiger une révision de chaque page.
Concernant les flux de travail, pour les projets de numérisation en cours où de nouveaux documents numérisés arrivent régulièrement, le flux de traitement par lots et de vérification devient une procédure opérationnelle standard. Les nouveaux documents entrent dans le pipeline, sont traités automatiquement via OCR avec détection d'orientation, et seules les exceptions nécessitent une intervention humaine. L'automatisation gère la routine. Le réviseur humain gère les exceptions.
Amélioration de l'OCR sur les pages avec rotation interne
Certains documents numérisés contiennent des pages dans lesquelles le contenu est pivoté au sein de la page plutôt que la page elle-même étant pivotée. Un tableau financier au format paysage peut être inséré dans un document au format portrait en faisant pivoter le contenu du tableau de 90 degrés tout en conservant les dimensions de la page au format portrait. Ces pages sont les plus difficiles à détecter en matière d'orientation, car leurs dimensions ne fournissent aucune indication quant à la nécessité d'une rotation.
Avec le traitement des documents, pour les pages avec rotation interne, le prétraitement manuel est l'approche la plus fiable. Dans Acrobat Pro, utilisez l’outil Modifier le PDF pour sélectionner la zone de contenu pivotée, faites-la pivoter selon l’orientation horizontale correcte et positionnez-la correctement sur la page. Après avoir corrigé la rotation interne, exécutez l'OCR sur la page corrigée. L'étape de prétraitement manuel prend environ une minute par page affectée, mais produit une sortie OCR propre et précise.
L'identification des pages avec rotation interne nécessite une inspection visuelle. Parcourez le document et recherchez les pages où le texte semble s'exécuter dans une direction inattendue par rapport aux bords de la page. Les pages avec rotation interne sont relativement rares dans la plupart des collections de documents, mais affectent de manière disproportionnée la qualité de l'OCR lorsqu'elles se produisent.
Choisir le bon moteur OCR pour les documents à orientation mixte
Différents moteurs OCR gèrent la détection d'orientation avec une précision variable. Tesseract avec le préprocesseur de redressement gère bien la rotation modérée, mais peut avoir des difficultés avec les pages tournées exactement à 90 ou 180 degrés. Google Cloud Vision OCR inclut une détection d'orientation intégrée qui gère tous les angles de rotation de manière fiable. Pour les documents critiques à orientation mixte où la précision est essentielle, les services OCR basés sur le cloud surpassent généralement les moteurs locaux en matière de gestion de l'orientation.
Testez le moteur OCR choisi sur un petit échantillon de pages à orientation mixte avant de vous engager dans un lot important. Un test de dix pages avec des modèles d'orientation connus révèle comment le moteur gère les types de rotation spécifiques dans vos documents. Le test prend quelques minutes et évite des heures de retraitement si la détection de l'orientation du moteur s'avère inadéquate pour vos types de documents particuliers.
Exportation de texte OCR à partir de documents à orientation mixte pour vérification
Après le traitement OCR, exportez le texte reconnu pour vérifier qu'il est complet sur toutes les pages. Dans Acrobat Pro, accédez à Outils, Exporter le PDF et choisissez Texte comme format de sortie. Le fichier texte exporté doit contenir le contenu de chaque page dans le bon ordre de lecture. Ouvrez le fichier texte et recherchez les termes dont vous savez qu'ils apparaissent sur des pages paysage spécifiques. Si ces termes sont absents de l'exportation, ces pages ont probablement été mal orientées lors de l'OCR et doivent être retraitées.
Concernant le traitement des documents, pour les documents destinés à des archives consultables, le texte exporté sert de vérification indépendante que chaque page a contribué son contenu à la couche consultable. Une exportation de texte comportant des lacunes ou des sections manquantes indique des échecs d'OCR qui nécessitent une attention particulière avant que le document n'entre dans l'archive permanente. L'étape d'exportation fonctionne comme un contrôle de qualité qui détecte les problèmes d'OCR liés à l'orientation avant qu'ils ne deviennent des défauts d'archivage permanents.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
