Vous scannez un contrat bilingue. La colonne de gauche est en anglais. La colonne de droite est en espagnol. Les deux langues doivent pouvoir faire l’objet de recherches, mais une exécution OCR standard configurée pour une langue détruira l’autre. L'OCR anglais appliqué au texte espagnol produit des absurdités car le moteur de reconnaissance s'attend à des fréquences de lettres et des modèles de mots différents. L'OCR espagnol appliqué à l'anglais produit des résultats tout aussi tronqués. Vous avez besoin d’un OCR qui comprend les deux langues simultanément.
Le OCR PDF multilingue est une fonctionnalité des moteurs de reconnaissance modernes qui peuvent basculer entre les modèles de langue au sein d'un même document. Le moteur détecte dans quelle langue chaque bloc de texte est écrit et applique le modèle de reconnaissance approprié. Le résultat est une reconnaissance précise du texte dans toutes les langues du document.

Comment les moteurs OCR gèrent plusieurs langues
Les moteurs OCR reconnaissent le texte en comparant les formes de caractères avec des modèles formés de l'apparence des lettres dans chaque langue. Un mannequin anglais sait que la lettre « e » est une lettre « e ». est le plus courant, ce "th" est le plus courant. apparaît fréquemment ensemble, et que certaines combinaisons de caractères comme "qx" apparaissent. ne se produisent presque jamais. Un mannequin espagnol sait que les caractères accentués comme "a" sont des caractères accentués. avec accent, "n" avec tilde, et les points d'interrogation inversés sont courants. Un modèle français s'attend à des voyelles accentuées fréquentes et à des digraphes spécifiques.
Lorsque vous spécifiez plusieurs langues pour une tâche OCR, le moteur charge les modèles de caractères pour toutes les langues spécifiées. Au fur et à mesure qu'il traite chaque bloc de texte de la page, il évalue quel modèle de langage correspond le mieux aux modèles de caractères observés et applique ce modèle. La détection de la langue s'effectue automatiquement au niveau du bloc de texte, de sorte qu'une page contenant un corps de texte en anglais et des notes de bas de page en français est traitée correctement sans balisage manuel de la langue.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Configuration de l'OCR multilingue
Dans La sélection de langue de l'outil OCR autorise plusieurs langues. Sélectionnez toutes les langues qui apparaissent dans le document. Pour un contrat bilingue anglais-espagnol, sélectionnez anglais et espagnol. Pour un document de l’Union européenne contenant l’anglais, le français et l’allemand, sélectionnez les trois. Pour un ouvrage scientifique comportant du texte anglais et des citations du grec ancien, sélectionnez l'anglais et le grec. Le moteur charge tous les modèles nécessaires.
Il existe un compromis entre la couverture linguistique et l’exactitude. Chaque langue supplémentaire ajoute davantage de modèles de caractères au processus de reconnaissance, ce qui augmente le risque de confusion entre des caractères similaires provenant de langues différentes. La lettre cyrillique "a" semble identique à la lettre latine "a" mais représente un son différent et apparaît dans des contextes différents. L'ajout de langues inutiles augmente le risque que le moteur classe mal les blocs de texte et applique le mauvais modèle de langue. Sélectionnez uniquement les langues qui apparaissent réellement dans le document, et non toutes les langues qui, selon vous, pourraient être utiles.
Scénarios OCR multilingues courants et comment les gérer
Le scénario multilingue le plus courant est un document principalement rédigé dans une langue avec de courts passages, des citations ou des notes de bas de page dans une autre. Un article scientifique en anglais avec des citations en français dans les notes de bas de page. Un manuel d'instructions en allemand avec des termes techniques en anglais. Un contrat juridique en espagnol avec des termes définis en anglais. Pour ces documents, la langue principale contient la majeure partie du texte et la langue secondaire apparaît dans des contextes courts et prévisibles.
Le moteur de reconnaissance gère bien ces documents multilingues car le changement de langue est localisé dans des blocs de texte spécifiques. Le corps du texte anglais est reconnu avec le modèle anglais. La cotation française est reconnue avec le modèle français. Étant donné que les deux langues apparaissent dans des blocs de texte distincts, la détection de langue du moteur identifie correctement le modèle à utiliser pour chaque bloc.
Un scénario plus complexe est celui d'un document dans lequel les langues sont entrelacées sur la même ligne, comme un manuel de langue qui montre une phrase en anglais suivie de sa traduction en espagnol sur la même ligne. Le moteur OCR peut traiter la ligne entière comme un seul bloc de texte et appliquer un modèle de langue à l'ensemble, produisant des erreurs dans la moitié de la ligne qui est dans l'autre langue. Pour ces documents, l’approche la plus précise consiste à effectuer une OCR du document deux fois, une fois dans chaque langue, et à fusionner manuellement les résultats. Cela demande beaucoup de travail et n’est pratique que pour les documents courts où la précision est essentielle.
Vérification des résultats OCR multilingues
Après avoir exécuté l'OCR multilingue, vérifiez les résultats en vérifiant le texte dans chaque langue. Recherchez un mot dont vous savez qu'il apparaît dans chaque langue. Confirmez que la recherche le trouve. Sélectionnez le texte dans chaque langue et copiez-le pour confirmer que les caractères sont corrects. Portez une attention particulière aux caractères accentués et aux symboles spéciaux. La reconnaissance Scanned PDF est très susceptible d'échouer sur les caractères qui n'existent pas dans le modèle de langue dominant, car le moteur peut utiliser par défaut l'équivalent latin le plus proche.
Les erreurs OCR courantes dans les documents multilingues incluent les caractères accentués remplacés par leurs équivalents non accentués, le e avec accent devient e, le n avec tilde devient n, la ponctuation spéciale comme les points d'interrogation inversés en espagnol remplacés par des points d'interrogation standard et les écritures non latines comme le cyrillique ou le grec sont reconnues à tort comme des caractères latins visuellement similaires. Ces erreurs sont généralement concentrées dans les passages en langue secondaire. Si le contenu en langue secondaire est critique, vérifiez manuellement ces passages par rapport au document original. L'outil OCR du WukongPDF fournit un score de confiance pour chaque bloc de texte reconnu, les scores les plus faibles indiquant les blocs pour lesquels le moteur de reconnaissance était moins sûr.
Pour les documents qui mélangent des langues à alphabet latin avec des écritures non latines, comme un document anglais avec des citations chinoises ou arabes, le défi de l'OCR multilingue est plus important car les formes de caractères sont fondamentalement différentes. Le moteur de reconnaissance doit faire la distinction entre des systèmes d'écriture entièrement distincts. Sélectionnez les langues spécifiques pour chaque famille de scripts qui apparaît dans le document. La gestion du PDF Format de WukongPDF prend en charge le mélange de scripts latins, cyrilliques, arabes, CJK et indiens dans une seule tâche OCR, bien que la précision varie en fonction du script et de la qualité de numérisation.
Une technique pratique pour améliorer l'OCR multilingue sur des documents comportant des sections linguistiques distinctes : pré-séparez le document par langue avant d'exécuter l'OCR. Si un contrat de 20 pages comporte les 10 premières pages en anglais et les 10 dernières pages en espagnol, divisez le document en deux fichiers, exécutez l'OCR en anglais sur le premier et l'OCR en espagnol sur le second, puis fusionnez à nouveau. Cela évite entièrement la surcharge du modèle multilingue et produit une précision légèrement supérieure, car chaque tâche OCR utilise un modèle linguistique unique optimisé pour le texte exact qu'il traite. Le flux de travail de séparation, OCR séparément et refusion prend quelques minutes supplémentaires, mais produit de manière fiable la meilleure précision pour les documents dont les limites de langue sont claires. Réservez l’approche OCR multilingue aux documents dans lesquels les langues sont véritablement entrelacées sur la même page et où la séparation n’est pas pratique.
Un dernier conseil pour l'OCR multilingue : si le document contient des écritures de droite à gauche comme l'arabe, l'hébreu ou le persan ainsi que des écritures de gauche à droite comme l'anglais ou le français, l'orientation du texte ajoute de la complexité. Les moteurs OCR doivent détecter non seulement la langue dans laquelle se trouve chaque bloc de texte, mais également la direction dans laquelle le texte circule. Un bloc de texte arabe doit être reconnu de droite à gauche, tandis que la légende anglaise située en dessous doit être reconnue de gauche à droite. La plupart des moteurs OCR modernes gèrent assez bien les documents à sens mixte lorsque vous spécifiez les deux familles de langues dans les paramètres. Après l'OCR, vérifiez le sens du texte en copiant un passage en arabe et en le collant dans un éditeur de texte. Les caractères doivent apparaître dans le bon ordre de lecture et non inversés.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
