Vous scannez un menu bilingue. Les noms des plats sont en italien. Les descriptions sont en anglais. Les prix sont des chiffres indépendants de la langue. Vous devez extraire uniquement le texte italien pour créer une liste de mots en italien, ou uniquement le texte anglais à envoyer à un traducteur pour une autre paire de langues. L'exécution de l'OCR sur l'ensemble du document produit un mélange des deux langues, ce qui convient pour la recherche mais pas pour l'extraction sélective.
L'extraction de texte dans une seule langue à partir d'un document OCR PDF multilingue nécessite un moteur OCR capable d'identifier dans quelle langue chaque bloc de texte est écrit et d'extraire uniquement les blocs correspondant à votre langue cible. Il s'agit d'une opération plus sélective que l'OCR standard, qui reconnaît tous les textes, quelle que soit la langue.

Fonctionnement de l'OCR sélective en langue
Les moteurs OCR avec prise en charge multilingue peuvent être configurés pour reconnaître simultanément du texte dans plusieurs langues. Lorsque vous spécifiez « Italien et Anglais » comme pour les langues OCR, le moteur reconnaît le texte dans les deux. Il marque également chaque bloc de texte reconnu avec la langue dans laquelle il a été reconnu. Un bloc de texte italien est étiqueté comme italien. Un bloc de texte anglais est étiqueté comme anglais. Le balisage linguistique permet une extraction sélective.
Après l'OCR, vous pouvez filtrer le texte reconnu par balise de langue. Exportez uniquement les blocs étiquetés comme italiens. La sortie est un document contenant uniquement le texte italien du menu. Les descriptions anglaises, reconnues mais filtrées, n'apparaissent pas dans la sortie. Cette extraction sélective est utile pour les flux de travail de traduction, les supports d'apprentissage des langues et l'analyse de contenu où vous avez besoin d'un texte dans une langue spécifique isolé du texte environnant dans d'autres langues.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Pas à pas : Extraire du texte dans une langue spécifique
Téléchargez le PDF numérisé sur l'outil OCR du WukongPDF. Sélectionnez les langues présentes dans le document. Pour le menu italien-anglais, sélectionnez l'italien et l'anglais. Exécutez l'OCR. L'outil reconnaît tout le texte et marque chaque bloc par langue. Une fois l'OCR terminée, utilisez le filtre de langue pour sélectionner l'italien. Exportez le texte filtré sous forme de fichier texte brut, de document Word ou de nouveau PDF contenant uniquement les blocs italiens.
La précision de la détection des langues dépend du caractère distinctif des langues. L'italien et l'anglais utilisent le même alphabet mais ont des modèles de mots différents. Le moteur OCR les distingue en analysant la fréquence des mots. L'italien comporte de nombreux mots se terminant par des voyelles. L'anglais contient de nombreux mots se terminant par des consonnes. Plus les langues sont distinctes, plus le marquage linguistique est précis. Deux langues étroitement liées, comme l'espagnol et le portugais, peuvent être confondues par le moteur sur de courts blocs de texte.
Gestion du texte multilingue sur la même ligne
Certains documents mélangent les langues au sein d'une même ligne, comme un manuel de langue qui associe une phrase en français à sa traduction en anglais sur la même ligne. Le moteur OCR peut classer la ligne entière comme langue dominante, en étiquetant par erreur les mots de la langue minoritaire. Pour ces documents, l'extraction sélective de la langue au niveau du bloc n'est pas assez précise. Vous avez besoin d’une approche différente.
L'alternative consiste à exécuter l'OCR deux fois, une fois avec chaque langue comme langue de reconnaissance unique. Le pass OCR uniquement en italien reconnaît bien le texte italien mais modifie le texte anglais. Le laissez-passer en anglais uniquement reconnaît bien l'anglais mais détruit l'italien. Comparez les deux sorties et sélectionnez manuellement la version correcte pour chaque segment de texte. Cette approche à double passage prend plus de temps mais produit l'extraction spécifique à la langue la plus précise pour les documents dans lesquels les langues sont entrelacées au niveau des phrases.
Vérification et nettoyage du texte extrait
Après avoir extrait le texte dans la langue cible, vérifiez que le filtrage linguistique était précis. Scannez le texte extrait à la recherche de mots qui sont clairement dans la mauvaise langue. Une extraction de texte italien à partir d'un menu ne doit pas contenir de mots anglais comme « grillé » ou « grillé ». ou "servi avec" à moins que le menu n'utilise intentionnellement ces mots dans les descriptions italiennes. Le texte filtré contenant des mots étrangers inattendus indique des erreurs de balisage linguistique qui nécessitent une correction manuelle.
Exécutez une vérification orthographique dans la langue cible. La vérification orthographique italienne signalera les mots anglais incorrectement inclus dans l'extraction italienne. Les indicateurs de vérification orthographique constituent un moyen efficace de rechercher les erreurs de marquage de langue sans lire chaque mot extrait. Le Extraire les données PDF qui a été filtré en fonction de la langue et vérifié par l'orthographe est prêt pour la traduction, l'analyse ou l'archivage. L'OCR Scanned PDF de WukongPDF avec filtrage de langue produit des extraits monolingues plus propres que le post-traitement de la sortie OCR multilingue pour supprimer la langue indésirable.
Une application pratique pour l'OCR sélective selon la langue : créer des glossaires bilingues à partir de documents traduits. Extrayez séparément tous les termes de la langue source et tous les termes de la langue cible. Alignez-les selon leur position sur la page, car chaque terme source a un terme cible correspondant à peu près à la même position verticale sur la page ou dans une colonne adjacente. Le résultat aligné devient une liste de termes que les traducteurs peuvent utiliser pour garantir la cohérence entre les traductions futures. Cette technique de création de glossaire est largement utilisée dans la traduction technique où une terminologie cohérente est essentielle.
Pour les documents dans lesquels les langues figurent dans des colonnes séparées, comme un contrat bilingue à deux colonnes, l'extraction sélective de la langue devient une tâche de sélection de colonnes. La colonne de gauche est une langue, la colonne de droite en est une autre. Au lieu de vous fier à la détection de langue, qui peut confondre des langues similaires, recadrez le PDF pour extraire chaque colonne séparément. Exécutez l'OCR en une seule langue sur chaque colonne. Cette approche de recadrage des colonnes est plus fiable que le filtrage linguistique pour les documents avec une séparation claire des langues en colonnes.
Pour les projets d'archives impliquant des documents historiques multilingues, l'OCR sélective selon la langue combinée au balisage des métadonnées crée une archive consultable dans laquelle les chercheurs peuvent trouver du contenu dans une langue spécifique parmi des milliers de documents. La sortie OCR de chaque document est étiquetée avec les langues détectées. Un chercheur recherchant des documents français du XVIIIe siècle peut filtrer uniquement les textes en langue française dans une collection multilingue. Cette approche sélective transforme l'OCR archivistique d'un outil brutal qui mélange les langues en un instrument de précision pour la recherche linguistique.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
