L'exécution de OCR PDF sur un dossier de documents numérisés devrait produire des PDF consultables avec des noms qui correspondent aux originaux. Lorsque les outils OCR par lots renomment les fichiers de sortie de manière générique, comme sortie1.pdf, sortie2.pdf, la connexion entre la version originale et la version consultable est perdue. La préservation des noms de fichiers via le processus OCR permet de conserver les documents numérisés organisés et traçables.
La préservation du nom de fichier est un détail de configuration et non une limitation de fonctionnalité. La plupart des outils OCR génèrent par défaut des noms de fichiers de sortie basés sur les noms de fichiers d'entrée ou permettent de spécifier un modèle de dénomination de sortie. La clé est de trouver le bon paramètre ou indicateur de ligne de commande avant d'exécuter le lot, et non après avoir découvert que 200 fichiers ont été renommés.
Les outils OCR Scanned PDF de WukongPDF traitent les documents individuellement et par lots tout en conservant les noms de fichiers d'origine.

OCR par lots avec l'assistant d'action d'Acrobat Pro
L'assistant d'action d'Acrobat Pro automatise le traitement PDF en plusieurs étapes sur un dossier. Accédez à Outils, Assistant d'action, Nouvelle action. Ajoutez l’étape Reconnaître le texte à l’action, en sélectionnant la langue OCR et les paramètres de sortie corrects. Ajoutez une étape Enregistrer qui enregistre les fichiers dans un dossier de sortie spécifié, en ajoutant éventuellement un suffixe tel que _OCR pour distinguer les fichiers consultables des originaux.
Exécutez l'action sur le dossier d'entrée. Acrobat ouvre chaque fichier, exécute l'OCR, enregistre le résultat avec le suffixe ajouté au nom de fichier d'origine et passe au fichier suivant. Le dossier de sortie contient des fichiers PDF consultables avec des noms tels que report_OCR.pdf correspondant au rapport.pdf d'origine. L'approche par suffixe préserve le nom de fichier d'origine tout en indiquant clairement quels fichiers ont été traités par OCR.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
OCR par lots en ligne de commande avec Tesseract
Tesseract traite un fichier image à la fois. Pour l'OCR par lots d'un dossier de PDF numérisés, convertissez d'abord chaque page PDF en image, exécutez Tesseract, puis recombinez en un PDF consultable. Un script shell gère le pipeline. Pour chaque PDF du dossier, le script extrait le nom de fichier de base, convertit les pages en images TIFF, exécute Tesseract avec l'indicateur de langue approprié et génère un PDF consultable avec le nom de fichier de base d'origine.
Le script utilise l'expansion des paramètres pour supprimer l'extension du fichier : base=${f%.pdf} donne le nom du fichier sans .pdf. La sortie de Tesseract est nommée $base et le PDF consultable résultant est enregistré sous ${base}_searchable.pdf. Le nom de fichier d'origine est conservé dans le nom de sortie. Une boucle d'une ligne traite un dossier entier : for f dans *.pdf ; faire tesseract $f ${f%.pdf} -l eng PDF; fait.
OCR par lots simplifiée avec OCRmyPDF
OCRmyPDF est un outil de ligne de commande basé sur Python qui ajoute une couche de texte OCR aux PDF existants. Il gère l’extraction d’images, l’OCR et le réassemblage de PDF en interne. Une seule commande traite un PDF : ocrmypdf input.pdf output.pdf. La sortie préserve les images de la page et ajoute le texte reconnu derrière elles sous forme de calque invisible.
Pour le traitement par lots, OCRmyPDF accepte un chemin de dossier avec l'indicateur --batch ou peut être bouclé dans un script shell. Le principal avantage par rapport à Tesseract pour le traitement PDF est qu'OCRmyPDF fonctionne directement avec l'entrée et la sortie PDF. Aucune conversion d'image intermédiaire n'est nécessaire. Le nom du fichier de sortie peut être spécifié par fichier, en préservant la convention de dénomination d'origine. Pour la numérisation de gros volumes de documents numérisés, OCRmyPDF combiné à une boucle shell offre le chemin le plus efficace depuis les numérisations brutes jusqu'aux archives consultables.
| Outil | Méthode batch | Gestion des noms de fichiers |
|---|---|---|
| Assistant d'action Acrobat Pro | Créer une action, appliquer au dossier | Préserve le nom de fichier d'origine, ajoute un suffixe |
| CLI Tesseract | Shell for-boucle sur le dossier | La sortie correspond au nom du fichier d'entrée |
| OCRmonPDF | Commande unique par fichier ou lot | Écrase ou crée un nouveau fichier selon les paramètres |
Vérification de la sortie OCR par lots
Après le traitement par lots, vérifiez un échantillon de fichiers de sortie avant d'archiver les originaux. Ouvrez trois à cinq fichiers PDF de sortie à partir de différentes parties de la liste de fichiers triés par ordre alphabétique. Recherchez un mot visible dans l'image numérisée. Si la recherche trouve le mot, l'OCR a réussi pour ce fichier. Vérifiez ponctuellement la première page, une page du milieu et la dernière page de chaque fichier échantillonné. La qualité OCR peut varier au sein d'un document si les pages ont une qualité de numérisation différente.
En ce qui concerne les flux de travail documentaires, pour les documents pour lesquels l'OCR a échoué, indiqué par un PDF dans lequel la recherche ne trouve rien, réexécutez l'OCR avec les paramètres ajustés. Augmentez la résolution de l'image à 400 DPI si la numérisation originale est de mauvaise qualité. Essayez un autre moteur OCR si Tesseract a produit de mauvais résultats. Traitez les fichiers problématiques individuellement plutôt que de réexécuter l’intégralité du lot.
L'OCR par lots avec préservation du nom de fichier transforme un dossier de documents numérisés inaccessibles en une archive consultable où chaque fichier est traçable jusqu'à son original. Le nom de fichier est le lien entre la numérisation originale et la version améliorée par OCR.
Stockage à long terme des PDF numérisés avec OCR
Une fois configurés, après le traitement OCR par lots, stockez les PDF consultables dans un emplacement préservant à la fois les images de page et la couche de texte OCR. Le format PDF/A avec une couche de texte intégrée est la norme d'archivage. Convertissez la sortie OCR en PDF/A à l'aide d'Acrobat Pro ou Ghostscript avec le paramètre de sortie PDF/A.
En pratique, la couche de texte OCR ajoute une surcharge minimale de taille de fichier, généralement de 5 à 15 %. Le compromis entre des fichiers légèrement plus volumineux et la possibilité de recherche en vaut presque toujours la peine. Un document numérisé qui ne peut pas être recherché est nettement moins utile qu'un document qui le peut.
En pratique, la structure des répertoires pour la sortie OCR par lots doit refléter la structure d'entrée lors du traitement des dossiers imbriqués. Un script batch récursif qui préserve la structure des chemins relatifs garantit que les fichiers améliorés par OCR conservent la même hiérarchie organisationnelle que les originaux.
En ce qui concerne les flux de travail documentaires, pour les projets OCR par lots extrêmement volumineux comportant des milliers de documents, envisagez de répartir la charge de travail sur plusieurs sessions ou machines. L'OCR nécessite beaucoup de calculs et un lot de dix mille pages peut prendre plusieurs heures sur une seule machine.
Une fois configuré, après avoir terminé un projet OCR par lots, générez un manifeste de traitement répertoriant chaque fichier d'entrée, son fichier de sortie, le moteur OCR et les paramètres utilisés, ainsi que la date de traitement. Le manifeste sert de documentation et d’enregistrement des fichiers traités.
D'un point de vue pratique, la transition d'archives numérisées impossibles à rechercher à des collections consultables améliorées par OCR est l'une des activités de numérisation ayant le plus grand impact. La possibilité de rechercher des documents auparavant inaccessibles les transforme d'enregistrements statiques en ressources d'informations actives.
La vitesse de traitement OCR varie en fonction de la complexité du document. Les pages de texte uniquement sont traitées rapidement. Les pages contenant des tableaux, des polices mixtes ou des éléments décoratifs prennent plus de temps. Un lot de pages de texte uniformes se termine plus rapidement qu'un lot de contenus variés.
Dans la plupart des outils, le paramètre de langue OCR affecte le temps et la précision du traitement par lots. La sélection uniquement des langues réellement présentes dans les documents évite une surcharge de traitement inutile et réduit la reconnaissance de faux caractères provenant de modèles linguistiques inutilisés.
Pour les documents contenant à la fois du texte et des photographies, le moteur OCR peut tenter de reconnaître le texte dans les zones de photographie, produisant ainsi des caractères parasites. Le filtrage post-OCR supprime ces artefacts en analysant la distribution spatiale du texte reconnu.
En règle générale, le paramètre DPI pour les images d'entrée OCR équilibre la vitesse de traitement et la précision. 300 DPI est la recommandation standard. 400 DPI améliore la précision des petits textes. 200 DPI traite plus rapidement mais peut manquer des caractères fins.
Après l'OCR par lots, exécutez un test de recherche par mot clé dans les fichiers traités en utilisant les termes connus pour apparaître dans les originaux. Les fichiers dans lesquels le mot clé n'est pas trouvé doivent être retraités avec des paramètres ajustés ou une révision manuelle.
Les fichiers de sortie OCR doivent être stockés dans une structure de dossiers qui sépare les fichiers traités des originaux. Cela évite le retraitement accidentel de fichiers déjà améliorés par OCR et maintient l'archive organisée.
Dans ce contexte, en pratique, la couche de texte OCR peut être extraite et stockée séparément sous forme de fichier texte brut pour chaque document. Des fichiers texte séparés prennent en charge la recherche en texte intégral dans l'archive sans ouvrir chaque PDF individuellement.
Avec le traitement des documents, pour les archives numérisées de grande valeur, envisagez d'exécuter l'OCR avec deux moteurs différents et de comparer le résultat. Les écarts entre les moteurs mettent en évidence une reconnaissance incertaine qui nécessite une vérification manuelle.
Batch OCR est le pont entre les archives papier et la recherche numérique. Un classeur de documents papier, une fois numérisés et traités par OCR, devient une base de connaissances consultable. La transition du physique au numérique consultable est l’une des transformations de gestion de l’information les plus impactantes qu’une organisation puisse opérer.
L'OCR par lots avec préservation du nom de fichier constitue le pont entre un dossier de documents numérisés inaccessibles et une archive numérique consultable. Le traitement est automatisé. Les noms de fichiers assurent la traçabilité. La couche de texte OCR rend chaque document visible. La combinaison transforme une collection statique en une ressource d'informations active.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
