Une boîte à chaussures contenant des reçus. Un dossier de factures PDF. Une année de dépenses professionnelles qui doivent être saisies dans une feuille de calcul pour la préparation des déclarations de revenus, les déclarations de dépenses ou l'analyse budgétaire. Taper manuellement chaque élément de campagne de chaque reçu dans Excel est lent, sujet aux erreurs et abrutissant. Un meilleur flux de travail utilise l'OCR pour lire le texte du reçu et exporte les éléments de campagne reconnus directement vers une feuille de calcul structurée.
Le pipeline OCR PDF vers tableur a considérablement mûri. Les moteurs OCR modernes peuvent reconnaître la présentation des reçus, identifier les éléments de campagne par leur position et leurs modèles de formatage, et exporter des données structurées qui nécessitent un nettoyage minimal. Ce qui prenait autrefois des heures de saisie manuelle des données prend désormais quelques minutes de traitement automatisé avec une brève étape de vérification.

Préparation des reçus et des factures pour l'OCR
La qualité de l'image source détermine la précision de la sortie OCR, qui détermine la quantité de nettoyage que vous devrez effectuer. Numérisez ou photographiez les reçus sur une surface plane et sombre avec un éclairage uniforme. Assurez-vous que le reçu est plat, non froissé ou plié. Capturez l'intégralité du reçu, y compris le nom du magasin en haut et le total en bas. L'absence du nom du magasin signifie que la sortie OCR n'a aucune identification du fournisseur.
Pour les reçus en papier thermique décolorés, améliorez le contraste avant d'exécuter l'OCR. Un reçu décoloré dont le texte est à peine visible à l’œil humain est essentiellement invisible grâce à l’OCR. Utilisez un éditeur d'images ou une application de numérisation avec amélioration du contraste pour assombrir le texte et éclaircir l'arrière-plan. L'image améliorée peut sembler peu naturelle à l'œil humain, mais produit des résultats OCR considérablement meilleurs.
Regroupez les reçus par type avant de les traiter. Les reçus d'un même magasin ont souvent des mises en page similaires, et leur traitement conjoint permet au moteur OCR d'apprendre le modèle de mise en page et d'améliorer la précision dans l'ensemble du lot. Le mélange des reçus de différents magasins oblige le moteur OCR à traiter chaque reçu comme une mise en page unique.
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Configuration de l'OCR pour l'extraction des données de reçu
Sélectionnez les paramètres OCR optimisés pour les reçus. Les reçus utilisent généralement de petites polices, du papier étroit et une impression thermique qui produit des caractères avec une densité d'encre incohérente. Les paramètres OCR optimisés pour les reçus incluent une numérisation à plus haute résolution, au moins 300 DPI et une sortie en niveaux de gris plutôt qu'en noir et blanc pour préserver les variations subtiles de la densité des caractères.
WukongPDF fournit un traitement OCR via le navigateur, vous permettant de numériser ou de télécharger des reçus et d'extraire du texte. L'OCR basé sur un navigateur traite les fichiers localement, conservant vos documents financiers sur votre appareil.
Pour Extraire les données PDF des reçus, le moteur OCR doit faire la distinction entre les descriptions d'articles, les quantités, les prix unitaires et les totaux de ligne. Le moteur utilise des indices de position pour faire cette distinction. Les articles se trouvent généralement à gauche, les quantités et les prix à droite et les totaux de ligne dans la colonne la plus à droite. Plus la présentation du reçu est cohérente, plus l'identification du champ est précise.
Exportation de données OCR au format feuille de calcul
Une fois l'OCR terminé, exportez les données reconnues au format CSV ou Excel. L'export doit conserver la séparation des champs identifiée lors de l'OCR : nom du fournisseur dans une colonne, date dans une autre, description de chaque article de ligne, quantité, prix unitaire et total de ligne dans leurs propres colonnes. La plupart des outils OCR incluent une option d'exportation du reçu vers une feuille de calcul.
La conversion du PDF numérisé en feuille de calcul n'est pas parfaite. Attendez-vous à consacrer cinq à dix minutes par reçu à la vérification et au nettoyage. Comparez la sortie de la feuille de calcul avec l’image du reçu d’origine. Vérifiez que les éléments de campagne totalisent le total du reçu. Vérifiez que la taxe a été correctement identifiée et séparée des prix des articles. L'étape de vérification détecte les erreurs OCR avant qu'elles ne se propagent dans vos notes de frais.
Pour le traitement des reçus récurrents, enregistrez les paramètres OCR et exportez la configuration en tant que préréglage. Chaque lot de reçus suivant est traité avec les mêmes paramètres, produisant un résultat cohérent. L'approche prédéfinie est particulièrement utile pour les propriétaires d'entreprise qui traitent des notes de frais mensuelles provenant du même ensemble de fournisseurs.
Gestion des factures multipages et des reçus complexes
Les factures de plusieurs pages nécessitent un traitement spécial, car les éléments de ligne peuvent continuer au-delà des limites des pages. Le moteur OCR doit reconnaître que les éléments de la page deux sont une continuation des éléments de la première page et non un nouvel ensemble d'éléments. La plupart des outils OCR gèrent cela correctement lorsque les pages de facture sont traitées comme un seul document.
Les reçus de restaurant avec les montants des pourboires manuscrits ajoutent une étape de vérification manuelle. L'OCR peut lire les montants imprimés mais a du mal avec l'écriture manuscrite, en particulier l'écriture manuscrite ajoutée après l'impression du reçu lorsque le stylo a pu croiser le texte imprimé. Le montant du pourboire et le total ajusté doivent être vérifiés et saisis manuellement si l’OCR ne peut pas les lire.
Après l'exportation vers une feuille de calcul, utilisez les outils de feuille de calcul pour catégoriser les dépenses. Ajoutez une colonne de catégorie et attribuez chaque élément de ligne à une catégorie de dépenses en fonction du fournisseur ou de la description de l'article. La catégorisation au cours du processus de révision OCR est plus efficace que la catégorisation une fois que tous les reçus ont été traités.
Pour les reçus imprimés recto verso, de plus en plus courants pour des raisons environnementales, numérisez les deux faces et traitez-les comme un seul document. Le moteur OCR lit le recto et le verso sous forme de pages séquentielles. Les lignes qui continuent du recto vers l'arrière du reçu doivent être traitées comme une seule transaction si le magasin imprime un avis de continuation au recto.
Les symboles monétaires et les séparateurs décimaux varient selon les régions. Un reçu d'un magasin européen utilise le symbole de l'euro et une virgule comme séparateur décimal. Configurez le moteur OCR pour les paramètres régionaux corrects avant le traitement. Le post-traitement de la feuille de calcul pour standardiser les formats monétaires sur les reçus de différents pays garantit la cohérence des rapports financiers.
Le format de la date sur les reçus varie considérablement. MM/JJ/AAAA aux États-Unis, JJ/MM/AAAA en Europe, AAAA/MM/JJ dans certaines parties d'Asie. L'OCR exporte la date sous forme de texte reconnu. La feuille de calcul doit interpréter correctement la date en fonction de l'origine du reçu. L'ajout d'une colonne de pays de réception facilite l'interprétation de la date pendant la phase de nettoyage.
Pour les notes de frais, la sortie de la feuille de calcul OCR peut être importée directement dans un logiciel de comptabilité ou des plateformes de gestion des dépenses. La plupart des plateformes acceptent les importations CSV avec des colonnes standards : date, fournisseur, description, montant, catégorie et mode de paiement. Le mappage des colonnes de sortie OCR avec les colonnes attendues de la plate-forme constitue la dernière étape du pipeline de réception à rapport.
Stockez le PDF du reçu original avec la sortie de la feuille de calcul OCR. Le PDF fait office de document faisant autorité. La feuille de calcul sert de données de travail. Si des questions surviennent concernant une transaction spécifique, le PDF du reçu original peut être consulté pour vérifier l'interprétation OCR.
Pour les fournisseurs récurrents avec des formats de reçus cohérents, la précision de l'OCR s'améliore au fil du temps à mesure que le moteur apprend la mise en page. Le premier reçu d’un nouveau fournisseur peut nécessiter un nettoyage manuel plus important que le dixième. L'enregistrement du résultat corrigé comme exemple de formation pour le moteur OCR accélère ce processus d'apprentissage.
Les taux de taxe sur les reçus varient selon l'emplacement et le type de produit. L'OCR peut reconnaître le montant de la taxe mais pas le taux de taxe. Le calcul du taux de taxe à partir du montant de la taxe et du sous-total permet de vérifier l'exactitude de l'OCR. Si le taux calculé ne correspond à aucun taux de taxe connu pour le lieu d'achat, soit l'OCR a mal lu les montants, soit le reçu comprend à la fois des articles taxables et non taxables.
Pour les dépenses professionnelles payées avec une combinaison de fonds personnels et professionnels, comme un déjeuner d'affaires où une personne a payé pour la table entière, le reçu doit être annoté avec la partie professionnelle. L'annotation doit être ajoutée à la feuille de calcul après l'OCR, et non au reçu PDF, afin de conserver le reçu original à des fins d'audit.
Le retour sur investissement de l’OCR des reçus devient positif au bout d’une cinquantaine de reçus, par rapport à une saisie manuelle des données. Pour les entreprises qui traitent des centaines de reçus chaque mois, les gains de temps se traduisent par une réduction mesurable des coûts de main-d'œuvre et des cycles de déclaration des dépenses plus rapides.
Les plateformes de gestion des reçus basées sur le cloud combinent l'OCR avec des applications mobiles qui capturent des photos des reçus au point de réception. Les données des reçus sont directement transférées dans les notes de frais sans l'étape intermédiaire d'enregistrement et de traitement ultérieur des fichiers PDF, ce qui rationalise davantage le flux de travail.
L'IRS et d'autres autorités fiscales acceptent les copies numériques des reçus à condition que l'image numérique soit lisible et représente fidèlement l'original. La sortie de la feuille de calcul OCR combinée au PDF du reçu original satisfait aux exigences de tenue de dossiers tout en rendant les données beaucoup plus utiles pour la préparation des déclarations de revenus.
Pour les entreprises qui traitent des reçus provenant de plusieurs pays, le système OCR doit gérer différentes langues, devises, formats de date et structures fiscales. Un reçu en provenance de France est différent d'un reçu en provenance du Japon et le système OCR doit être configuré pour chaque format régional.
La valeur à long terme des reçus numérisés va au-delà du besoin immédiat de déclaration des dépenses. Les données historiques des reçus peuvent être analysées pour les modèles de dépenses, les négociations avec les fournisseurs et les prévisions budgétaires, informations qui sont inaccessibles lorsque les reçus restent sous forme papier ou sous forme de fichiers PDF impossibles à rechercher.
La combinaison de la technologie OCR et de l'exportation de feuilles de calcul transforme les reçus des enregistrements statiques en données analysables qui prennent en charge la gestion financière, la conformité fiscale et la business intelligence.
La transition des reçus papier aux données numériques traitées par OCR représente l'une des applications les plus pratiques de l'automatisation des documents pour les petites entreprises et les particuliers gérant leurs finances.
Le traitement des reçus OCR convertit la tâche fastidieuse et sujette aux erreurs de saisie manuelle des données en un flux de travail rapide et automatisé qui se rentabilise en termes de gain de temps après les premières douzaines de reçus.
| Champ du reçu | Conseil de reconnaissance OCR | Exporter la colonne |
|---|---|---|
| Nom du magasin | Généralement en haut ; la plus grande police | Fournisseur |
| Date | Recherchez les modèles de date en haut | Date |
| Éléments de campagne | Blocs de texte alignés à gauche | Description, quantité, prix unitaire |
| Total | Avant taxes ; souvent étiqueté | Total |
| Impôt | Après le sous-total ; pourcentage ou fixe | Impôt |
| Total | Le montant le plus élevé ; souvent audacieux | Total |
Essayez l'OCR PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
