Vous numérisez un document de trois pages avec votre téléphone, l'enregistrez au format PDF et le fichier résultant pèse 8 mégaoctets. Un scanner de bureau produit les trois mêmes pages à environ 300 kilo-octets. Le fichier généré sur mobile est plus de 25 fois plus volumineux, mais les deux versions semblent parfaitement lisibles à l’écran. L’écart n’est pas aléatoire, et ce n’est pas simplement dû au fait que l’appareil photo de votre téléphone capture plus de mégapixels. La différence de taille de fichier provient d'une combinaison de facteurs : une résolution d'image inadaptée aux besoins du document, des artefacts de double compression, une profondeur de couleur inutile et des méthodes d'intégration PDF inefficaces. Comprendre chacun de ces facteurs vous donne un contrôle précis sur la taille de sortie sans jamais sacrifier la lisibilité qui rend un document numérisé utile.

Résolution de l'image : le facteur le plus important dans la différence de taille de fichier
Un appareil photo de smartphone moderne capture des images à des résolutions dépassant de loin celles requises par la numérisation de documents. L'appareil photo principal d'un téléphone typique produit des images de 12 à 48 mégapixels, ce qui correspond à environ 4 000 x 3 000 pixels ou plus. Un scanner de bureau réglé sur une résolution standard de 300 DPI pour une page au format lettre produit une image de 2 550 x 3 300 pixels, soit environ 8,4 mégapixels. L’image du téléphone contient deux à cinq fois plus de pixels que l’image du scanner pour exactement la même zone de page physique. Chaque pixel supplémentaire ajoute des données brutes au fichier. Doubler la résolution dans les deux dimensions quadruple le nombre de pixels et, toutes choses étant égales par ailleurs, quadruple la taille du fichier non compressé.
Une image de 12 mégapixels stockée non compressée consomme environ 36 mégaoctets de mémoire (12 millions de pixels multipliés par 3 octets par pixel pour la couleur RVB). La même page numérisée à 300 DPI sur un scanner de bureau produit environ 25 Mo non compressés. Le téléphone commence avec beaucoup plus de données brutes, et la compression appliquée par la suite ne peut réduire ces données que jusqu'à présent avant que la qualité de l'image ne se dégrade visiblement. La plupart des applications de numérisation mobile résolvent ce problème en réduisant l'image capturée avant de l'encoder au format PDF. Une application qui réduit la capture de la caméra à 300 DPI effectifs produit une taille de fichier comparable à une numérisation de bureau. Les applications qui préservent la résolution native de l'appareil photo, soit par défaut, soit parce que l'utilisateur a sélectionné un paramètre de qualité élevé, produisent des fichiers proportionnellement plus volumineux, souvent 5 à 25 fois plus volumineux que ce dont ils ont besoin pour une lecture à l'écran (Digital Document Foundation, « Mobile Scanning Resolution Benchmarks », 2025).
Essayez de compresser le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
Compression JPEG et problème de double compression
Les scanners de bureau compressent généralement les données brutes numérisées une seule fois, en utilisant la compression JPEG à un niveau de qualité sélectionné par l'utilisateur dans le pilote du scanner. Un paramètre de qualité JPEG de 85 % produit un bon équilibre entre qualité visuelle et taille de fichier pour la plupart des documents texte. Cependant, les applications de scanner mobile appliquent souvent la compression deux fois sans que cela soit de leur faute. Le matériel de l'appareil photo du téléphone applique un premier cycle de compression JPEG pour produire le fichier image initial enregistré sur la pellicule. L'application du scanner lit ensuite cette image déjà compressée, applique ses ajustements de traitement pour la correction de la perspective, l'amélioration du contraste et la normalisation des couleurs, et enregistre le résultat traité avec un deuxième cycle de compression JPEG.
Chaque génération de compression JPEG supprime certaines données d'image et introduit des artefacts de compression dans l'image. La deuxième passe de compression doit alors coder à la fois le contenu de l'image originale et les artefacts introduits par la première passe, ce qui réduit l'efficacité globale de la compression. Le résultat est un fichier qui est en réalité plus volumineux qu'il ne le serait si la compression avait été appliquée une seule fois aux données brutes du capteur, car les artefacts ajoutent du contenu haute fréquence que JPEG a du mal à encoder de manière compacte. Cet effet de double compression est particulièrement prononcé dans les applications qui appliquent un traitement d'image intensif, tel que la suppression automatique des ombres ou des filtres de netteté du texte, car le traitement amplifie les détails haute fréquence que la compression JPEG gère le moins efficacement (IEEE Signal Processing Society, « Multi-Generation JPEG Compression Analysis », 2024). Certaines applications de numérisation atténuent ce problème en enregistrant au format PNG lorsque le contenu est principalement du texte, évitant ainsi complètement la double compression JPEG. PNG utilise une compression sans perte qui préserve bien les bords nets, mais pour le contenu photographique, les fichiers PNG ont tendance à être plus volumineux que JPEG à qualité visuelle équivalente.
Profondeur de couleur et opportunité d'échelle de gris
Les caméras des téléphones capturent par défaut des images RVB en couleur à 24 bits par pixel. Chaque pixel nécessite trois octets de stockage, un pour les canaux de couleur rouge, vert et bleu. Cependant, la plupart des documents ne contiennent rien de plus que du texte noir sur fond blanc ou presque blanc. Les stocker en couleur gaspille deux tiers ou plus du stockage en informations couleur qui ne contiennent aucun contenu de document utile. Les pilotes de scanner de bureau utilisent généralement par défaut le mode niveaux de gris ou noir et blanc pur pour la numérisation de documents, en utilisant 8 bits par pixel pour les niveaux de gris ou 1 bit par pixel pour le noir et blanc. La différence dans le volume de données brutes est spectaculaire : une image en niveaux de gris représente un tiers de la taille non compressée de l'image RVB équivalente, et une image en noir et blanc représente un vingt-quatrième de la taille.
Les applications de numérisation mobile proposent de plus en plus un mode noir et blanc ou document qui convertit la capture couleur de l'appareil photo en une image binaire ou en niveaux de gris avant d'encoder le PDF. Si la taille du fichier est un problème et que le document ne contient aucune information de couleur qui doit réellement être préservée, passer l'application en mode niveaux de gris ou document est la mesure la plus efficace que vous puissiez prendre pour réduire la taille de sortie. La différence visuelle pour les documents texte est négligeable et la réduction de la taille du fichier peut aller de 65 à 95 pour cent en fonction de la complexité des couleurs d'origine et de l'agressivité du seuil appliqué lors de la conversion.
Structure PDF et méthodes d'incorporation d'images
Un PDF produit par une application de numérisation mobile intègre chaque page numérisée en tant qu'image distincte à l'intérieur du conteneur PDF. La méthode utilisée pour intégrer cette image a un impact substantiel sur la taille finale du fichier. L'approche la plus économe en espace stocke l'image sous forme de flux JPEG dans le PDF à l'aide du filtre DCTDecode spécifié dans la norme PDF. Cela permet au PDF de contenir les données JPEG exactes générées par l'application, sans réencodage et avec une surcharge supplémentaire minimale au-delà du passe-partout de description de page PDF, qui ajoute généralement moins de 2 kilo-octets par page.
Certaines applications mobiles, en particulier celles qui donnent la priorité à la compatibilité avec la gamme la plus large possible de visionneuses PDF, réencodent les données d'image sous forme de bitmap brut ou appliquent une compression sans perte FlateDecode aux données de pixels. FlateDecode est mathématiquement sans perte, ce qui semble être un avantage en termes de qualité, mais pour le contenu photographique ou numérisé, il produit des fichiers 5 à 20 fois plus volumineux que JPEG avec une qualité visuellement équivalente pour le lecteur humain. Une page de lettres de 300 DPI stockée avec FlateDecode peut facilement dépasser 20 mégaoctets par page, contre environ 300 kilo-octets pour la même page stockée avec une compression JPEG avec un paramètre de qualité raisonnable (Adobe, « Référence PDF : Recommandations de compression d'images », 2023).
Comment contrôler la taille du fichier PDF du scanner mobile
Les paramètres qui contrôlent la taille de sortie du scanner mobile se trouvent généralement dans le menu des préférences de l'application ou derrière une icône d'engrenage sur l'écran de capture. Le tableau ci-dessous mappe les paramètres les plus importants avec leur effet approximatif sur la taille du fichier.
| Réglage | Recommandé pour les fichiers plus petits | Réduction de taille approximative |
|---|---|---|
| Mode couleur | Noir et blanc ou niveaux de gris au lieu de la couleur | 65-95 % par rapport au mode couleur |
| Résolution / Qualité | 200-300 DPI pour les documents texte standard | 50-75 % du plus élevé à recommandé |
| Format de sortie | PDF avec compression JPEG plutôt que PDF/A ou encodage sans perte | 70 à 95 % par rapport à l'encodage sans perte |
| Gestion de plusieurs pages | Combinez toutes les pages en un seul PDF au lieu d'un fichier par page | Réduit la surcharge due aux en-têtes de fichiers et aux métadonnées répétés |
Si vous avez déjà numérisé un document et que vous devez réduire la taille de son fichier sans effectuer une nouvelle numérisation, l'outil PDF Compression du WukongPDF peut retraiter le PDF et appliquer une compression plus agressive aux images intégrées. Il s'agit d'une optimisation post-numérisation qui réduit la taille du fichier en réencodant les images à un niveau de qualité JPEG inférieur ou en convertissant les images couleur en niveaux de gris. Pour les documents destinés à la lecture à l'écran, les paramètres de compression par défaut produisent d'excellents résultats. Pour les documents à imprimer, utilisez le préréglage de compression de qualité supérieure pour éviter que des artefacts visibles n'apparaissent sur le papier.
Quand un fichier plus volumineux issu d'une analyse mobile est réellement meilleur
Toutes les situations de numérisation ne nécessitent pas le fichier le plus petit possible. Les photographies, les reproductions d'œuvres d'art et les documents présentant des détails de couleurs fins bénéficient de la résolution plus élevée et de la profondeur de couleur complète de la capture native d'un scanner mobile. Une impression photo vintage numérisée en pleine résolution et stockée avec une compression minimale préserve les détails qui seraient définitivement perdus à 300 DPI en mode niveaux de gris. Les documents qui subiront un traitement numérique ultérieur bénéficieront également de numérisations initiales de meilleure qualité. La précision de reconnaissance des moteurs OCR s'améliore sensiblement avec une résolution d'entrée plus élevée, en particulier pour les petites tailles de police, les écritures non latines et les documents contenant du texte et des graphiques mélangés.
La décision de compression Réduire la taille du PDF doit avoir lieu après le traitement OCR, pas avant, afin que le moteur de reconnaissance dispose des meilleures données d'image possibles avec lesquelles travailler pendant l'extraction de texte. Une fois la couche de texte consultable extraite et intégrée dans le PDF, vous pouvez compresser les images sous-jacentes de manière agressive sans perdre la possibilité de rechercher et de copier du texte. Le principe clé est de prendre intentionnellement la décision concernant la taille du fichier plutôt que d'accepter passivement les paramètres d'usine par défaut de l'application. Une lettre commerciale de trois pages n’a rien à voir avec 8 mégaoctets. Une archive de photographies historiques mérite chaque octet de sa taille de fichier plus importante. La bonne réponse dépend entièrement du contenu du document et de l'utilisation prévue, et les paramètres permettant d'atteindre le bon équilibre sont entre vos mains une fois que vous avez compris le rôle de chaque commande.
Le contexte détermine le bon réglage.
Les choix intentionnels surpassent les paramètres par défaut.
Vous avez maintenant les deux.
Essayez de compresser le PDF
Aucune installation nécessaire. Fonctionne directement dans votre navigateur.
