Comment optimiser la qualité de vos scans avant de lancer un OCR a PDF ?

On reçoit un lot de factures numérisées, on lance l’OCR, et le résultat est truffé de caractères fantômes, de mots coupés et de colonnes mélangées. Le réflexe est de blâmer le logiciel de reconnaissance. Dans la grande majorité des cas, le problème se situe en amont : c’est le scan lui-même qui sabote la chaîne. Avant de convertir un document en PDF interrogeable, quelques réglages à la source changent radicalement la fiabilité de l’extraction de texte.

Pourquoi un scan médiocre ruine l’OCR avant même qu’il ne démarre

Un PDF numérisé n’est qu’une image. Le moteur OCR analyse les formes de chaque caractère pour les traduire en texte exploitable. Quand l’image est floue, inclinée ou trop compressée, le moteur doit deviner, et il se trompe.

Ce qu’on oublie souvent, c’est que la qualité du scan conditionne aussi les traitements IA en aval. Les workflows de traitement intelligent de documents (IDP) utilisent désormais des modèles de vision-langage pour classer les pages, extraire des champs ou vérifier la cohérence des données. Une image dégradée ne fait pas que produire du texte illisible : elle fausse toute la chaîne documentaire, de la classification automatique jusqu’au contrôle de cohérence.

Concrètement, on constate qu’un même document numérisé proprement, à résolution correcte et avec un bon contraste, peut atteindre un taux de reconnaissance quasi parfait. Le même document photographié à la va-vite avec un smartphone sous un néon produit un résultat inutilisable, quel que soit le logiciel utilisé.

Résolution et format de fichier : les deux réglages qui changent tout pour un OCR a PDF

La résolution de numérisation est le premier paramètre à vérifier sur le scanner ou le copieur. En dessous d’un certain seuil, les caractères fins (accents, ponctuation, chiffres dans les tableaux) deviennent des taches que le moteur OCR ne peut pas distinguer.

Numériser à au moins 300 DPI est le seuil recommandé par l’ensemble des éditeurs de logiciels OCR. Pour des documents avec du texte très petit ou des tableaux denses, monter à 400 DPI apporte un gain réel.

Le format d’enregistrement compte autant que la résolution. Deux erreurs courantes :

  • Enregistrer le scan en JPEG avec un taux de compression élevé. La compression JPEG introduit des artefacts autour des lettres, particulièrement visibles sur du texte noir sur fond blanc. Ces artefacts sont interprétés comme des caractères parasites par l’OCR.
  • Utiliser un format couleur 24 bits pour un document texte noir et blanc. Le fichier est inutilement lourd et le traitement plus lent, sans bénéfice pour la reconnaissance.
  • Négliger le format TIFF ou PNG sans compression destructrice, qui conserve chaque pixel intact et donne les meilleurs résultats avant conversion en PDF.

Professionnel ajustant les paramètres OCR sur un logiciel de conversion PDF sur double écran

Redressement et nettoyage du scan : préparer l’image pour la reconnaissance de caractères

On sous-estime l’impact d’une page légèrement inclinée. Une rotation de quelques degrés suffit à décaler les lignes de texte et à provoquer des fusions de mots ou des sauts de ligne erronés dans le résultat OCR. La plupart des logiciels de numérisation intègrent une fonction de redressement automatique (deskew). L’activer systématiquement évite un bon tiers des erreurs de segmentation.

Contraste et seuillage pour un texte net

Un scan trop clair produit des lettres fantômes. Un scan trop sombre fusionne les caractères entre eux. Ajuster le contraste pour obtenir un texte noir dense sur fond blanc uniforme est le geste de prétraitement le plus efficace en temps passé par rapport au gain de précision.

Pour les documents anciens ou dégradés, appliquer un seuillage adaptatif (binarisation) transforme l’image en noir et blanc pur. Cette technique gère les variations d’éclairage sur une même page, là où un seuillage global échoue sur les zones d’ombre près de la reliure.

Suppression des bordures noires et des marques parasites

Les bordures noires créées par le capot du scanner ou les marques de perforation sont interprétées comme des caractères par certains moteurs OCR. Supprimer ces zones avant le traitement réduit le bruit et accélère la reconnaissance. Sur un lot de plusieurs centaines de pages, le nettoyage des bordures peut diviser par deux le nombre d’erreurs parasites.

Documents complexes : tableaux, multi-colonnes et formulaires numérisés

Les guides OCR classiques se concentrent sur le texte courant. En pratique, les documents les plus problématiques sont les tableaux, les formulaires à cases et les mises en page multi-colonnes. L’OCR confond les colonnes, mélange les cellules ou saute des champs entiers.

Quelques précautions spécifiques aident à limiter la casse :

  • Scanner les tableaux en mode niveaux de gris plutôt qu’en noir et blanc pur. Les filets fins des tableaux disparaissent avec une binarisation trop agressive, et le moteur OCR perd la structure de la grille.
  • Vérifier que les lignes de séparation du tableau sont continues. Un filet interrompu provoque la fusion de deux cellules adjacentes dans le résultat texte.
  • Pour les formulaires manuscrits mixtes (texte imprimé et écriture manuscrite), séparer mentalement les attentes : l’OCR classique reconnaît le texte imprimé, pas l’écriture à la main. Des outils spécialisés de reconnaissance d’écriture manuscrite (HTR) existent, mais les retours varient sur ce point selon la qualité de l’écriture et la langue.

Vue aérienne d'un document scanné avec loupe et checklist pour optimiser la qualité avant conversion OCR en PDF

Normes ISO de numérisation : un cadre souvent ignoré pour l’archivage de documents PDF

Quand on numérise des documents à des fins d’archivage légal ou de conformité, la question dépasse le simple confort de lecture. Les normes ISO 19263 et ISO 14641 définissent des exigences formelles sur la résolution, le contrôle qualité et la fidélité des scans. Ces référentiels imposent des seuils de résolution minimale, des contrôles visuels par échantillonnage et une traçabilité du processus de numérisation.

En France, la norme NF Z42-013 encadre l’archivage électronique et inclut des dispositions sur la qualité de la capture. Ignorer ces exigences expose à des contestations sur la valeur probante des documents numérisés, indépendamment de la qualité de l’OCR appliqué ensuite.

Pour les entreprises qui traitent des volumes importants de factures, contrats ou pièces comptables, aligner les paramètres de numérisation sur ces référentiels dès le départ évite de devoir rescanner des lots entiers après coup.

Checklist rapide avant de lancer l’OCR sur vos fichiers numérisés

Paramètres du scanner

Résolution réglée sur 300 DPI minimum. Format de sortie en TIFF ou PNG pour les documents texte. Mode niveaux de gris pour les tableaux et formulaires, noir et blanc pour le texte courant simple.

Prétraitement de l’image

Redressement automatique activé. Contraste ajusté pour un fond propre et des caractères bien définis. Bordures noires et marques parasites supprimées avant envoi au moteur OCR.

Langue et paramètres OCR

Langue du document correctement sélectionnée dans les paramètres du logiciel. Pour les documents multilingues, vérifier que le moteur prend en charge la détection multi-langue ou traiter chaque section séparément.

Un scan bien préparé ne garantit pas un résultat parfait, mais il élimine la majorité des erreurs évitables. Le temps passé en amont sur les réglages de numérisation et le nettoyage des images se récupère largement en corrections manuelles évitées après l’OCR a PDF.

Ne ratez rien de l'actu