Vous recevez un PDF, vous l'ouvrez, vous cherchez un mot : aucun résultat. Vous essayez de sélectionner une ligne à la souris : rien ne se sélectionne. Le document est bien là, parfaitement lisible à l'œil, mais pour l'ordinateur c'est une photographie. C'est la situation où l'OCR — la reconnaissance optique de caractères — devient nécessaire, et le moment où la plupart des gens découvrent que le résultat dépend bien davantage de l'image de départ que du logiciel.
Ce que fait réellement l'OCR (et pourquoi il ne « lit » pas)
Un moteur OCR ne comprend pas le texte : il le reconstruit. Le processus passe par des étapes mécaniques — repérer les zones de texte, redresser l'image, isoler les lignes, puis les mots, puis les caractères — et ce n'est qu'à la fin qu'il compare chaque forme aux modèles de lettres qu'il connaît, en retenant la plus probable.
Cela explique les erreurs typiques, absurdes au premier abord : rn lu comme m, 0 confondu avec O, 1 avec l. Ce ne sont pas des erreurs de compréhension, ce sont des erreurs de ressemblance visuelle. Un humain les corrige automatiquement grâce au contexte ; le moteur OCR, qui raisonne sur la forme avant le sens, non.
La qualité de l'image compte plus que le logiciel
Voilà le point contre-intuitif : changer de moteur OCR améliore peu, améliorer la numérisation améliore énormément. Les facteurs qui pèsent vraiment, par ordre d'impact :
| Facteur | Problème | Remède |
|---|---|---|
| Résolution | Sous 200 PPP, les petits caractères s'empâtent | Numériser à 300 PPP, le standard de fait |
| Contraste | Papier jauni ou photo dans la pénombre : lettres et fond se confondent | Noir et blanc ou hausse du contraste avant traitement |
| Inclinaison | Lignes de travers : le moteur les segmente mal | Redresser l'image, même de quelques degrés |
| Ombres et courbure | Photo d'un livre ouvert : le texte se déforme vers la pliure | Photographier en lumière diffuse, page aplatie |
Une photo prise à la va-vite au téléphone, de travers et avec l'ombre de la main dessus, donne des résultats médiocres avec n'importe quel moteur. Mieux vaut refaire la prise : le scanner par appareil photo applique redressement, recadrage et filtres de contraste avant même que le fichier n'arrive à la reconnaissance, et c'est presque toujours la différence entre un texte exploitable et un texte à ressaisir à la main.
Le score de fiabilité : la donnée la plus utile et la plus ignorée
Chaque page traitée reçoit une valeur de confiance, c'est-à-dire le degré de fiabilité que le moteur attribue à sa propre lecture. C'est l'information la plus précieuse de tout le processus, et presque personne ne la regarde.
La règle pratique : au-dessus de 90 %, le texte est généralement fiable et demande juste une relecture ; entre 70 % et 90 %, il y a des erreurs éparses à corriger ; en dessous de 70 %, mieux vaut refaire la prise que perdre du temps à corriger. Un score faible sur une seule page sur vingt signale presque toujours un problème physique de cette page — un pli, une ombre, une tache — et non une limite du système.
Comment extraire le texte, étape par étape
- Ouvrez l'OCR en ligne gratuit — sans inscription.
- Chargez les fichiers : images
PNG,JPG,WEBP,BMP,TIFFou PDF, y compris numérisés. Jusqu'à 15 Mo par fichier et 30 fichiers à la fois. - Sélectionnez la bonne langue avant de lancer. C'est l'étape qui pèse le plus sur la précision : français, anglais, italien, espagnol, allemand, portugais et albanais sont disponibles.
- Lancez la reconnaissance et vérifiez le score de fiabilité page par page.
- Copiez le texte, ou envoyez-le vers le workspace pour le transmettre à un autre outil — typiquement un résumé ou une traduction — sans rien recharger.
Là où l'OCR échoue systématiquement
- La mauvaise langue gâche tout. Un texte français traité comme de l'anglais perd accents et cédilles de façon systématique, car le moteur cherche des formes qui n'existent pas en français.
- Les tableaux deviennent du texte linéaire. Les cellules sont lues l'une après l'autre : les valeurs sont là, la relation ligne-colonne non.
- Les colonnes multiples se mélangent. Dans les journaux et magazines, le texte peut être reconstruit en traversant les colonnes au lieu de les suivre.
- L'italique et les polices décoratives ont des taux d'erreur bien plus élevés qu'un caractère typographique régulier.
- L'écriture manuscrite est une autre technologie. L'OCR classique reconnaît des caractères imprimés ; le manuscrit exige d'autres modèles et reste peu fiable.
Questions fréquentes
Quels formats puis-je charger ?
Des images en PNG, JPG, WEBP, BMP et TIFF, ainsi que des PDF, y compris numérisés et sans texte sélectionnable. La limite est de 15 Mo par fichier, jusqu'à 30 fichiers par traitement.
Quelles langues sont reconnues ?
Sept : français, anglais, italien, espagnol, allemand, portugais et albanais. La langue doit être choisie avant le traitement, car elle guide le moteur dans la reconnaissance des caractères accentués et des combinaisons propres à cette langue.
Comment savoir si un PDF a besoin d'OCR ?
Essayez de sélectionner un mot à la souris ou de chercher un terme avec Ctrl+F. Si la sélection ne fonctionne pas et que la recherche ne trouve rien, même pour des mots visiblement présents, le PDF contient des images et nécessite l'OCR.
Puis-je utiliser l'OCR sur une photo prise au téléphone ?
Oui, c'est même l'un des usages les plus courants. Le résultat s'améliore nettement si la page est cadrée droite, bien éclairée et sans ombres : passer d'abord par le scanner, qui redresse et augmente le contraste, donne presque toujours un texte plus propre.
En résumé
L'OCR transforme une image de texte en texte véritable, et c'est le préalable à presque tout le reste : chercher dans un document, le traduire, le résumer, le convertir. La précision dépend surtout de trois choses, dans cet ordre : qualité de la prise, langue correctement sélectionnée, et vérification du score de fiabilité avant de se fier au résultat. L'OCR gratuit en ligne accepte images et PDF jusqu'à 15 Mo en sept langues ; si le document est encore sur papier, mieux vaut partir du scanner, et de là le texte peut poursuivre vers les autres outils PDF et IA.