
Pourquoi les photos de pages de livres échouent à l'OCR (et comment quelques degrés d'inclinaison ruinent la précision)
Publié le 24 juil. 2026
Si vous avez déjà essayé de convertir en ligne la photo d’une page de livre en texte et obtenu un mur de charabia, vous avez probablement blâmé la mauvaise chose. Il est tentant de supposer que le vieux papier jauni ou le mauvais éclairage en sont responsables — mais dans nos tests, aucun des deux n’a fait bouger grand-chose. La cause réelle est presque toujours quelque chose que vous ne pouvez pas voir en regardant simplement la photo : une légère inclinaison de la caméra.
Le test : la même page, quatre conditions
Pour découvrir ce qui casse réellement l’OCR (reconnaissance optique de caractères) sur des photos de livres réelles, nous avons fait passer le même bloc de texte par Tesseract — le moteur OCR open source — dans quatre conditions : une numérisation propre et plate, une page jaunie et fanée, une photo inclinée d’environ 12 degrés, et une photo inclinée avec un reflet lumineux ajouté.
| Condition | Précision des mots |
|---|---|
| Numérisation propre et plate | 100 % |
| Page jaunie et fanée (sans inclinaison) | 100 % |
| Inclinée ~12° (sans décoloration) | 67,7 % |
| Inclinée ~8° + reflet | 71,0 % |
La page jaunie a obtenu le même score que la page impeccable — note parfaite. Dès qu’une inclinaison a été introduite, la précision s’est effondrée d’un tiers, produisant exactement le genre de résultat que quiconque a essayé des outils « scanner manuel en Word » a déjà vu : « brow, » au lieu de « brown », « Chapte,. » au lieu de « Chapter. », « hidde,, » au lieu de « hidden ».
Pourquoi une inclinaison minime cause autant de dégâts
Les moteurs OCR lisent le texte en balayant les rangées de l’image à la recherche de bandes horizontales cohérentes d’encre — c’est le mécanisme qu’ils utilisent pour distinguer une ligne de texte de la suivante. Sur une numérisation parfaitement à l’horizontale, chaque ligne de texte se trouve dans une bande horizontale bien nette, et le moteur sépare proprement la ligne 1, la ligne 2 et la ligne 3.
Inclinez la page ne serait-ce que de 10 degrés, et cette bande horizontale nette devient une traînée diagonale s’étendant sur des dizaines de rangées de pixels. La logique de segmentation des lignes du moteur commence à fusionner des caractères qui devraient appartenir à deux lignes distinctes, ou à scinder un seul caractère entre ce qu’elle croit être deux lignes différentes. Le résultat n’est pas « un peu moins précis » — c’est un résultat catégoriquement différent, parce que l’unité fondamentale que le moteur lit (une ligne) ne correspond plus à ce qui se trouve réellement dans l’image.
C’est aussi pourquoi une photo qui vous paraît parfaitement lisible peut quand même produire un résultat OCR illisible. Votre système visuel compense une inclinaison de 10 degrés sans aucun effort conscient — vous ne la percevez même pas comme inclinée. Un pipeline OCR naïf n’a pas cette compensation intégrée, et lit exactement les pixels qu’on lui donne.
La solution : redresser avant de reconnaître, pas après
La conclusion pratique n’est pas « tenez votre téléphone plus soigneusement » — une légère inclinaison en photographiant un livre ouvert est presque inévitable, puisque vous ne pressez pas la page à plat contre un scanner. La solution est automatique : détecter l’angle d’inclinaison et le corriger avant d’exécuter la reconnaissance de texte, pas après.
Une méthode fiable pour détecter l’angle sans aucun modèle lourd d’apprentissage automatique est la méthode du profil de projection : faire pivoter l’image à travers une plage d’angles candidats et, pour chacun, mesurer à quel point la distribution d’encre ligne par ligne est « pointue ». Au bon angle, les lignes de texte s’alignent en bandes nettes (forte variance entre les rangées) ; à tout autre angle, l’encre se répand sur les rangées (faible variance). L’angle qui produit la variance la plus élevée est l’angle de correction.
Exécuter cette correction d’abord, puis reconnaître le texte, a ramené chacun de nos cas de test inclinés à une précision de 100 % des mots — la même page, le même moteur OCR, la seule différence étant de la redresser d’abord.
Ce que cela signifie si vous numérisez un livre
- Ne vous inquiétez pas de l’état du papier. Le jaunissement, le fanage léger et la perte de contraste due au vieillissement du papier bougent à peine la précision à eux seuls. Un vieux livre de poche se numérise presque aussi bien qu’un neuf.
- Inquiétez-vous de l’angle. Même une inclinaison que vous ne remarqueriez pas à l’œil nu peut faire toute la différence entre un texte exploitable et du charabia.
- Le reflet du flash compte moins que l’inclinaison, mais nuit quand même. Un point lumineux sur du papier brillant peut effacer le texte qui se trouve dessous — la correction d’angle ne réparera pas une zone où il n’y a de toute façon pas d’encre lisible.
- Un outil qui corrige automatiquement l’inclinaison résout le vrai problème. Notre outil photo de page de livre en texte exécute exactement cette étape de détection et de correction dans votre navigateur avant la reconnaissance — sans téléversement, sans serveur, et il est conçu spécifiquement autour du problème de l’inclinaison plutôt que de supposer que vous lui fournissez une numérisation plate.
Si vous avez déjà essayé l’OCR sur la photo d’un livre et abandonné parce que le résultat était illisible, la page n’était probablement pas le problème — quelques degrés d’angle de caméra l’étaient presque certainement.