Que signifie CER ?
Le taux d’erreur de caractères compte les substitutions, insertions et suppressions nécessaires pour transformer le résultat en référence. Plus bas, c’est mieux.
24 systèmes OCR comparés sur 205 pages manuscrites, avec CER et WER normalisés, sources, coûts et méthode accessibles.
Chaque jeu reçoit le même poids dans les CER et WER normalisés. Les deux taux sont plafonnés à 100 % par page avant la moyenne ; plus bas, c’est mieux.
| Rang | Modèle | CER normalisé | WER normalisé | Coût par page | Frontière CER |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15,0 % | 24,8 % | 0,0108 $US | Oui |
| 2 | Gemini 3.7 Flash | 15,2 % | 26,7 % | 0,0040 $US | Oui |
| 3 | Gemini 3 Flash | 16,7 % | 26,1 % | 0,0034 $US | Oui |
| 4 | Gemini 3.8 Flash | 16,8 % | 28,9 % | 0,0036 $US | — |
| 5 | GPT-6 Astra | 18,0 % | 34,4 % | 0,0748 $US | — |
| 6 | Gemini 3.5 Flash Lite | 20,4 % | 35,6 % | 0,0020 $US | Oui |
| 7 | Claude Opus 5 | 22,1 % | 35,2 % | 0,0498 $US | — |
| 8 | Grok 4.5 | 25,3 % | 43,8 % | 0,0082 $US | — |
| 9 | Claude Sonnet 5 | 25,9 % | 42,9 % | 0,0135 $US | — |
| 10 | Qwen 3.8 Max | 27,1 % | 41,9 % | 0,0102 $US | — |
| 11 | Kimi K3 | 29,1 % | 46,7 % | 0,0282 $US | — |
| 12 | GPT-5.6 Sol | 35,5 % | 50,2 % | 0,0430 $US | — |
| 13 | Qwen 3.7 Flash | 37,5 % | 54,1 % | 0,00017 $US | Oui |
| 14 | Qwen 3.8 27B | 40,8 % | 57,8 % | 0,0065 $US | — |
| 15 | Gemma 4 26B-A4B | 40,8 % | 55,6 % | Non chiffré | — |
| 16 | GPT-5.6 Terra | 42,1 % | 57,2 % | 0,0338 $US | — |
| 17 | GPT-5.6 Luna | 44,7 % | 59,4 % | 0,0034 $US | — |
| 18 | GLM 5.3 Flash | 47,9 % | 62,2 % | 0,00091 $US | — |
| 19 | PaddleOCR-VL-1.6 | 54,0 % | 74,1 % | Non chiffré | — |
| 20 | LightOnOCR-2 | 56,7 % | 68,0 % | Non chiffré | — |
| 21 | DeepSeek V4.1 Flash | 58,3 % | 69,9 % | 0,0019 $US | — |
| 22 | GLM-OCR | 59,1 % | 73,8 % | Non chiffré | — |
| 23 | Tesseract 5.5.0 | 64,1 % | 93,0 % | Non chiffré | — |
| 24 | EasyOCR 1.7.2 | 68,1 % | 96,6 % | Non chiffré | — |
Des CER et WER plus faibles sont meilleurs. Les deux ignorent la casse et la ponctuation. La frontière utilise le CER et le coût.
Astra utilise le raisonnement low et une limite de 8192 tokens de sortie, raisonnement compris. Son coût correspond à la facturation réelle OpenRouter du 11 septembre 2026, écritures de cache et nouvelles tentatives techniques incluses. Les autres modèles API conservent leurs tarifs figés.
Le rapport sépare sept jeux publics de six groupes Inksight Benchmark et conserve les résultats de chaque source.
Chaque système a reçu les mêmes images figées. Les modèles API utilisent le même prompt ; les moteurs OCR locaux utilisent leurs pipelines natifs. Les échecs persistants comptent comme un CER et un WER de 1,0.
Après le nettoyage symétrique, les deux textes sont convertis en casse Unicode uniforme, la ponctuation est supprimée et les suites d’espaces ainsi produites sont réduites à un seul espace. Le CER compte les modifications de caractères ; le WER celles des mots séparés par des espaces. Aucune correction orthographique ni comparaison sémantique n’a été appliquée.
Les moyennes publiques CER et WER pondèrent également les sept jeux. Le résumé complet pondère également les sept jeux publics et les six groupes Inksight Benchmark.
| Jeu | Contenu | Langue · écriture | Pages | Licence | Source |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | Source |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | Source |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | Source |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | Source |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | Source |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | Source |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | Source |
Ces chiffres sont des comparaisons délimitées, pas des affirmations universelles sur tous les documents.
Le taux d’erreur de caractères compte les substitutions, insertions et suppressions nécessaires pour transformer le résultat en référence. Plus bas, c’est mieux.
Gemini 3.1 Pro a obtenu le CER moyen public le plus faible parmi les 24 configurations testées. Ce résultat ne vaut que pour ce corpus et ce protocole.
Le résumé complet inclut 72 pages Inksight Benchmark regroupées par langue et écriture. Les images et transcriptions privées ne sont pas publiées.
Oui. Les fichiers JSON et CSV contiennent les mesures par modèle et par groupe, les coûts normalisés, la latence et les taux d’échecs graves.
Importez une photo, un scan ou un PDF et comparez la transcription modifiable avec l’original.
Essayer Inksight gratuitementNous avons comparé le raisonnement de base et élevé sur les mêmes 12 pages avec six modèles, séparément du benchmark de 205 pages. Aucun n’a rempli nos critères de passage au raisonnement élevé ; tous ont conservé leur réglage de base.
| Modèle | Variation CER (pp)Plus bas = meilleur | Coût multiplié par |
|---|---|---|
| Gemini 3 Flash preview | +13,65 | 8,16× |
| Gemini 3.1 Pro | +15,94 | 8,93× |
| Claude Sonnet 5 | +0,23 | 1,03× |
| Grok 4.5 | -2,59 | 3,15× |
| GPT-5.6 Sol | +1,75 | 2,72× |
| Qwen 3.8 Max | +2,94 | 6,27× |
Élevé moins base ; négatif signifie meilleur. Les coûts utilisent les tarifs figés de l’expérience. Il s’agit des scores CER originaux du jeu de développement, non des scores normalisés et plafonnés du benchmark principal.
Davantage de raisonnement n’a pas aidé en moyenne dans cette petite expérience de développement. Les taux d’erreur ont augmenté de 5,32 points de pourcentage et les coûts ont fortement augmenté pour la plupart des modèles : une hausse moyenne de 404 % sur les six modèles.