Benchmark d’extraction de texte manuscrit

24 systèmes OCR comparés sur 205 pages manuscrites, avec CER et WER normalisés, sources, coûts et méthode accessibles.

Modèles
24
Pages
205
Résultats
4 920
Jeux publics
7

Précision et coût sur sept jeux publics.

Chaque jeu reçoit le même poids dans les CER et WER normalisés. Les deux taux sont plafonnés à 100 % par page avant la moyenne ; plus bas, c’est mieux.

RangModèleCER normaliséWER normaliséCoût par pageFrontière CER
1Gemini 3.1 Pro15,0 %24,8 %0,0108 $USOui
2Gemini 3.7 Flash15,2 %26,7 %0,0040 $USOui
3Gemini 3 Flash16,7 %26,1 %0,0034 $USOui
4Gemini 3.8 Flash16,8 %28,9 %0,0036 $US—
5GPT-6 Astra18,0 %34,4 %0,0748 $US—
6Gemini 3.5 Flash Lite20,4 %35,6 %0,0020 $USOui
7Claude Opus 522,1 %35,2 %0,0498 $US—
8Grok 4.525,3 %43,8 %0,0082 $US—
9Claude Sonnet 525,9 %42,9 %0,0135 $US—
10Qwen 3.8 Max27,1 %41,9 %0,0102 $US—
11Kimi K329,1 %46,7 %0,0282 $US—
12GPT-5.6 Sol35,5 %50,2 %0,0430 $US—
13Qwen 3.7 Flash37,5 %54,1 %0,00017 $USOui
14Qwen 3.8 27B40,8 %57,8 %0,0065 $US—
15Gemma 4 26B-A4B40,8 %55,6 %Non chiffré—
16GPT-5.6 Terra42,1 %57,2 %0,0338 $US—
17GPT-5.6 Luna44,7 %59,4 %0,0034 $US—
18GLM 5.3 Flash47,9 %62,2 %0,00091 $US—
19PaddleOCR-VL-1.654,0 %74,1 %Non chiffré—
20LightOnOCR-256,7 %68,0 %Non chiffré—
21DeepSeek V4.1 Flash58,3 %69,9 %0,0019 $US—
22GLM-OCR59,1 %73,8 %Non chiffré—
23Tesseract 5.5.064,1 %93,0 %Non chiffré—
24EasyOCR 1.7.268,1 %96,6 %Non chiffré—

Des CER et WER plus faibles sont meilleurs. Les deux ignorent la casse et la ponctuation. La frontière utilise le CER et le coût.

Astra utilise le raisonnement low et une limite de 8192 tokens de sortie, raisonnement compris. Son coût correspond à la facturation réelle OpenRouter du 11 septembre 2026, écritures de cache et nouvelles tentatives techniques incluses. Les autres modèles API conservent leurs tarifs figés.

Ce que nous avons évalué.

Le rapport sépare sept jeux publics de six groupes Inksight Benchmark et conserve les résultats de chaque source.

133
pages publiques
72
pages Inksight Benchmark
24
configurations
4 920
résultats enregistrés

Un protocole figé pour tous les modèles.

Chaque système a reçu les mêmes images figées. Les modèles API utilisent le même prompt ; les moteurs OCR locaux utilisent leurs pipelines natifs. Les échecs persistants comptent comme un CER et un WER de 1,0.

Après le nettoyage symétrique, les deux textes sont convertis en casse Unicode uniforme, la ponctuation est supprimée et les suites d’espaces ainsi produites sont réduites à un seul espace. Le CER compte les modifications de caractères ; le WER celles des mots séparés par des espaces. Aucune correction orthographique ni comparaison sémantique n’a été appliquée.

Les moyennes publiques CER et WER pondèrent également les sept jeux. Le résumé complet pondère également les sept jeux publics et les six groupes Inksight Benchmark.

Sources publiques incluses

JeuContenuLangue · écriturePagesLicenceSource
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0Source
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0Source
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0Source
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0Source
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0Source
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0Source
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsSource

Limites

  • — Les résultats décrivent uniquement les pages, versions et configurations évaluées.
  • — Certains jeux publics ont pu apparaître dans les données d’entraînement de fournisseurs.
  • — Les pages Inksight Benchmark utilisent des références figées, mais les documents privés ne sont pas publiés.
  • — Les CER et WER bruts d’une page peuvent dépasser 100 % ; les moyennes principales plafonnent chaque taux à 100 % par page.

Questions sur le benchmark

Ces chiffres sont des comparaisons délimitées, pas des affirmations universelles sur tous les documents.

Que signifie CER ?

Le taux d’erreur de caractères compte les substitutions, insertions et suppressions nécessaires pour transformer le résultat en référence. Plus bas, c’est mieux.

Quel modèle a été le plus précis sur les jeux publics ?

Gemini 3.1 Pro a obtenu le CER moyen public le plus faible parmi les 24 configurations testées. Ce résultat ne vaut que pour ce corpus et ce protocole.

Le benchmark contient-il des pages privées ?

Le résumé complet inclut 72 pages Inksight Benchmark regroupées par langue et écriture. Les images et transcriptions privées ne sont pas publiées.

Puis-je télécharger les résultats ?

Oui. Les fichiers JSON et CSV contiennent les mesures par modèle et par groupe, les coûts normalisés, la latence et les taux d’échecs graves.

Essayez votre propre écriture.

Importez une photo, un scan ou un PDF et comparez la transcription modifiable avec l’original.

Essayer Inksight gratuitement

Raisonner davantage aide-t-il ?

Nous avons comparé le raisonnement de base et élevé sur les mêmes 12 pages avec six modèles, séparément du benchmark de 205 pages. Aucun n’a rempli nos critères de passage au raisonnement élevé ; tous ont conservé leur réglage de base.

Raisonner davantage aide-t-il ?
ModèleVariation CER (pp)Plus bas = meilleurCoût multiplié par
Gemini 3 Flash preview+13,658,16×
Gemini 3.1 Pro+15,948,93×
Claude Sonnet 5+0,231,03×
Grok 4.5-2,593,15×
GPT-5.6 Sol+1,752,72×
Qwen 3.8 Max+2,946,27×

Élevé moins base ; négatif signifie meilleur. Les coûts utilisent les tarifs figés de l’expérience. Il s’agit des scores CER originaux du jeu de développement, non des scores normalisés et plafonnés du benchmark principal.

Davantage de raisonnement n’a pas aidé en moyenne dans cette petite expérience de développement. Les taux d’erreur ont augmenté de 5,32 points de pourcentage et les coûts ont fortement augmenté pour la plupart des modèles : une hausse moyenne de 404 % sur les six modèles.