Cosa significa CER?
Il tasso di errore dei caratteri conta sostituzioni, inserimenti ed eliminazioni necessari per trasformare il risultato nel riferimento. Più basso è meglio.
24 sistemi OCR confrontati su 205 pagine manoscritte, con CER e WER normalizzati, fonti, costi e metodologia visibili.
Ogni dataset ha lo stesso peso nei CER e WER normalizzati. Entrambi i tassi sono limitati al 100% per pagina prima della media; più bassi sono meglio.
| Posizione | Modello | CER normalizzato | WER normalizzato | Costo per pagina | Frontiera CER |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15,0% | 24,8% | 0,0108 USD | Sì |
| 2 | Gemini 3.7 Flash | 15,2% | 26,7% | 0,0040 USD | Sì |
| 3 | Gemini 3 Flash | 16,7% | 26,1% | 0,0034 USD | Sì |
| 4 | Gemini 3.8 Flash | 16,8% | 28,9% | 0,0036 USD | — |
| 5 | GPT-6 Astra | 18,0% | 34,4% | 0,0748 USD | — |
| 6 | Gemini 3.5 Flash Lite | 20,4% | 35,6% | 0,0020 USD | Sì |
| 7 | Claude Opus 5 | 22,1% | 35,2% | 0,0498 USD | — |
| 8 | Grok 4.5 | 25,3% | 43,8% | 0,0082 USD | — |
| 9 | Claude Sonnet 5 | 25,9% | 42,9% | 0,0135 USD | — |
| 10 | Qwen 3.8 Max | 27,1% | 41,9% | 0,0102 USD | — |
| 11 | Kimi K3 | 29,1% | 46,7% | 0,0282 USD | — |
| 12 | GPT-5.6 Sol | 35,5% | 50,2% | 0,0430 USD | — |
| 13 | Qwen 3.7 Flash | 37,5% | 54,1% | 0,00017 USD | Sì |
| 14 | Qwen 3.8 27B | 40,8% | 57,8% | 0,0065 USD | — |
| 15 | Gemma 4 26B-A4B | 40,8% | 55,6% | Non valutato | — |
| 16 | GPT-5.6 Terra | 42,1% | 57,2% | 0,0338 USD | — |
| 17 | GPT-5.6 Luna | 44,7% | 59,4% | 0,0034 USD | — |
| 18 | GLM 5.3 Flash | 47,9% | 62,2% | 0,00091 USD | — |
| 19 | PaddleOCR-VL-1.6 | 54,0% | 74,1% | Non valutato | — |
| 20 | LightOnOCR-2 | 56,7% | 68,0% | Non valutato | — |
| 21 | DeepSeek V4.1 Flash | 58,3% | 69,9% | 0,0019 USD | — |
| 22 | GLM-OCR | 59,1% | 73,8% | Non valutato | — |
| 23 | Tesseract 5.5.0 | 64,1% | 93,0% | Non valutato | — |
| 24 | EasyOCR 1.7.2 | 68,1% | 96,6% | Non valutato | — |
CER e WER più bassi sono migliori. Entrambi ignorano maiuscole, minuscole e punteggiatura. La frontiera usa CER e costo.
Astra usa ragionamento low e un limite di 8192 token di output, ragionamento incluso. Il costo è quello effettivamente fatturato da OpenRouter l’11 settembre 2026, incluse scritture nella cache e nuovi tentativi tecnici. Gli altri modelli API mantengono i prezzi congelati.
Il rapporto separa sette dataset pubblici da sei gruppi Inksight Benchmark e mantiene distinti i risultati di ogni fonte.
Ogni sistema ha ricevuto le stesse immagini congelate. I modelli API usano lo stesso prompt; i motori OCR locali usano pipeline native. I fallimenti persistenti contano come CER e WER 1,0.
Dopo la pulizia simmetrica, entrambi i testi vengono normalizzati per maiuscole e minuscole Unicode, privati della punteggiatura e le sequenze di spazi risultanti vengono compattate. Il CER conta le modifiche ai caratteri; il WER quelle alle parole separate da spazi. Non sono state applicate correzioni ortografiche o confronti semantici.
Le medie pubbliche CER e WER assegnano lo stesso peso ai sette dataset. Il riepilogo completo assegna lo stesso peso ai sette dataset pubblici e ai sei gruppi Inksight Benchmark.
| Dataset | Materiale | Lingua · scrittura | Pagine | Licenza | Fonte |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | Fonte |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | Fonte |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | Fonte |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | Fonte |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | Fonte |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | Fonte |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | Fonte |
I numeri sono confronti circoscritti, non affermazioni universali su tutti i documenti.
Il tasso di errore dei caratteri conta sostituzioni, inserimenti ed eliminazioni necessari per trasformare il risultato nel riferimento. Più basso è meglio.
Gemini 3.1 Pro ha ottenuto il CER medio pubblico più basso tra le 24 configurazioni valutate. Il risultato vale solo per questo corpus e protocollo.
Il riepilogo completo include 72 pagine Inksight Benchmark raggruppate per lingua e scrittura. Le immagini e trascrizioni private non vengono pubblicate.
Sì. I file JSON e CSV includono metriche per modello e gruppo, costi normalizzati, latenza e tassi di fallimenti gravi.
Carica una foto, una scansione o un PDF e confronta la trascrizione modificabile con l’originale.
Prova Inksight gratisAbbiamo confrontato ragionamento base e alto sulle stesse 12 pagine con sei modelli, separatamente dal benchmark di 205 pagine. Nessuno ha soddisfatto i criteri per passare al ragionamento alto; tutti hanno mantenuto le impostazioni base.
| Modello | Variazione CER (pp)Più basso è meglio | Moltiplicatore di costo |
|---|---|---|
| Gemini 3 Flash preview | +13,65 | 8,16× |
| Gemini 3.1 Pro | +15,94 | 8,93× |
| Claude Sonnet 5 | +0,23 | 1,03× |
| Grok 4.5 | -2,59 | 3,15× |
| GPT-5.6 Sol | +1,75 | 2,72× |
| Qwen 3.8 Max | +2,94 | 6,27× |
Alto meno base; negativo significa migliore. I costi usano i prezzi fissati per l’esperimento. Sono i punteggi CER originali del set di sviluppo, non quelli normalizzati e limitati del benchmark principale.
Più ragionamento non ha aiutato in media in questo piccolo esperimento di sviluppo. I tassi di errore sono saliti di 5,32 punti percentuali, mentre i costi sono aumentati nettamente per la maggior parte dei modelli: un aumento medio del 404% sui sei modelli.