Benchmark di estrazione del testo manoscritto

24 sistemi OCR confrontati su 205 pagine manoscritte, con CER e WER normalizzati, fonti, costi e metodologia visibili.

Modelli
24
Pagine
205
Risultati
4920
Dataset pubblici
7

Accuratezza e costo su sette dataset pubblici.

Ogni dataset ha lo stesso peso nei CER e WER normalizzati. Entrambi i tassi sono limitati al 100% per pagina prima della media; più bassi sono meglio.

PosizioneModelloCER normalizzatoWER normalizzatoCosto per paginaFrontiera CER
1Gemini 3.1 Pro15,0%24,8%0,0108 USDSì
2Gemini 3.7 Flash15,2%26,7%0,0040 USDSì
3Gemini 3 Flash16,7%26,1%0,0034 USDSì
4Gemini 3.8 Flash16,8%28,9%0,0036 USD—
5GPT-6 Astra18,0%34,4%0,0748 USD—
6Gemini 3.5 Flash Lite20,4%35,6%0,0020 USDSì
7Claude Opus 522,1%35,2%0,0498 USD—
8Grok 4.525,3%43,8%0,0082 USD—
9Claude Sonnet 525,9%42,9%0,0135 USD—
10Qwen 3.8 Max27,1%41,9%0,0102 USD—
11Kimi K329,1%46,7%0,0282 USD—
12GPT-5.6 Sol35,5%50,2%0,0430 USD—
13Qwen 3.7 Flash37,5%54,1%0,00017 USDSì
14Qwen 3.8 27B40,8%57,8%0,0065 USD—
15Gemma 4 26B-A4B40,8%55,6%Non valutato—
16GPT-5.6 Terra42,1%57,2%0,0338 USD—
17GPT-5.6 Luna44,7%59,4%0,0034 USD—
18GLM 5.3 Flash47,9%62,2%0,00091 USD—
19PaddleOCR-VL-1.654,0%74,1%Non valutato—
20LightOnOCR-256,7%68,0%Non valutato—
21DeepSeek V4.1 Flash58,3%69,9%0,0019 USD—
22GLM-OCR59,1%73,8%Non valutato—
23Tesseract 5.5.064,1%93,0%Non valutato—
24EasyOCR 1.7.268,1%96,6%Non valutato—

CER e WER più bassi sono migliori. Entrambi ignorano maiuscole, minuscole e punteggiatura. La frontiera usa CER e costo.

Astra usa ragionamento low e un limite di 8192 token di output, ragionamento incluso. Il costo è quello effettivamente fatturato da OpenRouter l’11 settembre 2026, incluse scritture nella cache e nuovi tentativi tecnici. Gli altri modelli API mantengono i prezzi congelati.

Cosa abbiamo valutato.

Il rapporto separa sette dataset pubblici da sei gruppi Inksight Benchmark e mantiene distinti i risultati di ogni fonte.

133
pagine pubbliche
72
pagine Inksight Benchmark
24
configurazioni
4920
risultati registrati

Un protocollo congelato per tutti i modelli.

Ogni sistema ha ricevuto le stesse immagini congelate. I modelli API usano lo stesso prompt; i motori OCR locali usano pipeline native. I fallimenti persistenti contano come CER e WER 1,0.

Dopo la pulizia simmetrica, entrambi i testi vengono normalizzati per maiuscole e minuscole Unicode, privati della punteggiatura e le sequenze di spazi risultanti vengono compattate. Il CER conta le modifiche ai caratteri; il WER quelle alle parole separate da spazi. Non sono state applicate correzioni ortografiche o confronti semantici.

Le medie pubbliche CER e WER assegnano lo stesso peso ai sette dataset. Il riepilogo completo assegna lo stesso peso ai sette dataset pubblici e ai sei gruppi Inksight Benchmark.

Fonti pubbliche incluse

DatasetMaterialeLingua · scritturaPagineLicenzaFonte
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0Fonte
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0Fonte
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0Fonte
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0Fonte
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0Fonte
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0Fonte
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsFonte

Limiti

  • — I risultati descrivono solo le pagine, le versioni e le configurazioni valutate.
  • — Alcuni dataset pubblici potrebbero essere comparsi nei dati di addestramento dei fornitori.
  • — Le pagine Inksight Benchmark usano riferimenti congelati, ma i documenti privati non vengono pubblicati.
  • — CER e WER grezzi di una pagina possono superare il 100%; le medie principali limitano ogni tasso al 100% per pagina.

Domande sul benchmark

I numeri sono confronti circoscritti, non affermazioni universali su tutti i documenti.

Cosa significa CER?

Il tasso di errore dei caratteri conta sostituzioni, inserimenti ed eliminazioni necessari per trasformare il risultato nel riferimento. Più basso è meglio.

Quale modello è stato più accurato sui dataset pubblici?

Gemini 3.1 Pro ha ottenuto il CER medio pubblico più basso tra le 24 configurazioni valutate. Il risultato vale solo per questo corpus e protocollo.

Il benchmark include pagine private?

Il riepilogo completo include 72 pagine Inksight Benchmark raggruppate per lingua e scrittura. Le immagini e trascrizioni private non vengono pubblicate.

Posso scaricare i risultati?

Sì. I file JSON e CSV includono metriche per modello e gruppo, costi normalizzati, latenza e tassi di fallimenti gravi.

Prova la tua scrittura.

Carica una foto, una scansione o un PDF e confronta la trascrizione modificabile con l’originale.

Prova Inksight gratis

Ragionare di più aiuta?

Abbiamo confrontato ragionamento base e alto sulle stesse 12 pagine con sei modelli, separatamente dal benchmark di 205 pagine. Nessuno ha soddisfatto i criteri per passare al ragionamento alto; tutti hanno mantenuto le impostazioni base.

Ragionare di più aiuta?
ModelloVariazione CER (pp)Più basso è meglioMoltiplicatore di costo
Gemini 3 Flash preview+13,658,16×
Gemini 3.1 Pro+15,948,93×
Claude Sonnet 5+0,231,03×
Grok 4.5-2,593,15×
GPT-5.6 Sol+1,752,72×
Qwen 3.8 Max+2,946,27×

Alto meno base; negativo significa migliore. I costi usano i prezzi fissati per l’esperimento. Sono i punteggi CER originali del set di sviluppo, non quelli normalizzati e limitati del benchmark principale.

Più ragionamento non ha aiutato in media in questo piccolo esperimento di sviluppo. I tassi di errore sono saliti di 5,32 punti percentuali, mentre i costi sono aumentati nettamente per la maggior parte dei modelli: un aumento medio del 404% sui sei modelli.