¿Qué significa CER?
La tasa de error de caracteres cuenta las sustituciones, inserciones y eliminaciones necesarias para transformar el resultado en la referencia. Un valor menor es mejor.
Comparamos 24 sistemas OCR en 205 páginas manuscritas, con CER y WER normalizados, fuentes, costes y metodología visibles.
Cada conjunto aporta el mismo peso al CER y al WER normalizados. Ambas tasas se limitan al 100 % por página antes de calcular la media; cuanto menores, mejor.
| Puesto | Modelo | CER normalizado | WER normalizado | Coste por página | Frontera CER |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15,0 % | 24,8 % | 0,0108 US$ | Sí |
| 2 | Gemini 3.7 Flash | 15,2 % | 26,7 % | 0,0040 US$ | Sí |
| 3 | Gemini 3 Flash | 16,7 % | 26,1 % | 0,0034 US$ | Sí |
| 4 | Gemini 3.8 Flash | 16,8 % | 28,9 % | 0,0036 US$ | — |
| 5 | GPT-6 Astra | 18,0 % | 34,4 % | 0,0748 US$ | — |
| 6 | Gemini 3.5 Flash Lite | 20,4 % | 35,6 % | 0,0020 US$ | Sí |
| 7 | Claude Opus 5 | 22,1 % | 35,2 % | 0,0498 US$ | — |
| 8 | Grok 4.5 | 25,3 % | 43,8 % | 0,0082 US$ | — |
| 9 | Claude Sonnet 5 | 25,9 % | 42,9 % | 0,0135 US$ | — |
| 10 | Qwen 3.8 Max | 27,1 % | 41,9 % | 0,0102 US$ | — |
| 11 | Kimi K3 | 29,1 % | 46,7 % | 0,0282 US$ | — |
| 12 | GPT-5.6 Sol | 35,5 % | 50,2 % | 0,0430 US$ | — |
| 13 | Qwen 3.7 Flash | 37,5 % | 54,1 % | 0,00017 US$ | Sí |
| 14 | Qwen 3.8 27B | 40,8 % | 57,8 % | 0,0065 US$ | — |
| 15 | Gemma 4 26B-A4B | 40,8 % | 55,6 % | Sin precio | — |
| 16 | GPT-5.6 Terra | 42,1 % | 57,2 % | 0,0338 US$ | — |
| 17 | GPT-5.6 Luna | 44,7 % | 59,4 % | 0,0034 US$ | — |
| 18 | GLM 5.3 Flash | 47,9 % | 62,2 % | 0,00091 US$ | — |
| 19 | PaddleOCR-VL-1.6 | 54,0 % | 74,1 % | Sin precio | — |
| 20 | LightOnOCR-2 | 56,7 % | 68,0 % | Sin precio | — |
| 21 | DeepSeek V4.1 Flash | 58,3 % | 69,9 % | 0,0019 US$ | — |
| 22 | GLM-OCR | 59,1 % | 73,8 % | Sin precio | — |
| 23 | Tesseract 5.5.0 | 64,1 % | 93,0 % | Sin precio | — |
| 24 | EasyOCR 1.7.2 | 68,1 % | 96,6 % | Sin precio | — |
Un CER y un WER menores son mejores. Ambos ignoran mayúsculas, minúsculas y puntuación. La frontera se calcula con CER y coste.
Astra usa razonamiento low y un límite de 8192 tokens de salida, incluido el razonamiento. Su coste es el importe real facturado por OpenRouter el 11 de septiembre de 2026, incluidas escrituras de caché y reintentos técnicos. Los demás modelos API conservan sus precios congelados.
El informe separa siete conjuntos públicos de seis grupos del Inksight Benchmark y conserva los resultados de cada fuente por separado.
Cada sistema recibió las mismas imágenes congeladas. Los modelos API usan el mismo prompt; los motores OCR locales, sus pipelines nativos. Los fallos persistentes cuentan como CER y WER 1,0.
Después de la limpieza simétrica, ambos lados se convierten a minúsculas Unicode, se elimina la puntuación y se compactan las secuencias de espacios resultantes. CER cuenta ediciones de caracteres y WER ediciones de palabras separadas por espacios. No se aplicó corrección ortográfica ni comparación semántica.
Las medias públicas de CER y WER dan el mismo peso a los siete conjuntos. El resumen completo da el mismo peso a los siete conjuntos públicos y a los seis grupos de Inksight Benchmark.
| Conjunto | Material | Idioma · escritura | Páginas | Licencia | Fuente |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | Fuente |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | Fuente |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | Fuente |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | Fuente |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | Fuente |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | Fuente |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | Fuente |
Las cifras son comparaciones acotadas, no afirmaciones universales sobre todos los documentos.
La tasa de error de caracteres cuenta las sustituciones, inserciones y eliminaciones necesarias para transformar el resultado en la referencia. Un valor menor es mejor.
Gemini 3.1 Pro obtuvo el menor CER medio público entre las 24 configuraciones evaluadas. La diferencia solo se aplica a este corpus y protocolo.
El resumen completo incluye 72 páginas de Inksight Benchmark agrupadas por idioma y escritura. Las imágenes y transcripciones privadas no se publican.
Sí. Los archivos JSON y CSV contienen métricas por modelo y por grupo, costes normalizados, latencia y tasas de fallos graves.
Sube una foto, un escaneo o un PDF y compara la transcripción editable con el original.
Probar Inksight gratisComparamos razonamiento base y alto en las mismas 12 páginas con seis modelos, por separado del benchmark de 205 páginas. Ninguno cumplió los criterios para cambiar a razonamiento alto; todos conservaron su configuración base.
| Modelo | Cambio CER (pp)Menor es mejor | Multiplicador de coste |
|---|---|---|
| Gemini 3 Flash preview | +13,65 | 8,16× |
| Gemini 3.1 Pro | +15,94 | 8,93× |
| Claude Sonnet 5 | +0,23 | 1,03× |
| Grok 4.5 | -2,59 | 3,15× |
| GPT-5.6 Sol | +1,75 | 2,72× |
| Qwen 3.8 Max | +2,94 | 6,27× |
Alto menos base; negativo significa mejor. Los costes usan los precios fijados para el experimento. Son los valores CER originales del conjunto de desarrollo, no las puntuaciones normalizadas y limitadas del benchmark principal.
Un mayor razonamiento no ayudó en promedio en este pequeño experimento de desarrollo. Las tasas de error subieron 5,32 puntos porcentuales y los costes aumentaron mucho en la mayoría de los modelos: un incremento medio del 404 % entre los seis modelos.