Benchmark de extracción de texto manuscrito

Comparamos 24 sistemas OCR en 205 páginas manuscritas, con CER y WER normalizados, fuentes, costes y metodología visibles.

Modelos
24
Páginas
205
Resultados
4920
Conjuntos públicos
7

Precisión y coste en siete conjuntos públicos.

Cada conjunto aporta el mismo peso al CER y al WER normalizados. Ambas tasas se limitan al 100 % por página antes de calcular la media; cuanto menores, mejor.

PuestoModeloCER normalizadoWER normalizadoCoste por páginaFrontera CER
1Gemini 3.1 Pro15,0 %24,8 %0,0108 US$Sí
2Gemini 3.7 Flash15,2 %26,7 %0,0040 US$Sí
3Gemini 3 Flash16,7 %26,1 %0,0034 US$Sí
4Gemini 3.8 Flash16,8 %28,9 %0,0036 US$—
5GPT-6 Astra18,0 %34,4 %0,0748 US$—
6Gemini 3.5 Flash Lite20,4 %35,6 %0,0020 US$Sí
7Claude Opus 522,1 %35,2 %0,0498 US$—
8Grok 4.525,3 %43,8 %0,0082 US$—
9Claude Sonnet 525,9 %42,9 %0,0135 US$—
10Qwen 3.8 Max27,1 %41,9 %0,0102 US$—
11Kimi K329,1 %46,7 %0,0282 US$—
12GPT-5.6 Sol35,5 %50,2 %0,0430 US$—
13Qwen 3.7 Flash37,5 %54,1 %0,00017 US$Sí
14Qwen 3.8 27B40,8 %57,8 %0,0065 US$—
15Gemma 4 26B-A4B40,8 %55,6 %Sin precio—
16GPT-5.6 Terra42,1 %57,2 %0,0338 US$—
17GPT-5.6 Luna44,7 %59,4 %0,0034 US$—
18GLM 5.3 Flash47,9 %62,2 %0,00091 US$—
19PaddleOCR-VL-1.654,0 %74,1 %Sin precio—
20LightOnOCR-256,7 %68,0 %Sin precio—
21DeepSeek V4.1 Flash58,3 %69,9 %0,0019 US$—
22GLM-OCR59,1 %73,8 %Sin precio—
23Tesseract 5.5.064,1 %93,0 %Sin precio—
24EasyOCR 1.7.268,1 %96,6 %Sin precio—

Un CER y un WER menores son mejores. Ambos ignoran mayúsculas, minúsculas y puntuación. La frontera se calcula con CER y coste.

Astra usa razonamiento low y un límite de 8192 tokens de salida, incluido el razonamiento. Su coste es el importe real facturado por OpenRouter el 11 de septiembre de 2026, incluidas escrituras de caché y reintentos técnicos. Los demás modelos API conservan sus precios congelados.

Qué se evaluó.

El informe separa siete conjuntos públicos de seis grupos del Inksight Benchmark y conserva los resultados de cada fuente por separado.

133
páginas públicas
72
páginas de Inksight Benchmark
24
configuraciones
4920
resultados registrados

Un protocolo congelado para todos los modelos.

Cada sistema recibió las mismas imágenes congeladas. Los modelos API usan el mismo prompt; los motores OCR locales, sus pipelines nativos. Los fallos persistentes cuentan como CER y WER 1,0.

Después de la limpieza simétrica, ambos lados se convierten a minúsculas Unicode, se elimina la puntuación y se compactan las secuencias de espacios resultantes. CER cuenta ediciones de caracteres y WER ediciones de palabras separadas por espacios. No se aplicó corrección ortográfica ni comparación semántica.

Las medias públicas de CER y WER dan el mismo peso a los siete conjuntos. El resumen completo da el mismo peso a los siete conjuntos públicos y a los seis grupos de Inksight Benchmark.

Fuentes públicas incluidas

ConjuntoMaterialIdioma · escrituraPáginasLicenciaFuente
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0Fuente
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0Fuente
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0Fuente
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0Fuente
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0Fuente
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0Fuente
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsFuente

Límites

  • — Los resultados solo describen las páginas, versiones y configuraciones evaluadas.
  • — Los conjuntos públicos pueden haber aparecido en datos de entrenamiento de algunos proveedores.
  • — Las páginas de Inksight Benchmark usan referencias congeladas, pero no se publican los documentos privados.
  • — El CER y el WER de una página pueden superar el 100 %; los promedios principales limitan cada tasa al 100 % por página.

Preguntas sobre el benchmark

Las cifras son comparaciones acotadas, no afirmaciones universales sobre todos los documentos.

¿Qué significa CER?

La tasa de error de caracteres cuenta las sustituciones, inserciones y eliminaciones necesarias para transformar el resultado en la referencia. Un valor menor es mejor.

¿Cuál fue el modelo más preciso en los conjuntos públicos?

Gemini 3.1 Pro obtuvo el menor CER medio público entre las 24 configuraciones evaluadas. La diferencia solo se aplica a este corpus y protocolo.

¿Incluye páginas privadas?

El resumen completo incluye 72 páginas de Inksight Benchmark agrupadas por idioma y escritura. Las imágenes y transcripciones privadas no se publican.

¿Puedo descargar los resultados?

Sí. Los archivos JSON y CSV contienen métricas por modelo y por grupo, costes normalizados, latencia y tasas de fallos graves.

Prueba tu propia escritura.

Sube una foto, un escaneo o un PDF y compara la transcripción editable con el original.

Probar Inksight gratis

¿Ayuda un mayor razonamiento?

Comparamos razonamiento base y alto en las mismas 12 páginas con seis modelos, por separado del benchmark de 205 páginas. Ninguno cumplió los criterios para cambiar a razonamiento alto; todos conservaron su configuración base.

¿Ayuda un mayor razonamiento?
ModeloCambio CER (pp)Menor es mejorMultiplicador de coste
Gemini 3 Flash preview+13,658,16×
Gemini 3.1 Pro+15,948,93×
Claude Sonnet 5+0,231,03×
Grok 4.5-2,593,15×
GPT-5.6 Sol+1,752,72×
Qwen 3.8 Max+2,946,27×

Alto menos base; negativo significa mejor. Los costes usan los precios fijados para el experimento. Son los valores CER originales del conjunto de desarrollo, no las puntuaciones normalizadas y limitadas del benchmark principal.

Un mayor razonamiento no ayudó en promedio en este pequeño experimento de desarrollo. Las tasas de error subieron 5,32 puntos porcentuales y los costes aumentaron mucho en la mayoría de los modelos: un incremento medio del 404 % entre los seis modelos.