O que significa CER?
A taxa de erro de caracteres conta substituições, inserções e exclusões necessárias para transformar o resultado na referência. Quanto menor, melhor.
24 sistemas OCR comparados em 205 páginas manuscritas, com CER e WER normalizados, fontes, custos e metodologia visíveis.
Cada conjunto recebe o mesmo peso nos CER e WER normalizados. As duas taxas são limitadas a 100% por página antes da média; quanto menores, melhor.
| Posição | Modelo | CER normalizado | WER normalizado | Custo por página | Fronteira CER |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15,0% | 24,8% | US$ 0,0108 | Sim |
| 2 | Gemini 3.7 Flash | 15,2% | 26,7% | US$ 0,0040 | Sim |
| 3 | Gemini 3 Flash | 16,7% | 26,1% | US$ 0,0034 | Sim |
| 4 | Gemini 3.8 Flash | 16,8% | 28,9% | US$ 0,0036 | — |
| 5 | GPT-6 Astra | 18,0% | 34,4% | US$ 0,0748 | — |
| 6 | Gemini 3.5 Flash Lite | 20,4% | 35,6% | US$ 0,0020 | Sim |
| 7 | Claude Opus 5 | 22,1% | 35,2% | US$ 0,0498 | — |
| 8 | Grok 4.5 | 25,3% | 43,8% | US$ 0,0082 | — |
| 9 | Claude Sonnet 5 | 25,9% | 42,9% | US$ 0,0135 | — |
| 10 | Qwen 3.8 Max | 27,1% | 41,9% | US$ 0,0102 | — |
| 11 | Kimi K3 | 29,1% | 46,7% | US$ 0,0282 | — |
| 12 | GPT-5.6 Sol | 35,5% | 50,2% | US$ 0,0430 | — |
| 13 | Qwen 3.7 Flash | 37,5% | 54,1% | US$ 0,00017 | Sim |
| 14 | Qwen 3.8 27B | 40,8% | 57,8% | US$ 0,0065 | — |
| 15 | Gemma 4 26B-A4B | 40,8% | 55,6% | Não precificado | — |
| 16 | GPT-5.6 Terra | 42,1% | 57,2% | US$ 0,0338 | — |
| 17 | GPT-5.6 Luna | 44,7% | 59,4% | US$ 0,0034 | — |
| 18 | GLM 5.3 Flash | 47,9% | 62,2% | US$ 0,00091 | — |
| 19 | PaddleOCR-VL-1.6 | 54,0% | 74,1% | Não precificado | — |
| 20 | LightOnOCR-2 | 56,7% | 68,0% | Não precificado | — |
| 21 | DeepSeek V4.1 Flash | 58,3% | 69,9% | US$ 0,0019 | — |
| 22 | GLM-OCR | 59,1% | 73,8% | Não precificado | — |
| 23 | Tesseract 5.5.0 | 64,1% | 93,0% | Não precificado | — |
| 24 | EasyOCR 1.7.2 | 68,1% | 96,6% | Não precificado | — |
CER e WER menores são melhores. Ambos ignoram maiúsculas, minúsculas e pontuação. A fronteira usa CER e custo.
Astra usa raciocínio low e limite de 8192 tokens de saída, incluindo raciocínio. O custo é o valor realmente faturado pela OpenRouter em 11 de setembro de 2026, incluindo gravações de cache e novas tentativas técnicas. Os outros modelos API mantêm seus preços congelados.
O relatório separa sete conjuntos públicos de seis grupos do Inksight Benchmark e mantém os resultados de cada fonte.
Cada sistema recebeu as mesmas imagens congeladas. Os modelos API usam o mesmo prompt; os motores OCR locais usam seus pipelines nativos. Falhas persistentes contam como CER e WER 1,0.
Após a limpeza simétrica, os dois textos passam por normalização de maiúsculas e minúsculas Unicode, remoção de pontuação e compactação das sequências de espaços resultantes. O CER conta edições de caracteres; o WER conta edições de palavras separadas por espaços. Não houve correção ortográfica nem comparação semântica.
As médias públicas de CER e WER dão o mesmo peso aos sete conjuntos. O resumo completo dá o mesmo peso aos sete conjuntos públicos e aos seis grupos do Inksight Benchmark.
| Conjunto | Material | Idioma · escrita | Páginas | Licença | Fonte |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | Fonte |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | Fonte |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | Fonte |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | Fonte |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | Fonte |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | Fonte |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | Fonte |
Os números são comparações delimitadas, não afirmações universais sobre todos os documentos.
A taxa de erro de caracteres conta substituições, inserções e exclusões necessárias para transformar o resultado na referência. Quanto menor, melhor.
Gemini 3.1 Pro obteve o menor CER médio público entre as 24 configurações avaliadas. O resultado se aplica apenas a este corpus e protocolo.
O resumo completo inclui 72 páginas do Inksight Benchmark agrupadas por idioma e escrita. As imagens e transcrições privadas não são publicadas.
Sim. Os arquivos JSON e CSV incluem métricas por modelo e grupo, custos normalizados, latência e taxas de falhas graves.
Envie uma foto, digitalização ou PDF e compare a transcrição editável com o original.
Testar o Inksight grátisComparamos raciocínio base e alto nas mesmas 12 páginas com seis modelos, separadamente do benchmark de 205 páginas. Nenhum atendeu aos critérios para mudar para raciocínio alto; todos mantiveram a configuração base.
| Modelo | Variação CER (pp)Menor é melhor | Multiplicador de custo |
|---|---|---|
| Gemini 3 Flash preview | +13,65 | 8,16× |
| Gemini 3.1 Pro | +15,94 | 8,93× |
| Claude Sonnet 5 | +0,23 | 1,03× |
| Grok 4.5 | -2,59 | 3,15× |
| GPT-5.6 Sol | +1,75 | 2,72× |
| Qwen 3.8 Max | +2,94 | 6,27× |
Alto menos base; negativo significa melhor. Os custos usam os preços fixados para o experimento. São os valores CER originais do conjunto de desenvolvimento, não os valores normalizados e limitados do benchmark principal.
Mais raciocínio não ajudou em média neste pequeno experimento de desenvolvimento. As taxas de erro subiram 5,32 pontos percentuais, enquanto os custos aumentaram muito para a maioria dos modelos: um aumento médio de 404% entre os seis modelos.