Benchmark de extração de texto manuscrito

24 sistemas OCR comparados em 205 páginas manuscritas, com CER e WER normalizados, fontes, custos e metodologia visíveis.

Modelos
24
Páginas
205
Resultados
4.920
Conjuntos públicos
7

Precisão e custo em sete conjuntos públicos.

Cada conjunto recebe o mesmo peso nos CER e WER normalizados. As duas taxas são limitadas a 100% por página antes da média; quanto menores, melhor.

PosiçãoModeloCER normalizadoWER normalizadoCusto por páginaFronteira CER
1Gemini 3.1 Pro15,0%24,8%US$ 0,0108Sim
2Gemini 3.7 Flash15,2%26,7%US$ 0,0040Sim
3Gemini 3 Flash16,7%26,1%US$ 0,0034Sim
4Gemini 3.8 Flash16,8%28,9%US$ 0,0036—
5GPT-6 Astra18,0%34,4%US$ 0,0748—
6Gemini 3.5 Flash Lite20,4%35,6%US$ 0,0020Sim
7Claude Opus 522,1%35,2%US$ 0,0498—
8Grok 4.525,3%43,8%US$ 0,0082—
9Claude Sonnet 525,9%42,9%US$ 0,0135—
10Qwen 3.8 Max27,1%41,9%US$ 0,0102—
11Kimi K329,1%46,7%US$ 0,0282—
12GPT-5.6 Sol35,5%50,2%US$ 0,0430—
13Qwen 3.7 Flash37,5%54,1%US$ 0,00017Sim
14Qwen 3.8 27B40,8%57,8%US$ 0,0065—
15Gemma 4 26B-A4B40,8%55,6%Não precificado—
16GPT-5.6 Terra42,1%57,2%US$ 0,0338—
17GPT-5.6 Luna44,7%59,4%US$ 0,0034—
18GLM 5.3 Flash47,9%62,2%US$ 0,00091—
19PaddleOCR-VL-1.654,0%74,1%Não precificado—
20LightOnOCR-256,7%68,0%Não precificado—
21DeepSeek V4.1 Flash58,3%69,9%US$ 0,0019—
22GLM-OCR59,1%73,8%Não precificado—
23Tesseract 5.5.064,1%93,0%Não precificado—
24EasyOCR 1.7.268,1%96,6%Não precificado—

CER e WER menores são melhores. Ambos ignoram maiúsculas, minúsculas e pontuação. A fronteira usa CER e custo.

Astra usa raciocínio low e limite de 8192 tokens de saída, incluindo raciocínio. O custo é o valor realmente faturado pela OpenRouter em 11 de setembro de 2026, incluindo gravações de cache e novas tentativas técnicas. Os outros modelos API mantêm seus preços congelados.

O que foi avaliado.

O relatório separa sete conjuntos públicos de seis grupos do Inksight Benchmark e mantém os resultados de cada fonte.

133
páginas públicas
72
páginas do Inksight Benchmark
24
configurações
4.920
resultados registrados

Um protocolo congelado para todos os modelos.

Cada sistema recebeu as mesmas imagens congeladas. Os modelos API usam o mesmo prompt; os motores OCR locais usam seus pipelines nativos. Falhas persistentes contam como CER e WER 1,0.

Após a limpeza simétrica, os dois textos passam por normalização de maiúsculas e minúsculas Unicode, remoção de pontuação e compactação das sequências de espaços resultantes. O CER conta edições de caracteres; o WER conta edições de palavras separadas por espaços. Não houve correção ortográfica nem comparação semântica.

As médias públicas de CER e WER dão o mesmo peso aos sete conjuntos. O resumo completo dá o mesmo peso aos sete conjuntos públicos e aos seis grupos do Inksight Benchmark.

Fontes públicas incluídas

ConjuntoMaterialIdioma · escritaPáginasLicençaFonte
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0Fonte
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0Fonte
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0Fonte
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0Fonte
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0Fonte
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0Fonte
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsFonte

Limites

  • — Os resultados descrevem somente as páginas, versões e configurações avaliadas.
  • — Alguns conjuntos públicos podem ter aparecido em dados de treinamento dos provedores.
  • — As páginas do Inksight Benchmark usam referências congeladas, mas os documentos privados não são publicados.
  • — O CER e o WER brutos de uma página podem passar de 100%; as médias principais limitam cada taxa a 100% por página.

Perguntas sobre o benchmark

Os números são comparações delimitadas, não afirmações universais sobre todos os documentos.

O que significa CER?

A taxa de erro de caracteres conta substituições, inserções e exclusões necessárias para transformar o resultado na referência. Quanto menor, melhor.

Qual modelo foi mais preciso nos conjuntos públicos?

Gemini 3.1 Pro obteve o menor CER médio público entre as 24 configurações avaliadas. O resultado se aplica apenas a este corpus e protocolo.

O benchmark inclui páginas privadas?

O resumo completo inclui 72 páginas do Inksight Benchmark agrupadas por idioma e escrita. As imagens e transcrições privadas não são publicadas.

Posso baixar os resultados?

Sim. Os arquivos JSON e CSV incluem métricas por modelo e grupo, custos normalizados, latência e taxas de falhas graves.

Teste sua própria escrita.

Envie uma foto, digitalização ou PDF e compare a transcrição editável com o original.

Testar o Inksight grátis

Mais raciocínio ajuda?

Comparamos raciocínio base e alto nas mesmas 12 páginas com seis modelos, separadamente do benchmark de 205 páginas. Nenhum atendeu aos critérios para mudar para raciocínio alto; todos mantiveram a configuração base.

Mais raciocínio ajuda?
ModeloVariação CER (pp)Menor é melhorMultiplicador de custo
Gemini 3 Flash preview+13,658,16×
Gemini 3.1 Pro+15,948,93×
Claude Sonnet 5+0,231,03×
Grok 4.5-2,593,15×
GPT-5.6 Sol+1,752,72×
Qwen 3.8 Max+2,946,27×

Alto menos base; negativo significa melhor. Os custos usam os preços fixados para o experimento. São os valores CER originais do conjunto de desenvolvimento, não os valores normalizados e limitados do benchmark principal.

Mais raciocínio não ajudou em média neste pequeno experimento de desenvolvimento. As taxas de erro subiram 5,32 pontos percentuais, enquanto os custos aumentaram muito para a maioria dos modelos: um aumento médio de 404% entre os seis modelos.