Benchmark rozpoznawania pisma odręcznego

24 systemy OCR porównane na 205 odręcznych stronach, ze znormalizowanymi CER i WER, źródłami danych, kosztami i metodą.

Modele
24
Strony
205
Wyniki
4920
Publiczne zbiory
7

Dokładność i koszt na siedmiu publicznych zbiorach.

W znormalizowanych średnich CER i WER każdy zbiór ma tę samą wagę. Przed uśrednieniem oba wskaźniki są ograniczane do 100% na stronę; niżej znaczy lepiej.

MiejsceModelZnormalizowany CERZnormalizowany WERKoszt za stronęGranica efektywności CER
1Gemini 3.1 Pro15,0%24,8%0,0108 USDTak
2Gemini 3.7 Flash15,2%26,7%0,0040 USDTak
3Gemini 3 Flash16,7%26,1%0,0034 USDTak
4Gemini 3.8 Flash16,8%28,9%0,0036 USD—
5GPT-6 Astra18,0%34,4%0,0748 USD—
6Gemini 3.5 Flash Lite20,4%35,6%0,0020 USDTak
7Claude Opus 522,1%35,2%0,0498 USD—
8Grok 4.525,3%43,8%0,0082 USD—
9Claude Sonnet 525,9%42,9%0,0135 USD—
10Qwen 3.8 Max27,1%41,9%0,0102 USD—
11Kimi K329,1%46,7%0,0282 USD—
12GPT-5.6 Sol35,5%50,2%0,0430 USD—
13Qwen 3.7 Flash37,5%54,1%0,00017 USDTak
14Qwen 3.8 27B40,8%57,8%0,0065 USD—
15Gemma 4 26B-A4B40,8%55,6%Brak ceny—
16GPT-5.6 Terra42,1%57,2%0,0338 USD—
17GPT-5.6 Luna44,7%59,4%0,0034 USD—
18GLM 5.3 Flash47,9%62,2%0,00091 USD—
19PaddleOCR-VL-1.654,0%74,1%Brak ceny—
20LightOnOCR-256,7%68,0%Brak ceny—
21DeepSeek V4.1 Flash58,3%69,9%0,0019 USD—
22GLM-OCR59,1%73,8%Brak ceny—
23Tesseract 5.5.064,1%93,0%Brak ceny—
24EasyOCR 1.7.268,1%96,6%Brak ceny—

Niższe CER i WER są lepsze. Oba ignorują wielkość liter i interpunkcję. Granica efektywności uwzględnia CER i koszt.

Astra działa z rozumowaniem na poziomie low i limitem 8192 tokenów wyjściowych, wliczając rozumowanie. Koszt to kwota faktycznie naliczona przez OpenRouter 11 września 2026 r., wraz z zapisami do pamięci podręcznej i technicznymi ponownymi próbami. Pozostałe modele API mają zamrożone ceny katalogowe.

Co zmierzyliśmy.

Raport oddziela siedem publicznych zbiorów od sześciu grup Inksight Benchmark i pokazuje wyniki osobno dla każdego źródła.

133
stron publicznych
72
stron Inksight Benchmark
24
konfiguracji
4920
zapisanych wyników

Jeden zamrożony protokół dla wszystkich modeli.

Każdy system otrzymał te same zamrożone obrazy. Modele API używają wspólnego promptu, a lokalne silniki OCR własnych natywnych potoków. Trwałe niepowodzenia liczymy jako CER i WER równe 1,0.

Po jednakowym oczyszczeniu oba teksty są sprowadzane do jednolitej wielkości liter według reguł Unicode, interpunkcja jest usuwana, a powstałe ciągi spacji są scalane. CER liczy edycje znaków, a WER edycje słów rozdzielonych spacjami. Nie stosowaliśmy korekty pisowni ani dopasowania semantycznego.

Publiczne średnie CER i WER traktują siedem zbiorów z równą wagą. Pełne podsumowanie nadaje równą wagę siedmiu publicznym zbiorom i sześciu grupom Inksight Benchmark.

Uwzględnione źródła publiczne

ZbiórMateriałJęzyk · pismoStronyLicencjaŹródło
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0Źródło
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0Źródło
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0Źródło
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0Źródło
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0Źródło
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0Źródło
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsŹródło

Ograniczenia

  • — Wyniki opisują tylko przetestowane strony, wersje i konfiguracje.
  • — Niektóre publiczne zbiory mogły trafić do danych treningowych części dostawców.
  • — Strony Inksight Benchmark mają zamrożone transkrypcje wzorcowe, ale prywatne dokumenty nie są publikowane.
  • — Surowe CER i WER pojedynczej strony mogą przekroczyć 100%; główne średnie ograniczają każdy wskaźnik do 100% na stronę.

Pytania o benchmark

Te liczby to porównania o ograniczonym zakresie, a nie uniwersalne twierdzenia o wszystkich dokumentach.

Co oznacza CER?

Wskaźnik błędów znakowych (CER) liczy podstawienia, wstawienia i usunięcia potrzebne, by zamienić wynik we wzorcową transkrypcję. Niżej znaczy lepiej.

Który model był najdokładniejszy na publicznych zbiorach?

Spośród 24 przetestowanych konfiguracji najniższy średni publiczny CER uzyskał Gemini 3.1 Pro. Wynik dotyczy wyłącznie tego korpusu i protokołu.

Czy benchmark zawiera prywatne strony?

Pełne podsumowanie obejmuje 72 strony Inksight Benchmark pogrupowane według języka i pisma. Prywatne obrazy i transkrypcje nie są publikowane.

Czy mogę pobrać wyniki?

Tak. Pliki JSON i CSV zawierają metryki dla każdego modelu i grupy, znormalizowane koszty, czas odpowiedzi i odsetek poważnych błędów.

Sprawdź na własnym piśmie.

Prześlij zdjęcie, skan lub PDF i porównaj edytowalną transkrypcję z oryginałem.

Wypróbuj Inksight za darmo

Czy więcej rozumowania poprawia dokładność?

Niezależnie od benchmarku na 205 stronach porównaliśmy standardowe i wysokie rozumowanie w 6 modelach na tych samych 12 stronach. Żaden model nie spełnił progu przejścia na wysokie rozumowanie, więc wszystkie zostały przy ustawieniach standardowych.

Czy więcej rozumowania poprawia dokładność?
ModelZmiana CER (pkt)Niżej znaczy lepiejMnożnik kosztu
Gemini 3 Flash preview+13,658,16×
Gemini 3.1 Pro+15,948,93×
Claude Sonnet 5+0,231,03×
Grok 4.5-2,593,15×
GPT-5.6 Sol+1,752,72×
Qwen 3.8 Max+2,946,27×

Różnica „wysokie − standardowe”. Wartość ujemna oznacza poprawę. Koszty oparte na cenach katalogowych ustalonych w chwili eksperymentu. To surowe wartości CER ze zbioru deweloperskiego, a nie znormalizowane i ograniczone wyniki głównego benchmarku.

W tym małym eksperymencie na zbiorze deweloperskim więcej rozumowania średnio nie poprawiło dokładności. Wskaźnik błędów pogorszył się o 5,32 pkt, a koszt w wielu modelach znacznie wzrósł — średnio o 404% w 6 modelach.