Co oznacza CER?
Wskaźnik błędów znakowych (CER) liczy podstawienia, wstawienia i usunięcia potrzebne, by zamienić wynik we wzorcową transkrypcję. Niżej znaczy lepiej.
24 systemy OCR porównane na 205 odręcznych stronach, ze znormalizowanymi CER i WER, źródłami danych, kosztami i metodą.
W znormalizowanych średnich CER i WER każdy zbiór ma tę samą wagę. Przed uśrednieniem oba wskaźniki są ograniczane do 100% na stronę; niżej znaczy lepiej.
| Miejsce | Model | Znormalizowany CER | Znormalizowany WER | Koszt za stronę | Granica efektywności CER |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15,0% | 24,8% | 0,0108 USD | Tak |
| 2 | Gemini 3.7 Flash | 15,2% | 26,7% | 0,0040 USD | Tak |
| 3 | Gemini 3 Flash | 16,7% | 26,1% | 0,0034 USD | Tak |
| 4 | Gemini 3.8 Flash | 16,8% | 28,9% | 0,0036 USD | — |
| 5 | GPT-6 Astra | 18,0% | 34,4% | 0,0748 USD | — |
| 6 | Gemini 3.5 Flash Lite | 20,4% | 35,6% | 0,0020 USD | Tak |
| 7 | Claude Opus 5 | 22,1% | 35,2% | 0,0498 USD | — |
| 8 | Grok 4.5 | 25,3% | 43,8% | 0,0082 USD | — |
| 9 | Claude Sonnet 5 | 25,9% | 42,9% | 0,0135 USD | — |
| 10 | Qwen 3.8 Max | 27,1% | 41,9% | 0,0102 USD | — |
| 11 | Kimi K3 | 29,1% | 46,7% | 0,0282 USD | — |
| 12 | GPT-5.6 Sol | 35,5% | 50,2% | 0,0430 USD | — |
| 13 | Qwen 3.7 Flash | 37,5% | 54,1% | 0,00017 USD | Tak |
| 14 | Qwen 3.8 27B | 40,8% | 57,8% | 0,0065 USD | — |
| 15 | Gemma 4 26B-A4B | 40,8% | 55,6% | Brak ceny | — |
| 16 | GPT-5.6 Terra | 42,1% | 57,2% | 0,0338 USD | — |
| 17 | GPT-5.6 Luna | 44,7% | 59,4% | 0,0034 USD | — |
| 18 | GLM 5.3 Flash | 47,9% | 62,2% | 0,00091 USD | — |
| 19 | PaddleOCR-VL-1.6 | 54,0% | 74,1% | Brak ceny | — |
| 20 | LightOnOCR-2 | 56,7% | 68,0% | Brak ceny | — |
| 21 | DeepSeek V4.1 Flash | 58,3% | 69,9% | 0,0019 USD | — |
| 22 | GLM-OCR | 59,1% | 73,8% | Brak ceny | — |
| 23 | Tesseract 5.5.0 | 64,1% | 93,0% | Brak ceny | — |
| 24 | EasyOCR 1.7.2 | 68,1% | 96,6% | Brak ceny | — |
Niższe CER i WER są lepsze. Oba ignorują wielkość liter i interpunkcję. Granica efektywności uwzględnia CER i koszt.
Astra działa z rozumowaniem na poziomie low i limitem 8192 tokenów wyjściowych, wliczając rozumowanie. Koszt to kwota faktycznie naliczona przez OpenRouter 11 września 2026 r., wraz z zapisami do pamięci podręcznej i technicznymi ponownymi próbami. Pozostałe modele API mają zamrożone ceny katalogowe.
Raport oddziela siedem publicznych zbiorów od sześciu grup Inksight Benchmark i pokazuje wyniki osobno dla każdego źródła.
Każdy system otrzymał te same zamrożone obrazy. Modele API używają wspólnego promptu, a lokalne silniki OCR własnych natywnych potoków. Trwałe niepowodzenia liczymy jako CER i WER równe 1,0.
Po jednakowym oczyszczeniu oba teksty są sprowadzane do jednolitej wielkości liter według reguł Unicode, interpunkcja jest usuwana, a powstałe ciągi spacji są scalane. CER liczy edycje znaków, a WER edycje słów rozdzielonych spacjami. Nie stosowaliśmy korekty pisowni ani dopasowania semantycznego.
Publiczne średnie CER i WER traktują siedem zbiorów z równą wagą. Pełne podsumowanie nadaje równą wagę siedmiu publicznym zbiorom i sześciu grupom Inksight Benchmark.
| Zbiór | Materiał | Język · pismo | Strony | Licencja | Źródło |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | Źródło |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | Źródło |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | Źródło |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | Źródło |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | Źródło |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | Źródło |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | Źródło |
Te liczby to porównania o ograniczonym zakresie, a nie uniwersalne twierdzenia o wszystkich dokumentach.
Wskaźnik błędów znakowych (CER) liczy podstawienia, wstawienia i usunięcia potrzebne, by zamienić wynik we wzorcową transkrypcję. Niżej znaczy lepiej.
Spośród 24 przetestowanych konfiguracji najniższy średni publiczny CER uzyskał Gemini 3.1 Pro. Wynik dotyczy wyłącznie tego korpusu i protokołu.
Pełne podsumowanie obejmuje 72 strony Inksight Benchmark pogrupowane według języka i pisma. Prywatne obrazy i transkrypcje nie są publikowane.
Tak. Pliki JSON i CSV zawierają metryki dla każdego modelu i grupy, znormalizowane koszty, czas odpowiedzi i odsetek poważnych błędów.
Prześlij zdjęcie, skan lub PDF i porównaj edytowalną transkrypcję z oryginałem.
Wypróbuj Inksight za darmoNiezależnie od benchmarku na 205 stronach porównaliśmy standardowe i wysokie rozumowanie w 6 modelach na tych samych 12 stronach. Żaden model nie spełnił progu przejścia na wysokie rozumowanie, więc wszystkie zostały przy ustawieniach standardowych.
| Model | Zmiana CER (pkt)Niżej znaczy lepiej | Mnożnik kosztu |
|---|---|---|
| Gemini 3 Flash preview | +13,65 | 8,16× |
| Gemini 3.1 Pro | +15,94 | 8,93× |
| Claude Sonnet 5 | +0,23 | 1,03× |
| Grok 4.5 | -2,59 | 3,15× |
| GPT-5.6 Sol | +1,75 | 2,72× |
| Qwen 3.8 Max | +2,94 | 6,27× |
Różnica „wysokie − standardowe”. Wartość ujemna oznacza poprawę. Koszty oparte na cenach katalogowych ustalonych w chwili eksperymentu. To surowe wartości CER ze zbioru deweloperskiego, a nie znormalizowane i ograniczone wyniki głównego benchmarku.
W tym małym eksperymencie na zbiorze deweloperskim więcej rozumowania średnio nie poprawiło dokładności. Wskaźnik błędów pogorszył się o 5,32 pkt, a koszt w wielu modelach znacznie wzrósł — średnio o 404% w 6 modelach.