CER とは何ですか?
文字誤り率のことで、認識結果を正解に直すために必要な置換・挿入・削除の回数を数えたものです。低いほど良い数値です。
手書き205ページで 24 種類の OCR システムを比較し、正規化した CER・WER、データの出典、コスト、手法をまとめました。
公開データの CER・WER の平均では、各データセットを同じ重みで扱っています。平均をとる前に、どちらの指標もページごとに100%で頭打ちにしています。低いほど良い数値です。
| 順位 | モデル | 正規化 CER | 正規化 WER | 1ページあたりのコスト | CER の効率フロンティア |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15.0% | 24.8% | $0.0108 | 該当 |
| 2 | Gemini 3.7 Flash | 15.2% | 26.7% | $0.0040 | 該当 |
| 3 | Gemini 3 Flash | 16.7% | 26.1% | $0.0034 | 該当 |
| 4 | Gemini 3.8 Flash | 16.8% | 28.9% | $0.0036 | — |
| 5 | GPT-6 Astra | 18.0% | 34.4% | $0.0748 | — |
| 6 | Gemini 3.5 Flash Lite | 20.4% | 35.6% | $0.0020 | 該当 |
| 7 | Claude Opus 5 | 22.1% | 35.2% | $0.0498 | — |
| 8 | Grok 4.5 | 25.3% | 43.8% | $0.0082 | — |
| 9 | Claude Sonnet 5 | 25.9% | 42.9% | $0.0135 | — |
| 10 | Qwen 3.8 Max | 27.1% | 41.9% | $0.0102 | — |
| 11 | Kimi K3 | 29.1% | 46.7% | $0.0282 | — |
| 12 | GPT-5.6 Sol | 35.5% | 50.2% | $0.0430 | — |
| 13 | Qwen 3.7 Flash | 37.5% | 54.1% | $0.00017 | 該当 |
| 14 | Qwen 3.8 27B | 40.8% | 57.8% | $0.0065 | — |
| 15 | Gemma 4 26B-A4B | 40.8% | 55.6% | 価格なし | — |
| 16 | GPT-5.6 Terra | 42.1% | 57.2% | $0.0338 | — |
| 17 | GPT-5.6 Luna | 44.7% | 59.4% | $0.0034 | — |
| 18 | GLM 5.3 Flash | 47.9% | 62.2% | $0.00091 | — |
| 19 | PaddleOCR-VL-1.6 | 54.0% | 74.1% | 価格なし | — |
| 20 | LightOnOCR-2 | 56.7% | 68.0% | 価格なし | — |
| 21 | DeepSeek V4.1 Flash | 58.3% | 69.9% | $0.0019 | — |
| 22 | GLM-OCR | 59.1% | 73.8% | 価格なし | — |
| 23 | Tesseract 5.5.0 | 64.1% | 93.0% | 価格なし | — |
| 24 | EasyOCR 1.7.2 | 68.1% | 96.6% | 価格なし | — |
CER・WER は低いほど良い数値です。どちらも大文字小文字と句読点の違いは無視します。効率フロンティアは CER とコストから求めています。
Astra は推論レベル low、推論分を含む出力上限8192トークンで実行しています。コストは2026年9月11日に OpenRouter から実際に請求された金額で、キャッシュ書き込みと技術的な再試行を含みます。他の API モデルは固定の定価を用いています。
7つの公開データセットと、Inksight Benchmark の6つのセットを分けて扱い、出典ごとに結果を示しています。
どのシステムにも同一の画像を渡しています。API モデルは共通のプロンプトを使い、ローカルの OCR エンジンは各自のネイティブなパイプラインを使います。恒常的に失敗した場合は CER・WER をいずれも 1.0 として計上します。
同じ前処理のあと、両方のテキストを Unicode の規則で大文字小文字をそろえ、句読点を削除し、その結果生じた連続する空白をまとめます。CER は文字単位、WER は空白で区切った語単位の編集回数を数えます。スペル補正や意味的な照合は行っていません。
公開データの CER・WER の平均は、7つのデータセットを同じ重みで扱います。全体のまとめでは、7つの公開データセットと Inksight Benchmark の6セットを同じ重みで扱います。
| データセット | 資料 | 言語 · 文字 | ページ数 | ライセンス | 出典 |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | 出典 |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | 出典 |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | 出典 |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | 出典 |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | 出典 |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | 出典 |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | 出典 |
ここでの数値は範囲を限った比較であり、あらゆる書類に当てはまる評価ではありません。
文字誤り率のことで、認識結果を正解に直すために必要な置換・挿入・削除の回数を数えたものです。低いほど良い数値です。
試した 24 構成の中では、Gemini 3.1 Pro が公開データの平均 CER で最も低い値でした。これはこのデータとこの手順に限った結果です。
全体のまとめには、言語と文字ごとにまとめた Inksight Benchmark の72ページが含まれます。画像やテキストそのものは公開していません。
はい。JSON と CSV に、モデル別・データセット別の指標、基準コスト、応答時間、大きな失敗の発生率を収録しています。
205ページのベンチマークとは別に、6つのモデルで同じ12ページを使い、標準の推論と高い推論を比較しました。高い推論に切り替える基準を満たしたモデルはなく、すべて標準設定のままにしています。
| モデル | CER の変化(ポイント)低いほど良い | コスト倍率 |
|---|---|---|
| Gemini 3 Flash preview | +13.65 | 8.16× |
| Gemini 3.1 Pro | +15.94 | 8.93× |
| Claude Sonnet 5 | +0.23 | 1.03× |
| Grok 4.5 | -2.59 | 3.15× |
| GPT-5.6 Sol | +1.75 | 2.72× |
| Qwen 3.8 Max | +2.94 | 6.27× |
「高い推論 − 標準」の差。マイナスは改善を意味します。コストは実験時点で固定した定価に基づきます。 これは開発セットでの元の CER 値であり、本ベンチマークの正規化・上限処理後のスコアではありません。
この小規模な開発セットでの実験では、推論を増やしても平均としては精度が上がりませんでした。誤り率は5.32ポイント悪化し、コストは多くのモデルで大きく増えて、6モデル平均で404%の増加となりました。