手書き文字認識ベンチマーク

手書き205ページで 24 種類の OCR システムを比較し、正規化した CER・WER、データの出典、コスト、手法をまとめました。

モデル
24
ページ
205
測定結果
4,920
公開データセット
7

7つの公開データセットでの精度とコスト。

公開データの CER・WER の平均では、各データセットを同じ重みで扱っています。平均をとる前に、どちらの指標もページごとに100%で頭打ちにしています。低いほど良い数値です。

順位モデル正規化 CER正規化 WER1ページあたりのコストCER の効率フロンティア
1Gemini 3.1 Pro15.0%24.8%$0.0108該当
2Gemini 3.7 Flash15.2%26.7%$0.0040該当
3Gemini 3 Flash16.7%26.1%$0.0034該当
4Gemini 3.8 Flash16.8%28.9%$0.0036—
5GPT-6 Astra18.0%34.4%$0.0748—
6Gemini 3.5 Flash Lite20.4%35.6%$0.0020該当
7Claude Opus 522.1%35.2%$0.0498—
8Grok 4.525.3%43.8%$0.0082—
9Claude Sonnet 525.9%42.9%$0.0135—
10Qwen 3.8 Max27.1%41.9%$0.0102—
11Kimi K329.1%46.7%$0.0282—
12GPT-5.6 Sol35.5%50.2%$0.0430—
13Qwen 3.7 Flash37.5%54.1%$0.00017該当
14Qwen 3.8 27B40.8%57.8%$0.0065—
15Gemma 4 26B-A4B40.8%55.6%価格なし—
16GPT-5.6 Terra42.1%57.2%$0.0338—
17GPT-5.6 Luna44.7%59.4%$0.0034—
18GLM 5.3 Flash47.9%62.2%$0.00091—
19PaddleOCR-VL-1.654.0%74.1%価格なし—
20LightOnOCR-256.7%68.0%価格なし—
21DeepSeek V4.1 Flash58.3%69.9%$0.0019—
22GLM-OCR59.1%73.8%価格なし—
23Tesseract 5.5.064.1%93.0%価格なし—
24EasyOCR 1.7.268.1%96.6%価格なし—

CER・WER は低いほど良い数値です。どちらも大文字小文字と句読点の違いは無視します。効率フロンティアは CER とコストから求めています。

Astra は推論レベル low、推論分を含む出力上限8192トークンで実行しています。コストは2026年9月11日に OpenRouter から実際に請求された金額で、キャッシュ書き込みと技術的な再試行を含みます。他の API モデルは固定の定価を用いています。

何を測ったか。

7つの公開データセットと、Inksight Benchmark の6つのセットを分けて扱い、出典ごとに結果を示しています。

133
公開ページ
72
Inksight Benchmark のページ
24
構成
4,920
記録した結果

全モデル共通の固定プロトコル。

どのシステムにも同一の画像を渡しています。API モデルは共通のプロンプトを使い、ローカルの OCR エンジンは各自のネイティブなパイプラインを使います。恒常的に失敗した場合は CER・WER をいずれも 1.0 として計上します。

同じ前処理のあと、両方のテキストを Unicode の規則で大文字小文字をそろえ、句読点を削除し、その結果生じた連続する空白をまとめます。CER は文字単位、WER は空白で区切った語単位の編集回数を数えます。スペル補正や意味的な照合は行っていません。

公開データの CER・WER の平均は、7つのデータセットを同じ重みで扱います。全体のまとめでは、7つの公開データセットと Inksight Benchmark の6セットを同じ重みで扱います。

使用した公開データ

データセット資料言語 · 文字ページ数ライセンス出典
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0出典
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0出典
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0出典
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0出典
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0出典
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0出典
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research terms出典

この結果の限界

  • — 結果は、実際に試したページ・バージョン・設定についてのみ当てはまります。
  • — 公開データセットの一部は、提供元によっては学習データに含まれていた可能性があります。
  • — Inksight Benchmark のページは固定の正解テキストを使いますが、非公開の画像とテキストは公開していません。
  • — ページ単位の生の CER・WER は100%を超えることがあります。主要な平均値では、ページごとに100%で頭打ちにしています。

ベンチマークについてのよくある質問

ここでの数値は範囲を限った比較であり、あらゆる書類に当てはまる評価ではありません。

CER とは何ですか?

文字誤り率のことで、認識結果を正解に直すために必要な置換・挿入・削除の回数を数えたものです。低いほど良い数値です。

公開データで最も精度が高かったモデルは?

試した 24 構成の中では、Gemini 3.1 Pro が公開データの平均 CER で最も低い値でした。これはこのデータとこの手順に限った結果です。

非公開のページも含まれていますか?

全体のまとめには、言語と文字ごとにまとめた Inksight Benchmark の72ページが含まれます。画像やテキストそのものは公開していません。

結果のデータはダウンロードできますか?

はい。JSON と CSV に、モデル別・データセット別の指標、基準コスト、応答時間、大きな失敗の発生率を収録しています。

あなたの手書きで試してください。

写真・スキャン・PDF をアップロードして、編集できるテキストと元のページを見比べてみてください。

Inksight を無料で試す

推論を増やすと精度は上がるのか

205ページのベンチマークとは別に、6つのモデルで同じ12ページを使い、標準の推論と高い推論を比較しました。高い推論に切り替える基準を満たしたモデルはなく、すべて標準設定のままにしています。

推論を増やすと精度は上がるのか
モデルCER の変化(ポイント)低いほど良いコスト倍率
Gemini 3 Flash preview+13.658.16×
Gemini 3.1 Pro+15.948.93×
Claude Sonnet 5+0.231.03×
Grok 4.5-2.593.15×
GPT-5.6 Sol+1.752.72×
Qwen 3.8 Max+2.946.27×

「高い推論 − 標準」の差。マイナスは改善を意味します。コストは実験時点で固定した定価に基づきます。 これは開発セットでの元の CER 値であり、本ベンチマークの正規化・上限処理後のスコアではありません。

この小規模な開発セットでの実験では、推論を増やしても平均としては精度が上がりませんでした。誤り率は5.32ポイント悪化し、コストは多くのモデルで大きく増えて、6モデル平均で404%の増加となりました。