手寫辨識評測

以 205 頁手寫頁面比較 24 套 OCR 系統,整理正規化後的 CER 與 WER、資料來源、成本與方法。

模型
24
頁
205
測量結果
4,920
公開資料集
7

7 個公開資料集上的準確率與成本。

公開資料的 CER 與 WER 平均值中,每個資料集的權重相同。計算平均前,兩項指標都先在每頁以 100% 為上限。數值越低越好。

排名模型正規化 CER正規化 WER每頁成本CER 效率前緣
1Gemini 3.1 Pro15.0%24.8%US$0.0108是
2Gemini 3.7 Flash15.2%26.7%US$0.0040是
3Gemini 3 Flash16.7%26.1%US$0.0034是
4Gemini 3.8 Flash16.8%28.9%US$0.0036—
5GPT-6 Astra18.0%34.4%US$0.0748—
6Gemini 3.5 Flash Lite20.4%35.6%US$0.0020是
7Claude Opus 522.1%35.2%US$0.0498—
8Grok 4.525.3%43.8%US$0.0082—
9Claude Sonnet 525.9%42.9%US$0.0135—
10Qwen 3.8 Max27.1%41.9%US$0.0102—
11Kimi K329.1%46.7%US$0.0282—
12GPT-5.6 Sol35.5%50.2%US$0.0430—
13Qwen 3.7 Flash37.5%54.1%US$0.00017是
14Qwen 3.8 27B40.8%57.8%US$0.0065—
15Gemma 4 26B-A4B40.8%55.6%無價格—
16GPT-5.6 Terra42.1%57.2%US$0.0338—
17GPT-5.6 Luna44.7%59.4%US$0.0034—
18GLM 5.3 Flash47.9%62.2%US$0.00091—
19PaddleOCR-VL-1.654.0%74.1%無價格—
20LightOnOCR-256.7%68.0%無價格—
21DeepSeek V4.1 Flash58.3%69.9%US$0.0019—
22GLM-OCR59.1%73.8%無價格—
23Tesseract 5.5.064.1%93.0%無價格—
24EasyOCR 1.7.268.1%96.6%無價格—

CER 與 WER 越低越好,兩者都忽略大小寫與標點符號的差異。效率前緣依 CER 與成本計算。

Astra 以推理等級 low、含推理在內的輸出上限 8192 個 token 執行。成本為 2026 年 9 月 11 日 OpenRouter 實際收取的金額,包含快取寫入與技術性重試。其他 API 模型採用固定定價。

我們測量了什麼。

7 個公開資料集與 Inksight Benchmark 的 6 個資料組分開處理,並依來源分別列出結果。

133
公開頁面
72
Inksight Benchmark 頁面
24
設定組合
4,920
記錄的結果

所有模型共用的固定流程。

每個系統都收到完全相同的圖片。API 模型使用相同的提示詞,本機 OCR 引擎則使用各自原生的處理流程。持續失敗時,CER 與 WER 都記為 1.0。

經過相同的前處理後,兩份文字都依 Unicode 規則統一大小寫、移除標點符號,並合併因此產生的連續空白。CER 以字元為單位、WER 以空白分隔的詞為單位計算編輯次數。不進行拼字校正或語意比對。

公開資料的 CER 與 WER 平均值中,7 個資料集權重相同。整體總結中,7 個公開資料集與 Inksight Benchmark 的 6 個資料組權重相同。

使用的公開資料

資料集資料內容語言 · 文字頁數授權來源
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0來源
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0來源
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0來源
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0來源
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0來源
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0來源
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research terms來源

這些結果的限制

  • — 結果只適用於實際測試過的頁面、版本與設定。
  • — 部分公開資料集可能已被某些供應商納入訓練資料。
  • — Inksight Benchmark 的頁面使用固定的正確文字,但非公開的圖片與文字不對外公開。
  • — 每頁的原始 CER 與 WER 可能超過 100%。主要平均值在每頁以 100% 為上限。

關於評測的常見問題

這裡的數字是範圍有限的比較,並非適用於所有文件的評價。

什麼是 CER?

CER 是字元錯誤率,計算把辨識結果修正為正確文字所需的替換、插入與刪除次數。數值越低越好。

在公開資料上最準確的模型是哪一個?

在測試的 24 種設定中,Gemini 3.1 Pro 在公開資料上的平均 CER 最低。這個結果僅限於這些資料與這套流程。

也包含非公開的頁面嗎?

整體總結包含依語言與文字分組的 72 頁 Inksight Benchmark 頁面。圖片與文字本身不對外公開。

可以下載結果資料嗎?

可以。JSON 與 CSV 收錄了各模型、各資料集的指標、基準成本、回應時間與重大失敗的發生率。

用您自己的手寫字試試看。

上傳照片、掃描檔或 PDF,把可編輯的文字和原始頁面對照看看。

免費試用 Inksight

提高推理強度能提升準確率嗎?

在 205 頁的評測之外,我們另外用相同的 12 頁,比較了 6 個模型在標準推理與高推理下的表現。沒有任何模型達到改用高推理的標準,因此全部維持標準設定。

提高推理強度能提升準確率嗎?
模型CER 變化(百分點)越低越好成本倍數
Gemini 3 Flash preview+13.658.16×
Gemini 3.1 Pro+15.948.93×
Claude Sonnet 5+0.231.03×
Grok 4.5-2.593.15×
GPT-5.6 Sol+1.752.72×
Qwen 3.8 Max+2.946.27×

「高推理 − 標準」的差值。負值代表改善。成本依實驗當時鎖定的定價計算。 這些是開發集上的原始 CER 值,並非本評測經正規化與上限處理後的分數。

在這個小型開發集的實驗中,提高推理強度平均而言並未提升準確率。錯誤率惡化了 5.32 個百分點,多數模型的成本大幅增加,6 個模型平均增加 404%。