什麼是 CER?
CER 是字元錯誤率,計算把辨識結果修正為正確文字所需的替換、插入與刪除次數。數值越低越好。
以 205 頁手寫頁面比較 24 套 OCR 系統,整理正規化後的 CER 與 WER、資料來源、成本與方法。
公開資料的 CER 與 WER 平均值中,每個資料集的權重相同。計算平均前,兩項指標都先在每頁以 100% 為上限。數值越低越好。
| 排名 | 模型 | 正規化 CER | 正規化 WER | 每頁成本 | CER 效率前緣 |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15.0% | 24.8% | US$0.0108 | 是 |
| 2 | Gemini 3.7 Flash | 15.2% | 26.7% | US$0.0040 | 是 |
| 3 | Gemini 3 Flash | 16.7% | 26.1% | US$0.0034 | 是 |
| 4 | Gemini 3.8 Flash | 16.8% | 28.9% | US$0.0036 | — |
| 5 | GPT-6 Astra | 18.0% | 34.4% | US$0.0748 | — |
| 6 | Gemini 3.5 Flash Lite | 20.4% | 35.6% | US$0.0020 | 是 |
| 7 | Claude Opus 5 | 22.1% | 35.2% | US$0.0498 | — |
| 8 | Grok 4.5 | 25.3% | 43.8% | US$0.0082 | — |
| 9 | Claude Sonnet 5 | 25.9% | 42.9% | US$0.0135 | — |
| 10 | Qwen 3.8 Max | 27.1% | 41.9% | US$0.0102 | — |
| 11 | Kimi K3 | 29.1% | 46.7% | US$0.0282 | — |
| 12 | GPT-5.6 Sol | 35.5% | 50.2% | US$0.0430 | — |
| 13 | Qwen 3.7 Flash | 37.5% | 54.1% | US$0.00017 | 是 |
| 14 | Qwen 3.8 27B | 40.8% | 57.8% | US$0.0065 | — |
| 15 | Gemma 4 26B-A4B | 40.8% | 55.6% | 無價格 | — |
| 16 | GPT-5.6 Terra | 42.1% | 57.2% | US$0.0338 | — |
| 17 | GPT-5.6 Luna | 44.7% | 59.4% | US$0.0034 | — |
| 18 | GLM 5.3 Flash | 47.9% | 62.2% | US$0.00091 | — |
| 19 | PaddleOCR-VL-1.6 | 54.0% | 74.1% | 無價格 | — |
| 20 | LightOnOCR-2 | 56.7% | 68.0% | 無價格 | — |
| 21 | DeepSeek V4.1 Flash | 58.3% | 69.9% | US$0.0019 | — |
| 22 | GLM-OCR | 59.1% | 73.8% | 無價格 | — |
| 23 | Tesseract 5.5.0 | 64.1% | 93.0% | 無價格 | — |
| 24 | EasyOCR 1.7.2 | 68.1% | 96.6% | 無價格 | — |
CER 與 WER 越低越好,兩者都忽略大小寫與標點符號的差異。效率前緣依 CER 與成本計算。
Astra 以推理等級 low、含推理在內的輸出上限 8192 個 token 執行。成本為 2026 年 9 月 11 日 OpenRouter 實際收取的金額,包含快取寫入與技術性重試。其他 API 模型採用固定定價。
7 個公開資料集與 Inksight Benchmark 的 6 個資料組分開處理,並依來源分別列出結果。
每個系統都收到完全相同的圖片。API 模型使用相同的提示詞,本機 OCR 引擎則使用各自原生的處理流程。持續失敗時,CER 與 WER 都記為 1.0。
經過相同的前處理後,兩份文字都依 Unicode 規則統一大小寫、移除標點符號,並合併因此產生的連續空白。CER 以字元為單位、WER 以空白分隔的詞為單位計算編輯次數。不進行拼字校正或語意比對。
公開資料的 CER 與 WER 平均值中,7 個資料集權重相同。整體總結中,7 個公開資料集與 Inksight Benchmark 的 6 個資料組權重相同。
| 資料集 | 資料內容 | 語言 · 文字 | 頁數 | 授權 | 來源 |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | 來源 |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | 來源 |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | 來源 |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | 來源 |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | 來源 |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | 來源 |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | 來源 |
這裡的數字是範圍有限的比較,並非適用於所有文件的評價。
CER 是字元錯誤率,計算把辨識結果修正為正確文字所需的替換、插入與刪除次數。數值越低越好。
在測試的 24 種設定中,Gemini 3.1 Pro 在公開資料上的平均 CER 最低。這個結果僅限於這些資料與這套流程。
整體總結包含依語言與文字分組的 72 頁 Inksight Benchmark 頁面。圖片與文字本身不對外公開。
可以。JSON 與 CSV 收錄了各模型、各資料集的指標、基準成本、回應時間與重大失敗的發生率。
在 205 頁的評測之外,我們另外用相同的 12 頁,比較了 6 個模型在標準推理與高推理下的表現。沒有任何模型達到改用高推理的標準,因此全部維持標準設定。
| 模型 | CER 變化(百分點)越低越好 | 成本倍數 |
|---|---|---|
| Gemini 3 Flash preview | +13.65 | 8.16× |
| Gemini 3.1 Pro | +15.94 | 8.93× |
| Claude Sonnet 5 | +0.23 | 1.03× |
| Grok 4.5 | -2.59 | 3.15× |
| GPT-5.6 Sol | +1.75 | 2.72× |
| Qwen 3.8 Max | +2.94 | 6.27× |
「高推理 − 標準」的差值。負值代表改善。成本依實驗當時鎖定的定價計算。 這些是開發集上的原始 CER 值,並非本評測經正規化與上限處理後的分數。
在這個小型開發集的實驗中,提高推理強度平均而言並未提升準確率。錯誤率惡化了 5.32 個百分點,多數模型的成本大幅增加,6 個模型平均增加 404%。