ما معنى CER؟
يحسب معدل خطأ الأحرف الاستبدالات والإضافات والحذف اللازمة لتحويل النتيجة إلى المرجع. الأقل أفضل.
مقارنة 24 نظام OCR على 205 صفحات مكتوبة بخط اليد، مع CER وWER الموحّدين والمصادر والتكلفة والمنهجية.
تحصل كل مجموعة على الوزن نفسه في متوسطي CER وWER العامين. يُحدّ كلا المعدلين عند 100% لكل صفحة قبل حساب المتوسط؛ الأقل أفضل.
| الترتيب | النموذج | CER الموحّد | WER الموحّد | تكلفة الصفحة | حد CER الكفء |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 15.0% | 24.8% | 0.0108 US$ | نعم |
| 2 | Gemini 3.7 Flash | 15.2% | 26.7% | 0.0040 US$ | نعم |
| 3 | Gemini 3 Flash | 16.7% | 26.1% | 0.0034 US$ | نعم |
| 4 | Gemini 3.8 Flash | 16.8% | 28.9% | 0.0036 US$ | — |
| 5 | GPT-6 Astra | 18.0% | 34.4% | 0.0748 US$ | — |
| 6 | Gemini 3.5 Flash Lite | 20.4% | 35.6% | 0.0020 US$ | نعم |
| 7 | Claude Opus 5 | 22.1% | 35.2% | 0.0498 US$ | — |
| 8 | Grok 4.5 | 25.3% | 43.8% | 0.0082 US$ | — |
| 9 | Claude Sonnet 5 | 25.9% | 42.9% | 0.0135 US$ | — |
| 10 | Qwen 3.8 Max | 27.1% | 41.9% | 0.0102 US$ | — |
| 11 | Kimi K3 | 29.1% | 46.7% | 0.0282 US$ | — |
| 12 | GPT-5.6 Sol | 35.5% | 50.2% | 0.0430 US$ | — |
| 13 | Qwen 3.7 Flash | 37.5% | 54.1% | 0.00017 US$ | نعم |
| 14 | Qwen 3.8 27B | 40.8% | 57.8% | 0.0065 US$ | — |
| 15 | Gemma 4 26B-A4B | 40.8% | 55.6% | غير مسعّر | — |
| 16 | GPT-5.6 Terra | 42.1% | 57.2% | 0.0338 US$ | — |
| 17 | GPT-5.6 Luna | 44.7% | 59.4% | 0.0034 US$ | — |
| 18 | GLM 5.3 Flash | 47.9% | 62.2% | 0.00091 US$ | — |
| 19 | PaddleOCR-VL-1.6 | 54.0% | 74.1% | غير مسعّر | — |
| 20 | LightOnOCR-2 | 56.7% | 68.0% | غير مسعّر | — |
| 21 | DeepSeek V4.1 Flash | 58.3% | 69.9% | 0.0019 US$ | — |
| 22 | GLM-OCR | 59.1% | 73.8% | غير مسعّر | — |
| 23 | Tesseract 5.5.0 | 64.1% | 93.0% | غير مسعّر | — |
| 24 | EasyOCR 1.7.2 | 68.1% | 96.6% | غير مسعّر | — |
كلما انخفض CER وWER كان أفضل. يتجاهل كلاهما حالة الأحرف وعلامات الترقيم. يعتمد الحد الكفء على CER والتكلفة.
يستخدم Astra مستوى الاستدلال low وحدًا أقصى 8192 رمز إخراج يشمل الاستدلال. التكلفة هي المبلغ الفعلي الذي فوترته OpenRouter في 11 سبتمبر 2026، بما في ذلك كتابة التخزين المؤقت والمحاولات التقنية المعادة. تحتفظ نماذج API الأخرى بأسعارها الثابتة.
يفصل التقرير سبع مجموعات عامة عن ست مجموعات من Inksight Benchmark، ويعرض نتائج كل مصدر على حدة.
تلقى كل نظام الصور الثابتة نفسها. تشترك نماذج API في التعليمات نفسها وتستخدم محركات OCR المحلية مساراتها الأصلية. تُحسب الإخفاقات المستمرة بقيمتي CER وWER تساويان 1.0.
بعد التنظيف المتماثل، تُوحّد حالة الأحرف في النصين وفق Unicode، وتُحذف علامات الترقيم، وتُدمج تتابعات المسافات الناتجة. يحسب CER تعديلات الأحرف، ويحسب WER تعديلات الكلمات المفصولة بمسافات. لم نستخدم تصحيحًا إملائيًا أو مقارنة دلالية.
يعطي متوسطا CER وWER العامان الوزن نفسه للمجموعات السبع. ويعطي الملخص الكامل الوزن نفسه للمجموعات العامة السبع ومجموعات Inksight Benchmark الست.
| مجموعة البيانات | المادة | اللغة · الخط | الصفحات | الترخيص | المصدر |
|---|---|---|---|---|---|
| BN-HTRd | Modern handwritten prose | Bengali · Bengali | 18 | CC BY 4.0 | المصدر |
| ScaDS German | Modern copied prose | German · Latin | 18 | CC BY 4.0 | المصدر |
| RASAM | Historical manuscript prose | Arabic · Arabic | 18 | Apache 2.0 | المصدر |
| Pinkas | Historical community ledger | Hebrew · Hebrew | 18 | CC BY 4.0 | المصدر |
| EPARCHOS | Historical codex | Historical Greek · Greek | 18 | CC BY 4.0 | المصدر |
| POPP Census | Historical census tables | French · Latin | 18 | CC BY 4.0 | المصدر |
| IAM Handwriting | Modern handwritten copied prose | English · Latin | 25 | IAM non-commercial research terms | المصدر |
الأرقام مقارنات محددة النطاق وليست أحكامًا شاملة على كل المستندات.
يحسب معدل خطأ الأحرف الاستبدالات والإضافات والحذف اللازمة لتحويل النتيجة إلى المرجع. الأقل أفضل.
حقق Gemini 3.1 Pro أقل متوسط CER عام بين الإعدادات 24 المختبرة. تنطبق النتيجة على هذا المتن والبروتوكول فقط.
يشمل الملخص الكامل 72 صفحة من Inksight Benchmark مجمعة حسب اللغة والخط. لا ننشر الصور أو النصوص الخاصة.
نعم. تتضمن ملفات JSON وCSV مقاييس كل نموذج ومجموعة والتكلفة المعيارية وزمن الاستجابة ومعدلات الإخفاقات الكبيرة.
ارفع صورة أو مسحًا ضوئيًا أو ملف PDF وقارن النص القابل للتحرير بالأصل.
جرّب Inksight مجانًاقارنّا الاستدلال الأساسي والعالي على الصفحات الـ12 نفسها عبر ستة نماذج، بشكل منفصل عن معيار الـ205 صفحات. لم يستوفِ أي نموذج معايير الانتقال إلى الاستدلال العالي، لذا احتفظت جميعها بالإعدادات الأساسية.
| النموذج | تغيّر CER (نقطة مئوية)الأقل أفضل | مضاعف التكلفة |
|---|---|---|
| Gemini 3 Flash preview | +13.65 | 8.16× |
| Gemini 3.1 Pro | +15.94 | 8.93× |
| Claude Sonnet 5 | +0.23 | 1.03× |
| Grok 4.5 | -2.59 | 3.15× |
| GPT-5.6 Sol | +1.75 | 2.72× |
| Qwen 3.8 Max | +2.94 | 6.27× |
العالي ناقص الأساسي؛ القيمة السالبة تعني أداءً أفضل. تستخدم التكاليف الأسعار الثابتة وقت التجربة. هذه درجات CER الأصلية لمجموعة التطوير، وليست الدرجات المطَبّعة والمحدودة للمعيار الرئيسي.
لم يساعد المزيد من الاستدلال في المتوسط في هذه التجربة الصغيرة على مجموعة التطوير. ارتفعت معدلات الخطأ بمقدار 5.32 نقطة مئوية، بينما زادت التكاليف بشدة لمعظم النماذج، بمتوسط زيادة قدره 404% عبر النماذج الستة.