معيار استخراج النص المكتوب بخط اليد

مقارنة 24 نظام OCR على 205 صفحات مكتوبة بخط اليد، مع CER وWER الموحّدين والمصادر والتكلفة والمنهجية.

النماذج
24
الصفحات
205
النتائج
4,920
مجموعات عامة
7

الدقة والتكلفة عبر سبع مجموعات بيانات عامة.

تحصل كل مجموعة على الوزن نفسه في متوسطي CER وWER العامين. يُحدّ كلا المعدلين عند 100% لكل صفحة قبل حساب المتوسط؛ الأقل أفضل.

الترتيبالنموذجCER الموحّدWER الموحّدتكلفة الصفحةحد CER الكفء
1Gemini 3.1 Pro15.0‎%‎24.8‎%‎‏0.0108 US$نعم
2Gemini 3.7 Flash15.2‎%‎26.7‎%‎‏0.0040 US$نعم
3Gemini 3 Flash16.7‎%‎26.1‎%‎‏0.0034 US$نعم
4Gemini 3.8 Flash16.8‎%‎28.9‎%‎‏0.0036 US$—
5GPT-6 Astra18.0‎%‎34.4‎%‎‏0.0748 US$—
6Gemini 3.5 Flash Lite20.4‎%‎35.6‎%‎‏0.0020 US$نعم
7Claude Opus 522.1‎%‎35.2‎%‎‏0.0498 US$—
8Grok 4.525.3‎%‎43.8‎%‎‏0.0082 US$—
9Claude Sonnet 525.9‎%‎42.9‎%‎‏0.0135 US$—
10Qwen 3.8 Max27.1‎%‎41.9‎%‎‏0.0102 US$—
11Kimi K329.1‎%‎46.7‎%‎‏0.0282 US$—
12GPT-5.6 Sol35.5‎%‎50.2‎%‎‏0.0430 US$—
13Qwen 3.7 Flash37.5‎%‎54.1‎%‎‏0.00017 US$نعم
14Qwen 3.8 27B40.8‎%‎57.8‎%‎‏0.0065 US$—
15Gemma 4 26B-A4B40.8‎%‎55.6‎%‎غير مسعّر—
16GPT-5.6 Terra42.1‎%‎57.2‎%‎‏0.0338 US$—
17GPT-5.6 Luna44.7‎%‎59.4‎%‎‏0.0034 US$—
18GLM 5.3 Flash47.9‎%‎62.2‎%‎‏0.00091 US$—
19PaddleOCR-VL-1.654.0‎%‎74.1‎%‎غير مسعّر—
20LightOnOCR-256.7‎%‎68.0‎%‎غير مسعّر—
21DeepSeek V4.1 Flash58.3‎%‎69.9‎%‎‏0.0019 US$—
22GLM-OCR59.1‎%‎73.8‎%‎غير مسعّر—
23Tesseract 5.5.064.1‎%‎93.0‎%‎غير مسعّر—
24EasyOCR 1.7.268.1‎%‎96.6‎%‎غير مسعّر—

كلما انخفض CER وWER كان أفضل. يتجاهل كلاهما حالة الأحرف وعلامات الترقيم. يعتمد الحد الكفء على CER والتكلفة.

يستخدم Astra مستوى الاستدلال low وحدًا أقصى 8192 رمز إخراج يشمل الاستدلال. التكلفة هي المبلغ الفعلي الذي فوترته OpenRouter في 11 سبتمبر 2026، بما في ذلك كتابة التخزين المؤقت والمحاولات التقنية المعادة. تحتفظ نماذج API الأخرى بأسعارها الثابتة.

ما الذي اختبرناه.

يفصل التقرير سبع مجموعات عامة عن ست مجموعات من Inksight Benchmark، ويعرض نتائج كل مصدر على حدة.

133
صفحة عامة
72
صفحة من Inksight Benchmark
24
إعدادًا
4,920
نتيجة مسجلة

بروتوكول ثابت لجميع النماذج.

تلقى كل نظام الصور الثابتة نفسها. تشترك نماذج API في التعليمات نفسها وتستخدم محركات OCR المحلية مساراتها الأصلية. تُحسب الإخفاقات المستمرة بقيمتي CER وWER تساويان 1.0.

بعد التنظيف المتماثل، تُوحّد حالة الأحرف في النصين وفق Unicode، وتُحذف علامات الترقيم، وتُدمج تتابعات المسافات الناتجة. يحسب CER تعديلات الأحرف، ويحسب WER تعديلات الكلمات المفصولة بمسافات. لم نستخدم تصحيحًا إملائيًا أو مقارنة دلالية.

يعطي متوسطا CER وWER العامان الوزن نفسه للمجموعات السبع. ويعطي الملخص الكامل الوزن نفسه للمجموعات العامة السبع ومجموعات Inksight Benchmark الست.

المصادر العامة المشمولة

مجموعة البياناتالمادةاللغة · الخطالصفحاتالترخيصالمصدر
BN-HTRdModern handwritten proseBengali · Bengali18CC BY 4.0المصدر
ScaDS GermanModern copied proseGerman · Latin18CC BY 4.0المصدر
RASAMHistorical manuscript proseArabic · Arabic18Apache 2.0المصدر
PinkasHistorical community ledgerHebrew · Hebrew18CC BY 4.0المصدر
EPARCHOSHistorical codexHistorical Greek · Greek18CC BY 4.0المصدر
POPP CensusHistorical census tablesFrench · Latin18CC BY 4.0المصدر
IAM HandwritingModern handwritten copied proseEnglish · Latin25IAM non-commercial research termsالمصدر

الحدود

  • — تصف النتائج الصفحات والإصدارات والإعدادات المختبرة فقط.
  • — ربما ظهرت بعض المجموعات العامة في بيانات تدريب بعض المزوّدين.
  • — تستخدم صفحات Inksight Benchmark مراجع ثابتة، لكن الصور والنصوص الخاصة لا تُنشر.
  • — قد يتجاوز CER وWER الخامان للصفحة 100%؛ وتحد المتوسطات الرئيسية كل معدل عند 100% لكل صفحة.

أسئلة عن المعيار

الأرقام مقارنات محددة النطاق وليست أحكامًا شاملة على كل المستندات.

ما معنى CER؟

يحسب معدل خطأ الأحرف الاستبدالات والإضافات والحذف اللازمة لتحويل النتيجة إلى المرجع. الأقل أفضل.

أي نموذج كان الأدق في المجموعات العامة؟

حقق Gemini 3.1 Pro أقل متوسط CER عام بين الإعدادات 24 المختبرة. تنطبق النتيجة على هذا المتن والبروتوكول فقط.

هل يتضمن المعيار صفحات خاصة؟

يشمل الملخص الكامل 72 صفحة من Inksight Benchmark مجمعة حسب اللغة والخط. لا ننشر الصور أو النصوص الخاصة.

هل يمكن تنزيل النتائج؟

نعم. تتضمن ملفات JSON وCSV مقاييس كل نموذج ومجموعة والتكلفة المعيارية وزمن الاستجابة ومعدلات الإخفاقات الكبيرة.

اختبر خطك أنت.

ارفع صورة أو مسحًا ضوئيًا أو ملف PDF وقارن النص القابل للتحرير بالأصل.

جرّب Inksight مجانًا

هل يساعد المزيد من الاستدلال؟

قارنّا الاستدلال الأساسي والعالي على الصفحات الـ12 نفسها عبر ستة نماذج، بشكل منفصل عن معيار الـ205 صفحات. لم يستوفِ أي نموذج معايير الانتقال إلى الاستدلال العالي، لذا احتفظت جميعها بالإعدادات الأساسية.

هل يساعد المزيد من الاستدلال؟
النموذجتغيّر CER (نقطة مئوية)الأقل أفضلمضاعف التكلفة
Gemini 3 Flash preview+13.658.16×
Gemini 3.1 Pro+15.948.93×
Claude Sonnet 5+0.231.03×
Grok 4.5‎-2.593.15×
GPT-5.6 Sol+1.752.72×
Qwen 3.8 Max+2.946.27×

العالي ناقص الأساسي؛ القيمة السالبة تعني أداءً أفضل. تستخدم التكاليف الأسعار الثابتة وقت التجربة. هذه درجات CER الأصلية لمجموعة التطوير، وليست الدرجات المطَبّعة والمحدودة للمعيار الرئيسي.

لم يساعد المزيد من الاستدلال في المتوسط في هذه التجربة الصغيرة على مجموعة التطوير. ارتفعت معدلات الخطأ بمقدار 5.32 نقطة مئوية، بينما زادت التكاليف بشدة لمعظم النماذج، بمتوسط زيادة قدره 404% عبر النماذج الستة.