EN
ابدأ هنا المواضيع الفِرَق المرجع المستجدّات المحفوظات
الذكاء الاصطناعي والـ models

Benchmark

اختبار معياري يُستخدَم للمقارنة بين الـ models في مهارة معيّنة — برمجة، رياضيات، قراءة، استدلال — بتشغيلها جميعًا على المجموعة نفسها من الأسئلة وتقييم النتائج. إنه يحوّل سؤال «أيّ model أفضل؟» إلى رقم تصفّه جنبًا إلى جنب، وهو أمر مفيد لكنه ليس القصّة كاملةً أبدًا.
لماذا يهمّك

الـ benchmarks هي كيف تقرأ ادّعاءات «الأحدث في مجاله» بذهن صافٍ — فهي إشارة مفيدة، لكن الاختبار الحقيقي هو ما إذا كان الـ model يؤدّي جيّدًا في مهمّتك الفعلية.

ضمن موضوع حين يخطئ الذكاء الاصطناعي
انظر أيضًا

← كل المصطلحات