الذكاء الاصطناعي والـ models
Evals
Evaluations · Evaluation
الـ evals هي اختبارات قابلة للتكرار تقيس مدى جودة أداء الذكاء الاصطناعي لمهمة محدّدة — مثل unit tests، لكن لسلوك الـ model. تجمع مجموعة من المدخلات النموذجية مع إجابات معروفة الصحّة، ثم تشغّل الـ model، وتعطي درجة لمدى اقترابه منها. بها يجيب الفريق عن سؤال «هل حسّن ذلك التغيير الأمور فعلًا؟» بدلًا من التخمين من حفنة محاولات يدوية.
لماذا يهمّك
ضمن موضوع حين يخطئ الذكاء الاصطناعي → بدون evals تضبط الـ prompts والـ models بالحدس فقط؛ ومعها تستطيع أن تثبت أن تغييرًا ما قد ساعد — أو لم يساعد — قبل أن تطلقه.
انظر أيضًا