أول لقاء لمعظم الناس مع هذه المشكلة يكون عبر مرجع. تسأل عن خلفية موضوع ما، فتعود إليك فقرة مرتّبة ومعها مصدر — بحث، ومؤلّف يبدو معقولًا، ودورية، وسنة. تذهب لتبحث عنه فلا تجده. لم يُنقل إلى مكان آخر، ولا هو خلف اشتراك مدفوع: هو ببساطة لم يوجد قط. ولم يكن في تلك الإجابة أي شيء يميّزها عن عشر إجابات صحيحة تلقّيتها قبل ساعة.
تلك الفجوة — بين شكل الإجابة وبين صحّتها — هي ما تدور حوله المصطلحات الأربعة أدناه، وهي سبب اجتماعها في صفحة واحدة بدل أربع. الهلوسة هي الخلل نفسه، والدليل أدناه يشرح آليته كما ينبغي. أمّا النسخة المختصرة فهي أن الأمر ليس كذبًا، وليس bug نسي أحدهم إصلاحه: الـ language model يؤلّف القطعة التالية الأكثر معقوليةً من النص، و«المعقول» يتقاطع مع «الصحيح» في معظم الأحيان لا في كلّها. ولا تملك الآلية أي وسيلة للتمييز بين الحالتين، وهذا بالضبط سبب أن طلاقة الإجابة لا تحمل أي معلومة عن دقّتها.
الـ alignment شيء مختلف يوضع عادةً في خانة القلق نفسها، والفصل بينهما يساعد. حين يرفض Claude طلبًا أو يعترض على طريقة صياغتك، فهذا ليس عطلًا في النظام — بل هو الجهد المقصود لجعل أداة شديدة القدرة تتصرّف كما ينوي الناس فعلًا. الخطأ شيء والامتناع شيء آخر، ولا علاقة لأحدهما بالآخر. والتعامل مع الرفض بوصفه bug تلتفّ حوله خطأ في التصنيف، وغالبًا إشارة إلى أن الطلب يحتاج إعادة تفكير لا إعادة صياغة.
الـ evals والـ benchmarks هما كيف يعرف أحد شيئًا من هذا بدل أن يخمّنه. الـ benchmark اختبار موحّد يشغّل عدّة models على الأسئلة نفسها، فيتحوّل سؤال «أيّها أفضل؟» إلى رقم تستطيع مقارنته — مفيد لتقرأ ادّعاءات «الأحدث في مجاله» في إعلان إطلاق بذهن صافٍ، وهو ليس القصة كاملة أبدًا، لأن عملك ليس هو الـ benchmark. أمّا الـ evals فهي الفكرة نفسها موجَّهة إلى عملك أنت: مجموعة من الأمثلة الحقيقية بإجابات معروفة الصحّة، تُقيَّم بطريقة قابلة للتكرار، فيستطيع الفريق أن يثبت أن تغييرًا ما قد ساعد فعلًا بدل ضبط الـ prompts بالحدس. وإذا كنت تعمّم هذا على مجموعة كاملة، فهذا الفارق هو الفرق بين رأي ودليل.
الخلاصة العملية أضيق ممّا يوحي به القلق. العمل الذي يحوّل فيه الـ model مادةً قدّمتها أنت — تلخيص مستند أرفقته، إعادة ترتيب ملاحظاتك، الصياغة انطلاقًا من قالبك — يحمل قدرًا ضئيلًا جدًا من هذه المخاطرة. لكن الخطر يرتفع لحظة أن تعتمد الإجابة على معرفة لم تكن ضمن ما قدّمته له: رقم بعينه، تاريخ، سعر، مرجع، اسم إعداد في أداة ما. لذا تحقّق عند المفصل الذي يكون التحقّق فيه أرخص ما يكون، وهو الحدس نفسه الذي يجعل رؤية ما غيّره Claude والتراجع عنه يستحق ثلاثين ثانية. وحين تحتاج إجابات مسنودة إلى مستندات حقيقية بدل الاستدعاء من الذاكرة، فهذا ما وُجد له الاسترجاع.
المصطلحات
- Hallucination
- حين يذكر الذكاء الاصطناعي شيئًا غير صحيح بثقة تامّة — يستشهد بـ function غير موجودة، أو يخترع ملفًا، أو يتذكّر خطأً كيفية عمل أداة ما. إنه لا يكذب؛ بل يطابق الأنماط ليصل إلى إجابة تبدو معقولة حين لا يعرف الجواب فعلًا.
- Alignment AI safety · Guardrails
- العمل على جعل سلوك الذكاء الاصطناعي متطابقًا مع ما يقصده الناس ويقدّرونه فعلًا — أن يكون مفيدًا وصادقًا، وأن يرفض الطلبات التي تسبّب ضررًا حقيقيًّا. الـ guardrails هي الحدود العملية التي تفرض ذلك في الاستخدام اليومي: القيود التي تمنع نظامًا قادرًا من إساءة الاستخدام أو الخروج عن المسار.
- Evals Evaluations · Evaluation
- الـ evals هي اختبارات قابلة للتكرار تقيس مدى جودة أداء الذكاء الاصطناعي لمهمة محدّدة — مثل unit tests، لكن لسلوك الـ model. تجمع مجموعة من المدخلات النموذجية مع إجابات معروفة الصحّة، ثم تشغّل الـ model، وتعطي درجة لمدى اقترابه منها. بها يجيب الفريق عن سؤال «هل حسّن ذلك التغيير الأمور فعلًا؟» بدلًا من التخمين من حفنة محاولات يدوية.
- Benchmark
- اختبار معياري يُستخدَم للمقارنة بين الـ models في مهارة معيّنة — برمجة، رياضيات، قراءة، استدلال — بتشغيلها جميعًا على المجموعة نفسها من الأسئلة وتقييم النتائج. إنه يحوّل سؤال «أيّ model أفضل؟» إلى رقم تصفّه جنبًا إلى جنب، وهو أمر مفيد لكنه ليس القصّة كاملةً أبدًا.