الذكاء الاصطناعي والـ models
Multimodal
model يتعامل مع أكثر من مجرّد نصّ — يستطيع استقبال الصور ولقطات الشاشة وملفّات PDF والمخطّطات، وأحيانًا الصوت، كلّها في المحادثة نفسها. كلمة «Modal» تشير إلى نمط من الإدخال؛ وmultimodal تعني ببساطة أنه يفهم عدّة أنماط دفعةً واحدة، فتستطيع المزج بين صورة وسؤال بحرّية.
لماذا يهمّك
ضمن موضوع كيف يعمل الذكاء الاصطناعي فعلًا → إنه سبب قدرتك على لصق لقطة شاشة لخطأ، أو صورة للوح أبيض، أو رسم بياني، والسؤال عنها مباشرةً — دون الحاجة إلى إعادة كتابة كلّ شيء بالكلمات أولًا.