هناك فاتورتان مختلفتان تختبئان خلف سؤال «كم يكلّف الذكاء الاصطناعي». الأولى هي المقعد الذي يدفعه أحدهم شهريًا — قرار شراء يُتَّخذ مرة واحدة ثم يُنسى. والثانية هي الإنفاق المبني على الاستخدام، وهو يتحرّك كل يوم بحسب طريقة عمل الناس الفعلية. والثانية هي التي تنتج الاجتماع الذي ارتفع فيه رقم ولم يغيّر أحد شيئًا.
والمفاجأة دائمًا في المكان نفسه، وهو عكس المكان الذي ينظر إليه الناس. الجزء الغالي ليس تفكير الـ model، ولا الإجابات الطويلة التي يكتبها. إنه كل ما ترسله أنت — الملفات، والتاريخ، والتعليمات الثابتة التي ترافق كل request على حدة. وهذا يعني أن سؤال التكلفة وسؤال الـ context هما السؤال نفسه بثوبين مختلفين: فالـ context المحكم المقصود أرخص وأفضل في آنٍ واحد. ونادرًا ما تضطر إلى مقايضة أحدهما بالآخر.
وهذا التأطير يفسّر أيضًا لماذا يهمّ prompt caching أكثر مما يوحي اسمه. إن كنت سترسل التعليمات الطويلة نفسها أو المستند الكبير نفسه دورًا بعد دور، فيمكن للعمل الغالي المتمثّل في قراءته أن يحدث مرة واحدة ثم يُعاد استخدامه بجزء بسيط من السعر. تجد تعريفه أدناه، وهو معظم سبب أن جلسة عمل طويلة لا تكلّف ما قد تتوقّعه قراءة ساذجة لصفحة الأسعار.
وعادتان تنجزان معظم المهمة، ولا تحتاج أيٌّ منهما إلى جدول بيانات. افتح أضيق مجلد يحوي المهمة فعلًا، بدلًا من توجيه Claude إلى قرص مشترك وتركه يخوض فيه. وابدأ محادثة جديدة حين يتغيّر الموضوع، بدلًا من ترك session واحدة تحمل ظهيرة كاملة من التاريخ غير المترابط — انظر الـ sessions لمعرفة متى تمسح ومتى تواصل. وحين تريد الرقم الحقيقي بدلًا من الإحساس، يخبرك /cost بما استهلكته الـ session الحالية.
وسؤال واحد يُدرج تحت التكلفة وهو ليس منها حقًا: هل تحتاج إلى جهاز أقوى. بالنسبة لكل مهني تقريبًا الجواب لا — فالـ model يعمل في مركز بيانات، ومهمة حاسوبك المحمول هي عرض النتيجة. والدليل أدناه يغطّي الحالات الضيّقة التي يغيّر فيها العتاد المحلي الجواب فعلًا، ولماذا تجعل حالة سوق العتاد الراهنة الحجّة لصالح السحابة أقوى لا أضعف.
المصطلحات
- Prompt caching Context caching
- الـ prompt caching يحفظ النسخة المعالَجة لدى الـ model من نصٍّ ترسله بشكل متكرّر — مجموعة طويلة من التعليمات، أو مستند كبير — كي لا يضطر إلى إعادة قراءته من الصفر في كل turn. الطلب التالي يعيد استخدام الجزء المخزّن في الـ cache، وهذا أسرع بكثير وأرخص بكثير، لأن الـ input المخزّن يُحاسب عليه بجزء بسيط من سعر الـ input العادي. في جلسة Claude Code طويلة، حيث يُعاد استخدام السياق نفسه turn بعد turn، يكون أحد أكبر موفّري التكلفة على الإطلاق.
قراءات أطول
- أين تذهب نفقات الـ AI فعلًا — وكيف تخفّضها حين تقفز فاتورة الـ AI، تكون الغريزة لوم النموذج أو تقصير الإجابات. وكلاهما يُخطئ المحرّك الحقيقي: ما الذي تُدخِله. إليك لماذا يهيمن الـ input على التكلفة، وما الذي يحرّك الرقم فعلًا. 9 دقائق
- هل تحتاج إلى جهاز قوي لاستخدام الذكاء الاصطناعي في 2026؟ نقص عالمي في الذاكرة يدفع أسعار الأجهزة المحمولة الراقية إلى الأعلى بحدّة، وتغذّي الشائعات موجة شراء متعجّلة. قبل أن تنفق، يجدر بك أن تفصل بين سؤالين مختلفين تمامًا — تشغيل الذكاء الاصطناعي محليًا مقابل مجرّد استخدامه — لأن إجابة السؤال الذي يهمّ معظم الناس رخيصة على نحو مريح. 9 min
- خطط Claude وحدود الاستخدام: ما الذي تدفع ثمنه فعلًا لا أحد يبلغ حدّ الاستخدام لأنه اختار الخطة الخطأ. بل يبلغه لأنه لم يعرف أن الحدّ مشترك، أو ما الذي كان يستهلكه بهدوء. 10 دقائق
كيف تفعلها
-
/costاعرض كم من الـ tokens استهلكتها هذه الجلسة، والتكلفة حتى الآن.