EN
ابدأ هنا المواضيع الفِرَق المرجع المستجدّات المحفوظات
معرفة عمليّة

ما تكلفة الذكاء الاصطناعي

لماذا فاتورة الذكاء الاصطناعي لديّ بهذا الارتفاع، وكيف أخفّضها؟

الإجابة المختصرة

معظم فاتورة الذكاء الاصطناعي هي الـ context الذي ترسله، لا الإجابات التي تعود إليك — الجانب الوارد يمثّل نحو 90% من التكلفة. والعلاج هو إرسال قدر أقل — مجلد عمل أضيق، وبدء session جديدة عند تغيّر الموضوع، والاعتماد على prompt caching لما تعيد استخدامه.

هناك فاتورتان مختلفتان تختبئان خلف سؤال «كم يكلّف الذكاء الاصطناعي». الأولى هي المقعد الذي يدفعه أحدهم شهريًا — قرار شراء يُتَّخذ مرة واحدة ثم يُنسى. والثانية هي الإنفاق المبني على الاستخدام، وهو يتحرّك كل يوم بحسب طريقة عمل الناس الفعلية. والثانية هي التي تنتج الاجتماع الذي ارتفع فيه رقم ولم يغيّر أحد شيئًا.

والمفاجأة دائمًا في المكان نفسه، وهو عكس المكان الذي ينظر إليه الناس. الجزء الغالي ليس تفكير الـ model، ولا الإجابات الطويلة التي يكتبها. إنه كل ما ترسله أنت — الملفات، والتاريخ، والتعليمات الثابتة التي ترافق كل request على حدة. وهذا يعني أن سؤال التكلفة وسؤال الـ context هما السؤال نفسه بثوبين مختلفين: فالـ context المحكم المقصود أرخص وأفضل في آنٍ واحد. ونادرًا ما تضطر إلى مقايضة أحدهما بالآخر.

وهذا التأطير يفسّر أيضًا لماذا يهمّ prompt caching أكثر مما يوحي اسمه. إن كنت سترسل التعليمات الطويلة نفسها أو المستند الكبير نفسه دورًا بعد دور، فيمكن للعمل الغالي المتمثّل في قراءته أن يحدث مرة واحدة ثم يُعاد استخدامه بجزء بسيط من السعر. تجد تعريفه أدناه، وهو معظم سبب أن جلسة عمل طويلة لا تكلّف ما قد تتوقّعه قراءة ساذجة لصفحة الأسعار.

وعادتان تنجزان معظم المهمة، ولا تحتاج أيٌّ منهما إلى جدول بيانات. افتح أضيق مجلد يحوي المهمة فعلًا، بدلًا من توجيه Claude إلى قرص مشترك وتركه يخوض فيه. وابدأ محادثة جديدة حين يتغيّر الموضوع، بدلًا من ترك session واحدة تحمل ظهيرة كاملة من التاريخ غير المترابط — انظر الـ sessions لمعرفة متى تمسح ومتى تواصل. وحين تريد الرقم الحقيقي بدلًا من الإحساس، يخبرك /cost بما استهلكته الـ session الحالية.

وسؤال واحد يُدرج تحت التكلفة وهو ليس منها حقًا: هل تحتاج إلى جهاز أقوى. بالنسبة لكل مهني تقريبًا الجواب لا — فالـ model يعمل في مركز بيانات، ومهمة حاسوبك المحمول هي عرض النتيجة. والدليل أدناه يغطّي الحالات الضيّقة التي يغيّر فيها العتاد المحلي الجواب فعلًا، ولماذا تجعل حالة سوق العتاد الراهنة الحجّة لصالح السحابة أقوى لا أضعف.

المصطلحات

Prompt caching Context caching
الـ prompt caching يحفظ النسخة المعالَجة لدى الـ model من نصٍّ ترسله بشكل متكرّر — مجموعة طويلة من التعليمات، أو مستند كبير — كي لا يضطر إلى إعادة قراءته من الصفر في كل turn. الطلب التالي يعيد استخدام الجزء المخزّن في الـ cache، وهذا أسرع بكثير وأرخص بكثير، لأن الـ input المخزّن يُحاسب عليه بجزء بسيط من سعر الـ input العادي. في جلسة Claude Code طويلة، حيث يُعاد استخدام السياق نفسه turn بعد turn، يكون أحد أكبر موفّري التكلفة على الإطلاق.

قراءات أطول

كيف تفعلها

  • /cost اعرض كم من الـ tokens استهلكتها هذه الجلسة، والتكلفة حتى الآن.