لو بتستخدم Claude أو Gemini في تطبيق إنتاج، القرار اللي اتخذ الأسبوع ده هيمس حساب الـ API بتاعك خلال 6 شهور. Google أعلنت Ironwood TPU في Google Cloud Next 2026، Anthropic أكدت استهلاك حتى مليون شريحة TPU على مراحل، وMeta دخلت بصفقة تأجير متعددة المليارات. الخلاصة مش "هاجر من Nvidia"، الخلاصة بالظبط: سعر الـ inference اللي انت بتدفعه هيقع، بس مش على كل النماذج بنفس القدر.
عصر الـ Inference بدأ: Ironwood وصفقة Anthropic وإيه معناها ليك
المشكلة باختصار
لحد أبريل 2026، شرائح Nvidia من نوع H100 وB200 كانت الـ default لأي حد عايز يشغّل LLM في الإنتاج. السعر؟ حوالي 2 إلى 4 دولار للساعة الواحدة لـ H100 على بنية تحتية عامة، وأعلى من كدا بكتير لما الطلب يعلى. النتيجة إن كل تطبيق شغّال بـ API بيدفع "ضريبة Nvidia" ضمنيًا جوّه سعر التوكن. Google Ironwood غيّرت المعادلة: شريحة مصممة تحديدًا للـ inference مش للـ training، وAnthropic وقّعت على ~400 ألف شريحة في المرحلة الأولى كجزء من خطة تصل لمليون.
مثال بسيط: Inference مقابل Training
تخيّل إنك فتحت مطعم. في الأول لازم تدرّب الطباخ على الوصفات: ده بياخد شهور، تجارب كتير، ومعدّات ضخمة في المطبخ. ده بالظبط الـ training. بعد كدا الزبون بيدخل ويطلب أكل جاهز: الطباخ بيطبخ الطلب بسرعة من وصفة هو متدرّب عليها. ده الـ inference. الخطوتين شغل مختلف تمامًا: الـ training بياخد أيام أو أسابيع مرة واحدة، والـ inference بيحصل ملايين المرات في الثانية لما التطبيق شغّال.
بشكل تقني: training هو عملية تحديث أوزان النموذج (weights) عن طريق backpropagation على مليارات الأمثلة، وبتحتاج عرض ذاكرة ضخم وdouble precision أحيانًا. inference هو تمرير forward بس على أوزان ثابتة، غالبًا بدقة أقل (INT8 أو FP8)، والتحدي الأكبر هو latency والـ throughput مش الدقة العددية. علشان كدا تصميم شريحة واحدة للاتنين بيبقى compromise — Ironwood بتتخصّص في الشغل الثاني بس.
الأرقام اللي تفرق في قرارك
- سعة Anthropic الجديدة: ~3.5 جيجاواط من قدرة الحوسبة تبدأ 2027. ده رقم أكبر من استهلاك مدن صغيرة كاملة.
- حجم الصفقة المالية: Anthropic ملتزمة بعشرات المليارات، والمرحلة الأولى وحدها ~$10B على 400,000 شريحة TPUv7 Ironwood عبر Broadcom.
- الفرق في الأداء: Ironwood بتدّي 10× من TPU v5p في peak performance، و~4× تحديدًا في مهام الـ inference، مع 192GB من ذاكرة HBM3E لكل شريحة.
- الأثر المتوقّع على السعر: التقدير إن تكلفة التوكن في الـ inference هتنزل 20 إلى 40% خلال 6–12 شهر، مبني على مقارنة بموجة التخفيضات اللي حصلت لما Google نقلت Gemini على TPU v5p سنة 2024.
الافتراض هنا: Anthropic وGoogle وMeta مش هيمرروا كل التوفير على المستخدم النهائي على طول. الهامش الربحي هيتوسع الأول، وبعدين الأسعار الرسمية على Claude API وGemini API تنزل تدريجيًا تحت ضغط المنافسة.