لو فاتورة الـ AI عندك بقت أعلى من فاتورة قاعدة البيانات، المشكلة مش إن الموديل غالي. المشكلة إنك بتبعت كل سؤال — البسيط والصعب — لنفس الموديل الكبير. الـ Model Cascade هو إنك تجرّب موديل رخيص الأول، ولو ما عرفش يجاوب بثقة كافية، تصعّد للموديل الكبير. الناتج العملي في تطبيقات production: توفير من 60% لـ 85% من التكلفة مع الحفاظ على 95%+ من جودة الإجابة.
Model Cascade: ابعت للرخيص الأول وصعّد لما تحتاج
المشكلة باختصار
تسعير Claude في 2026 بيشتغل على ثلاث طبقات: Haiku 4.5 بـ $1 input / $5 output لكل مليون توكن، Sonnet 4.6 بـ $3/$15، و Opus 4.7 بـ $5/$25. الفرق بين Haiku و Opus خمس مرات في كل اتجاه. لو تطبيقك بيرد على 100 ألف سؤال يومياً، 70% منهم أسئلة بسيطة (تلخيص قصير، استخراج JSON، تصنيف)، أنت بتدفع 5x زيادة على معظم الترافيك بدون داعي.
مثال للمبتدئ — مكتب الاستشارات
تخيّل مكتب استشارات قانونية فيه ثلاث موظفين: متدرب راتبه 5 آلاف، محامي متوسط راتبه 25 ألف، شريك خبير راتبه 125 ألف. لو كل سؤال — من "الميعاد النهائي للاستئناف كام يوم؟" لـ "اعمل مذكرة دفاع لقضية مُعقدة" — بيروح للشريك الخبير، المكتب هيفلس في شهر. الحل البديهي: المتدرب يرد على الأسئلة المباشرة، يحوّل اللي مش متأكد منه للمحامي المتوسط، والمحامي يحوّل النادر جداً للشريك. ده بالظبط الـ Cascade.
التعريف العلمي الدقيق
الـ Model Cascade هو نمط معماري بيشغّل سلسلة موديلات بترتيب صاعد في القدرة والتكلفة، مع بوابة ثقة (confidence gate) بين كل مرحلة. الموديل الأصغر بيجاوب الأول، وبيتبعت رده على فاحص (verifier) إما داخلي (self-eval) أو خارجي (classifier صغير). لو الثقة فوق العتبة، الجواب يرجع للمستخدم. لو تحت، الطلب يتصعّد للموديل الأكبر.
الفرق بينه وبين الـ Routing: في الـ Routing بتاخد قرار واحد قبل ما تستدعي أي موديل (مصنّف بيقول "ده سؤال صعب → Opus"). في الـ Cascade بتستدعي الرخيص فعلياً وبتقرّر بناءً على رده. الـ Routing أرخص في الـ overhead لكن أقل دقة في توزيع الترافيك. الـ Cascade أدق لكن بيدفع تكلفة المرحلة الأولى دايماً.
الأرقام: ليه الموضوع يستحق من الأساس
على بنشمارك RouteLLM المنشورة، التوجيه الذكي بيوفر حتى 85% من التكلفة مع الحفاظ على 95% من جودة GPT-4. على Amazon Bedrock الإحصائيات الرسمية بتقول 60% توفير في إعدادات production فعلية. والورقة الأكاديمية "A Unified Approach to Routing and Cascading for LLMs" من ETH Zürich بتثبت إن الـ cascade routing الموحّد بيتفوّق على كل من الطريقتين منفردتين بنسبة 5–7% في نقطة Pareto.
حساب عملي على ألف سؤال (متوسط 1K توكن دخل + 500 توكن خرج لكل سؤال):
]]>