هذا المقال يتطلب مستوى متوسط — تحتاج فهم أساسي لمعمارية Transformer، الـ feedforward layers، ومفهوم الـ inference cost. لو أنت مبتدئ تمامًا، اقرأ مقال "Embeddings للمبتدئ" قبل ده.
لو شفت سعر DeepSeek-V3 على الـ API ($0.27 لكل مليون input token) ومقارنته بـ GPT-4 Turbo ($10 لكل مليون)، الفرق 37x. ده مش هامش ربح ولا حرب أسعار. ده اختلاف معماري جوهري اسمه Mixture of Experts، وهو السبب اللي خلّى موديلات 2025-2026 تكسر معادلة "الذكاء = تكلفة عالية".
Mixture of Experts: ازاي موديل بـ 671B باراميتر يتكلف زي موديل 37B
المشكلة باختصار
الموديل الكثيف (Dense) زي Llama 3 70B بيشغّل كل الـ 70 مليار باراميتر مع كل توكن واحد. لو سؤالك "ما تاريخ ميلاد جمال عبد الناصر؟"، الموديل بيستهلك نفس الـ FLOPs اللي بيستهلكها لو سؤالك "اشرحلي ميكانيكا الكم بمعادلات لاجرانج". ده هدر هائل، وهو السبب الرئيسي إن الـ inference غالي.
المعضلة الكلاسيكية: عايز موديل ذكي (يعني باراميترات كتير) ورخيص (compute قليل وقت الـ inference). الاتنين ضد بعض في المعمارية الكثيفة. MoE بتفك الارتباط ده بالظبط.
المثال البسيط: المستشفى المتخصص
تخيّل مستشفى فيه 256 طبيب، كل واحد متخصص في حاجة محددة. لما مريض بيدخل، الاستقبال (الـ router) بيشوف الشكوى ويبعته لاتنين بس من الأطباء، اللي بالظبط مناسبين لحالته. مش معقول كل المرضى يشوفهم كل الـ 256 طبيب — ده هيكون هدر مهول.
المريض الجاي يشكي من ألم في القلب → الراوتر بيبعته لطبيب القلب وطبيب الباطنة. مريض تاني يشكي من كسر → الراوتر بيبعته لطبيب العظام وطبيب الأشعة. كل مريض بيستفيد من خبرة المستشفى الكاملة، لكن مش كل المستشفى بتشتغل عليه.
Mixture of Experts بيشتغل بنفس المنطق: عندك مجموعة "خبراء" (شبكات FFN صغيرة)، وفيه مكوّن اسمه Gating Network بياخد التوكن الجاي ويقرر يبعته لأنهي اتنين أو تلاتة من أصل 256.
التعريف العلمي الدقيق
في كل MoE layer، بدل ما يكون عندك FFN واحدة (كبيرة)، بيكون عندك N من الـ FFNs (تسمى experts، عادة 8 أو 64 أو 256). لكل توكن x، الـ router بيحسب توزيع احتمالي على الخبراء عبر softmax(W_g · x)، وبياخد الـ top-k خبراء فقط (عادة k=1 أو k=2).
الناتج النهائي = combination مرجّح للخبراء النشطين فقط. الباقي مش بيتشغّل أصلاً. ده بيعمل فصل صريح بين:
- Total parameters: حجم الموديل الكامل المخزّن في الذاكرة.
- Active parameters: اللي بيتحرّك فعلاً مع كل توكن.
DeepSeek-V3 عنده 671B إجمالي، لكن 37B بس active لكل توكن. يعني الذكاء بحجم 671B لكن التكلفة الحسابية بحجم 37B تقريبًا. ده الـ trick.