مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو تطبيقك بيبعت نفس الـ system prompt الطويل آلاف المرات يومياً لـ Claude، أنت بتدفع نفس التوكنز كل مرة من غير داعي. Prompt Caching بيخلّي Anthropic تخزّن البريفكس على سيرفرها وترجعه بـ 10% من السعر و80% أقل في زمن أول توكن. شرح للمتوسط بمثال مكتب البريد للمبتدئ، تعريف علمي لـ KV cache والـ ephemeral storage، كود Python شغّال على Anthropic SDK 0.40+، أرقام مقاسة من فاتورة 2000 request/يوم، الفرق بين 5-min و 1-hour cache، trade-offs الـ writes الزيادة والـ ordering، وحالات لا تستخدم فيها الـ caching أصلاً.
لو شغّلت Llama 3 70B على A100 80GB ولقيت السيرفر بيرفض الطلب رقم 16، الموديل مش هو اللي بياكل الذاكرة. KV Cache هو، وبيهدر 60-80% منها في تجزئة. PagedAttention في vLLM بترفع الإنتاجية 8x. مقال للمحترف بشرح علمي دقيق، كود vLLM 0.7+ شغّال، أرقام من ورقة Kwon et al. SOSP 2023.
لو تطبيقك بيبعت نفس الـ system prompt الطويل مع كل request، أنت بتدفع 100% كل مرة بلا داعي. Prompt Caching بيقطع التكلفة لـ 10% والـ time-to-first-token من 2.1 ثانية لـ 0.32. مقال للمحترف بمثال الكاشير للمبتدئ، تعريف علمي للـ KV Cache Persistence، كود Python شغّال على Anthropic SDK، أرقام مقاسة من إنتاج 18,000 طلب يومي، 4 trade-offs حقيقية، وحالات لا تستخدمه فيها أصلاً.
لو بتبعت نفس المستند الطويل لـ Claude في كل طلب، Prompt Caching بينزّل تكلفة الـ input للجزء المُكاش لـ 10% فقط ويسرّع الرد بنسبة 80% على المتوسط. مقال للمستوى المتوسط بمثال مكتب الاستقبال للمبتدئ، تعريف علمي للـ cache_control و TTL، كود Python شغّال على Anthropic SDK، أرقام مقاسة من workload 200 طلب يومي، trade-offs الذاكرة والتكلفة الأولى، وحالات لازم تطفي الـ cache فيها أصلاً.
لو سألت Claude عن سياسة شركة ورد عليك بكلام معقول لكن ما تعرفش من فين، Citations API بيخلي كل جملة معاها مصدرها الحرفي من ملفك. مقال للمبتدئ بمثال محمد طالب الثانوية، تعريف علمي للـ content blocks، كود Python شغّال على Anthropic SDK 0.40+، أرقام مقاسة من إنتاج (هلوسة من 11% إلى 0.6%)، trade-offs، ومتى لا تستخدمه.
لو حاولت تشغّل Llama 3 70B محلياً والـ GPU بتاعك 24GB، الموديل بيقولك "محتاج 140GB". Quantization بيقطع الذاكرة لـ 25% بفقدان أقل من نقطة على MMLU. مقال للمستوى المتوسط بمثال السوبرماركت للمبتدئ، تعريف علمي للـ AWQ و GPTQ، كود vLLM شغّال على RTX 4090، أرقام مقاسة من MMLU و HumanEval، trade-offs، وحالات لا تستخدم فيها الـ Quantization أصلاً.
لو موديل Llama 3.1 70B بيطلب 140GB ذاكرة وعندك GPU واحد بـ 48GB، Quantization بيقطع المتطلبات للربع — 35GB — مع خسارة دقة أقل من 1% على MMLU. مقال للمستوى المتوسط بمثال ضغط الصور للمبتدئ، تعريف علمي للـ AWQ و GPTQ، كود Python شغّال على transformers + AutoAWQ، أرقام مقاسة من ورقة AWQ 2024 و Hugging Face، trade-offs، وحالات لا تستخدم Quantization فيها أصلاً.
لو حاولت تشغّل Llama 3.1 70B لقيت إنه محتاج 140GB ذاكرة و4 كروت A100. NF4 Quantization بينزّله لـ40GB وA100 واحد بفقد 0.5% فقط في MMLU. مقال للمتوسط بمثال ضغط الصورة من 16 مليون لون لـ256، شرح علمي للـNormalFloat 4 من ورقة Tim Dettmers (NeurIPS 2023)، كود Python شغّال على bitsandbytes + transformers، أرقام مقاسة (perplexity, MMLU, tok/s)، 4 trade-offs حقيقية، وحالات لازم تتجنّب فيها NF4.
لو inference الـ Llama 3 70B بياخد 8 ثواني والمستخدم بيقفل التاب، Speculative Decoding بيقطع الزمن للنص بنفس الموديل ونفس الجودة. الفكرة: موديل صغير سريع بيخمّن، موديل كبير بيتأكد بالتوازي. مقال للمحترف بمثال الكاشير للمبتدئ، التعريف العلمي الدقيق للـ acceptance probability من ورقة DeepMind 2023، كود vLLM 0.6+ شغّال، أرقام مقاسة على H100 (24 → 71 توكن/ثانية)، trade-offs الذاكرة والـ batching، وحالات لا تستخدم فيها التقنية أصلاً.