مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو الـ agent بتاعك بيرسل system prompt حجمه 35 KB في كل طلب، الموديل بيقراه من الصفر وبتدفع كامل التوكنز. Prompt Caching بيحفظ الجزء الثابت على سيرفر Anthropic ويعيد استخدامه بسعر 10% وزمن TTFT أقل بـ 4x. مقال للمحترف بمثال الكاشير للمبتدئ، تعريف علمي للـ KV cache، كود Python شغّال على Anthropic SDK، أرقام مقاسة من إنتاج (88% انخفاض الفاتورة)، trade-offs الـ cache invalidation، وحالات لا يستحق فيها التفعيل.
لو شغّلت Llama 3 70B على A100 80GB ولقيت السيرفر بيرفض الطلب رقم 16، الموديل مش هو اللي بياكل الذاكرة. KV Cache هو، وبيهدر 60-80% منها في تجزئة. PagedAttention في vLLM بترفع الإنتاجية 8x. مقال للمحترف بشرح علمي دقيق، كود vLLM 0.7+ شغّال، أرقام من ورقة Kwon et al. SOSP 2023.
لو تطبيقك بيبعت نفس الـ system prompt الطويل مع كل request، أنت بتدفع 100% كل مرة بلا داعي. Prompt Caching بيقطع التكلفة لـ 10% والـ time-to-first-token من 2.1 ثانية لـ 0.32. مقال للمحترف بمثال الكاشير للمبتدئ، تعريف علمي للـ KV Cache Persistence، كود Python شغّال على Anthropic SDK، أرقام مقاسة من إنتاج 18,000 طلب يومي، 4 trade-offs حقيقية، وحالات لا تستخدمه فيها أصلاً.