المستوى المطلوب: متوسط — مناسب للمطور اللي بنى تكامل واحد على الأقل مع Claude API أو أي LLM، عارف يفرّق بين system prompt و user message، ومتعامل قبل كده مع `usage` object في الردود.
Prompt Caching في Claude: قلّل فاتورة الـ System Prompt 89% بسطر واحد
لو chatbot شركتك بيرسل system prompt حجمه 22,000 token مع كل سؤال، انت بتدفع $0.066 لكل طلب من جيبك بدون داعي. Prompt Caching في Claude Sonnet 4.6 بيخلّي نفس الـ prefix يتكرر بـ 10% من السعر الأصلي بعد أول مرة، وبسطر واحد إضافي في الـ payload. مفيش مكتبة جديدة، مفيش setup سيرفر، مفيش redeploy.
المشكلة باختصار
أي تطبيق فيه LLM بيشتغل على knowledge base ثابت بيدفع نفس التكلفة مرتين، عشرات المرات في اليوم. تخيّل chatbot دعم فني عربي بيشتغل على knowledge base فيه 22,000 token (دليل المنتج، سياسات الإرجاع، الأسئلة الشائعة، 12 مثال محادثة سابقة). كل سؤال جديد من العميل بيرسل نفس الـ knowledge base + السؤال الجديد.
على Claude Sonnet 4.6 بسعر $3 لكل مليون input token، الـ 22K دول بياخدوا $0.066 لكل طلب. لو عندك 1,000 طلب يومياً، التكلفة بتطلع $66 يومياً = $1,980 شهرياً، 96% منهم بتدفع تكلفة نفس النص. ده هدر مباشر، مش "تكلفة تشغيل".
مثال للتقريب: موظف الاستقبال الجديد كل دقيقة
تخيّل إنك بتفتح شركة، وكل شوية بييجي عميل جديد ومعاه نفس السؤال "إيه شروط الإرجاع؟". الموظف الكفء بيقرأ دليل السياسات مرة واحدة الصبح، بيحفظه، وبيرد على كل عميل في ثانيتين. لكن لو الموظف غبي وقاعد يقرأ الدليل من الأول مع كل سؤال، أنت بتدفع 4 دقايق ضايعة كل مرة + بتخسر العميل اللي زهق من الانتظار.
Prompt Caching بيخلّي Claude يعمل اللي عمله الموظف الكفء: بيحفظ الجزء الثابت من الـ prompt في cache سريع على الـ infrastructure بتاع Anthropic، ولما نفس النص ييجي تاني خلال 5 دقايق، Claude بيقرأه من الـ cache بـ 10% من السعر و85% أقل latency. الجزء المتغيّر بس (سؤال العميل الجديد) هو اللي بيتعامل معاه من جديد.
التعريف العلمي: إيه اللي بيحصل تحت الـ hood
Prompt Caching هو آلية بتسمح لـ Claude بحفظ جزء من الـ context window في ephemeral cache على infrastructure Anthropic. الـ cache بيُربط بـ deterministic hash للـ token sequence من بداية الـ prompt لحد آخر block فيه `cache_control`. أي request جاي بنفس الـ prefix بالظبط بيلاقي الـ KV cache (مصفوفات الـ Key و الـ Value من attention layers) جاهزة محسوبة، فبيوفّر مرحلة الـ prefill الحسابية اللي بتاخد 90% من الزمن في prompts الطويلة.
التكلفة على Sonnet 4.6 بسعر input عادي $3/M token:
- Cache write (أول مرة بس): 1.25× السعر العادي = $3.75/M لمدة 5 دقايق، أو 2× = $6/M لمدة ساعة
- Cache read (أي طلب بعد كده على نفس الـ prefix): 0.1× السعر العادي = $0.30/M token
- الحد الأدنى للـ cache: 1,024 token لـ Sonnet و Opus، 2,048 token لـ Haiku — أقل من كده الـ caching بيتجاهل بالكامل
- الـ TTL الافتراضي: 5 دقايق من آخر cache hit. كل hit بيـ reset الـ timer