المستوى المطلوب: متوسط — لازم تكون استخدمت Anthropic SDK قبل كده وفاهم الفرق بين system و messages، وليك خبرة بسيطة بقياس تكلفة الـ tokens.
لو بتبعت لـ Claude نفس system prompt بـ 8,000 توكن مع كل request، إنت فعلياً بتدفع تكلفة التوكنز دي 1,000 مرة في اليوم على نفس النص. Prompt Caching بيخلّيك تدفع 25% زيادة بس على أول request، وبعد كده 10% من السعر العادي على كل request لاحق لمدة 5 دقايق. التوفير على workload إنتاج حقيقي بيوصل 90% من فاتورة الإدخال.
Prompt Caching في Claude: السطر الواحد اللي بيقطع فاتورة الـ API للعشر
المشكلة باختصار
افترض إنك بتبني مساعد دعم فني يرد على أسئلة العملاء. الـ system prompt بتاعك فيه: تعليمات الشركة، 50 صفحة من الـ FAQ المختصرة، 12 مثال على الردود الجيدة. مجموع كل ده 9,200 توكن. كل سؤال عميل بيكلّفك 9,200 input + 80 توكن من السؤال نفسه + الرد. مع 5,000 سؤال يومي على Claude Sonnet 4.5، بتدفع تقريباً $138 يومياً على الـ system prompt اللي بيتكرّر بدون أي تغيير. ده $4,140 شهرياً على نص ثابت، 99% منه ضريبة بدون قيمة مضافة.
المثال البسيط: ليه الـ Cache مهم أصلاً
تخيّل إنك أمين مكتبة. كل صباح بييجي 200 طالب يسألوك على نفس الكتاب: "كتاب الجبر للصف الثالث، الفصل الرابع". إنت كل مرة بتمشي 50 متر للرف الخلفي، تجيب الكتاب، ترجع تديه للطالب. مع 200 طالب، إنت قطعت 10 كيلومتر علشان نفس المعلومة.
الحل البديهي: حط الكتاب على المكتب قدامك. أول طالب بيدفع تكلفة المشية مرة واحدة. الـ 199 الباقيين بيستلموا في ثانية.
ده بالظبط اللي Prompt Caching بيعمله. الـ system prompt الطويل = الكتاب. كل request جديد = طالب. الـ cache على سيرفر Anthropic = المكتب اللي قدامك. أول request بيدفع تكلفة "المشي" (معالجة 9,000 توكن من الصفر). الـ requests اللي بعد كده بتقرأ من cache جاهز.
التعريف العلمي بدقة
Prompt Caching هو ميزة في Anthropic API بتسمح لك بتعليم جزء من الـ prompt على إنه قابل للحفظ في ذاكرة مؤقتة على سيرفرات Anthropic. لما يوصل request جديد بنفس الـ prefix الموسوم حرفياً، السيرفر بيستخدم النسخة المعالَجة المخزّنة بدل ما يعيد الـ tokenization والـ embedding من الصفر.
التسعير الحالي على Claude Sonnet 4.5 (مايو 2026):
- Input عادي: $3.00 لكل مليون توكن.
- Cache write (أول مرة، ephemeral 5 دقايق): $3.75 لكل مليون توكن — أغلى 25%.
- Cache read (مرات متكررة): $0.30 لكل مليون توكن — أرخص 90%.
- Cache write 1-hour (TTL ساعة كاملة): $6.00 لكل مليون توكن — أغلى 100%.
الـ cache الافتراضي مدته 5 دقايق (ephemeral). كل ما توصل request جديدة بنفس الـ prefix، التايمر بيتعمله reset. ده معناه إن الـ cache فعلياً بيعيش طول ما الـ traffic مستمر.