مستوى المقال: محترف
لو فاتورة Qdrant + Cohere reranker + embeddings بقت $1,124 شهرياً على نظام RAG عربي بـ 6,400 مستند، انت غالباً بتدفع تمن بنية مبالغ فيها. الـ 1M token context في Claude Sonnet 4.6 و Gemini 2.5 Pro غيّر معادلة القرار، و 60% من أنظمة RAG الإنتاجية اللي شفتها في 2026 ممكن تتشال وتتحوّل لـ Long Context بتوفير 50%+ من الفاتورة.
RAG ولا Long Context: قرار معماري بيقلب اقتصاد نظامك
المشكلة باختصار
في 2023 لما الـ context window كان 8K token، RAG كان الحل الوحيد لأي شركة عندها أكتر من 50 مستند. في مايو 2026، الـ 1M token context بقى متاح في Claude Sonnet 4.6، Gemini 2.5 Pro، و GPT-5 long context tier، وده غيّر القرار بالكامل.
المشكلة دلوقتي: فرق هندسية كتيرة بتبني RAG بدافع inertia ومش لأنها فعلاً محتاجاه. النتيجة: vector DB + embedding pipeline + reranker + chunking strategy + evaluation harness لـ workload ممكن يخلص في system prompt واحد بـ 400K token مع prompt caching.
مثال للمبتدئ: مكتبة شخصية مقابل مكتبة الجامعة
تخيل عندك 200 كتاب في بيتك. لما تدور على معلومة، انت بتعرف الكتب وفي راسك أماكنها التقريبية. بتفتح 3 أو 4 كتب بسرعة وتلاقي اللي عايزه. ده Long Context: كل المعرفة قدامك دفعة واحدة، والـ "بحث" بيحصل جوا دماغك.
لو عندك 50,000 كتاب في مكتبة جامعة كاملة، مينفعش تفتح كل كتاب. لازم نظام فهرسة (Dewey Decimal)، رف محدد لكل كتاب، وموظف فهرسة بيرشدك. ده RAG: عندك مخزن خارجي وآلية retrieval، النموذج بيشوف بس النتائج اللي اترجعت.
السؤال الحقيقي مش "RAG ولا Long Context"، السؤال هو: قد إيه حجم الـ corpus بتاعك بالـ tokens، وقد إيه تردد التحديث، وقد إيه نسبة الـ queries اللي بتحتاج cross-document reasoning؟
التعريف العلمي بالظبط
RAG (Retrieval-Augmented Generation) من ورقة Lewis et al. 2020 هو نمط معماري بيقسّم الاستدلال على مرحلتين: (1) retriever بيجيب top-k passages من مخزن خارجي بناءً على similarity score بين embedding السؤال و embeddings المستندات، (2) generator بياخد الـ passages كـ context ويولّد إجابة.
Long Context هو ببساطة إن النموذج بياخد كل الـ corpus (أو جزء كبير منه) كـ input مباشر في الـ context window، بدون retrieval خارجي. الـ "retrieval" هنا بيحصل ضمن الـ attention mechanism بتاع النموذج نفسه عبر الـ tokens المرفوعة.
الافتراض المخفي في RAG: الـ relevant context أصغر بكثير من الـ corpus الكامل (عادةً < 1%). لما الافتراض ده يتكسر — corpus صغير، أو queries محتاجة 20%+ من الـ corpus لإجابة دقيقة — RAG بيبقى مجرد overhead بدون فايدة.
أرقام مقاسة على workload عربي حقيقي
قسته على نظام دعم فني لشركة Fintech عربية في فبراير 2026. الـ corpus: 6,400 مستند سياسات وإجراءات (متوسط 1,200 token لكل مستند = 7.68M token إجمالاً). 3,200 سؤال شهرياً من 14,000 عميل نشط.
- RAG (Qdrant managed + Cohere embed-multilingual-v3 + rerank-3): دقة 79.4% (مُقاسة على 400 سؤال مُقيّم بشرياً)، latency P95 = 1,840ms، تكلفة شهرية $1,124 (Qdrant $340 + embeddings $180 + reranker $284 + LLM $320).