لو نموذج الـ AI بيرجعلك إجابة غلط على مسألة حساب من ابتدائي، المشكلة مش إنه «غبي». المشكلة إنك بتسأله السؤال وتطلب الإجابة في نفس النفس. Chain of Thought بيكسر السؤال لخطوات، وبيرفع الدقة في GSM8K من 17.9% إلى 78.7% على PaLM-540B من غير ما تغيّر النموذج (Wei et al., 2022).
Chain of Thought باختصار: ليه الفكرة دي بتشتغل فعلاً
النماذج الكبيرة بتولّد كل توكن بناءً على اللي قبله. لما بتخلّيها تكتب خطوات الحل قبل الإجابة النهائية، بتديها «مساحة حسابية» داخل الـ context نفسه. كل خطوة بتبني على الخطوة اللي قبلها، فالنتيجة بتطلع أدق.
المشكلة باختصار
افرض إن عندك chatbot بيخدم محل بيع جزمة. عميل سأل: «اشتريت 3 جزم بـ 450 جنيه الواحدة، خصم 15% على المجموع، الشحن 60 جنيه، كم المجموع النهائي؟». لو بعتّ السؤال ده لـ Claude Haiku بدون توجيه، النموذج هيرمي رقم مباشرة. الرقم ده ممكن يكون صح، وممكن يكون غلط، والـ rate الإجمالي للأخطاء هنا بيوصل لـ 30-40% على الأسئلة الشبيهة قبل ما تستخدم CoT (مرجع: Anthropic prompt engineering guide).
الـ trade-off اللي بتدفعه بدون CoT: بتوفّر توكنز قليلة جدًا، بس بتخسر ثقة المستخدم لما الإجابة تطلع غلط في الفلوس.
مثال للمبتدئ: قصة الحاسبة وصاحبها
تخيّل ولد في الصف الرابع. سألته في الفصل: «3 جزم بـ 450 جنيه، خصم 15%، شحن 60، كام المجموع؟». لو طلبت منه يقول الرقم في ثانية، هيخمّن. لو قلت له: «اكتب الخطوات على ورقة الأول وبعدين قول الإجابة»، الاحتمال إنه يطلّع رقم صح بيرتفع جدًا.
النموذج اللغوي بيشتغل بنفس المنطق. الفرق إنه «بيكتب على الورقة» داخل نص الرد نفسه. Chain of Thought = اطلب منه يكتب الخطوات قبل ما يدّيك الرقم النهائي.
التعريف العلمي الدقيق
Chain of Thought Prompting هي تقنية توجيه (prompting) بتطلب من النموذج يولّد سلسلة من خطوات الاستدلال الوسيطة قبل الإجابة النهائية. الورقة الأصلية «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models» نشرها فريق Google Research (Wei et al., 2022, arXiv:2201.11903).
الورقة أثبتت إن CoT بيظهر كقدرة «emergent» في النماذج اللي حجمها فوق 100B parameter. النماذج الأصغر مش بتاخد فايدة كبيرة، أحيانًا بتاخد ضرر. الافتراض ده مهم: لو شغّال على نموذج صغير محلي (مثلاً 7B)، CoT لوحده مش هيحلّ المشكلة.
3 صيغ شائعة لـ CoT
- Zero-shot CoT: تضيف جملة زي «دعنا نفكّر خطوة بخطوة» في آخر البرومبت. أبسط صيغة، أرخص، ودقتها أقل من Few-shot.
- Few-shot CoT: تدّي النموذج 2-4 أمثلة محلولة بخطوات قبل السؤال الجديد. أعلى دقة، بس بتاكل توكنز إدخال أكتر.
- Self-consistency: تشغّل CoT 5-10 مرات بـ temperature أعلى من صفر، وتاخد الإجابة الأكثر تكرارًا. بترفع الدقة 5-15%، بس بتضرب التكلفة في عدد المحاولات.