مستوى المقال: مبتدئ. المقال ده هيخلّيك تفهم ليه نفس السؤال بيرجّع إجابات مختلفة من الذكاء الاصطناعي، وإزاي تتحكم فيها برقم واحد بدل ما تسيبها للصدفة.
لو سألت ChatGPT نفس السؤال مرتين وطلعلك ردّين مختلفين، انت مش لاقي عطل. انت لقيت إعداد اسمه Temperature. لما تفهمه، هتبطّل تشتكي من "النموذج بيتغير"، وتبدأ تظبطه حسب شغلك.
إزاي الذكاء الاصطناعي بيقرر الكلمة اللي بعدها؟
المشكلة باختصار
معظم الناس فاكرة إن النموذج "بيعرف" الإجابة الصح ويكتبها. اللي بيحصل فعلاً مختلف. النموذج بيتنبأ بالكلمة التالية بس. وكل مرة بيختار من قائمة احتمالات، مش كلمة واحدة مؤكدة. الرقمين اللي بيتحكموا في الاختيار ده هما Temperature وTop-p. لو مش فاهمهم، انت بتشتغل بالبركة.
الفكرة بمثال بسيط: الشيف اللي بيختار البهار
تخيّل شيف قدامه طبق، وعايز يضيف مكوّن أخير. قدامه أطباق صغيرة: ملح (احتمال كبير إنه المناسب)، فلفل (احتمال أقل)، قرفة (احتمال صغير)، وشطة (احتمال أصغر). الشيف مش بيحطّ الملح بالضرورة كل مرة. بيرمي عملة معدّلة بتميل ناحية الاحتمالات الكبيرة.
دلوقتي فيه زرّاير في إيده:
- لو خفّض Temperature، الفروق بين الأطباق بتكبر. الملح بيبقى شبه مؤكد. الشيف بقى متحفّظ ومتوقّع.
- لو رفع Temperature، الفروق بتقلّ. القرفة والشطة بقى ليهم فرصة حقيقية. الشيف بقى مغامر وبيفاجئك.
النموذج بيعمل نفس الحكاية بالظبط، بس بدل البهار، الأطباق هي "الكلمات المرشّحة" للكلمة الجاية.
نفس الكلام بشكل علمي دقيق
في كل خطوة، النموذج بيطلّع رقم خام (logit) لكل كلمة ممكنة في القاموس. الأرقام دي بتتحوّل لاحتمالات عن طريق دالة اسمها softmax. مجموع الاحتمالات كله بيساوي 1. الكلمة اللي ليها أعلى احتمال هي الأرجح، بس مش الوحيدة.
الـ Temperature (رمزها T) بتتدخّل قبل softmax: بنقسم كل logit على T.
- T أقل من 1 (مثلاً 0.2): بيكبّر الفروق، فالتوزيع بيبقى "حادّ" والنموذج بيختار الأرجح غالبًا. نتيجة ثابتة ومتوقّعة.
- T = 1: التوزيع زيّ ما هو من غير تعديل.
- T أكبر من 1 (مثلاً 1.5): بيقرّب الاحتمالات من بعضها، فالنموذج بيجرّب كلمات أبعد. إبداع أكتر، لكن مخاطرة كلام غير منطقي بتزيد.
أما Top-p (اسمه nucleus sampling) فبيشتغل بمنطق تاني: رتّب الكلمات من الأعلى احتمالًا للأقل، وخُد أقل مجموعة مجموع احتمالها يوصل لـ p (مثلاً 0.9)، وتجاهل الباقي. يعني Top-p = 0.9 معناه "اختَر من الكلمات اللي بتغطّي 90% من الاحتمال، وارمِ الذيل الغريب".
فيه كمان Top-k: خُد أعلى k كلمة بس (مثلاً أعلى 40)، وسيب الباقي. الفرق إن Top-k رقم ثابت، وTop-p بيتأقلم حسب مدى ثقة النموذج في كل خطوة.