الرئيسيةمن أناالدوراتالمدونةسوق الأوامرالمناهج والباقاتالشركاء

دورات عربية متخصصة في التقنية والبرمجة والذكاء الاصطناعي.

المنصة مبنية على الوضوح، التطبيق، والنتيجة النافعة: شرح مرتب يساعدك تفهم الأدوات، تكتب كودًا أفضل، وتستخدم الذكاء الاصطناعي بوعي داخل العمل الحقيقي.

المنصة

  • الرئيسية
  • من أنا
  • الدورات
  • المناهج والباقات
  • سوق الأوامر
  • المدونة

الدعم

  • الأسئلة الشائعة
  • تواصل معنا
  • سياسة الخصوصية
  • شروط استخدام التطبيق
  • سياسة الاسترجاع

© 2026 أحمد حايس. جميع الحقوق محفوظة.

الرئيسيةالدوراتالمناهجالمدونةالدخول
الذكاء الاصطناعي

RLHF للمبتدئين: إزاي اتعلّم ChatGPT يبقى مؤدب ومفيد بدل ما يقول أي كلام

مبتدئ26 يوليو 20265 دقائق قراءة
RLHF للمبتدئين: إزاي اتعلّم ChatGPT يبقى مؤدب ومفيد بدل ما يقول أي كلام

المستوى المطلوب: مبتدئ. كل اللي محتاجه إنك تكون جرّبت ChatGPT أو Claude مرة واحدة. مفيش رياضيات ثقيلة، والكود في الآخر اختياري تمامًا.

بعد المقال ده هتعرف بالظبط إزاي نموذج زي ChatGPT اتحوّل من آلة بتكمّل كلام على النت لمساعد بيرد عليك بأدب، بيرفض يأذيك، وبيحاول يفيدك فعلاً. الاسم العلمي للحكاية دي هو RLHF، يعني "التعلّم المعزّز من ملاحظات البشر".

المشكلة باختصار

نموذج اللغة الخام اتدرّب على حاجة واحدة بس: توقّع الكلمة التالية في نصوص الإنترنت. مفيهوش أي فكرة عن معنى "مفيد" أو "مؤدب" أو "آمن". لو سألته سؤال، ممكن يرد بكلام سام، أو معلومة مخترعة، أو يكمّل سؤالك بأسئلة تانية بدل ما يجاوب. كل المساعدين اللي بتستخدمهم النهاردة اتظبطوا بـ RLHF علشان يتصرّفوا صح، فلو بتتعامل مع أي منتج AI، انت بتلمس نتيجة RLHF كل يوم.

الفكرة الأول بمثال بسيط

تخيّل معاك طبّاخ جديد موهوب جدًا. حافظ ألف وصفة ويعرف يطبخ أي حاجة، بس مش عارف ذوق زباين المطعم. كل يوم بيطلّع طبقين من نفس الأكلة، والزبون بيدوق ويقول: "الطبق ده أحسن من ده". الطبّاخ مش بيتعلّم وصفة جديدة، هو بيتعلّم يميل ناحية اللي الناس بتفضّله. بعد آلاف التذوّقات، بقى بيطبخ على طول الأكل اللي الزباين بتحبه.

RLHF بيشتغل بنفس المنطق بالظبط. النموذج بيقترح ردّين على نفس السؤال، وبشر بيقولوا "الرد ده أحسن"، والنموذج يعدّل نفسه علشان يقرّب من الردود اللي البشر بيفضّلوها. مفيش حد بيكتب للنموذج القاعدة؛ هو بيستنتجها من التفضيلات.

الشرح العلمي: تلات مراحل

دلوقتي بعد ما الصورة اتضحت، خلّينا ندخل في التفاصيل. RLHF مش خطوة واحدة، ده تلات مراحل ورا بعض.

  1. الضبط الإشرافي (SFT): بنجمع أمثلة كتبها بشر لأسئلة وإجاباتها المثالية، وبنعمل fine-tune للنموذج عليها. هنا النموذج بيتعلّم شكل الإجابة الكويسة: يجاوب بدل ما يكمّل السؤال.
  2. نموذج المكافأة (Reward Model): بنعرض للنموذج ردّين على نفس السؤال، وبشر بيرتّبوهم (A أحسن من B). بندرّب نموذج تاني اسمه نموذج المكافأة يدّي كل رد درجة رقمية تعبّر عن رضا البشر عنه.
  3. التعلّم المعزّز (RL/PPO): النموذج يحاول يطلّع ردود بترفع الدرجة اللي بيدّيها نموذج المكافأة، بخوارزمية اسمها PPO. النتيجة: النموذج يتعلّم يتصرّف زي ما البشر عايزين.

مثال كود تقدر تجرّبه

قلب تدريب نموذج المكافأة سطر واحد: خلّي درجة الرد المُفضَّل أعلى من المرفوض. ده بيتحسب بخسارة اسمها Bradley-Terry. السكربت ده بيشتغل فعلاً بـ PyTorch:

Python
import torch
import torch.nn.functional as F

# درجات نموذج المكافأة لردّين على نفس السؤال
reward_chosen   = torch.tensor([2.1])   # الرد اللي فضّله الإنسان
reward_rejected = torch.tensor([0.4])   # الرد المرفوض

# خسارة الترتيب: بتقلّ كل ما الفرق بين الدرجتين يكبر
loss = -F.logsigmoid(reward_chosen - reward_rejected)
print(round(loss.item(), 3))   # ~0.167

لو غيّرت درجة الرد المفضّل لـ 5.0، الخسارة هتنزل لحوالي 0.01، لأن النموذج بقى واثق في الترتيب. للتدريب الكامل مش هتكتب ده بإيدك: مكتبة trl من Hugging Face فيها RewardTrainer وPPOTrainer جاهزين.

الأرقام اللي بتقنع

في ورقة InstructGPT سنة 2022، نموذج بحجم 1.3 مليار باراميتر متدرّب بـ RLHF، فضّله المقيّمون البشر على نموذج GPT-3 بحجم 175 مليار باراميتر، رغم إنه أصغر 100 مرة. يعني المحاذاة الصح غلبت الحجم الأكبر بكتير. سيناريو واقعي: لو بتبني شات بوت لبنك بـ 50 ألف محادثة في اليوم، النموذج الخام ممكن يرد بمعلومة مخترعة أو نبرة غير لائقة؛ RLHF هو اللي بيخلّيه يلتزم بالنبرة ويرفض الطلبات الخطيرة.

الـ trade-offs اللي لازم تعرفها

  • بتكسب: مساعد مفيد ومؤدب وبيرفض الأذى، بجودة ردود أعلى بوضوح من النموذج الخام.
  • بتخسر: تكلفة بشرية ضخمة (عشرات لمئات الآلاف من المقارنات اليدوية)، وأحيانًا "ضريبة المحاذاة" (alignment tax) يعني النموذج يضعف شوية في بعض المهام الدقيقة.
  • خطر خفي: "غش المكافأة" (reward hacking) لما النموذج يتعلّم يخدع نموذج المكافأة، زي ما يطلّع ردود طويلة تبان مقنعة من غير محتوى حقيقي.

الافتراض هنا إن عندك بيانات تفضيلات بشرية بجودة كويسة ومتّسقة. لو التقييمات متضاربة، نموذج المكافأة هيطلع ضعيف، وكل اللي بعده هيتبني على أساس مهزوز.

متى لا تستخدم RLHF

لو مشروعك مجرد استدعاء API لموديل جاهز زي GPT-4 أو Claude، فدول اتظبطوا بـ RLHF أصلاً، ومش محتاج تعمله بنفسك. RLHF مكلّف ومعقّد؛ لأغلب الحالات، الـ prompt engineering أو ضبط إشرافي بسيط أو طريقة أحدث وأرخص اسمها DPO بتوصّلك لنتيجة قريبة بمجهود أقل بكتير. سيب RLHF الكامل لما تبني نموذجًا من الصفر، أو تحاذي سلوكًا دقيقًا على نطاق واسع، ويكون عندك ميزانية تقييم بشري حقيقية.

الخطوة التالية

افتح محرر Python وجرّب سكربت خسارة الترتيب فوق، وغيّر الأرقام وشوف الخسارة بتتحرّك إزاي؛ ده بيثبّت الفكرة في دماغك في دقيقتين. لو عايز تروح أعمق، ثبّت pip install trl واقرا مثال RewardTrainer على داتا Anthropic/hh-rlhf.

المصادر

  • Christiano et al., 2017 — "Deep Reinforcement Learning from Human Preferences" — arXiv:1706.03741 (أصل فكرة نموذج المكافأة من التفضيلات).
  • Ouyang et al., 2022 — "Training language models to follow instructions with human feedback" (InstructGPT) — arXiv:2203.02155 (رقم 1.3B مقابل 175B).
  • OpenAI — "Aligning language models to follow instructions" — openai.com.
  • Bai et al., 2022 (Anthropic) — "Training a Helpful and Harmless Assistant with RLHF" — arXiv:2204.05862.
  • Hugging Face — مكتبة TRL (RewardTrainer وPPOTrainer) — huggingface.co/docs/trl.

هل استفدت من المقال؟

اطّلع على المزيد من المقالات والدروس المجانية من نفس المسار المعرفي.

تصفّح المدونة