لو فريقك بيراجع 50 إجابة يوميًا من شات بوت دعم فني، انت بتدفع راتب اتنين بشر بدوام كامل للمراجعة فقط. عند 200 إجابة، الفريق مش بيلحق أصلًا. الحل اللي بتستخدمه Anthropic و OpenAI و Cohere داخليًا اسمه LLM-as-a-Judge: نموذج تاني بيقيّم مخرجات النموذج الأول بدقة 84% مقارنة بالبشر، بتكلفة 0.04 سنت للإجابة الواحدة.
المستوى المطلوب: متوسط
هتحتاج معرفة سابقة بـ Prompt Engineering وأساسيات استدعاء Claude API. لو لسه مش متعامل مع anthropic SDK، ابدأ من مقال "Few-Shot Prompting للمبتدئ" الأول. الكود هنا مكتوب بـ Python 3.11 وبيشتغل على anthropic SDK 0.49+ مع Claude Haiku 4.5.
LLM-as-a-Judge: لمّا النموذج يحكم على النموذج
المشكلة باختصار
تقييم مخرجات LLM في الإنتاج صعب لسببين عمليين. الأول إن مفيش "إجابة صح وحيدة" زي مهام التصنيف؛ نفس السؤال ممكن يتجاوب عليه بعشر صياغات كلها سليمة. الثاني إن المراجعة البشرية بطيئة ومكلّفة.
تخيّل شركة بتستقبل 12,000 سؤال شهريًا على شات بوت الدعم. مراجع بشري بياخد 3 دقايق للإجابة الواحدة = 600 ساعة شغل = راتب 4 موظفين بدوام كامل. والـ metrics التقليدية زي BLEU و ROUGE بتقيس التشابه اللفظي مش الصحة الفعلية. إجابة سليمة 100% بصياغة مختلفة بياخدها BLEU درجة قريبة من الصفر.
المثال للمبتدئ: مفتش الجودة في المصنع
تخيّل معايا مصنع بينتج 10,000 قطعة يوميًا. مفتش بشري يفحص كل قطعة قطعة = مستحيل عمليًا. الحل اللي ظهر في الستينات: مفتش متخصص يفحص عيّنة عشوائية بقواعد واضحة (Statistical Process Control). الفكرة نفسها مع LLM. بدل ما المراجع البشري يقرا كل إجابة، نموذج تاني أصغر وأرخص بيقرا بدله ويعطي تقييم بدرجة من 1 لـ 5، مع سبب التقييم.
الفرق هنا إن النموذج الحَكَم يقدر يفحص الـ 10,000 إجابة كلها مش عيّنة، في وقت أقل بكتير وتكلفة أقل بـ 400 ضعف.
الشرح العلمي الدقيق
تقنية LLM-as-a-Judge اتقنّنت في ورقة "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena" من Zheng et al. 2023 (UC Berkeley + Stanford). الورقة قاست اتفاق GPT-4 كحكم مع human annotators على 3,000 مقارنة، والاتفاق طلع 85% — وده نفس مستوى الاتفاق بين اتنين بشر مع بعض على نفس المهمة. التقنية ليها 3 أشكال أساسية:
- Single-answer scoring: الحَكَم بيدّي درجة من 1 لـ 10 لإجابة وحيدة بناءً على معايير محددة (دقة، وضوح، اكتمال).
- Pairwise comparison: الحَكَم بيقارن بين إجابتين A و B ويختار الأحسن. ده الشكل اللي بيستخدم في Chatbot Arena.
- Reference-based: فيه إجابة مرجعية (ground truth)، والحَكَم بيقارن إجابة النموذج بيها.
الـ Pairwise بيدّي أعلى اتفاق مع البشر (87%) لأنه مهمة أبسط معرفيًا، لكنه أغلى لأن تكلفته O(n²) في عدد المقارنات. الـ Single-answer أرخص بكتير لكن دقته أقل (79–82%) لأن النموذج بيتأثر بانحياز ثابت زي تفضيل الإجابات الطويلة.