مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو Claude العادي بيحلّ 16% بس من مسائل AIME 24 وExtended Thinking بيرفعها لـ 61%، السؤال مش هل تفعّله — السؤال متى تدفع 5x التكلفة و8x الزمن. شرح للمتوسط بمثال طالب الامتحان للمبتدئ، تعريف علمي للـ thinking budget و reasoning tokens، كود Python شغّال على Anthropic SDK، أرقام مقاسة من AIME 24 و SWE-Bench و MATH-500، خمس trade-offs، وحالات لا تستخدم فيها التقنية أصلاً.
لو حاولت تشغّل Llama 3 70B على A100 80GB بـ 32K context وجاتلك CUDA OOM، المشكلة مش في وزن الموديل. المشكلة في الـ KV Cache اللي بيكبر خطيًا مع طول الـ context. مقال للمتوسط بمثال السكرتير، تعريف علمي للـ Key-Value matrices في self-attention، كود Python يقيس الاستهلاك فعليًا، أرقام مقاسة على Llama 3، أربع تقنيات تقليل (MQA, GQA, PagedAttention, KV Quantization)، 4 trade-offs، ومتى تتجاهل المشكلة دي أصلاً.
تدريب كامل لـ Llama 3 8B بيحتاج 320GB ذاكرة GPU وسيرفر بـ$60,000. LoRA بيدرّب نفس الموديل في 6 ساعات على RTX 4090 واحدة بـ 16GB، بفقد جودة 1-2% بس. مقال للمتوسط بمثال محرر الكتاب للمبتدئ، تعريف علمي للـ low-rank decomposition من ورقة Hu et al. 2021، كود PEFT + QLoRA شغّال، أرقام مقاسة على 12,000 مثال عربي، 4 trade-offs، ومتى لا تستخدم LoRA أصلاً.