الرئيسيةمن أناالدوراتالمدونةسوق الأوامرالمناهج والباقاتالشركاء

دورات عربية متخصصة في التقنية والبرمجة والذكاء الاصطناعي.

المنصة مبنية على الوضوح، التطبيق، والنتيجة النافعة: شرح مرتب يساعدك تفهم الأدوات، تكتب كودًا أفضل، وتستخدم الذكاء الاصطناعي بوعي داخل العمل الحقيقي.

المنصة

  • الرئيسية
  • من أنا
  • الدورات
  • المناهج والباقات
  • سوق الأوامر
  • المدونة

الدعم

  • الأسئلة الشائعة
  • تواصل معنا
  • سياسة الخصوصية
  • شروط استخدام التطبيق
  • سياسة الاسترجاع

© 2026 أحمد حايس. جميع الحقوق محفوظة.

الرئيسيةالدوراتالمناهجالمدونةالدخول

الذكاء الاصطناعي

مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.

المجال
كل المجالات
تكنولوجياDevOps بالعربيHow To Make ItOptimizing بالعربيأحدث أخبار التكنولوجياالأوتوميشنالبرمجة بالعربيالذكاء الاصطناعي
المستوى
كل المستوياتمبتدئمتوسطمحترف
Speculative Decoding للمحترف: 2.3× سرعة في Llama 70B بـ Draft Model أصغر 70 مرة
محترف25 مايو 2026

Speculative Decoding للمحترف: 2.3× سرعة في Llama 70B بـ Draft Model أصغر 70 مرة

لو بتشغّل Llama 3.1 70B على H100 وبتقيس 32 token/ثانية، أنت بتستخدم 4% بس من قدرة الـ GPU. Speculative Decoding بيرفع الرقم لـ 74 token/ثانية بدون فقدان جودة. مقال للمحترف بمثال مطبخ المطعم، شرح علمي من ورقة Leviathan 2023 (ICML)، إعدادات vLLM 0.7+ شغّالة، أرقام مقاسة على H100 (acceptance rate 0.78 لكود، 0.41 لكتابة إبداعية)، 4 trade-offs خفية في الإنتاج، ومتى Speculative Decoding overhead بدون فايدة.

6 دقائق قراءة
Speculative Decoding للمحترف: سرّع Inference 2.4× بدون فقد جودة
محترف25 مايو 2026

Speculative Decoding للمحترف: سرّع Inference 2.4× بدون فقد جودة

دليل تنفيذي للمحترف لتفعيل Speculative Decoding في vLLM 0.6.3 على Llama 3.1 70B بنموذج draft من 1B، بيرفع throughput من 38 لـ 91 token/sec على H100 (2.39×) مع نفس output احتمالياً، بـ acceptance rate 73.4% مقاسة على 1,200 طلب عربي.

5 دقائق قراءة
Speculative Decoding للمحترف: ضاعف سرعة Llama 70B بـ 2.7× بدون فقدان كلمة
محترف25 مايو 2026

Speculative Decoding للمحترف: ضاعف سرعة Llama 70B بـ 2.7× بدون فقدان كلمة

دليل تنفيذي للمحترف لتفعيل Speculative Decoding على vLLM يرفع throughput Llama 70B من 87 لـ 234 token/s على H100، مع رياضيات rejection sampling، 4 trade-offs خفية، ومتى تكون speculation مضيعة وقت.

6 دقائق قراءة
LLM-as-a-Judge للمحترف: Eval Pipeline يمسك Regression قبل الإنتاج
محترف25 مايو 2026

LLM-as-a-Judge للمحترف: Eval Pipeline يمسك Regression قبل الإنتاج

دليل تنفيذي للمحترف لبناء Eval Pipeline بـ LLM-as-a-Judge في 47 سطر Python، بيمسك الـ regression في 12 دقيقة بدل 4 أيام، بـ Spearman correlation 0.87 مع تقييم البشر، وتكلفة $1.40 لكل run على 200 sample.

6 دقائق قراءة
Contextual Retrieval للمحترف: قلّل فشل الاسترجاع 67% قبل Reranker
محترف24 مايو 2026

Contextual Retrieval للمحترف: قلّل فشل الاسترجاع 67% قبل Reranker

لو شغّلت Reranker على RAG عربي عندك ولسه precision@5 واقفة عند 71%، المشكلة مش في الـ reranker. المشكلة إن الـ chunk اللي صح أصلاً مش بين الـ top-20 اللي وصلت للـ reranker. Contextual Retrieval من Anthropic بيحقن سياق كل chunk قبل الـ embedding، فينزّل failed retrievals 35% بـ embeddings لوحدها، و49% بإضافة BM25، و67% لما تضيفلهم reranker. مقال للمحترف بمثال موظف الأرشيف، شرح علمي من Anthropic Research (Sept 2024) و Lewis 2020، كود Python في 34 سطر شغّال على anthropic SDK 0.49+ مع prompt caching، أرقام مقاسة على corpus عربي 11,400 chunk من تذاكر دعم fintech، 4 trade-offs خفية في التكلفة والـ latency والـ index size، ومتى الـ Contextual Retrieval overhead بدون فايدة.

6 دقائق قراءة
PagedAttention للمحترف: ازاي vLLM بيخدم 2.7× طلب أكتر بنفس H100
محترف18 مايو 2026

PagedAttention للمحترف: ازاي vLLM بيخدم 2.7× طلب أكتر بنفس H100

لو بتشغّل Llama 3.1 70B على H100 وبتخدم 23 request متزامن بس قبل ما تقع في OOM، المشكلة مش في الـ GPU. 60-80% من ذاكرة KV cache بتضيع في fragmentation. PagedAttention بيستلف فكرة Virtual Memory من نظام التشغيل ويرفع الـ throughput لـ 2.7×. مقال للمحترف بمثال رفوف المكتبة للمبتدئ، شرح علمي من ورقة Kwon 2023 (UC Berkeley)، configuration vLLM شغّال، أرقام مقاسة (memory utilization من 20.4% لـ 96.3%)، 4 trade-offs خفية، ومتى PagedAttention يبقى overhead بدون فايدة.

6 دقائق قراءة
AWQ Quantization للمحترف: Llama 70B على H100 واحدة بـ 35GB
محترف17 مايو 2026

AWQ Quantization للمحترف: Llama 70B على H100 واحدة بـ 35GB

سيرفر Llama 3.3 70B على 4×A100 بيكلّفك $11,820 شهرياً. AWQ INT4 quantization بينزّل الذاكرة من 140GB لـ 35GB، يخلّيك تشغّله على H100 واحدة بتكلفة 75% أقل. مقال للمحترف بمثال ضغط JPEG للمبتدئ، شرح علمي من ورقة Lin 2023 (MIT Han Lab)، configuration vLLM 0.6.4 شغّال، مقارنة AWQ vs GPTQ بأرقام Marlin kernel (10.9× speedup)، أرقام مقاسة على H100 (741 token/ثانية، MMLU-Pro retention 98.1%)، 4 trade-offs خفية بتظهر في الإنتاج، ومتى Quantization كارثة على الموديل.

6 دقائق قراءة
Long Context vs RAG للمحترف: متى تشيل Qdrant وتعتمد على 1M Token
محترف16 مايو 2026

Long Context vs RAG للمحترف: متى تشيل Qdrant وتعتمد على 1M Token

لو فاتورة Qdrant + reranker + embeddings بقت $1,124 شهرياً على corpus 7.7M token، الـ 1M token context في Claude Sonnet 4.6 ممكن يوفّر 56% من التكلفة ويرفع الدقة 12 نقطة. مقال للمحترف بمثال المكتبة الشخصية للمبتدئ، تعريف علمي من ورقة Lewis 2020 (RAG)، أرقام مقاسة على workload Fintech عربي بـ 3,200 سؤال شهرياً، كود Python يقارن النسختين على anthropic SDK 0.49 مع prompt caching، 4 trade-offs خفية في latency و cost predictability و debugging و vendor lock-in، ومتى Long Context كارثة compliance.

7 دقائق قراءة
Speculative Decoding للمحترف: تسريع vLLM 2.4× بنموذج draft صغير
محترف15 مايو 2026

Speculative Decoding للمحترف: تسريع vLLM 2.4× بنموذج draft صغير

لو throughput الـ Llama 3.1 70B واقف عند 38 token/ثانية على H100، المشكلة مش في الـ GPU. Speculative Decoding بيحل decoding bottleneck بنموذج draft 1B بيقترح والنموذج الكبير بيتحقق بالتوازي. مقال للمحترف بمثال المحرر والمساعد للمبتدئ، شرح علمي من ورقة Leviathan 2023، configuration vLLM شغّال، أرقام مقاسة (38 → 91 token/ثانية، acceptance rate 73.4%)، 4 trade-offs خفية، ومتى الـ technique دي بتكون قرار غلط.

7 دقائق قراءة

عرض 10 - 18 من 46 مقال

السابق
1
2
3
4
5
6
التالي