التصنيف الرئيسي للمقالات التقنية: برمجة، ذكاء اصطناعي، DevOps، تحسين الأداء، أوتوميشن، وأخبار التكنولوجيا.
لو سألت Claude عن سياسة شركة ورد عليك بكلام معقول لكن ما تعرفش من فين، Citations API بيخلي كل جملة معاها مصدرها الحرفي من ملفك. مقال للمبتدئ بمثال محمد طالب الثانوية، تعريف علمي للـ content blocks، كود Python شغّال على Anthropic SDK 0.40+، أرقام مقاسة من إنتاج (هلوسة من 11% إلى 0.6%)، trade-offs، ومتى لا تستخدمه.
لو حاولت تشغّل Llama 3 70B محلياً والـ GPU بتاعك 24GB، الموديل بيقولك "محتاج 140GB". Quantization بيقطع الذاكرة لـ 25% بفقدان أقل من نقطة على MMLU. مقال للمستوى المتوسط بمثال السوبرماركت للمبتدئ، تعريف علمي للـ AWQ و GPTQ، كود vLLM شغّال على RTX 4090، أرقام مقاسة من MMLU و HumanEval، trade-offs، وحالات لا تستخدم فيها الـ Quantization أصلاً.
لو 8 microservices بتاكل 24 pod طول اليوم وفيهم 3 بس اللي عنده شغل وقت الذروة، بتدفع لـ idle بنسبة 60%+. KEDA بيربط عدد الـ pods بـ Kafka consumer lag مباشرةً، فبتدفع للشغل الحقيقي بس. شرح للمحترف بمثال العيادة للمبتدئ، تعريف علمي للـ ScaledObject، YAML شغّال على KEDA 2.13، أرقام إنتاج (70% توفير، 3x تحسّن في P99)، trade-offs الـ cold start و rebalance، ومتى لا تستخدم scale-to-zero أصلاً.
لو فريقك بيعدّل في Google Sheets والـ DB محتاج يلحق التعديل، الـ cron كل 5 دقايق بيحرق quota وبيوصل التحديث متأخر. هنا pipeline يدفع التعديل من Sheets لـ PostgreSQL في 1.2 ثانية بدون polling، بـ Apps Script Trigger + FastAPI Webhook + HMAC، مع كود شغّال، أرقام مقاسة على 14 مستخدم متزامن، trade-offs، وحالات لا تستخدمه فيها.
لو موديل Llama 3.1 70B بيطلب 140GB ذاكرة وعندك GPU واحد بـ 48GB، Quantization بيقطع المتطلبات للربع — 35GB — مع خسارة دقة أقل من 1% على MMLU. مقال للمستوى المتوسط بمثال ضغط الصور للمبتدئ، تعريف علمي للـ AWQ و GPTQ، كود Python شغّال على transformers + AutoAWQ، أرقام مقاسة من ورقة AWQ 2024 و Hugging Face، trade-offs، وحالات لا تستخدم Quantization فيها أصلاً.
لو شغّلت 8 threads في Python على CPU بـ 16 core وفوجئت إن الكود ماتسرّعش بل بطئ، السبب اسمه Global Interpreter Lock. مقال للمحترف بمثال الميكروفون الواحد للمبتدئ، تعريف علمي دقيق لـ CPython وbytecode evaluation، كود Python 3.12 شغّال يقيس الفرق بين threading و multiprocessing، أرقام مقاسة فعلياً، نظرة على PEP 703 وفكرة free-threaded Python، trade-offs واضحة، وحالات يبقى فيها threading منطقي رغم الـ GIL.
لو حاولت تشغّل Llama 3.1 70B لقيت إنه محتاج 140GB ذاكرة و4 كروت A100. NF4 Quantization بينزّله لـ40GB وA100 واحد بفقد 0.5% فقط في MMLU. مقال للمتوسط بمثال ضغط الصورة من 16 مليون لون لـ256، شرح علمي للـNormalFloat 4 من ورقة Tim Dettmers (NeurIPS 2023)، كود Python شغّال على bitsandbytes + transformers، أرقام مقاسة (perplexity, MMLU, tok/s)، 4 trade-offs حقيقية، وحالات لازم تتجنّب فيها NF4.
لو inference الـ Llama 3 70B بياخد 8 ثواني والمستخدم بيقفل التاب، Speculative Decoding بيقطع الزمن للنص بنفس الموديل ونفس الجودة. الفكرة: موديل صغير سريع بيخمّن، موديل كبير بيتأكد بالتوازي. مقال للمحترف بمثال الكاشير للمبتدئ، التعريف العلمي الدقيق للـ acceptance probability من ورقة DeepMind 2023، كود vLLM 0.6+ شغّال، أرقام مقاسة على H100 (24 → 71 توكن/ثانية)، trade-offs الذاكرة والـ batching، وحالات لا تستخدم فيها التقنية أصلاً.
لو حسبت فاتورة Claude الشهرية بالعربي ولقيتها 3 أضعاف نفس الـ workload بالإنجليزي، السبب مش زيادة في السعر. السبب مفهوم اسمه Tokenization. مقال للمبتدئ بمثال قطع الليجو، تعريف علمي للـ Byte-Pair Encoding، كود Python شغّال على Anthropic SDK يقيس الفرق، أرقام مقاسة من 500 سؤال إنتاج، 4 خطوات توفير عملية، trade-offs، وحالات لا يستحق الموضوع فيها وقتك أصلاً.