مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو خدمتك في Kubernetes بتنادي API خارجي وبتحس بتأخير غامض، غالبًا السبب سطر options ndots:5 في resolv.conf بيحوّل كل نداء لخمسة استعلامات DNS. المقال للمحترف يشرح السبب بمثال بسيط ثم علميًا، مع باتش dnsConfig قابل للنسخ، أرقام قبل وبعد، الـ trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.
لو الـ p99 بتاع خدمتك بيقفز لثانيتين ومتوسط استهلاك المعالج تحت 40%، غالبًا مش محتاج عقدة أقوى — الـ kernel بيكبح بودك بسبب CFS quota. مقال للمحترف يشرح المفهوم بمثال بسيط ثم علميًا، مع أوامر cpu.stat وPromQL للكشف، سيناريو بأرقام (كبح 63% ← 6%، p99 من 2100ms لـ 240ms)، ثلاث روافع حل بمقايضاتها، تحذير على مستوى الـ kernel، ومتى لا تشيل الحدود، مع مصادر رسمية.
لو Prometheus بيتقتل بـ OOMKilled والرام بتقفز فجأة من غير زيادة ترافيك، غالبًا السبب ليبل واحد غير محدود (زي user_id) بيفجّر عدد السلاسل الزمنية. اعرف تكتشف المشكلة بـ PromQL و/status/tsdb، وتصلّحها بالـ relabeling، بأرقام حقيقية وحدود قابلة للتطبيق ومصادر رسمية.
سيرفرك بيرفض اتصالات جديدة والـ CPU والرام مرتاحين؟ غالبًا جدول nf_conntrack امتلأ فبيدروب كل SYN جديد. مقال للمحترف يشرح تتبّع الاتصال بمثال دفتر الفندق، ثم علميًا، مع أوامر تشخيص، ثلاث روافع حل (رفع السقف، تقليل الـ timeouts، NOTRACK) بأرقام حقيقية للذاكرة، trade-offs، ومتى لا تستخدمها، مع مصادر رسمية.
عمليات Zombie بتتراكم لمّا تطبيقك يشتغل كـ PID 1 جوّه Docker من غير ما يحصدها، لحد ما جدول العمليات يمتلي وأي fork جديد يفشل. اعرف السبب على مستوى الكيرنل، وإزاي --init و tini يحلّوها في سطر واحد، مع أرقام قبل وبعد ومصادر.
لو بتـ deploy صور Docker من غير فحص، انت بتشحن ثغرات معروفة للإنتاج. هنا تبني بوابة Trivy في الـ CI توقف الصورة المصابة في أقل من 15 ثانية، بأوامر قابلة للنسخ، أرقام حقيقية، trade-offs، ومتى لا تستخدمها.
طلب checkout بياخد 742 مللي ثانية وانت مش عارف أنهي خدمة السبب. الـ Distributed Tracing بـ OpenTelemetry بيوريك المتسبّب بالظبط. دليل للمحترف بمثال إيصال الشحنة، شرح الـ span وانتشار السياق، كود OTel شغّال، إعداد tail sampling قابل للنسخ، أرقام overhead، trade-offs، ومتى متستخدموش، مع مصادر رسمية.
لو الـ cluster الإنتاجي عندك انهار دلوقتي، إيه الـ RTO الحقيقي اللي هتقدر تضمنه للإدارة؟ Velero v1.14 بيخلّي backup كامل (manifests + PV + secrets) واسترجاع في أقل من 18 دقيقة. مقال للمحترف بمثال بنك السبائك للمبتدئ، شرح علمي من توثيق Velero الرسمي، CRDs وأوامر CLI كاملة شغّالة على EKS 1.30 + S3، أرقام مقاسة على cluster بـ 96 microservice، 5 trade-offs خفية، ومتى Velero بيكون قرار غلط.
لو فاتورة EKS بتاعتك بتعدّي $14K شهرياً و Cluster Autoscaler بياخد 4 دقائق علشان pod واحد pending يقعد، Karpenter v1.0 بيشيل طبقة الـ Node Groups بالكامل ويختار instance type مناسب من ~700 SKU لحظياً. مقال للمحترف بمثال مدير المطعم للمبتدئ، إعداد NodePool و EC2NodeClass كامل على EKS 1.30، أرقام مقاسة من cluster بـ 142 microservice (التوفير 38%، Spot coverage من 22% لـ 68%، scheduling من 247s لـ 52s)، 4 trade-offs خفية، ومتى Karpenter يبقى مبالغة هندسية.