مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو خدمتك بتقع وترجع وتقع تاني على طول تحت الضغط، غالبًا المشكلة في طريقة إعادة المحاولة عندك مش في الخدمة. المقال يشرح عاصفة إعادة المحاولة وحلها بالـ Exponential Backoff مع Full Jitter، بكود Python شغّال وأرقام وtrade-offs ومتى لا تستخدمه، مع مصادر رسمية.
لو تطبيقك بيقع وقت الذروة وانت دافع سيرفرات فاضية بقية اليوم، الـ Horizontal Pod Autoscaler بيحل المشكلتين: بيزوّد الـ Pods لمّا الحِمل يعلى وبيرجّعها لمّا يهدأ. شرح للمتوسط بمثال كاشير السوبر ماركت، معادلة الحساب، ملف YAML جاهز، أرقام من متجر إلكتروني، الـ trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.
لو شغّلت PostgreSQL في Docker ولقيت البيانات راحت بعد الـ restart، ده مش عطل. الحاوية بتكتب في طبقة مؤقتة بتتمسح. المقال يشرح السبب بمثال غرفة الفندق، ثم علميًا بطبقة الكتابة والـ copy-on-write، مع أوامر Volumes جاهزة للنسخ، أرقام، trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.
لو مهندسَين شغّلوا terraform apply في نفس اللحظة، ملف الحالة ممكن يتكتب نُصّه من الأول ونُصّه من التاني وتتكسر بنيتك. المقال للمتوسط يشرح قفل الحالة بمثال الكرّاسة والقلم الواحد، ثم علميًا، مع إعداد S3 native locking بسطر واحد (use_lockfile) على Terraform 1.10+، الأمر، شكل خطأ القفل، force-unlock، أرقام، trade-offs، ومتى لا تحتاجه، مع مصادر رسمية.
تقدر تنزّل حجم صورة Docker من 1.2 جيجابايت لـ 80 ميجابايت من غير ما تلمس كود تطبيقك. مقال للمبتدئ يشرح الـ multi-stage build بمثال المطبخ، ثم علميًا بالطبقات وCOPY --from، مع Dockerfile كامل قبل وبعد، أوامر قياس، المقايضات، ومتى لا تستخدمه، مع مصادر رسمية.
تقدر تغيّر عمودًا في جدول فيه 50 مليون صف والموقع شغّال بلا ثانية توقف. المقال يشرح نمط Expand-Contract بثلاث مراحل، بمثال مطبخ المطعم ثم علميًا عبر قفل ALTER، مع أوامر PostgreSQL شغّالة للـ backfill على دفعات، أرقام حقيقية، المقايضات، ومتى لا تستخدمه، مع مصادر رسمية.
لو الـ p99 بتاع خدمتك بيقفز لثانيتين ومتوسط استهلاك المعالج تحت 40%، غالبًا مش محتاج عقدة أقوى — الـ kernel بيكبح بودك بسبب CFS quota. مقال للمحترف يشرح المفهوم بمثال بسيط ثم علميًا، مع أوامر cpu.stat وPromQL للكشف، سيناريو بأرقام (كبح 63% ← 6%، p99 من 2100ms لـ 240ms)، ثلاث روافع حل بمقايضاتها، تحذير على مستوى الـ kernel، ومتى لا تشيل الحدود، مع مصادر رسمية.
لو Prometheus بيتقتل بـ OOMKilled والرام بتقفز فجأة من غير زيادة ترافيك، غالبًا السبب ليبل واحد غير محدود (زي user_id) بيفجّر عدد السلاسل الزمنية. اعرف تكتشف المشكلة بـ PromQL و/status/tsdb، وتصلّحها بالـ relabeling، بأرقام حقيقية وحدود قابلة للتطبيق ومصادر رسمية.
لو الـ CPU بتاع قاعدة بياناتك بيقفز 100% كل شوية من غير زيادة زوّار، غالبًا مفتاح كاش انتهت صلاحيته فضربته آلاف الطلبات مع بعض. مقال للمتوسط يشرح Cache Stampede بمثال المطعم ثم علميًا، مع كود Python + Redis لقفل single-flight، أرقام حقيقية، حلول بديلة، trade-offs، ومتى لا تستخدمه، مع مصادر.