مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
لو خدمة الدفع بطؤت لـ 8 ثواني وبعد نص دقيقة النظام كله وقع، المشكلة مش في الدفع — دي انهيار متسلسل. قاطع الدائرة بيعزل الخدمة الفاشلة ويرجّع خطأ فوري في أقل من مللي ثانية، بمثال القاطع الكهربائي ثم شرح علمي، كود Python شغّال، أرقام، trade-offs، ومتى لا تستخدمه، مع مصادر.
مع Blue-Green بتشغّل نسختين متطابقتين وتحوّل الترافيك بينهم بضغطة واحدة: نشر بدون downtime وتراجع في ثوانٍ. شرح بمثال المسرح ثم علميًا، مع تطبيق Kubernetes قابل للنسخ، أرقام حقيقية، الـ trade-off، ومتى لا تستخدمه، مع مصادر.
لو كل مرة بتعمل deploy بتلاقي أخطاء 5xx بتقفز شوية بعدها، المشكلة مش في الكود. الـ pod بيموت وسايب طلبات في نصها. المقال يشرح الإيقاف الآمن (Graceful Shutdown) في Kubernetes بمثال بسيط ثم علميًا، مع ملف YAML وكود Go قابل للنسخ، أرقام قبل وبعد، الـ trade-offs، ومتى لا تحتاجه، مع مصادر رسمية.
لو خدمتك بتقع وترجع وتقع تاني على طول تحت الضغط، غالبًا المشكلة في طريقة إعادة المحاولة عندك مش في الخدمة. المقال يشرح عاصفة إعادة المحاولة وحلها بالـ Exponential Backoff مع Full Jitter، بكود Python شغّال وأرقام وtrade-offs ومتى لا تستخدمه، مع مصادر رسمية.
لو تطبيقك بيقع وقت الذروة وانت دافع سيرفرات فاضية بقية اليوم، الـ Horizontal Pod Autoscaler بيحل المشكلتين: بيزوّد الـ Pods لمّا الحِمل يعلى وبيرجّعها لمّا يهدأ. شرح للمتوسط بمثال كاشير السوبر ماركت، معادلة الحساب، ملف YAML جاهز، أرقام من متجر إلكتروني، الـ trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.
لو مهندسَين شغّلوا terraform apply في نفس اللحظة، ملف الحالة ممكن يتكتب نُصّه من الأول ونُصّه من التاني وتتكسر بنيتك. المقال للمتوسط يشرح قفل الحالة بمثال الكرّاسة والقلم الواحد، ثم علميًا، مع إعداد S3 native locking بسطر واحد (use_lockfile) على Terraform 1.10+، الأمر، شكل خطأ القفل، force-unlock، أرقام، trade-offs، ومتى لا تحتاجه، مع مصادر رسمية.
تقدر تغيّر عمودًا في جدول فيه 50 مليون صف والموقع شغّال بلا ثانية توقف. المقال يشرح نمط Expand-Contract بثلاث مراحل، بمثال مطبخ المطعم ثم علميًا عبر قفل ALTER، مع أوامر PostgreSQL شغّالة للـ backfill على دفعات، أرقام حقيقية، المقايضات، ومتى لا تستخدمه، مع مصادر رسمية.
لو الـ CPU بتاع قاعدة بياناتك بيقفز 100% كل شوية من غير زيادة زوّار، غالبًا مفتاح كاش انتهت صلاحيته فضربته آلاف الطلبات مع بعض. مقال للمتوسط يشرح Cache Stampede بمثال المطعم ثم علميًا، مع كود Python + Redis لقفل single-flight، أرقام حقيقية، حلول بديلة، trade-offs، ومتى لا تستخدمه، مع مصادر.
تطبيقك بيرمي too many clients وقت الذروة والسيرفر مرتاح؟ السبب إن كل اتصال بيفتح عملية كاملة في Postgres. اعرف تركّب PgBouncer بنمط transaction pooling وتنزّل 600 اتصال لـ 20 اتصال حقيقي في أقل من 10 دقايق، بمثال بسيط ثم شرح علمي، إعداد قابل للنسخ، أرقام قبل وبعد، trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.