مقالات عملية مرتبة حسب المجال والمستوى، اختر المجال المناسب واقرأ من مستوى مبتدئ إلى محترف.
تطبيقك بيرمي too many clients وقت الذروة والسيرفر مرتاح؟ السبب إن كل اتصال بيفتح عملية كاملة في Postgres. اعرف تركّب PgBouncer بنمط transaction pooling وتنزّل 600 اتصال لـ 20 اتصال حقيقي في أقل من 10 دقايق، بمثال بسيط ثم شرح علمي، إعداد قابل للنسخ، أرقام قبل وبعد، trade-offs، ومتى لا تستخدمه، مع مصادر رسمية.
لو تطبيقك يرمي EMFILE فجأة والـ CPU مرتاح، المشكلة في سقف واصفات الملفات (1024 الافتراضي). اكتشفها بأمر واحد واضبط LimitNOFILE صح، مع الفرق بين تسريب الواصفات ورفع الحد.
لو نداءاتك بين الخدمات بطيئة وCoreDNS عليه ضغط غريب، غالبًا السبب إعداد ndots:5 اللي بيحوّل كل بحث DNS لـ 4 أو 5 استعلامات. اتعلّم تكتشفها وتصلّحها بـ FQDN وdnsConfig وNodeLocal DNSCache بأرقام وأوامر قابلة للنسخ.
لو الـ Pod بيدخل في حلقة restart أو بيرمي 502 وهو لسه بيقلّع، المشكلة غالبًا في ضبط الـ probes. اضبط liveness و readiness و startup صح بمثال بسيط وكود YAML قابل للنسخ وأرقام حقيقية.
لو الـ Pod بيموت بـ Exit 137 من غير سبب واضح، المشكلة إنه تخطّى حدّ الذاكرة فقتله الكيرنل. هنا تفهمها بمثال بسيط، تكتشفها بأمر واحد، وتصلّحها بضبط requests وlimits صح، بأرقام ومصادر رسمية.
خدمتك بطيئة والـ CPU مستواه 40%؟ غالبًا المشكلة إن الـ CPU limit بيخنق الحاويّة عبر CFS quota. اتعلّم تكتشف الـ throttling وتصلّحه بأرقام حقيقية.
لو كل rolling update بيرجّعلك أخطاء 502، المشكلة إن الـ Pod بيموت وهو ماسك اتصالات شغّالة. شرح للمتوسط لـ preStop و SIGTERM و terminationGracePeriodSeconds بمثال وكود Kubernetes قابل للنسخ وأرقام وtrade-offs.
عميل أو بوت واحد بيرسل 500 طلب/ثانية يقدر يخلّي الـ API بتاعك بطيء للكل. Rate Limiting في Nginx بـ 8 أسطر بيحدّ كل IP عند معدل ثابت ويرجّع 429 للفائض. مقال للمتوسط بمثال حارس الملهى، شرح خوارزمية الدلو المثقوب، إعداد limit_req كامل قابل للنسخ، أرقام قبل وبعد، فخ الـ NAT المشترك، trade-offs، ومتى متستخدموش، مع مصادر رسمية.