التنبيهات وأهداف مستوى الخدمة
تعلّم كيفية تحويل بيانات قابلية المراقبة إلى تنبيهات قابلة للتنفيذ باستخدام أهداف مستوى الخدمة وميزانيات الأخطاء والتنبيهات القائمة على الأعراض، بما يقلل الضوضاء ولا ينبه الأشخاص إلا عند الحاجة.
التنبيهات وأهداف مستوى الخدمة درس مجاني في Microservices Communication Patterns (Saga, Circuit Breaker) على CoddyKit. هذا هو الدرس 4 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Microservices Communication Patterns (Saga, Circuit Breaker)، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Microservices Communication Patterns (Saga, Circuit Breaker) 4 دروس في المجموع.
بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.
From Observability to Action
Traces, logs, and metrics tell you what is happening. Alerting decides when a human needs to act. The goal is to page on real user pain, not on every blip.
What Is an SLI?
A Service Level Indicator is a measured aspect of service behavior, such as request latency, error rate, or availability. SLIs are the raw signal you alert on.
ok = 995
total = 1000
availability = ok / total * 100
print('Availability SLI:', availability, '%')What Is an SLO?
A Service Level Objective is a target for an SLI over a window, for example 'availability >= 99.9% over 30 days'. It defines what 'good enough' means.
Error Budgets
If your SLO is 99.9%, then 0.1% of requests are allowed to fail. That 0.1% is your error budget. Spend it on risk; if you burn it, slow down and stabilize.
slo = 99.9
budget_pct = 100 - slo
monthly_requests = 1000000
allowed_failures = monthly_requests * budget_pct / 100
print('Error budget (failures/month):', allowed_failures)Symptom vs Cause Alerts
Alert on symptoms users feel (high error rate, slow responses), not on every internal cause (one pod restarted). Cause alerts create noise; symptom alerts capture real impact.
Burn-Rate Alerting
Instead of paging the instant the SLO is missed, alert on how fast you are burning the error budget. A fast burn pages immediately; a slow burn opens a ticket.
def burn_rate(observed_error_rate, budget_rate):
return observed_error_rate / budget_rate
print('Burn rate:', burn_rate(0.01, 0.001), 'x budget')Reducing Alert Fatigue
Too many alerts and engineers ignore them all. Keep pages rare and meaningful:
- Every page must be actionable.
- Route non-urgent issues to tickets.
- Group related alerts together.
The Four Golden Signals
Google's SRE book recommends alerting on four signals:
- Latency
- Traffic
- Errors
- Saturation
Cover these and you catch most user-facing problems.
Severity Levels
Classify alerts by severity so the response matches the impact.
severity = {'P1': 'page on-call now', 'P2': 'page during hours', 'P3': 'create ticket'}
print(severity['P1'])Runbooks
Attach a runbook link to every alert. It tells the responder what the alert means, how to confirm impact, and the first steps to mitigate. Runbooks turn panic into procedure.
Closing the Loop
After each incident, review which alerts fired (and which should have). Tune thresholds, delete noisy alerts, and update runbooks. Alerting quality improves through iteration.
Quick Check
You have an SLO of 99.9% availability. What does the remaining 0.1% represent?
Recap
You learned alerting and SLOs:
- SLIs measure behavior; SLOs set targets; error budgets quantify allowed failure.
- Alert on symptoms and burn rate, not every cause.
- Use severity levels and runbooks to make pages actionable.
- Iterate to cut alert fatigue.
Good alerting pages humans only when users actually hurt.
تعلم Microservices Communication Patterns (Saga, Circuit Breaker) مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 12
- الدروس
- 48
الأسئلة الشائعة
هل درس «التنبيهات وأهداف مستوى الخدمة» مجاني؟
نعم — نص درس «التنبيهات وأهداف مستوى الخدمة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Microservices Communication Patterns (Saga, Circuit Breaker)، انتقل إلى CoddyKit PRO. تتضمن دورة Microservices Communication Patterns (Saga, Circuit Breaker) 4 دروس في المجموع.
ماذا ستتعلم في «التنبيهات وأهداف مستوى الخدمة»؟
تعلّم كيفية تحويل بيانات قابلية المراقبة إلى تنبيهات قابلة للتنفيذ باستخدام أهداف مستوى الخدمة وميزانيات الأخطاء والتنبيهات القائمة على الأعراض، بما يقلل الضوضاء ولا ينبه الأشخاص إلا عند الحاجة. تتمرن على Microservices Communication Patterns (Saga, Circuit Breaker) مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ Microservices Communication Patterns (Saga, Circuit Breaker)؟
لا تُشترط خبرة سابقة. Microservices Communication Patterns (Saga, Circuit Breaker) على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 4.
كم من الوقت يستغرق درس «التنبيهات وأهداف مستوى الخدمة»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس Microservices Communication Patterns (Saga, Circuit Breaker) هذا؟
نعم. كل درس في Microservices Communication Patterns (Saga, Circuit Breaker) يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- مفاهيم التتبّع الموزع
- استراتيجيات التسجيل المركزي
- المقاييس وفحوصات الصحة
- التنبيهات وأهداف مستوى الخدمة