SRE-301 Advanced ⏱ 8 weeks

Advanced SRE & Observability

Deep observability and reliability at scale: distributed tracing, alert design, chaos engineering, capacity planning and mature on-call practice.

Prerequisites: SRE-201 SRE Fundamentals

Syllabus

Module 1 — Observability

  • Three pillars: metrics, logs, traces
  • OpenTelemetry
  • Distributed tracing with Jaeger/Tempo

Module 2 — Alerting that works

  • Symptom-based alerting
  • Burn-rate alerts on SLOs
  • Reducing alert fatigue

Module 3 — Resilience engineering

  • Chaos experiments
  • Load testing
  • Graceful degradation patterns

Module 4 — Scale & practice

  • Capacity planning
  • Performance analysis
  • Production readiness reviews
  • Building an on-call rotation