Site Reliability Engineering (SRE)
À propos de ce cours
Le Site Reliability Engineering (SRE) est une discipline créée par Google pour construire et maintenir des systèmes à grande échelle. Ce cours vous apprend les principes et pratiques SRE pour améliorer la fiabilité de vos services.
Prérequis
- Monitoring & Logs (cours précédent)
- DevOps fundamentals
- Kubernetes basics
- Scripting (Python/Bash)
Contenu du cours
-
- Origines chez Google
- SRE vs DevOps
- Principes fondamentaux
-
- Service Level Indicators
- Service Level Objectives
- Service Level Agreements
-
- Concept et calcul
- Policies
- Decision making
-
- Définition du toil
- Identification
- Automation strategies
-
- Incident response
- Rôles et communication
- Escalation
-
- Blameless culture
- Template et process
- Action items
-
- Forecasting
- Load testing
- Resource management
-
- Deployment strategies
- Feature flags
- Rollbacks
-
- On-call best practices
- Team structure
- SRE maturity
-
- Labs pratiques
- Implémentation SRE
- Certifications
Durée estimée
⏱️ 16-20 heures de formation incluant les exercices pratiques
Objectifs pédagogiques
À la fin de ce cours, vous serez capable de :
- Définir des SLIs et SLOs pertinents
- Gérer un Error Budget
- Identifier et éliminer le Toil
- Conduire des Post-mortems blameless
- Planifier la capacité des systèmes
- Implémenter les pratiques Release Engineering