Aller au contenu principal

Site Reliability Engineering (SRE)


À propos de ce cours

Le Site Reliability Engineering (SRE) est une discipline créée par Google pour construire et maintenir des systèmes à grande échelle. Ce cours vous apprend les principes et pratiques SRE pour améliorer la fiabilité de vos services.


Prérequis

  • Monitoring & Logs (cours précédent)
  • DevOps fundamentals
  • Kubernetes basics
  • Scripting (Python/Bash)

Contenu du cours

  1. Introduction au SRE

    • Origines chez Google
    • SRE vs DevOps
    • Principes fondamentaux
  2. SLIs, SLOs et SLAs

    • Service Level Indicators
    • Service Level Objectives
    • Service Level Agreements
  3. Error Budget

    • Concept et calcul
    • Policies
    • Decision making
  4. Élimination du Toil

    • Définition du toil
    • Identification
    • Automation strategies
  5. Gestion des Incidents

    • Incident response
    • Rôles et communication
    • Escalation
  6. Post-mortems

    • Blameless culture
    • Template et process
    • Action items
  7. Capacity Planning

    • Forecasting
    • Load testing
    • Resource management
  8. Release Engineering

    • Deployment strategies
    • Feature flags
    • Rollbacks
  9. Bonnes pratiques

    • On-call best practices
    • Team structure
    • SRE maturity
  10. Exercices et Projets

    • Labs pratiques
    • Implémentation SRE
    • Certifications

Durée estimée

⏱️ 16-20 heures de formation incluant les exercices pratiques


Objectifs pédagogiques

À la fin de ce cours, vous serez capable de :

  • Définir des SLIs et SLOs pertinents
  • Gérer un Error Budget
  • Identifier et éliminer le Toil
  • Conduire des Post-mortems blameless
  • Planifier la capacité des systèmes
  • Implémenter les pratiques Release Engineering