📊 Cours observabilité gratuit : voir ce qui se passe en production
Bienvenue dans le cours découverte observabilité le plus pédagogique en français. En 7 leçons courtes, vous allez comprendre pourquoi on ne peut pas exploiter un système qu'on ne mesure pas, et comment les équipes les plus fiables du monde savent qu'un problème existe avant que leurs utilisateurs ne le signalent.
Ce que ce cours vise : répondre pour de bon aux questions « monitoring ou observabilité ? », « c'est quoi les trois piliers ? », « à quoi sert un SLO ? », « pourquoi mon équipe ignore les alertes ? », « Prometheus ou Datadog ? » — avec des exemples concrets et sans jargon.
Ce que ce cours ne fait pas : vous apprendre à écrire une requête PromQL ou à configurer un tableau de bord Grafana. Cette maîtrise pratique est l'objet du cours Premium Monitoring et Logs.
Ce que vous allez découvrir
Contenu du cours
| N° | Leçon | Objectif principal | Durée |
|---|---|---|---|
| 1 | Le problème que l'observabilité résout | Comprendre le coût réel de piloter à l'aveugle | 6 min |
| 2 | Monitoring ou observabilité ? | Distinguer rigoureusement les deux notions | 6 min |
| 3 | Les trois piliers | Métriques, logs, traces : quand utiliser lequel | 8 min |
| 4 | Que mesurer exactement ? | Les quatre signaux dorés, les méthodes USE et RED | 7 min |
| 5 | SLI, SLO et budget d'erreur | Le cœur de la démarche SRE, expliqué simplement | 7 min |
| 6 | Les outils et l'art de l'alerte | Prometheus, Grafana, OpenTelemetry + alertes utiles | 7 min |
| 7 | Cas d'usage réels + FAQ | Google, incidents célèbres + 14 questions fréquentes | 5 min |
| 8 | Quiz et attestation | Valider vos acquis en 5 questions corrigées | 3 min |
Ce cours est-il pour vous ?
- Vous êtes développeur·se et vous découvrez les problèmes de production par les messages des utilisateurs.
- Vous êtes administrateur·rice système ou SRE et vous voulez structurer votre approche au-delà des graphiques de charge processeur.
- Vous êtes en astreinte et vous êtes réveillé·e par des alertes qui, une fois sur deux, ne correspondent à rien.
- Vous êtes en reconversion DevOps et l'observabilité revient dans tous les entretiens.
- Vous êtes chef de projet ou CTO et vous voulez comprendre ce que signifie réellement « notre service est disponible à 99,9 % ».
Aucun prérequis lourd. La lecture préalable de Découverte Docker et Découverte Kubernetes aide à saisir les exemples, sans être indispensable.
Plan du cours en un coup d'œil
Ce que vous saurez à la fin
Aucune requête à retenir. À la fin du cours, vous saurez :
- Expliquer la différence entre monitoring et observabilité sans hésiter.
- Choisir entre métriques, logs et traces selon la question posée.
- Appliquer les quatre signaux dorés à n'importe quel service.
- Définir un SLO pertinent et calculer le budget d'erreur correspondant.
- Comprendre pourquoi votre équipe souffre de fatigue d'alerte, et comment y remédier.
- Comparer Prometheus, Grafana, Datadog et OpenTelemetry avec de vrais arguments.
- Aborder sereinement le cours Premium Monitoring et Logs.
⏱️ Durée estimée
Environ 45 minutes de lecture au total. Chaque leçon est autonome — vous pouvez en lire une par jour, ou tout enchaîner en une soirée.
Prérequis et cousins recommandés
Prérequis utiles :
- Découverte Linux — comprendre les journaux système et les processus.
- Découverte Docker — les conteneurs changent la façon de collecter les journaux.
- Découverte Kubernetes — l'environnement où Prometheus s'est imposé.
Suite naturelle après ce cours :
- Cours Premium Monitoring et Logs — Prometheus, Grafana, Loki, Jaeger en pratique
- Découverte CI/CD — l'observabilité est le prérequis du canary et du déploiement continu
- Découverte sécurité — détecter une intrusion suppose de savoir observer
Questions fréquentes en une réponse
Monitoring ou observabilité — quelle différence ?
Monitoring : surveiller des indicateurs que vous avez choisis à l'avance. Il répond aux questions que vous saviez devoir poser.
Observabilité : capacité à comprendre l'état interne du système à partir de ce qu'il émet, y compris pour des questions que vous n'avez jamais anticipées.
Formule utile : le monitoring couvre les problèmes connus, l'observabilité permet d'investiguer les problèmes inédits. La leçon 2 développe.
Les trois piliers, c'est quoi ?
- Métriques — des nombres agrégés dans le temps. Peu coûteuses. Répondent à « y a-t-il un problème ? »
- Logs — des événements textuels horodatés. Volumineux. Répondent à « que s'est-il passé exactement ? »
- Traces — le parcours d'une requête à travers tous les services. Répondent à « où est la lenteur dans la chaîne ? »
La leçon 3 détaille chacun, avec les coûts et les pièges.
Que faut-il surveiller en priorité ?
Les quatre signaux dorés définis par Google :
- Latence — le temps de réponse.
- Trafic — le volume de demandes.
- Erreurs — le taux d'échec.
- Saturation — le remplissage des ressources critiques.
Si vous ne pouvez surveiller que quatre choses, ce sont celles-là. Pas la charge processeur — c'est expliqué en leçon 4.
C'est quoi un SLO et un budget d'erreur ?
Un SLO est un objectif chiffré interne, par exemple « 99,9 % des requêtes servies en moins de 300 ms sur 30 jours ».
Le budget d'erreur est son complément : avec 99,9 %, vous avez droit à 0,1 % d'échecs, soit environ 43 minutes par mois.
Ce budget devient un outil de décision : s'il est épuisé, on gèle les nouvelles fonctionnalités pour se consacrer à la fiabilité. La leçon 5 explique tout.
Prometheus ou Datadog ?
Prometheus + Grafana — gratuit, open source, standard de fait sur Kubernetes. Mais vous l'exploitez vous-même.
Datadog (ou New Relic, Dynatrace, Grafana Cloud) — immédiatement opérationnel, très complet, mais le coût croît vite avec le nombre de machines.
Règle simple : petite équipe sans compétence d'exploitation → offre commerciale. Équipe déjà à l'aise avec Kubernetes → Prometheus. La leçon 6 compare en détail.
Pourquoi mon équipe ignore-t-elle les alertes ?
C'est la fatigue d'alerte, et c'est un problème de conception, pas de discipline. Elle vient de trois causes :
- Des alertes qui ne demandent aucune action (« charge processeur à 80 % » — et alors ?).
- Des alertes trop nombreuses, dont la majorité sont des faux positifs.
- Des alertes qui n'indiquent pas quoi faire.
Règle d'or : une alerte qui réveille quelqu'un doit exiger une action humaine immédiate. Sinon, ce n'est pas une alerte, c'est un tableau de bord. Voir la leçon 6.
Ce cours découverte explique quoi mesurer et pourquoi, sans configuration. Pour installer Prometheus, écrire des requêtes PromQL, construire des tableaux de bord Grafana, centraliser des journaux avec Loki et tracer avec Jaeger, passez au cours Premium Monitoring et Logs — inclus dans tous nos forfaits payants.
Autres cours découverte à ne pas manquer
- Découverte Kubernetes — l'environnement où Prometheus règne
- Découverte CI/CD — l'observabilité conditionne le canary
- Découverte Docker — collecter les journaux d'un conteneur
- Découverte cloud — les services de supervision managés
- Découverte sécurité — observer pour détecter
- Découverte Linux — journaux système et processus
Prêt·e ? Commencer par la leçon 1 →