Introduction à l'administration avancée
Table des matières
- Le rôle d'administrateur senior
- Compétences essentielles
- Environnements de production
- Méthodologie et bonnes pratiques
- Outils de l'administrateur
- Exercices pratiques
1 - Le rôle d'administrateur senior
Responsabilités
Différences avec un admin junior
| Aspect | Junior | Senior |
|---|---|---|
| Scope | Tâches assignées | Vision globale |
| Problèmes | Résolution guidée | Diagnostic autonome |
| Décisions | Suit les procédures | Définit les procédures |
| Architecture | Implémente | Conçoit |
| Sécurité | Applique les règles | Définit la politique |
Évolution de carrière
🔝 Retour à la table des matières
2 - Compétences essentielles
Hard Skills
| Domaine | Compétences |
|---|---|
| Système | Kernel, systemd, performance tuning |
| Réseau | TCP/IP avancé, firewall, VPN, load balancing |
| Stockage | RAID, LVM, SAN, NFS, iSCSI |
| Sécurité | Hardening, audit, SELinux/AppArmor |
| Virtualisation | KVM, VMware, conteneurs |
| Automatisation | Bash, Python, Ansible, Terraform |
| Monitoring | Prometheus, Grafana, ELK |
Soft Skills
- Communication : Expliquer des concepts techniques
- Documentation : Procédures claires et maintenues
- Gestion du stress : Incidents en production
- Mentorat : Former les juniors
- Vision stratégique : Anticiper les besoins
Certifications reconnues
| Certification | Éditeur | Niveau |
|---|---|---|
| RHCSA | Red Hat | Intermédiaire |
| RHCE | Red Hat | Avancé |
| LFCS | Linux Foundation | Intermédiaire |
| LFCE | Linux Foundation | Avancé |
| CompTIA Linux+ | CompTIA | Intermédiaire |
🔝 Retour à la table des matières
3 - Environnements de production
Caractéristiques d'un environnement de production
Niveaux de SLA
| SLA | Downtime/an | Downtime/mois |
|---|---|---|
| 99% | 3.65 jours | 7.3 heures |
| 99.9% | 8.76 heures | 43.8 minutes |
| 99.99% | 52.6 minutes | 4.38 minutes |
| 99.999% | 5.26 minutes | 26.3 secondes |
Important
Un SLA de 99.9% semble élevé mais représente tout de même 43 minutes d'indisponibilité par mois !
Environnements typiques
┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ DEV │ → │ STAGING │ → │ PROD │
│ │ │ │ │ │
│ Développeurs│ │ Tests QA │ │ Utilisateurs│
│ Libre accès │ │ Pré-prod │ │ Accès limité│
└─────────────┘ └─────────────┘ └─────────────┘
🔝 Retour à la table des matières
4 - Méthodologie et bonnes pratiques
ITIL - Gestion des services
| Processus | Description |
|---|---|
| Incident Management | Restaurer le service rapidement |
| Problem Management | Identifier et éliminer les causes |
| Change Management | Contrôler les modifications |
| Release Management | Déployer de manière fiable |
Gestion des changements
Documentation obligatoire
# Structure de documentation recommandée
docs/
├── architecture/
│ ├── infrastructure.md
│ └── network-diagram.md
├── procedures/
│ ├── backup-restore.md
│ ├── incident-response.md
│ └── deployment.md
├── runbooks/
│ ├── service-restart.md
│ └── troubleshooting-guide.md
└── policies/
├── security-policy.md
└── change-management.md
Post-mortem après incident
# Post-mortem : [Titre de l'incident]
## Résumé
- Date : YYYY-MM-DD
- Durée : X heures
- Impact : [Description]
## Timeline
- HH:MM - Détection
- HH:MM - Actions prises
- HH:MM - Résolution
## Cause racine
[Explication détaillée]
## Actions correctives
1. [ ] Action 1
2. [ ] Action 2
## Leçons apprises
[Ce qu'on retient]
🔝 Retour à la table des matières
5 - Outils de l'administrateur
Monitoring et observabilité
| Outil | Usage |
|---|---|
| Prometheus | Métriques et alertes |
| Grafana | Dashboards |
| ELK Stack | Logs centralisés |
| Nagios/Zabbix | Monitoring infrastructure |
| Datadog/New Relic | APM SaaS |
Configuration Management
| Outil | Type |
|---|---|
| Ansible | Agentless, YAML |
| Puppet | Agent, Ruby DSL |
| Chef | Agent, Ruby DSL |
| SaltStack | Agent/Agentless, YAML |
Infrastructure as Code
| Outil | Usage |
|---|---|
| Terraform | Multi-cloud provisioning |
| CloudFormation | AWS IaC |
| Pulumi | IaC avec langages généraux |
Outils CLI essentiels
# Performance
htop, iotop, iftop, nethogs, dstat
# Réseau
tcpdump, wireshark, nmap, ss, ip
# Système
strace, ltrace, lsof, fuser
# Logs
journalctl, tail, less, grep, awk
# Stockage
lsblk, fdisk, parted, pvs, vgs, lvs
🔝 Retour à la table des matières
6 - Exercices pratiques
Exercice 1 : Auto-évaluation
Évaluez vos compétences actuelles :
| Domaine | 1-5 | À améliorer |
|---|---|---|
| Scripting Bash | ||
| Configuration réseau | ||
| Sécurité système | ||
| Monitoring | ||
| Troubleshooting |
Exercice 2 : Documentation
Créez un runbook pour le redémarrage d'un service critique :
Structure suggérée
# Runbook : Redémarrage du service [NOM]
## Prérequis
- Accès root au serveur
- Vérifier la fenêtre de maintenance
## Procédure
1. Vérifier l'état actuel
2. Notifier les équipes
3. Arrêter le service
4. Vérifier les logs
5. Démarrer le service
6. Valider le fonctionnement
7. Clôturer
## Rollback
En cas de problème...
Quiz
Q1. Que signifie un SLA de 99.99% en termes de downtime mensuel ?
Réponse
Environ 4.38 minutes de downtime par mois maximum.
Q2. Quelle est la différence entre Incident Management et Problem Management ?
Réponse
- Incident Management : Restaurer le service rapidement (réactif)
- Problem Management : Identifier et éliminer la cause racine (proactif)
🔝 Retour à la table des matières
Points clés à retenir
- L'admin senior a une vision globale et définit les procédures
- Les SLA dictent les exigences de disponibilité
- La documentation est aussi importante que les compétences techniques
- Le Change Management évite les incidents en production
- Maîtriser les outils de monitoring et automatisation