Aller au contenu principal

Introduction à l'administration avancée


Table des matières

  1. Le rôle d'administrateur senior
  2. Compétences essentielles
  3. Environnements de production
  4. Méthodologie et bonnes pratiques
  5. Outils de l'administrateur
  6. Exercices pratiques


1 - Le rôle d'administrateur senior

Responsabilités

Différences avec un admin junior

AspectJuniorSenior
ScopeTâches assignéesVision globale
ProblèmesRésolution guidéeDiagnostic autonome
DécisionsSuit les procéduresDéfinit les procédures
ArchitectureImplémenteConçoit
SécuritéApplique les règlesDéfinit la politique

Évolution de carrière

🔝 Retour à la table des matières



2 - Compétences essentielles

Hard Skills

DomaineCompétences
SystèmeKernel, systemd, performance tuning
RéseauTCP/IP avancé, firewall, VPN, load balancing
StockageRAID, LVM, SAN, NFS, iSCSI
SécuritéHardening, audit, SELinux/AppArmor
VirtualisationKVM, VMware, conteneurs
AutomatisationBash, Python, Ansible, Terraform
MonitoringPrometheus, Grafana, ELK

Soft Skills

  • Communication : Expliquer des concepts techniques
  • Documentation : Procédures claires et maintenues
  • Gestion du stress : Incidents en production
  • Mentorat : Former les juniors
  • Vision stratégique : Anticiper les besoins

Certifications reconnues

CertificationÉditeurNiveau
RHCSARed HatIntermédiaire
RHCERed HatAvancé
LFCSLinux FoundationIntermédiaire
LFCELinux FoundationAvancé
CompTIA Linux+CompTIAIntermédiaire

🔝 Retour à la table des matières



3 - Environnements de production

Caractéristiques d'un environnement de production

Niveaux de SLA

SLADowntime/anDowntime/mois
99%3.65 jours7.3 heures
99.9%8.76 heures43.8 minutes
99.99%52.6 minutes4.38 minutes
99.999%5.26 minutes26.3 secondes
Important

Un SLA de 99.9% semble élevé mais représente tout de même 43 minutes d'indisponibilité par mois !

Environnements typiques

┌─────────────┐    ┌─────────────┐    ┌─────────────┐
│ DEV │ → │ STAGING │ → │ PROD │
│ │ │ │ │ │
│ Développeurs│ │ Tests QA │ │ Utilisateurs│
│ Libre accès │ │ Pré-prod │ │ Accès limité│
└─────────────┘ └─────────────┘ └─────────────┘

🔝 Retour à la table des matières



4 - Méthodologie et bonnes pratiques

ITIL - Gestion des services

ProcessusDescription
Incident ManagementRestaurer le service rapidement
Problem ManagementIdentifier et éliminer les causes
Change ManagementContrôler les modifications
Release ManagementDéployer de manière fiable

Gestion des changements

Documentation obligatoire

# Structure de documentation recommandée
docs/
├── architecture/
│ ├── infrastructure.md
│ └── network-diagram.md
├── procedures/
│ ├── backup-restore.md
│ ├── incident-response.md
│ └── deployment.md
├── runbooks/
│ ├── service-restart.md
│ └── troubleshooting-guide.md
└── policies/
├── security-policy.md
└── change-management.md

Post-mortem après incident

# Post-mortem : [Titre de l'incident]

## Résumé
- Date : YYYY-MM-DD
- Durée : X heures
- Impact : [Description]

## Timeline
- HH:MM - Détection
- HH:MM - Actions prises
- HH:MM - Résolution

## Cause racine
[Explication détaillée]

## Actions correctives
1. [ ] Action 1
2. [ ] Action 2

## Leçons apprises
[Ce qu'on retient]

🔝 Retour à la table des matières



5 - Outils de l'administrateur

Monitoring et observabilité

OutilUsage
PrometheusMétriques et alertes
GrafanaDashboards
ELK StackLogs centralisés
Nagios/ZabbixMonitoring infrastructure
Datadog/New RelicAPM SaaS

Configuration Management

OutilType
AnsibleAgentless, YAML
PuppetAgent, Ruby DSL
ChefAgent, Ruby DSL
SaltStackAgent/Agentless, YAML

Infrastructure as Code

OutilUsage
TerraformMulti-cloud provisioning
CloudFormationAWS IaC
PulumiIaC avec langages généraux

Outils CLI essentiels

# Performance
htop, iotop, iftop, nethogs, dstat

# Réseau
tcpdump, wireshark, nmap, ss, ip

# Système
strace, ltrace, lsof, fuser

# Logs
journalctl, tail, less, grep, awk

# Stockage
lsblk, fdisk, parted, pvs, vgs, lvs

🔝 Retour à la table des matières



6 - Exercices pratiques

Exercice 1 : Auto-évaluation

Évaluez vos compétences actuelles :

Domaine1-5À améliorer
Scripting Bash
Configuration réseau
Sécurité système
Monitoring
Troubleshooting

Exercice 2 : Documentation

Créez un runbook pour le redémarrage d'un service critique :

Structure suggérée
# Runbook : Redémarrage du service [NOM]

## Prérequis
- Accès root au serveur
- Vérifier la fenêtre de maintenance

## Procédure
1. Vérifier l'état actuel
2. Notifier les équipes
3. Arrêter le service
4. Vérifier les logs
5. Démarrer le service
6. Valider le fonctionnement
7. Clôturer

## Rollback
En cas de problème...

Quiz

Q1. Que signifie un SLA de 99.99% en termes de downtime mensuel ?

Réponse

Environ 4.38 minutes de downtime par mois maximum.

Q2. Quelle est la différence entre Incident Management et Problem Management ?

Réponse
  • Incident Management : Restaurer le service rapidement (réactif)
  • Problem Management : Identifier et éliminer la cause racine (proactif)

🔝 Retour à la table des matières



Points clés à retenir

  • L'admin senior a une vision globale et définit les procédures
  • Les SLA dictent les exigences de disponibilité
  • La documentation est aussi importante que les compétences techniques
  • Le Change Management évite les incidents en production
  • Maîtriser les outils de monitoring et automatisation

🔝 Retour à la table des matières


Chapitre suivant : Hardening et sécurité →