Domaine d’expertise
Site Reliability Engineering
La fiabilité devient un sujet de gouvernance lorsque tout incident est prioritaire, qu’aucun niveau de service n’est négocié et que les équipes ne peuvent jamais arrêter la livraison pour réduire le risque.
Définition opérationnelle
Le SRE rend la fiabilité arbitrable par des objectifs de service, des budgets d’erreur, une ingénierie de l’exploitation et des boucles d’apprentissage fondées sur les incidents.
Problèmes réellement rencontrés
-
01
SLO choisis selon les métriques disponibles
-
02
Astreinte saturée par des alertes non actionnables
-
03
Post-mortems sans suivi des actions structurelles
-
04
Fiabilité traitée comme la seule responsabilité des opérations
Décisions concernées
- Définir les parcours et niveaux de service réellement critiques
- Arbitrer vitesse de changement et risque avec un budget d’erreur
- Choisir les investissements qui réduisent toil et exposition
Erreurs fréquentes
- Adopter les rituels SRE sans pouvoir décisionnel
- Fixer 99,9 % sans coût ni dépendances analysés
- Transformer chaque symptôme en alerte
Signaux qu’une expertise externe devient utile
- Les mêmes classes d’incidents se répètent
- L’astreinte dépend de quelques personnes
- Les objectifs produit ignorent le risque opérationnel
Méthode Omnivya
-
1.
Identifier services, utilisateurs et parcours critiques
-
2.
Analyser incidents, alertes, toil et dépendances
-
3.
Proposer SLI, SLO et règles d’arbitrage
-
4.
Installer une boucle de revue avec responsabilités explicites
Livrables possibles
- Catalogue de services et criticité
- Proposition de SLI, SLO et budgets d’erreur
- Plan de réduction du toil et des risques récurrents
Preuves de raisonnement
- SLI calculables à partir de données qualifiées
- Alertes rattachées à une action attendue
- Actions d’incident avec propriétaire et vérification
Limites explicites
- Ne pas fixer un SLO sans discussion métier
- Ne pas externaliser durablement l’astreinte
- Ne pas utiliser le blâme comme mécanisme de fiabilité
Formats de mission associés
- Diagnostic ciblé
Clarifier une décision technique précise à partir d’observations bornées.
- Revue de risques techniques
Qualifier le risque au-delà du volume de tickets ou de CVE.
- Gouvernance technique récurrente
Instaurer un rythme de décisions techniques documentées, sans dépendance opaque.
Questions fréquentes
- Faut-il créer une équipe SRE ?
- Pas toujours. Les pratiques peuvent être distribuées si responsabilités, temps et pouvoir d’arbitrage sont réels.
- Un budget d’erreur bloque-t-il les livraisons ?
- Il fournit une règle de décision convenue. La réponse dépend du niveau de consommation, du risque et des exceptions définies.
- Pouvez-vous cadrer une astreinte ?
- Oui, notamment sur la couverture, les escalades, la qualité des alertes, les compétences et la charge soutenable.
Arbitrer un objectif de fiabilité
Si la tension décrite est la vôtre, cadrons la décision avant d’élargir le périmètre.