Rehausser la barre : nouveaux SLO à 99 % (et 99.9 % pour la santé globale)
created: dimanche, juin 15, 2025
En bref
| Indicateur |
Ancien SLO |
Nouveau SLO |
| Any DTZ customer-facing service |
95 % |
99 % |
| dtz overall health (sonde agrégée) |
95 % |
99.9 % |
Les nouveaux objectifs prennent effet **1 July 2025** et seront mesurés sur la même fenêtre glissante de 30 jours que vous connaissez déjà depuis la [status page](https://status.dtz.rocks).
Pourquoi nous sommes prêts pour un neuf supplémentaire
Au cours de l’année écoulée, notre plateforme a discrètement évolué de « prometteuse » à « éprouvée » :
- Les données parlent : Depuis le 1er avril nous avons enregistré 11 incidents de production totalisant 7 h 28 m d’indisponibilité. Cela représente 99.66 % de disponibilité sur une période de 75 jours — déjà au-dessus du nouvel objectif global.
- La santé globale est solide : La sonde agrégée dtz overall health n’a été indisponible que 16 m en 2025 à ce jour, soit 99.97 %.
- Le temps moyen de rétablissement (MTTR) a diminué de 42 % grâce aux rollback automatiques, aux déploiements blue/green et à une suite croissante de tests smoke.
- Observabilité partout : Chaque chemin critique émet désormais des métriques RED (rate, errors, duration) et les alertes de burn des SLO remontent directement dans les canaux Slack des équipes d’astreinte.
Ce qui change pour vous
- Budgets d’erreur plus serrés. Avec 99 % de disponibilité, un service peut désormais être indisponible environ ~7 h 18 m par mois (précédemment ~36 h). Pour la vérification de santé globale à 99.9 %, la tolérance n’est que 43 m.
- Réponse aux incidents plus rapide. Les seuils de pager sont raccourcis de 3 m à 60 s de sondes en échec afin que nous puissions agir avant que vous ne remarquiez.
- Crédits transparents. Si nous franchissons l’SLO, des crédits de service seront appliqués automatiquement — aucun ticket requis. Les ToS mises à jour seront publiées la semaine prochaine.
- Télémétrie publique enrichie. Des percentiles de latence et des graphiques de burn-rate seront ajoutés à chaque composant sur la page de statut pour que vous puissiez corréler les problèmes avec vos propres tableaux de bord.
- Sondes redondantes depuis trois régions pour chaque heartbeat.
- Rollbacks de déploiement instantanés. 90 % des reversions sont déjà complétés en moins de trois minutes ; l’objectif est inférieur à une minute.
- Des exercices de chaos gardent les playbooks de récupération à jour.
- Des opérations durables, pas des opérations gaspillantes. Nous continuons à fonctionner selon des calendriers sensibles au carbone ; plus de nines ne signifient pas plus de mégawatts.
Un aperçu rapide des chiffres
Depuis 1er avril 2025 nous avons observé :
- 11 incidents sur cinq services.
- Durée moyenne des incidents : 41 m.
- La plus longue panne unique : 1 h 5 m (objectstore, 06 avril).
- Dernière fenêtre de 30 jours : 2 incidents, 1 h 9 m de temps d’arrêt total → 99.85 % de disponibilité.
Ces chiffres nous offrent une marge confortable pour atteindre les nouveaux objectifs, même avant que les prochaines améliorations de redondance ne soient déployées.
Merci
La fiabilité n’est pas un interrupteur qu’on actionne — c’est l’effet cumulé des revues de conception, de la couverture de tests, de l’observabilité et d’une équipe qui se soucie du résultat. Vos rapports de bugs et vos suggestions de fonctionnalités nous ont poussés à élever la barre. Continuez à nous faire vos retours, et à une réduction des pages, des opérations plus vertes et un neuf supplémentaire.