Raising the Bar: Nuovi SLO al 99 % (e 99.9 % per l'Overall Health)
created: domenica, giu 15, 2025
TL;DR
| Metrica |
Vecchio SLO |
Nuovo SLO |
| Qualsiasi servizio DTZ rivolto al cliente |
95 % |
99 % |
| dtz overall health (heartbeat aggregato) |
95 % |
99.9 % |
I nuovi obiettivi entrano in vigore **1° luglio 2025** e saranno misurati sulla stessa finestra mobile di 30 giorni che già conosci dalla [status page](https://status.dtz.rocks).
Perché siamo pronti per un ulteriore nove
Nell’ultimo anno la nostra piattaforma è passata silenziosamente da “promettente” a “rodato”:
- I dati parlano: Dal 1° aprile abbiamo registrato 11 incidenti di produzione per un totale di 7 h 28 m di downtime. Questo corrisponde a una disponibilità del 99.66 % in un periodo di 75 giorni—già oltre il nuovo obiettivo globale.
- La salute complessiva è solida: La sonda aggregata dtz overall health è stata indisponibile per soli 16 m nel 2025 finora, traducendosi in 99.97 %.
- Il MTTR (tempo medio di ripristino) si è ridotto del 42 % grazie a rollback automatici, deploy blue/green e a una suite crescente di smoke test.
- Osservabilità ovunque: Ogni percorso critico ora emette metriche RED (rate, errors, duration) e gli allarmi di consumo SLO (SLO burn) arrivano direttamente nei canali Slack dei turnisti.
Cosa cambia per te
- Budget di errore più stretti. Con il 99 % di disponibilità un servizio può ora restare down per ~7 h 18 m al mese (precedentemente ~36 h). Per il controllo overall-health al 99.9 % l’ammissibile è di appena 43 m.
- Risposta agli incidenti più rapida. Le soglie del pager vengono ridotte da 3 m a 60 s di sonde fallite così da poter intervenire prima che tu te ne accorga.
- Crediti trasparenti. Se superiamo lo SLO, i crediti di servizio verranno accreditati automaticamente—nessun ticket necessario. I ToS aggiornati entreranno in vigore la prossima settimana.
- Telemetria pubblica più ricca. I percentili di latenza e i grafici del burn-rate saranno aggiunti a ogni componente nella status page in modo che tu possa correlare i problemi con i tuoi dashboard.
Come rimarremo entro il budget degli errori
- Sonde ridondanti da tre regioni per ogni heartbeat.
- Rollback dei deploy istantanei. Il 90 % delle inversioni è già completato in meno di tre minuti; l’obiettivo è sotto il minuto.
- Esercitazioni di chaos mantengono aggiornati i playbook di recupero.
- Operazioni sostenibili, non sprecone. Continuiamo a operare secondo schedule attenti al carbonio; più nove non significano più megawatt.
Uno sguardo rapido ai numeri
Dal 1° aprile 2025 abbiamo registrato:
- 11 incidenti su cinque servizi.
- Durata media degli incidenti: 41 m.
- Outage singolo più lungo: 1 h 5 m (objectstore, 06 aprile).
- Ultima finestra di 30 giorni: 2 incidenti, 1 h 9 m di downtime totale → 99.85 % di disponibilità.
Queste cifre ci lasciano un margine confortevole per raggiungere i nuovi target anche prima che arrivino gli imminenti upgrade di ridondanza.
Grazie
La reliability non è un interruttore da accendere—è l’effetto cumulativo di review di design, copertura dei test, osservabilità e di un team che ci mette cura. I tuoi report di bug e i suggerimenti sulle funzionalità ci hanno spinti ad alzare l’asticella. Continua a inviare feedback, e a noi non resta che brindare a meno pagine, operazioni più ecologiche e a un nove in più.