Subiendo el listón: nuevos SLOs al 99 % (y 99.9 % para la salud general)
created: domingo, jun 15, 2025
Resumen
| Metric |
Old SLO |
New SLO |
| Any DTZ customer-facing service |
95 % |
99 % |
| dtz overall health (aggregated heartbeat) |
95 % |
99.9 % |
Los nuevos objetivos entran en vigor el **1 de julio de 2025** y se medirán durante la misma ventana móvil de 30 días que ya conoce desde la [página de estado](https://status.dtz.rocks).
Por qué estamos listos para un nueve más
En el último año nuestra plataforma ha evolucionado silenciosamente de “prometedora” a “probada en batalla”:
- Los datos hablan: Desde el 1 de abril hemos registrado 11 incidentes de producción con un total de 7 h 28 m de tiempo de inactividad. Eso es una disponibilidad del 99.66 % durante un periodo de 75 días—ya por encima del nuevo objetivo global.
- La salud general es muy sólida: La sonda agregada dtz overall health ha estado indisponible solo 16 m en 2025 hasta la fecha, lo que se traduce en 99.97 %.
- El tiempo medio de recuperación (MTTR) se redujo un 42 % gracias a rollback automáticos, despliegues blue/green y una creciente batería de pruebas de humo.
- Observabilidad en todas partes: Cada camino crítico ahora emite métricas RED (rate, errors, duration) y las alertas de consumo de SLO alimentan directamente los canales de Slack del personal de guardia.
Qué cambia para usted
- Presupuestos de errores más estrictos. Con una disponibilidad del 99 % un servicio puede ahora estar caído aproximadamente ~7 h 18 m por mes (anteriormente ~36 h). Para la comprobación de salud general al 99.9 % la tolerancia es de solo 43 m.
- Respuesta a incidentes más rápida. Los umbrales de pager se están reduciendo de 3 m a 60 s de sondas fallidas para que podamos actuar antes de que lo note.
- Créditos transparentes. Si incumplimos el SLO, los créditos de servicio se aplicarán automáticamente—no se requiere ticket. Los ToS actualizados entran en vigor la próxima semana.
- Telemetría pública más completa. Se añadirán percentiles de latencia y gráficos de burn-rate a cada componente en la página de estado para que pueda correlacionar problemas con sus propios paneles.
Cómo nos mantendremos dentro del presupuesto
- Sondas redundantes desde tres regiones para cada latido.
- Reversiones de despliegue instantáneas. El 90 % de las reversiones ya se completan en menos de tres minutos; la meta es menos de un minuto.
- simulacros de caos mantienen los playbooks de recuperación frescos.
- Operaciones sostenibles, no operaciones derrochadoras. Continuamos operando con horarios conscientes de carbono; más nueves no significan más megavatios.
Un vistazo rápido a los números
Desde 1 de abril de 2025 hemos observado:
- 11 incidentes en cinco servicios.
- Duración media de incidentes: 41 m.
- Mayor corte único: 1 h 5 m (objectstore, 06 de abril).
- Última ventana de 30 días: 2 incidentes, 1 h 9 m de tiempo de inactividad total → 99.85 % de disponibilidad.
Estas cifras nos dan un margen cómodo para cumplir los nuevos objetivos incluso antes de que lleguen las próximas mejoras de redundancia.
Gracias
La fiabilidad no es un interruptor que se activa—es el efecto acumulativo de revisiones de diseño, cobertura de pruebas, observabilidad y un equipo que se preocupa. Sus informes de errores y sugerencias de funciones nos empujaron a subir el listón. Siga enviando comentarios, y brindemos por menos avisos, operaciones más ecológicas y un nueve extra.