2026-10-17 –, Track 1
Parecía un día normal: las alertas habituales, el ruido esperable en un sistema distribuido como Grafana Tempo, nuestra base de datos de trazas. Hasta que llegó una de las gordas, y yo estaba de guardia.
El p99 de la latencia de escritura en uno de nuestros clústeres más grandes pasó de cientos de milisegundos a más de 3 segundos. En un clúster que ingiere 64 TB al día, esto no es anecdótico. Los timeouts empezaron a multiplicarse y, con ellos, la incertidumbre sobre millones de spans potencialmente perdidos. Declaré el incidente.
Esta charla trata de lo que pasa cuando todo se rompe en producción y tú estás al mando. A partir de este incidente real, veremos cómo convertir una crisis en una oportunidad de crecimiento técnico y profesional.
¿Qué vas a aprender?
* Triaje sin pánico: Cómo responder durante los primeros minutos críticos, definir roles (Comandante e Investigador) y comunicar con claridad y transparencia cuando la causa no está clara.
* Diagnóstico pragmático: Técnicas para evitar el sesgo de confirmación y la visión de túnel cuando las alertas no dejan de sonar.
* Post-mortems que importan: Cómo escribir análisis blameless (sin culpas) que generen cambios sistémicos, no documentos olvidados.
* Crecimiento profesional: Por qué los incidentes son uno de los aceleradores más poderosos en la carrera de un ingeniero.
Cerraremos con ejercicio simulado, poniendo en práctica las las herramientas de triaje y comunicación aprendidas.
Granadino, trabajo desarrollando Grafana Tempo, una base de datos de trazas distribuida. Trotamundos digital.