Planteamiento y caso de uso
Describe un incidente de producción en cuya revisión hayas participado: ¿cómo reconstruiste los hechos, evitaste culpar a personas, impulsaste acciones concretas y verificaste que los cambios redujeran el riesgo de recurrencia? La respuesta debe mostrar comunicación, compensaciones (trade-offs), colaboración y seguimiento bajo presión.
Qué evalúa el entrevistador
- Si puedes explicar el impacto, las decisiones y la recuperación con una cronología y evidencia.
- Si distingues una cultura libre de culpas de eludir la rendición de cuentas, enfocándote en los sistemas y procesos.
- Si conviertes «mejorar el monitoreo» en un responsable, una fecha límite y una señal de aceptación.
- Si reconoces tus propios errores de juicio y demuestras seguimiento y verificación entre equipos.
Preguntas para aclarar antes de responder
- ¿Qué usuarios, SLOs o flujos de negocio se vieron afectados y durante cuánto tiempo?
- ¿Qué rol desempeñaste y qué decisiones tomaste directamente?
- ¿Qué hechos se conocían en ese momento y cuáles conclusiones son fruto de la retrospectiva?
- ¿Cómo se priorizaron, asignaron, verificaron y midieron las acciones?
Un marco de respuesta de 30 segundos
Respondería con «situación, acción, resultado, autopsia». Primero, cuantificar el impacto y los objetivos de recuperación en una cronología; luego, explicar mis responsabilidades operativas y de comunicación. En la revisión, debatir las condiciones observables del sistema, las señales y el contexto de las decisiones en lugar de asignar culpas personales. Finalmente, reducir el plan a unas pocas acciones de alta prioridad, cada una con un responsable, fecha límite y señal medible, y verificar el resultado mediante un despliegue, repetición de alertas o un game day.
Análisis detallado paso a paso
1. Establecer el límite fáctico
Recopila alertas, registros, historiales de cambios e impacto en los usuarios, y luego construye una cronología considerando las zonas horarias. Separa los hechos observados, las hipótesis que se tenían en el momento y la visión retrospectiva para que la información posterior no se use para juzgar una decisión previa.
2. Declarar tu rol
Indica si eras el ingeniero de guardia (on-call), coordinador, responsable del lanzamiento o personal de soporte en la respuesta, y explica tu autoridad y la ruta de escalamiento. El entrevistador busca tu contribución concreta, no una lista de los logros de todos.
3. Describir la recuperación, no actos heroicos
Explica cómo redujiste el impacto, pausaste cambios riesgosos, solicitaste ayuda y mantuviste informadas a las partes interesadas. Si hiciste una reversión (rollback), degradaste una funcionalidad o aceptaste una compensación (trade-off), conéctalo con las señales y los riesgos que se conocían en ese instante.
4. Establecer reglas para un debate libre de culpas
Enfócate en las condiciones del sistema, la retroalimentación de las herramientas, las brechas en los procesos y el contexto de las decisiones, no en etiquetas como descuidado o irresponsable. La cultura libre de culpas preserva la calidad del aprendizaje; no borra la rendición de cuentas sobre permisos, capacitación o cumplimiento normativo.
5. Encontrar factores del sistema que se puedan modificar
Desglosa las causas en desencadenante, amplificadores, retraso en la detección, obstáculos para la recuperación y restricciones organizacionales. Un solo umbral puede ser tanto una brecha de detección como un problema de diseño de capacidad; no lo reduzcas a «alguien pasó por alto una alerta».
6. Redactar acciones que puedan ser aceptadas
Cada acción necesita una operación, un responsable, una fecha límite, una prioridad y una señal de aceptación. Reescribe «añadir monitoreo» como una consulta, un umbral, una regla de enrutamiento y una fecha de simulacro para que un simple deseo no se disfrace de plan.
7. Manejar los desacuerdos
Cuando las prioridades difieran, vuelve al impacto en el usuario, la reducción del riesgo, el costo de implementación y las dependencias. Registra las sugerencias rechazadas y sus motivos; ejecuta un experimento pequeño cuando sea útil en lugar de discutir en abstracto.
8. Verificar el ciclo de mejora
Después del despliegue, observa alertas similares, el tiempo de recuperación y las métricas de usuario, y programa un simulacro de fallo o reversión (rollback). Si las métricas no mejoran, reabre la acción. La finalización implica evidencia de un menor riesgo, no simplemente un documento entregado.
Compensaciones y límites
- Un mayor nivel de detalle en la autopsia no es automáticamente mejor; preserva la evidencia que cambie decisiones o reduzca riesgos.
- El debate libre de culpas mejora la calidad de la información, pero el comportamiento malicioso, el cumplimiento normativo o el abuso de privilegios siguen requiriendo una investigación formal.
- Demasiadas acciones diluyen la ejecución; entrégalas en lotes según el riesgo y la reversibilidad.
- Un simulacro revela brechas en el proceso, pero no puede demostrar que todos los fallos extremos estén cubiertos; declara lo que queda sin verificar.
Plan de implementación y evidencia
- Congela la cronología, el impacto y la evidencia clave tras el incidente y confírmalos con los roles involucrados.
- Lleva a cabo una revisión libre de culpas separando hechos, hipótesis, factores del sistema y percepciones personales.
- Haz seguimiento de las acciones con responsables, fechas límite, prioridades y métricas de aceptación.
- Verifica las acciones mediante un despliegue, repetición de alertas, reversión (rollback) o game day.
- Coteja el ciclo de aprendizaje con las directrices de Google SRE Postmortem Culture y AWS Game Days.
Errores comunes y preguntas de seguimiento
Error 1: Contar una historia de héroe personal
Enfatizar soluciones hechas a altas horas de la noche sin explicar las señales, la colaboración y los cambios en el sistema no demuestra una reducción del riesgo para el equipo.
Error 2: Usar la cultura libre de culpas para evitar la rendición de cuentas
La revisión libre de culpas protege el aprendizaje; no elimina la responsabilidad en materia de permisos, capacitación o cumplimiento normativo. Explica cómo el esclarecimiento de los hechos y la mejora avanzan de la mano.
Error 3: Enumerar eslóganes como acciones
«Mejorar el monitoreo» y «aumentar la cobertura de pruebas» carecen de responsable o condición de aceptación. Reescríbelos como tareas ejecutables y medibles.
Pregunta de seguimiento: ¿Qué pasa si el responsable rechaza una acción?
Alinea basándote en la evidencia del impacto y la prioridad del riesgo, registra el desacuerdo y ejecuta un experimento de bajo costo con una fecha de revisión en lugar de dejar el conflicto solo en las notas de la reunión.
Pregunta de seguimiento: ¿Cómo demuestras que la autopsia funcionó?
Compara alertas similares, el MTTR, el éxito de las reversiones (rollbacks) y el impacto en el usuario; luego usa un game day o inyección de fallas. Si las métricas no varían, reevalúa la hipótesis y las acciones.