Tema representativo de entrevista

Entrevista general: ¿Cómo dirigir un postmortem sin culpas que genere acciones concretas?

GeneralIntermedio
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Un incidente de producción ha sido mitigado. Debes facilitar el postmortem: ¿cómo recopilas los hechos, evitas culpar a individuos, analizas los factores contribuyentes y transformas las conclusiones en acciones que reduzcan la recurrencia? ¿Qué haces si un interesado del negocio exige un culpable inmediato?

Planteamiento y contexto

Esta pregunta evalúa el ciclo de aprendizaje después de un incidente, no un relato de la depuración. Una respuesta sólida abarca el impacto, la cronología, el desencadenante y los factores contribuyentes, la respuesta, los elementos de acción, la revisión y la divulgación. Asume que el incidente está mitigado y que la evidencia incluye alertas, despliegues, cambios, registros, notas de guardia y datos de impacto en el usuario; aclara la gravedad y los plazos en primer lugar.

Que sea sin culpas (blameless) no significa que esté libre de responsabilidad. Se asume que los participantes actuaron con una intención razonable dada la información disponible en ese momento y luego se examinan las brechas en los sistemas, procesos, herramientas e información. Aun así, se designa un responsable del incidente, responsables de las acciones y fechas límite. Las conductas maliciosas, las violaciones de políticas o las investigaciones de cumplimiento deben seguir un proceso autorizado independiente.

El escenario se adapta a entrevistas de SRE, backend, plataforma, liderazgo técnico e ingeniería multifuncional. Para un rol general, también evalúa si puedes transformar una falla en una mejora de proceso reutilizable en lugar de contar una historia de heroísmo o atribuir la culpa a una sola persona.

Qué evalúan los entrevistadores

Primero, ¿puedes definir el propósito y el alcance? Google SRE trata un postmortem como una forma de documentar el impacto, comprender las causas raíz y contribuyentes, e implementar acciones preventivas; el restablecimiento del servicio es solo el punto de partida.

Segundo, ¿puedes reconstruir los hechos sin sesgo retrospectivo? Cada entrada de la cronología debe tener una fuente, zona horaria y nivel de certeza. Reemplaza «alguien fue descuidado» por la señal observable, el permiso, el valor predeterminado o la brecha de proceso que condicionó la decisión.

Tercero, ¿puedes preservar tanto la seguridad psicológica como la ejecución? Las acciones necesitan un único responsable, prioridad, identificador de seguimiento y un estado final verificable. «Mejorar el monitoreo» o «tener más cuidado» no pueden demostrar que se produjo un cambio.

Cuarto, ¿puedes manejar la presión? Cuando una parte interesada busca culpables, separa la investigación de conducta del aprendizaje del sistema, utiliza el impacto y la evidencia para explicar el riesgo en los reportes futuros y, aun así, haz explícita la responsabilidad de la remediación.

Preguntas de clarificación

  • ¿Cuál fue la gravedad y el impacto en los usuarios? Los usuarios afectados, la duración, la integridad de los datos y el impacto en los SLO determinan la profundidad de la revisión.
  • ¿Cuál es el propósito de la revisión? ¿Es el aprendizaje y la prevención, o existe también una investigación de cumplimiento, mala conducta o desempeño?
  • ¿Quién puede participar y leer el documento? Incluye a personal de guardia, lanzamientos, soporte, servicios afectados y socios de negocio mientras se gestionan los datos confidenciales.
  • ¿Dónde se conservan las evidencias? Confirma registros, alertas, historiales de despliegue, tickets, comunicaciones, retención y zona horaria.
  • ¿Cómo se incorporan las acciones al trabajo habitual? Comprende el sistema de seguimiento, las reglas de prioridad, el modelo de asignación de responsables y la evidencia de aceptación para que el seguimiento perdure tras la reunión.

Respuesta de 30 segundos

«Primero confirmo el alcance, el impacto y el propósito, separando una revisión de aprendizaje de cualquier investigación de conducta autorizada. Antes de la reunión, preservo y concilio alertas, cambios, registros y comunicaciones en una cronología con fuentes. En la reunión utilizo un lenguaje sin culpas y examino el desencadenante, los factores contribuyentes, las fortalezas y brechas de la respuesta y las defensas ausentes en lugar de buscar un chivo expiatorio. Convierto las conclusiones en acciones con tipo, prioridad, un único responsable, fecha de entrega, seguimiento y métrica de verificación; luego reviso y comparto el documento con los equipos que pueden aprender o actuar. Si alguien exige un culpable, presento la evidencia y el riesgo para futuros reportes, mantengo la investigación independiente y continúo con las mejoras del sistema y de los procesos».

Respuesta paso a paso

Paso 1: Definir desencadenantes y participantes

Confirma si el incidente cumple con los criterios de revisión, como tiempo de inactividad visible para el usuario, pérdida de datos, reversión manual, tiempo de recuperación excesivo o fallas en el monitoreo. Asigna un facilitador y un responsable del documento. Invita a personas que puedan aportar hechos o implementar acciones, no a una audiencia para un juicio.

Paso 2: Recopilar evidencia antes de redactar una historia

Construye una cronología en una única zona horaria. Cada fila registra la hora, el evento, la fuente y el nivel de certeza. Separa la detección, la mitigación, la recuperación y la confirmación del impacto restablecido. No comiences con «la causa raíz fue un error del operador»; registra la interfaz, el valor predeterminado, el permiso, la capacitación y la ruta de aprobación que eran visibles en ese momento.

text
Time  | Fact                         | Source          | Confidence
10:02 | Deployment started           | Release system  | High
10:07 | Error rate crossed threshold | Metrics panel   | High
10:11 | Rollback completed           | Change record   | High

Paso 3: Separar desencadenante, factores contribuyentes y defensas ausentes

El desencadenante es el evento inmediato. Los factores contribuyentes explican por qué el impacto se expandió o prolongó. Las defensas ausentes explican por qué el evento no se detectó ni se bloqueó antes. Pregunta qué hizo que la decisión fuera razonable en ese momento, qué información faltaba y qué punto de control podría haber limitado el radio de impacto. Los cinco porqués o un árbol de fallas pueden ayudar, pero no reduzcas un incidente complejo a una sola causa.

Paso 4: Revisar la respuesta

Registra qué salió bien, qué salió mal y qué se evitó por poco. Evalúa si la mitigación redujo el radio de impacto, si el escalamiento ocurrió a tiempo y si la comunicación facilitó la toma de decisiones. La velocidad de recuperación por sí sola no es suficiente; inspecciona los controles de reversión faltantes, los límites de permisos y la claridad de los roles.

Paso 5: Convertir las acciones en compromisos verificables

Los ejemplos de Google SRE asignan a los elementos de acción un tipo, prioridad, responsable único, identificador de seguimiento y un estado final medible. Cubre prevención, detección, mitigación, recuperación o aprendizaje según corresponda. Cada elemento debe responder «¿está completo?» con evidencia.

AcciónTipoResponsable / plazoVerificación
Bloquear versiones sin reversiónPrevenirPlataforma de lanzamientos / 2 semanasLa prueba de bloqueo de CI pasa y la versión insegura no se puede fusionar
Alertar sobre tasa de errores y radio de impactoDetectarLíder de guardia / 1 semanaEl simulacro activa la alerta y la notificación llega en menos de 5 minutos
Agregar reversión con un solo clicMitigarPropietario del servicio / 3 semanasUn ejercicio controlado restablece el servicio dentro del objetivo
Actualizar roles de incidentes y escalamientoAprenderGestor de incidentes / 1 semanaUn nuevo operador completa la transferencia a partir del runbook

Paso 6: Revisar, compartir y realizar seguimiento

Los propietarios técnicos y del servicio revisan la exhaustividad, el impacto, la profundidad del análisis y las prioridades. Publica el documento aprobado en un repositorio de incidentes consultable con controles de privacidad. Vincula las acciones al flujo de trabajo habitual y luego inspecciona los elementos vencidos, los incidentes repetidos y la evidencia de que los cambios completados reducen el riesgo. Un documento no revisado o sin seguimiento genera poco aprendizaje organizacional.

Paso 7: Manejar la presión para encontrar un culpable

Reconoce la necesidad de rendición de cuentas y control de riesgos, y luego explica dos vías paralelas: los investigadores autorizados manejan la mala conducta o el cumplimiento mediante evidencias; la revisión de aprendizaje analiza cómo los sistemas permitieron el incidente y cómo prevenir la recurrencia. Describe lo que hizo un individuo cuando sea relevante, pero evita el lenguaje personal o humillante. El responsable de una acción asume la entrega, no la culpa personal.

Respuesta de ejemplo de alta calidad

«Primero confirmaría la gravedad, el impacto en los usuarios, el riesgo para los datos y el propósito de la revisión. Si el propósito es el aprendizaje y la prevención, mantendría separada cualquier investigación de desempeño o conducta. Antes de la reunión, preservaría alertas, registros, historiales de despliegue, tickets y comunicaciones, normalizaría la zona horaria y construiría una cronología con fuentes. Invitaría al personal de guardia, lanzamientos, soporte, el servicio afectado y los responsables de las acciones.

Abriría con un acuerdo de trabajo sin culpas: analizar la información, los sistemas y los procesos disponibles en ese momento, sin etiquetar a las personas. Verificaríamos la cronología y luego separaríamos el desencadenante, los factores contribuyentes, las defensas ausentes y lo que salió bien, mal o casi sale mal. Para cada conclusión, preguntaría qué cambio de sistema, herramienta o proceso respalda.

Cada acción especificaría un tipo de prevención, detección, mitigación o recuperación, prioridad, responsable único, fecha límite, identificador de seguimiento y evidencia de aceptación. Por ejemplo, reemplazaría "mejorar el monitoreo" por "cuando la tasa de errores y la proporción de instancias afectadas superen los umbrales acordados, enviar una alerta al responsable y demostrar la entrega en un plazo de cinco minutos durante un simulacro". Los responsables revisan el borrador, este ingresa al backlog del equipo y fiscalizamos su finalización y la reducción del riesgo.

Si una parte interesada exige un culpable, le explicaría que las investigaciones de rendición de cuentas deben ser independientes y basarse en evidencias, y que culpar a las personas puede desincentivar futuros reportes. No ocultaría hechos ni responsabilidades. El resultado es una vía de aprendizaje documentada junto con mejoras duraderas en el sistema».

Errores comunes

  • Tratar lo "sin culpas" como falta de responsables → Las acciones no tienen un plan de entrega → Separa la investigación de conducta de la asignación de responsables de las acciones.
  • Nombrar una sola causa raíz → Las condiciones que amplificaron el impacto desaparecen → Separa el desencadenante, los factores contribuyentes y las defensas ausentes.
  • Confiar en la memoria → El sesgo retrospectivo distorsiona la cronología → Preserva la evidencia y registra las fuentes y el nivel de certeza.
  • Escribir «mejorar el monitoreo» → No se puede evaluar su cumplimiento → Agrega umbrales, tiempo de entrega, simulacros y evidencia.
  • Asignar la misma prioridad a todas las acciones → Los riesgos críticos quedan en espera → Clasifica por impacto, probabilidad de recurrencia y esfuerzo.
  • Invitar solo al personal de guardia → Faltan hechos de otros equipos y de los usuarios afectados → Invita a los participantes y a quienes implementarán los cambios.
  • Terminar cuando el documento está redactado → Las acciones desaparecen en el trabajo diario → Hazles seguimiento e inspecciona incidentes vencidos o recurrentes.
  • Usar la vergüenza para crear rendición de cuentas → Reportar se vuelve menos seguro → Describe las brechas del sistema con evidencia e investiga por separado.

Preguntas de seguimiento y respuestas

Pregunta de seguimiento 1: ¿La cultura sin culpas excusa una violación evidente de las políticas?

No. La revisión establece un objetivo de aprendizaje; los procesos autorizados investigan comportamientos maliciosos, omisiones intencionales o problemas de cumplimiento. La revisión sigue registrando hechos, permisos y controles faltantes, y asigna responsables de la remediación.

Pregunta de seguimiento 2: ¿Cómo sabes que una acción no es una simulación?

Exige un único responsable, fecha de entrega, identificador de seguimiento y un estado final verificable. Un elemento de prevención puede tener una prueba de bloqueo, uno de detección un simulacro y uno de mitigación un objetivo de recuperación. «Generar conciencia» no tiene evidencia de aceptación.

Pregunta de seguimiento 3: ¿Se puede publicar antes de conocer todas las causas?

Publica un borrador con hechos, niveles de incertidumbre señalados, impacto conocido, cronología, hipótesis actuales y preguntas abiertas. Agrega los factores contribuyentes y las acciones más adelante. Un borrador oportuno y honesto preserva más aprendizaje que un documento reconstruido meses después a partir de la memoria.

Pregunta de seguimiento 4: ¿Cómo seleccionas la audiencia con la que se comparte?

Compártelo con personas que puedan aprender o implementar cambios, eliminando datos personales, de clientes y datos sensibles innecesarios. La revisión entre equipos detecta riesgos similares; si aplican restricciones legales o de seguridad, documenta el motivo y proporciona un resumen seguro.

Fuentes públicas

Preguntas relacionadas