Tema representativo de entrevista

Entrevista de Ciencia de Datos: ¿Cómo detectas el sesgo de supervivencia en un experimento?

DatosIntermedio
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Un experimento de una funcionalidad aumenta la conversión entre los usuarios que permanecen activos, pero muchos usuarios asignados desaparecen. ¿Cómo decides si el resultado es real?

Planteamiento y contexto

El resultado visible se mide únicamente entre los usuarios con un resultado observado. La entrevista indaga si los usuarios que abandonaron, fallaron en la telemetría o fueron filtrados difieren sistemáticamente, y cómo restaurar una población de decisión válida.

Qué evalúa el entrevistador

  • Reconocer el sesgo de supervivencia como el condicionamiento sobre supervivientes seleccionados.
  • Reconstruir el denominador de asignación antes de leer las tasas de resultados.
  • Separar los datos faltantes, la exposición y los efectos del tratamiento.

Preguntas de aclaración antes de responder

  • ¿El estimando principal es por intención de tratar (intent-to-treat) sobre todos los usuarios asignados o un efecto por protocolo (per-protocol)?
  • ¿Cuándo y por qué los usuarios pueden marcharse, desactivar la telemetría o dejar de ser elegibles?
  • ¿Están disponibles los recuentos de asignación, los recuentos de exposición y los recuentos de resultados por grupo y segmento?
  • ¿Se definió el filtro de retención antes del lanzamiento o se introdujo después de ver los resultados?

Estructura de respuesta de 30 segundos

Congelaría la decisión, reconstruiría el embudo desde la asignación hasta la exposición y el resultado, y compararía la pérdida de usuarios (attrition) por grupo. El análisis principal debe mantener a todos los usuarios aleatorizados en el denominador, tratando los resultados faltantes de manera explícita. Inspeccionaría el desajuste en la proporción de la muestra (sample-ratio mismatch), la pérdida de telemetría y los segmentos previos al tratamiento, para luego reportar límites de sensibilidad para resultados faltantes plausibles. Una mejora observada solo en los supervivientes puede ser descriptiva, pero no puede considerarse el efecto de lanzamiento sin supuestos más sólidos.

Análisis paso a paso en profundidad

1. Definir la población

Nombra la unidad, el momento de asignación, la regla de elegibilidad y la ventana de medición. Conserva a cada usuario asignado en la población por intención de tratar; no la reemplaces silenciosamente con usuarios que abrieron la funcionalidad o permanecieron activos.

2. Reconstruir el embudo

Para cada grupo, cuenta los usuarios asignados, los usuarios expuestos, los usuarios activos, los resultados observados y los resultados faltantes. Añade tasas y recuentos absolutos. Una mayor tasa de conversión entre los supervivientes puede coexistir con una peor conversión total si el tratamiento causa más salidas tempranas.

3. Diagnosticar el mecanismo de selección

Verifica el desajuste en la proporción de la muestra (sample-ratio mismatch), las reglas de despliegue, las versiones de cliente, la geografía, el dispositivo, la latencia y la entrega de eventos. Compara el comportamiento previo al tratamiento entre los usuarios retenidos y los faltantes. Si la falta de datos depende del tratamiento o del riesgo de resultado, el análisis de casos completos (complete-case analysis) estará sesgado.

4. Elegir la estimación principal

Utiliza la intención de tratar para la decisión de lanzamiento, gestionando los resultados faltantes mediante una regla preespecificada o límites. Reporta los resultados por protocolo o basados únicamente en supervivientes como secundarios y etiqueta sus supuestos. Si la aleatorización o la telemetría están fallando, repara el pipeline o repite el experimento en lugar de declarar un ganador narrativamente.

5. Comunicar la incertidumbre

Muestra los recuentos por grupo, las diferencias de desgaste (attrition), los intervalos y los escenarios de sensibilidad. Segmenta únicamente en función de variables previas al tratamiento y preespecifica el análisis. Escala el problema cuando la decisión cambie a través de supuestos plausibles de resultados faltantes.

Respuesta de ejemplo de alta calidad

«Pausaría el lanzamiento y reconstruiría el embudo de asignación a resultado para ambos grupos. Mi estimación principal mantiene a cada usuario aleatorizado, mientras que la conversión exclusiva de supervivientes es secundaria. Probaría el desajuste en la proporción de la muestra, la pérdida de telemetría y la deserción específica de cada grupo, y luego compararía el riesgo previo al tratamiento entre los usuarios observados y los faltantes. Publicaría intervalos por intención de tratar junto con límites de sensibilidad; si la conclusión depende de resultados faltantes no verificables o de una ruta de aleatorización defectuosa, corregiría el experimento o lo volvería a ejecutar».

Errores comunes

  • Usar solo usuarios activos → el abandono relacionado con el tratamiento desaparece → conservar a todos los usuarios asignados para la intención de tratar.
  • Tratar los eventos faltantes como aleatorios → la pérdida de telemetría puede depender del grupo o del resultado → diagnosticar la ausencia de datos y reportar la sensibilidad.
  • Llamar a la exposición el denominador automáticamente → la exposición puede ser posterior al tratamiento → establecer el estimando antes de filtrar.
  • Ocultar el desgaste en un porcentaje → los recuentos desiguales pueden revertir la decisión → mostrar recuentos absolutos y diferencias entre grupos.

Preguntas de seguimiento y respuestas

¿Se pueden simplemente imputar los resultados faltantes?

Solo con un modelo declarado y un análisis de sensibilidad. La imputación múltiple puede ser útil bajo supuestos de datos faltantes al azar (missing-at-random), pero no prueba dichos supuestos; los límites en el peor de los casos (worst-case) o de punto de inflexión (tipping-point) pueden revelar la fragilidad de la decisión.

¿Cuándo es útil un resultado por protocolo?

Puede describir el efecto entre los usuarios que siguieron un protocolo definido, pero la adherencia suele ser posterior al tratamiento. Trátalo como secundario y explica los supuestos o utiliza un método causal diseñado para la adherencia al tratamiento.

¿Cómo se distingue el sesgo de supervivencia del desajuste en la proporción de la muestra (sample-ratio mismatch)?

El desajuste en la proporción de la muestra se refiere a los recuentos de asignación que se desvían de la división planificada. El sesgo de supervivencia se refiere al condicionamiento sobre un subconjunto seleccionado tras la asignación. Pueden coexistir, por lo que se deben auditar tanto el denominador de aleatorización como la retención posterior.

Fuentes públicas

Preguntas relacionadas