1. Planteamiento
Un nuevo flujo de incorporación está en una prueba A/B. Tras dividir por tipo de usuario, el tratamiento tiene una tasa de conversión más alta tanto para usuarios nuevos como recurrentes; tras combinar los estratos, el tratamiento tiene una tasa de conversión general más baja. El responsable del producto (product owner) quiere una decisión de lanzamiento hoy mismo.
Construya un ejemplo numérico concreto que muestre cómo puede ocurrir esta reversión, luego presente un flujo de análisis desde denominadores brutos y balance de aleatorización hasta un estimador estratificado y una prueba de interacción. Finalmente, establezca la evidencia requerida para un lanzamiento global, un lanzamiento estratificado, pausar el experimento o recolectar más datos.
2. Restricciones y aclaraciones
- Este es un experimento en línea aleatorizado; "nuevos" y "recurrentes" son estratos definidos antes de que comience el experimento.
- La métrica principal es si cada usuario completa la conversión clave en una ventana fija. Los eventos repetidos de un mismo usuario no son muestras independientes.
- Los números en el planteamiento son datos de práctica, no un resultado real de una empresa ni un umbral de lanzamiento universal.
- Primero alinee las ventanas de observación, la deduplicación, la definición de exposición y la marca de agua de datos (watermark). Si un estrato se ve afectado por el tratamiento, no debe usarse directamente para una división causal en subgrupos.
3. Razonamiento principal: la mezcla de denominadores puede revertir el resultado
La conversión general es un promedio ponderado por el tamaño de la muestra de las tasas de conversión por estrato. Si las proporciones de los estratos difieren entre ramas, el tratamiento puede ser mejor en cada estrato mientras que el agregado se revierte.
Considere un ejemplo extremo pero claro. En un estrato de línea base alta, el control es 990/1000 = 99% y el tratamiento es 100/100 = 100%. En un estrato de línea base baja, el control es 1/100 = 1% y el tratamiento es 20/1000 = 2%. El tratamiento mejora en un punto porcentual en ambos estratos, pero el control agregado es 991/1100 = 90.1% y el tratamiento agregado es 120/1100 = 10.9%. La diferencia proviene de ubicar la mayoría de las observaciones en diferentes estratos de línea base, no de que el tratamiento empeore a alguno de los estratos.
En un experimento real, una diferencia de mezcla tan grande suele señalar un problema de aleatorización, exposición, muestreo o ventana de tiempo. No demuestra que cada promedio general sea incorrecto. Cuando las proporciones de los estratos están balanceadas por diseño, o se utiliza una estandarización de población objetivo preespecificada, la estimación general aún puede representar el efecto de tratamiento promedio de la población objetivo.
4. Diagnóstico y pseudocódigo de referencia
Agregue denominadores y numeradores a nivel de usuario por rama, estrato y flag de conversión. Compare las proporciones de los estratos, los efectos y los intervalos de confianza. No comience con un porcentaje general favorable y luego pruebe cortes arbitrarios hasta que aparezca una explicación.
for arm in [control, treatment]:
for stratum in [new, returning]:
n[arm, stratum] = count_distinct_users(arm, stratum)
y[arm, stratum] = count_users_with_conversion(arm, stratum)
rate[arm, stratum] = y[arm, stratum] / n[arm, stratum]
share[arm, stratum] = n[arm, stratum] / sum_s(n[arm, s])
check_exposure_and_assignment_balance()
check_missing_users_duplicates_and_window()
report_stratum_effects_and_confidence_intervals()
weights = preregistered_target_population_shares()
standardized_effect = sum_s(weights[s] * (rate[treatment, s] - rate[control, s]))
test_arm_by_stratum_interaction()Si los estratos están disponibles antes de la aleatorización, estratifique la aleatorización o al menos monitoree la asignación dentro de cada estrato. El plan de análisis debe prerregistrar los estratos principales, los pesos de la población objetivo, la métrica principal y la regla de detención para que el resultado no dicte qué corte elegir.
5. Corrección, estadística y decisiones de lanzamiento
Un estimador estratificado vuelve a aplicar el efecto de cada estrato sobre los mismos pesos de la población objetivo, de modo que una diferencia en la mezcla de la muestra no se confunda con un efecto del tratamiento. Los pesos deben provenir de una definición de población previa al experimento o del diseño de aleatorización, no inferirse a partir del resultado observado.
Evalúe la interacción entre el tratamiento y el estrato para determinar si las diferencias de efecto superan el ruido de muestreo. Si la interacción es sustancial y estable, se puede justificar un lanzamiento diferenciado para usuarios nuevos y recurrentes. Si no es sustancial, prefiera la estimación general preespecificada en lugar de seleccionar el estrato que mejor se vea.
La significancia estadística por sí sola no justifica un lanzamiento. Combine un efecto mínimo aceptable, métricas de control (guardrails), duración del experimento, tamaño de la muestra, conversiones retrasadas y completitud de datos. Si el registro de exposición, la contaminación entre ramas, la aleatorización o la madurez de la ventana fallan, pause la decisión y repare los datos en lugar de ocultar el problema con más segmentaciones.
6. Preguntas de seguimiento y trampas comunes
- ¿Cuándo puede un estrato crear un problema causal? Si se produce después de la exposición, condicionar sobre él puede crear sesgo de colisionador (collider bias); utilice una variable previa a la exposición o un análisis de mecanismos preespecificado en su lugar.
- ¿Por qué no segmentar sin límite? Cada corte no registrado añade oportunidades para un resultado significativo por azar; controle la multiplicidad y clasifique los hallazgos exploratorios como hipótesis.
- ¿Toda diferencia agregada es la paradoja de Simpson? No. Primero verifique denominadores, elegibilidad de exposición, ventanas, deduplicación y datos faltantes, luego confirme si las direcciones realmente se revierten dentro de los estratos.
- ¿Qué pasa si el tratamiento tiene una mezcla de estratos diferente? Investigue primero la aleatorización y el enrutamiento. Si se conocen los pesos de la población objetivo, use la estimación estandarizada preespecificada; nunca elija los pesos después de ver los resultados.
7. Referencias
- Guías de Good Data Analysis y Analysis traps de Google for Developers.
- Explicación de Optimizely sobre la paradoja de Simpson y los resultados de experimentos segmentados.
- Preguntas públicas de entrevistas de ciencia de datos que cubren reversiones en pruebas A/B.
8. Criterios de evaluación en entrevistas
Capacidad para calcular denominadores y pesos
El candidato debe usar conteos para mostrar el escenario de "gana en cada estrato, pierde en el agregado" e identificar las proporciones desiguales de los estratos como la pista clave.
Capacidad para separar el diagnóstico de la decisión
Debe verificar la aleatorización, exposición, ventanas y calidad de los datos antes de discutir estimadores, interacciones y reglas de lanzamiento.
Capacidad para establecer límites causales
Debe identificar estratos posteriores a la exposición, sesgo de colisionador y riesgo de multiplicidad en lugar de tratar cada corte como una conclusión independiente.
Capacidad para dar un plan ejecutable
Debe proponer aleatorización estratificada, pesos prerregistrados, métricas de control y condiciones para un lanzamiento estratificado o la continuación de pruebas, en lugar de limitarse a decir "recolectar más datos".