Planteamiento y alcance
Una prueba A/B mejora significativamente una métrica central de conversión, pero el tiempo de carga de la página y las quejas a soporte empeoran. ¿Cómo evalúas la confiabilidad y decides si continuar, pausar, revertir o expandir?
La práctica de experimentación de Microsoft separa las métricas de éxito, de control (guardrail) y de calidad de datos, monitoreándolas de forma continua. Una regresión en una métrica de control no debe ocultarse detrás de una métrica principal que mejora. La pregunta evalúa las reglas preestablecidas, el diagnóstico causal y la responsabilidad sobre el riesgo para el usuario.
Qué evalúa el entrevistador
El candidato debe verificar la aleatorización, la proporción de la muestra, la instrumentación y la potencia estadística, para luego clasificar la gravedad del guardrail, la duración y los usuarios afectados. Una respuesta sólida nombra umbrales de detención, acciones de investigación, comunicación con las partes interesadas y un experimento de seguimiento, en lugar de decir únicamente "recopilar más datos".
Marco de respuesta de 30 segundos
"No lanzaría de inmediato. Primero verificaría el SRM, la pérdida de eventos, el tamaño de la muestra, la segmentación y las ventanas de tiempo para confirmar que la regresión del guardrail sea real y específica del tratamiento. Si la carga o las quejas cruzan un umbral crítico preestablecido, pausaría o revertiría. Si el efecto es pequeño e incierto, reduciría el tráfico, mantendría la ventana de observación preestablecida e investigaría el mecanismo y los segmentos. Expandiría solo cuando la calidad de los datos sea sólida, los guardrails sean aceptables y el riesgo sea reversible".
Respuesta detallada paso a paso
Paso 1: Volver al protocolo del experimento
Revisa la hipótesis, las métricas principales y de control, el MDE, el tamaño de la muestra, la duración, la unidad de aleatorización y las reglas de detención. No cambies los criterios de éxito después de ver los resultados.
Paso 2: Validar la calidad de los datos primero
Verifica el desajuste en la proporción de la muestra (SRM), los registros de exposición, la pérdida de eventos, las versiones mixtas, el tráfico de bots y los cambios de instrumentación. Si la calidad está comprometida, marca el resultado como no decidible en lugar de tratar la significancia estadística como una verdad absoluta.
Paso 3: Clasificar la gravedad del guardrail
Define umbrales estrictos y flexibles además de la duración para el tiempo de carga, los errores, las quejas y los reembolsos. Una infracción estricta de rendimiento o seguridad se pausa automáticamente; el ruido menor se puede investigar pero no exponer indefinidamente.
Paso 4: Segmentar y diagnosticar el mecanismo
Segmenta por dispositivo, red, región, usuarios nuevos versus recurrentes y pasos críticos del embudo. Inspecciona el rendimiento, la fricción, las causas de las quejas y las rutas para determinar si la conversión aumentó a costa de sacrificar una experiencia duradera.
Paso 5: Elegir una acción
Infracción estricta: detener y revertir. Riesgo medio con incertidumbre: reducir el tráfico, corregir y reiniciar. Guardrails estables con beneficio reproducible: expandir en etapas predefinidas. Registra la decisión y al responsable en lugar de cambiar las reglas verbalmente.
Paso 6: Manejar múltiples métricas estadísticamente
Las métricas principales, de control y de calidad cumplen propósitos diferentes; no las promedies en una sola puntuación. Utiliza pruebas de no inferioridad o verificación de umbrales para los guardrails, e intervalos y tamaños del efecto declarados previamente para la métrica principal, reportando la incertidumbre y el riesgo de multiplicidad.
Paso 7: Comunicar el riesgo para los usuarios y el equipo
Informa a ingeniería, diseño, soporte y cumplimiento sobre el alcance afectado, la evidencia, las condiciones de parada y el plan de recuperación. Si un segmento minoritario se ve perjudicado a favor de una ganancia general, documenta el segmento y la remediación en lugar de reportar únicamente un promedio.
Paso 8: Convertir el aprendizaje en el siguiente experimento
Corrige el problema de rendimiento o experiencia y registra un nuevo experimento mientras conservas el resultado inmutable original. Divide las pruebas de mecanismos cuando sea necesario, agrega guardrails de retención y quejas, y asigna responsables para las alertas, la pausa y la reversión.
Compensaciones y límites
Revertir inmediatamente o recopilar evidencia
Los umbrales estrictos y el daño irreversible requieren una detención inmediata. Las regresiones pequeñas y reversibles pueden estudiarse con una exposición reducida. Los umbrales deben elegirse antes de ver los resultados.
Significancia estadística o importancia comercial
Las muestras grandes hacen que los efectos diminutos sean significativos. Las decisiones también necesitan del tamaño del efecto, el costo y el impacto en los segmentos. Una caída no significativa en un guardrail sigue siendo relevante cuando la muestra tiene baja potencia o el riesgo es alto.
Ganancia general o equidad de segmentos
Un promedio que mejora no significa que todos los grupos se beneficien. Establece guardrails independientes y efectos mínimos para grupos críticos, de modo que los promedios no oculten daños concentrados.
Simulacros de fallas y evolución
SRM o pérdida de instrumentación
Modifica deliberadamente el registro de exposición y verifica que las alertas de calidad bloqueen el lanzamiento automático. Conserva el estado de la prueba para un nuevo análisis tras la reparación.
Regresión en redes de bajo rendimiento
Empuja el tiempo de carga para dispositivos con recursos limitados más allá del umbral estricto y verifica la pausa o reversión automática en lugar de la expansión.
Una caída leve pero persistente en el guardrail
Establece un umbral flexible y una ventana de observación máxima. Detén o rediseña cuando la ventana expire sin una explicación del mecanismo.
Errores comunes y preguntas de seguimiento
Error 1: Lanzar porque la métrica principal es significativa
Pregunta qué guardrails son paradas obligatorias y si algún segmento tiene el resultado opuesto.
Error 2: Promediar todas las métricas en una sola puntuación
Pregunta por qué el rendimiento, la seguridad y las quejas no pueden simplemente intercambiarse por conversión.
Error 3: Cambiar el tamaño de la muestra tras ver los resultados
Pregunta cómo se evitan la detención temprana y el reporte selectivo.
Error 4: Mirar solo el promedio general
Pregunta si los dispositivos limitados, los usuarios nuevos o las regiones clave tienen una regresión concentrada.
Error 5: No tener un responsable ni una ruta de reversión
Pregunta quién pausa la prueba durante la noche y qué tan rápido se restablece la versión segura.
Preguntas de seguimiento extendidas y respuestas de referencia
¿Cuándo puede continuar un experimento?
Continúa únicamente cuando la calidad de los datos sea correcta, no se haya infringido ningún guardrail estricto, el riesgo sea reversible y la exposición se reduzca dentro de la ventana de observación preestablecida.
¿Cómo explicas el escenario de "aumento de conversión, aumento de quejas"?
Valida los datos y los segmentos, luego evalúa si una ganancia de conversión a corto plazo generó fricción para el usuario. Pausa y corrige cuando el daño supere el guardrail.
¿Cómo hacer que la regla sea ejecutable?
Codifica los umbrales, las alertas, las pausas, las reversiones, los aprobadores y los registros de decisiones en la plataforma de experimentación en lugar de depender de juicios ad hoc.