Pregunta y contexto
Un marketplace de entregas bajo demanda desea probar un nuevo algoritmo de despacho en 24 zonas operativas. Un pedido del grupo de tratamiento puede tomar un repartidor que de otro modo recibiría un pedido de control, y los repartidores pueden desplazarse entre zonas adyacentes. Diseña un experimento para estimar el efecto de desplegar el algoritmo en un mercado completo. Explica el estimando, la unidad de aleatorización, los controles de desbordamiento (spillover) y arrastre temporal (carryover), el cálculo de potencia, el análisis, las métricas de control (guardrails) y la decisión de lanzamiento.
Las 24 zonas, la intervención y los detalles operativos son supuestos de un caso de entrevista, no hechos sobre una plataforma real. Asume que el algoritmo es reversible y puede ser seleccionado por un servicio de experimentación. No asumas una ventana de switchback o un período de lavado (washout); estos deben justificarse a partir de la dinámica de los pedidos y repartidores.
Esta es una pregunta difícil de diseño de experimentos para científicos de datos, científicos de experimentación, economistas y analistas de producto. Una página pública de preguntas de entrevista clasifica un experimento en red como un caso difícil de ciencia de datos y análisis de datos, registrando como fecha en que se realizó el 7 de abril de 2026. LinkedIn ha documentado experimentos por conglomerados para detectar interferencia en redes sociales. DoorDash ha documentado switchbacks por región-tiempo para despacho y, en un caso de anuncios de marketplace de 2025, explicó por qué el arrastre temporal y la baja potencia pueden hacer que los switchbacks sean una mala opción cuando un recurso puede aislarse en su lugar. Un artículo de ICLR 2026 continúa estudiando el problema de sesgo-varianza en experimentos de red aleatorizados por conglomerados. En conjunto, estas fuentes respaldan la representatividad actual y la relevancia técnica. No establecen con qué frecuencia alguna empresa formula la pregunta ni justifican atribuirla a una empresa específica.
El error central es aleatorizar pedidos y comparar dos medias a nivel de usuario. El algoritmo altera el acceso a un grupo compartido de repartidores, por lo que el tratamiento de un pedido puede cambiar el resultado de otro. Eso viola la condición de no interferencia detrás de una interpretación A/B ordinaria. Una respuesta sólida define primero el efecto de interés, mapea cómo viaja el tratamiento a través del espacio y el tiempo, y luego hace que la asignación, el estimador, el cálculo de incertidumbre y la decisión de despliegue respondan a esa misma pregunta.
Qué evalúa el entrevistador
Primero, ¿puede el candidato definir la pregunta causal? “¿El tratamiento supera al control?” es una formulación incompleta. La decisión del producto concierne al efecto de aplicar el nuevo algoritmo a un mercado completo, lo cual puede diferir del efecto directo sobre un pedido tratado mientras los vecinos permanecen mezclados.
Segundo, ¿puede el candidato describir la interferencia como un mecanismo? Los repartidores compartidos generan competencia entre pedidos; el movimiento de repartidores conecta zonas adyacentes; las entregas abiertas y las respuestas conductuales generan arrastre temporal a lo largo del tiempo. Mencionar “efectos de red” sin identificar estas aristas no define un diseño.
Tercero, ¿puede el candidato elegir entre diseños en lugar de recitar simplemente “aleatorización por conglomerados”? Los conglomerados geográficos reducen la competencia entre grupos, pero pueden dejar pocas unidades independientes. Los switchbacks crean más unidades de región-tiempo, pero pueden sesgarse por el arrastre temporal. Los diseños de saturación en dos etapas pueden separar los efectos directos y de desbordamiento en un grafo social. La división de recursos puede crear universos aislados cuando el presupuesto o inventario escaso realmente se puede particionar.
Cuarto, ¿puede el candidato alinear el análisis con la asignación? Millones de pedidos no generan millones de observaciones independientes cuando el tratamiento se asigna a unos pocos bloques de mercado-tiempo. La potencia, la ponderación, los errores estándar y las verificaciones de aleatorización deben reflejar las unidades y las probabilidades de asignación del diseño.
Finalmente, ¿puede el candidato rechazar un resultado engañoso? Una respuesta sólida verifica la asignación, la exposición, los cruces de límites, la persistencia, los experimentos concurrentes y la madurez de las métricas antes de interpretar el incremento (lift). También señala cuándo un switchback estima un efecto de política a corto plazo pero no puede respaldar una conclusión sobre el equilibrio a largo plazo o el comportamiento aprendido de los repartidores.
Preguntas aclaratorias para hacer
- ¿Qué efecto impulsa la decisión? ¿El objetivo es el efecto por pedido elegible si cada zona utiliza la nueva política, el efecto promedio por bloque de mercado-tiempo, un efecto directo sobre los pedidos tratados o el desbordamiento sobre los pedidos no tratados? El estimador y la ponderación dependen de esta elección.
- ¿Por dónde viaja la interferencia? ¿Puede un repartidor atender múltiples zonas? ¿Se puede asignar un pedido cruzando un límite de zona? ¿Las tarifas, incentivos, agrupación (batching) o prioridades de cola también acoplan las zonas? La respuesta define el grafo de interferencia.
- ¿Durante cuánto tiempo puede el tratamiento afectar los resultados posteriores? ¿Cuáles son las distribuciones de los tiempos de asignación, recolección, finalización, reposicionamiento de repartidores y retorno a la oferta disponible? Una ruta de código reversible no implica un estado del marketplace inmediatamente reversible.
- ¿Cuántos mercados independientes existen? ¿Son las 24 zonas grupos laborales separados o subdivisiones de cuatro ciudades estrechamente conectadas? Veinticuatro etiquetas pueden representar solo cuatro conglomerados geográficos útiles.
- ¿Se puede aislar el recurso escaso? Un presupuesto, inventario de candidatos o cuota puede dividirse en grupos independientes. Los repartidores generalmente no se pueden duplicar, por lo que la aleatorización por universos de recursos puede ser inviable para el despacho.
- ¿Cuál es el resultado principal y el denominador? Las entregas completadas por pedido elegible, el tiempo de recolección, la utilización del repartidor y las reservas brutas responden a preguntas diferentes. La elegibilidad debe quedar fija antes de que el tratamiento pueda cambiar el ingreso a la cola o la finalización.
- ¿Qué métricas de control (guardrails) bilaterales y rezagadas importan? Los guardrails candidatos incluyen cancelaciones, entregas tardías, ingresos del repartidor por hora activa, tiempo de inactividad, tasa de aceptación, quejas de clientes y desplazamiento entre zonas.
- ¿Qué políticas concurrentes modifican el mismo mercado? Las promociones, precios, respuestas climáticas y otros experimentos de despacho pueden interactuar con la asignación. Pueden requerir bloqueo, exclusión o un diseño explícitamente factorial.
- ¿Qué registros de asignación y exposición existen? El equipo necesita la variante programada, el algoritmo real, el conglomerado de mercado, el bloque de tiempo, la hora de elegibilidad del pedido, las transiciones de repartidores, el mecanismo de respaldo (fallback) y la madurez de los resultados para distinguir fallas de diseño de efectos del producto.
Estructura de respuesta en 30 segundos
“Primero definiría el estimando como el cambio por pedido elegible si todo el mercado objetivo utilizara la nueva política de despacho. La aleatorización a nivel de pedido no es válida porque el tratamiento y el control compiten por los mismos repartidores. Construiría un grafo de movimiento y asignación, combinaría zonas con alto tráfico transfronterizo y, dado que la política es reversible, evaluaría un switchback aleatorizado por conglomerado y tiempo. El bloque y cualquier ventana de transición fija provendrían del arrastre observado, no de una duración predeterminada. Planificaría la potencia a partir de la varianza histórica del conglomerado-bloque y la autocorrelación, analizaría por intención de tratar utilizando el cronograma de asignación y usaría un estimador y método de incertidumbre que coincidan con el estimando por pedido y el diseño agrupado. Antes de leer el lift, verificaría la asignación, la exposición real, la contaminación y la madurez de las métricas. Lanzaría a través de un despliegue regional persistente solo si la finalización mejora y se cumplen los guardrails de clientes y repartidores; un aprendizaje prolongado o un desbordamiento no resuelto requerirían en su lugar un despliegue por conglomerados más largo”.
Análisis detallado paso a paso
Paso 1: Definir el estimando antes de elegir el método de asignación
Escribe el contraste objetivo con palabras: “Para los pedidos que serían elegibles bajo cualquiera de las dos políticas, ¿cuál es el cambio en el resultado principal cuando cada unidad en el mercado objetivo sigue el nuevo algoritmo en lugar del algoritmo actual?”. Este es un efecto de política de lanzamiento completo.
Bajo interferencia, el resultado de un pedido depende de su propia asignación y de las asignaciones que lo rodean. Una prueba a nivel de usuario en un mercado mixto estima principalmente un efecto directo bajo saturación parcial; no necesariamente equivale al contraste de todo tratamiento frente a todo control. Si la empresa desea tanto los efectos directos como los de desbordamiento, nómbralos como estimandos separados en lugar de esperar que una sola diferencia tratamiento-control identifique ambos.
Congela la elegibilidad antes de que la política pueda afectarla. Por ejemplo, define los pedidos elegibles a partir de la validez de la solicitud, el área de servicio y una marca de tiempo registrada antes del despacho. Un resultado como entregas completadas por pedido elegible preserva las fallas y los pedidos no asignados. Un “tiempo promedio de entrega entre pedidos de tratamiento completados” condiciona sobre un evento posterior al tratamiento y puede hacer que una política que descarta pedidos difíciles parezca más rápida.
Paso 2: Convertir los “efectos de red” en un mapa de interferencia
Crea aristas a partir de datos operativos y reglas del producto:
- los pedidos están conectados cuando compiten por el mismo repartidor durante intervalos superpuestos;
- las zonas están conectadas por asignaciones que cruzan zonas y movimiento de repartidores;
- los bloques de tiempo están conectados mientras una entrega asignada permanezca abierta o un repartidor permanezca desplazado;
- las políticas están conectadas cuando los precios, la agrupación, los incentivos u otro experimento modifican la misma capacidad.
Usa datos previos al experimento para este mapa. No construyas conglomerados a partir de comportamientos creados por el tratamiento. Cuantifica la proporción de asignaciones y transiciones de repartidores que cruzan cada límite propuesto. Una agrupación útil mantiene la mayoría de las aristas fuertes dentro de un conglomerado mientras conserva suficientes conglomerados para la potencia estadística. El enfoque publicado por LinkedIn hace explícito este mismo compromiso: más conglomerados proporcionan más unidades de aleatorización, mientras que conglomerados más grandes reducen las aristas que cruzan entre tratamiento y control.
El mapa también identifica resultados que el diseño no puede aislar. Si los repartidores cruzan regularmente todos los límites de zona, la asignación a nivel de zona solo renombra un mercado conectado. El equipo podría necesitar aleatorizar a nivel de toda la ciudad a lo largo del tiempo, utilizar mercados persistentes separados o aceptar una afirmación causal más débil.
Paso 3: Comparar diseños frente al mecanismo
Aleatorización de Bernoulli individual: tiene un tamaño de muestra nominal alto y es útil cuando las unidades no se afectan entre sí. Es inapropiada para esta política de despacho porque los pedidos de tratamiento consumen capacidad compartida y contaminan el control.
Aleatorización persistente por conglomerados geográficos: asigna todo el tráfico elegible en un conglomerado de mercado suficientemente aislado a una sola política durante todo el experimento. Maneja mejor el arrastre temporal prolongado y el aprendizaje conductual que la alternancia rápida, pero 24 zonas pueden reducirse a solo unos pocos mercados conectados. El balance, la potencia y la generalización se vuelven difíciles.
Aleatorización por switchback agrupado: asigna un conglomerado geográfico conectado a una política durante un bloque de tiempo y luego vuelve a aleatorizar los bloques futuros. Se adapta a un algoritmo de despacho reversible cuyos efectos importantes decaen dentro de un período medible. El diseño de despacho publicado por DoorDash utiliza unidades de región-tiempo por esta razón. Crea más unidades experimentales, pero los bloques vecinos siguen conectados cuando persisten pedidos abiertos, repartidores reubicados o cambios de comportamiento.
Aleatorización en dos etapas o por saturación: asigna primero un conglomerado de red a un nivel de saturación de tratamiento y luego asigna a los miembros dentro de él. Puede identificar cómo cambian los resultados con la exposición de los vecinos y es útil para funciones sociales o de referidos. Es más compleja y menos natural cuando una sola política de despacho debe gobernar el mismo grupo compartido de repartidores en un momento dado.
Aleatorización por universos aislados: particiona el recurso interferente en sí. El ejemplo de anuncios de DoorDash de 2025 divide los presupuestos de campaña para que las variantes no puedan consumir el presupuesto de la otra. Esto puede ser más sólido que un switchback cuando el recurso es divisible y cada universo puede operar con normalidad. No crea una solución válida fingir que el mismo repartidor pertenece a dos grupos independientes.
Para el caso planteado, elige un switchback agrupado solo después de confirmar que el efecto principal decae con suficiente rapidez. Agrupa zonas adyacentes fuertemente conectadas en conglomerados de mercado y luego aleatoriza unidades de conglomerado de mercado × bloque de tiempo. Si el efecto incluye semanas de aprendizaje del repartidor o reposicionamiento persistente, utiliza en su lugar un despliegue persistente por conglomerados.
Paso 4: Diseñar el cronograma de switchback y la regla de transición
Estima el arrastre temporal a partir de la duración de los pedidos previa al experimento, las transiciones de repartidores y la simulación operativa; luego prueba cronogramas candidatos con datos A/A. El bloque debe ser lo suficientemente largo como para que se resuelva una gran parte del estado relevante, pero bloques más cortos crean más unidades y, por lo general, más potencia. El tamaño de la región genera el mismo balance: regiones más grandes reducen las fugas espaciales y reducen el número de unidades independientes.
Aleatoriza cada bloque dentro de estratos preespecificados, como conglomerado de mercado, día de la semana y franja horaria. No alternes determinísticamente tratamiento y control, porque una secuencia fija puede alinearse con tendencias de demanda. Equilibra las secuencias y evita que un conglomerado reciba solo una variante durante una franja horaria crítica.
Define las transiciones antes de que lleguen los resultados. El análisis principal puede atribuir cada pedido elegible a la política programada en su momento de elegibilidad y seguirlo hasta su madurez. Si el protocolo utiliza un período de lavado (washout) en los límites, haz que ese intervalo sea fijado por el cronograma, exclúyelo de ambos brazos, explica el estimando modificado e incluye su pérdida en la potencia. No elimines pedidos que “parezcan contaminados” después de inspeccionar los resultados.
Un registro compacto de asignación predeclarado podría ser:
experimental unit = market cluster × time block
assignment = randomized within market cluster × time-of-week stratum
eligibility time = recorded before dispatch policy selection
primary outcome = completed delivery within the fixed maturity horizon per eligible order
primary estimand = full-rollout effect per eligible order
transition rule = fixed before exposure; no outcome-based exclusionsPaso 5: Planificar la potencia a partir de unidades efectivas, no del recuento de pedidos
Utiliza períodos A/A históricos o cronogramas de asignación reproducidos para estimar la varianza entre conglomerados-bloques, la correlación serial dentro de un mercado, los choques temporales comunes, el tráfico desigual y cualquier ajuste de covariables planificado. Vuelve a aleatorizar el cronograma propuesto muchas veces y mide con qué frecuencia detecta un efecto mínimo preespecificado bajo supuestos realistas de arrastre temporal.
La muestra efectiva está determinada por la información de asignación independiente, no por el número bruto de entregas anidadas dentro de un bloque. Acortar los bloques puede agregar unidades pero aumentar el sesgo por arrastre temporal. Agrandar los conglomerados puede reducir las fugas espaciales pero eliminar unidades. La planificación de potencia debe mostrar esta frontera de sesgo-varianza y seleccionar el efecto más pequeño que justifique el costo operativo, no buscar un cronograma que garantice significancia.
Preespecifica la duración, la asignación, las reglas de parada y cualquier reducción de varianza utilizando únicamente covariables previas al tratamiento. Si los conglomerados disponibles no pueden identificar el efecto mínimo que amerite una decisión, manifiesta esa limitación antes del lanzamiento. Un recuento gigante de pedidos no puede compensar la existencia de solo cuatro mercados independientes.
Paso 6: Analizar según el diseño y el estimando
Utiliza la asignación por intención de tratar a partir del cronograma aleatorizado. Reporta el cumplimiento y la exposición real al algoritmo por separado; no elimines los pedidos con respaldo (fallback) del tratamiento. Agrega diagnósticos a nivel de conglomerado-bloque, porque es allí donde cambia la asignación.
Haz coincidir la ponderación con el estimando. Una media no ponderada entre conglomerados-bloques estima un efecto de bloque promedio. Si el objetivo de decisión es un efecto por pedido elegible bajo el despliegue y los tamaños de los conglomerados varían, utiliza un estimador consistente con el diseño estilo Horvitz-Thompson o Hájek basado en probabilidades de asignación conocidas, y declara su población objetivo. Reporta el efecto de bloque promedio como una vista secundaria en lugar de cambiar de estimando de manera encubierta.
Para la incertidumbre, prefiere la inferencia por aleatorización sobre el esquema de asignación real cuando sea factible. Una alternativa basada en modelos debe dar cuenta de observaciones repetidas dentro de los mercados, dependencia serial, choques temporales compartidos y estratificación. Tratar cada pedido como independiente produce intervalos artificialmente estrechos. Reporta la estimación, el intervalo, el efecto mínimo relevante para la decisión y la sensibilidad a la regla de transición preespecificada.
Antes del impacto, ejecuta verificaciones de salud:
- proporciones de tratamiento programadas y balance dentro de cada estrato;
- persistencia de asignación y exposición real al algoritmo;
- tasas de pedidos elegibles, fallbacks y eventos faltantes por brazo;
- asignaciones entre conglomerados y movimiento de repartidores;
- madurez del resultado y cancelaciones tardías;
- superposición de políticas y experimentos concurrentes;
- calibración A/A de tasas de falsos positivos bajo el mismo pipeline.
Paso 7: Vincular el resultado a una decisión de lanzamiento
Elige un resultado principal vinculado al objetivo de despacho, como entregas completadas dentro de un horizonte fijo por pedido elegible. Agrega guardrails para clientes, como cancelación, retraso, tasa de quejas y espera para la recolección; los guardrails para repartidores pueden incluir ganancias por hora activa, tiempo de inactividad, tasa de aceptación y concentración de carga de trabajo no segura. Define márgenes de daño y umbrales de reversión antes de la exposición.
Un resultado positivo de switchback respalda un efecto de política de mercado a corto plazo bajo los bloques evaluados. Puede no capturar la oferta de equilibrio, el aprendizaje de los repartidores o la retención durante semanas. Dale seguimiento con un despliegue regional persistente o un grupo de control retenido (holdout) cuando esas dinámicas importen. Compara la dirección y magnitud con el switchback, monitorea los límites y detén la expansión si los guardrails o la contaminación superan el límite predeclarado.
Si los experimentos por conglomerados y los individuales no coinciden, no los promedies en un solo número. La diferencia puede ser evidencia de interferencia, como lo ilustra el metaexperimento publicado por LinkedIn. Revisa cada estimando, la fuga de conglomerados, la salud de la asignación y la potencia antes de decidir qué diseño coincide mejor con un lanzamiento completo.
Respuesta de muestra de alta calidad
“Comenzaría haciendo explícita la pregunta causal. La decisión de lanzamiento es el cambio en las entregas completadas por pedido elegible si todo el mercado objetivo utiliza el nuevo algoritmo de despacho. Eso es diferente de tratar un pedido mientras los pedidos vecinos permanecen en control. Definiría la elegibilidad antes del despacho para que el tratamiento no pueda mejorar su propio denominador, y seguiría cada pedido asignado hasta un horizonte de madurez fijo.
La aleatorización a nivel de pedido no es válida aquí. Un pedido tratado puede tomar el único repartidor adecuado y alterar la espera o la finalización del pedido de control, mientras que el movimiento del repartidor propaga ese efecto a través de los límites de las zonas y hacia períodos de tiempo posteriores. Usaría datos previos al experimento sobre asignación y movimiento para construir un grafo de interferencia, y luego combinaría zonas adyacentes hasta que las asignaciones entre conglomerados y el movimiento de repartidores caigan por debajo de un umbral diagnóstico predeclarado. Si las 24 zonas se reducen a solo unos pocos mercados conectados, lo declararía así en lugar de afirmar que existen 24 conglomerados independientes.
Dado que el código de despacho es reversible, mi primer candidato es un switchback agrupado. Cada conglomerado de mercado conectado recibe un algoritmo durante un bloque de tiempo aleatorizado. Aleatorizaría los bloques dentro de estratos de mercado y día/hora de la semana, sin alternar de forma determinística. La duración de la ventana proviene de los datos de finalización de pedidos y reposicionamiento de repartidores más simulaciones de cronogramas A/A. Ventanas cortas proporcionan más unidades pero aumentan el arrastre temporal; ventanas largas reducen las fugas pero pierden potencia. Si la política altera el comportamiento del repartidor durante semanas, rechazaría el switchback y utilizaría un despliegue persistente a nivel de mercado.
El análisis principal es por intención de tratar utilizando el algoritmo programado en el momento de elegibilidad pre-despacho del pedido. Mantendría los fallbacks y las asignaciones fallidas en su brazo original. Debido a que la asignación ocurre a nivel de bloque de mercado, la potencia y la incertidumbre provienen de esas unidades y su dependencia serial, no de millones de pedidos. Simularía el cronograma propuesto con datos históricos A/A, preespecificaría el efecto mínimo, la duración y la regla de transición, y usaría inferencia por aleatorización basada en el diseño cuando sea factible. Dado que la métrica de decisión es por pedido elegible, usaría un estimador ponderado consistente con el diseño con probabilidades de asignación conocidas y también reportaría el efecto promedio no ponderado de bloque de mercado.
Antes de leer el lift, verificaría el equilibrio del tratamiento dentro de los estratos, la exposición real a la política, las tasas de fallback y eventos faltantes, las asignaciones entre conglomerados, las transiciones de repartidores, la madurez del resultado y los experimentos superpuestos. Mi resultado principal serían las entregas completadas dentro del horizonte fijo por pedido elegible. Las cancelaciones de clientes, los retrasos, las quejas, la espera para la recolección, así como las ganancias, el tiempo de inactividad y la aceptación de los repartidores tendrían márgenes de daño predeclarados.
Si la estimación supera el efecto mínimo útil y todos los guardrails, ejecutaría un despliegue regional persistente para verificar que el resultado del switchback a corto plazo sobreviva al aprendizaje y a los cambios de equilibrio. Si el arrastre temporal sigue siendo significativo, los conglomerados son insuficientes para el efecto planificado o las estimaciones individuales y por conglomerados discrepan sin un mecanismo claro, no presentaría el resultado a nivel de usuario como un efecto de lanzamiento completo. Rediseñaría el experimento o acotaría la afirmación causal”.
Errores comunes
- Aleatorizar millones de pedidos de forma independiente → El tratamiento y el control consumen la misma oferta de repartidores, por lo que el tamaño de muestra nominal oculta la interferencia → Aleatoriza una unidad que contenga la interacción principal o aísla el recurso en sí.
- Decir “usar conglomerados” sin definir la arista → La geografía puede no contener el movimiento de los repartidores, la interacción social, la competencia por el presupuesto o el arrastre temporal → Construye el mapa de interferencia a partir del mecanismo real y los datos previos al tratamiento.
- Elegir un switchback estándar de 30 minutos → Una ventana conveniente puede ser más corta que los efectos de entrega y reposicionamiento o más larga de lo necesario → Estima el arrastre temporal y calibra los cronogramas candidatos con datos A/A y simulación.
- Alternar variantes de manera determinística → El tratamiento puede alinearse con períodos pico, días laborables o tendencias → Vuelve a aleatorizar bloques dentro de estratos preespecificados de tiempo y mercado.
- Contar cada pedido como independiente → La asignación ocurre en una unidad más agregada, produciendo una incertidumbre subestimada y falsa confianza → Basa la potencia y la inferencia en la estructura aleatorizada real.
- Reportar una media de bloque no ponderada como efecto de despliegue por pedido → Tamaños de bloque desiguales cambian la población objetivo → Define el estimando y utiliza un estimador consistente con el diseño con ponderación explícita.
- Eliminar pedidos límite después de ver los resultados → Las exclusiones basadas en resultados rompen la comparación aleatorizada → Predeclara la elegibilidad, el manejo de transiciones y la madurez, y mantén la asignación por intención de tratar.
- Tratar el switchback como universalmente robusto → El arrastre temporal, el aprendizaje, la baja potencia y los choques temporales comunes pueden invalidarlo o debilitarlo → Utiliza conglomerados persistentes, saturación o universos aislados cuando sus supuestos encajen mejor.
- Lanzar basándose únicamente en un incremento a corto plazo → El equilibrio del marketplace y el comportamiento de los repartidores pueden cambiar bajo un despliegue persistente → Valida con un despliegue persistente por etapas y guardrails bilaterales.
Preguntas de seguimiento y respuestas
Seguimiento 1: ¿Qué pasa si las 24 zonas se reducen a solo cuatro mercados independientes?
Cuatro conglomerados de mercado proporcionan poca información para un experimento persistente por conglomerados, y tener muchos pedidos dentro de ellos no resuelve ese problema. Si los efectos decaen rápidamente, los bloques repetidos de mercado-tiempo aleatorizados pueden aportar información, siempre que se modelen la dependencia serial y el arrastre temporal. Si los efectos duran semanas, las opciones honestas son un despliegue de mercado emparejado o por fases más largo, un ajuste de covariables previas al tratamiento más fuerte, simulación para el riesgo operativo o esperar a tener más mercados independientes. Reporta una incertidumbre amplia y acota la afirmación; no generes independencia artificial dividiendo zonas conectadas.
Seguimiento 2: ¿Qué pasa si el tratamiento altera el comportamiento de los repartidores durante varias semanas?
Un switchback rápido estima una mezcla de la política actual y el historial previo, siendo un mal diseño para evaluar el efecto a largo plazo. Utiliza una asignación persistente por conglomerados o un despliegue aleatorizado por fases, mide la activación, las horas suministradas, las ganancias, la retención y los resultados de los clientes durante todo el horizonte conductual, y mantén la asignación a nivel de mercado. Un switchback aún puede servir para evaluar efectos algorítmicos inmediatos, pero no puede reemplazar el experimento de horizonte prolongado.
Seguimiento 3: ¿Cómo cambiaría el diseño para una función de compartir en redes sociales?
Construye un grafo a partir de relaciones previas al tratamiento o aristas de interacción. La aleatorización por conglomerados puede aproximar un contraste de red de todos tratados frente a todos en control cuando la mayoría de las aristas permanecen dentro de los conglomerados. Si el objetivo incluye efectos directos y de desbordamiento, aleatoriza los conglomerados a diferentes niveles de saturación de tratamiento y luego aleatoriza a los usuarios dentro de los conglomerados. Preespecifica los mapeos de exposición, como la proporción tratada de vecinos relevantes, y planifica considerando una menor potencia y la superposición entre comunidades.
Seguimiento 4: ¿Qué pasa si el canal de interferencia es un presupuesto publicitario divisible?
Divide el presupuesto o inventario en universos independientes y dale a cada variante acceso exclusivo a su grupo. Esto elimina la canibalización directa manteniendo la asignación a nivel de usuario y puede mejorar la potencia. Valida que los grupos no puedan prestarse fondos, que la distribución del gasto (pacing) y las subastas no los vuelvan a conectar, y que la división represente la política de lanzamiento completo. Si el aislamiento es incompleto, mide la fuga y mantén acotada la afirmación causal.
Seguimiento 5: ¿Qué pasa si los experimentos a nivel individual y a nivel de conglomerados discrepan?
Primero verifica la asignación, la exposición, las definiciones de métricas, la madurez y la potencia en ambos. Luego compara los estimandos: una prueba individual mide el tratamiento en un entorno mixto, mientras que una prueba por conglomerados mueve a más vecinos juntos y puede aproximar mejor el lanzamiento completo. Cuantifica las aristas entre conglomerados y la saturación, y utiliza un metaexperimento preespecificado o una prueba de aleatorización cuando sea posible. Una diferencia significativa es evidencia para investigar la interferencia, no una razón para seleccionar el incremento más grande.
Seguimiento 6: ¿Cómo elegirías la ventana de switchback en la práctica?
Grafica el decaimiento de pedidos abiertos, el desplazamiento de repartidores y las métricas clave después de las transiciones de política utilizando datos previos al experimento o pruebas piloto seguras. Simula varios cronogramas aleatorizados en períodos A/A, midiendo la calibración de falsos positivos, la varianza y la sensibilidad a buffers de límite fijos. Selecciona la ventana más corta cuyo arrastre residual permanezca por debajo de la tolerancia predeclarada mientras la potencia siga siendo adecuada, y luego ejecuta análisis de sensibilidad sobre opciones vecinas de ventanas y transiciones.