Tema representativo de entrevista

Entrevista de ciencia de datos: ¿Cómo usarías diferencias en diferencias para evaluar un cambio en un producto?

DatosDifícil
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Un equipo de producto lanza un nuevo flujo de pago solo en algunas regiones. Antes del lanzamiento, la conversión es del 10% en las regiones tratadas y del 8% en las regiones de control; después es del 14% y del 9%. ¿Cómo evaluarías el cambio con diferencias en diferencias?

Planteamiento y alcance

Un equipo de producto lanza un nuevo flujo de pago solo en algunas regiones. Antes del lanzamiento, la conversión es del 10% en las regiones tratadas y del 8% en las regiones de control; después es del 14% y del 9%. ¿Cómo evaluarías el cambio con diferencias en diferencias?

Este es un ejercicio de inferencia causal para roles de ciencia de datos, analítica de producto y plataformas de experimentación. Los cuatro porcentajes son supuestos de la entrevista, no resultados comerciales observados. Separa el movimiento descriptivo de la identificación causal y analiza la asignación, las ventanas de tiempo, las tendencias paralelas y el riesgo del despliegue escalonado.

Qué evalúa el entrevistador

Una respuesta sólida define el estimando antes de verificar los supuestos; no salta de inmediato a “la conversión aumentó tres puntos”. El entrevistador también busca sesgos de selección, shocks concurrentes, efectos de desbordamiento (spillovers), observaciones repetidas, errores estándar agrupados (clustered) y el riesgo de que un modelo ingenuo de efectos fijos bidireccionales mezcle efectos bajo una adopción escalonada.

Preguntas aclaratorias

  • ¿Cómo se asignan las regiones al tratamiento y la empresa eligió regiones en las que se esperaba un alto crecimiento?
  • ¿Existen varios periodos previos al lanzamiento para verificar la tendencia?
  • ¿Cambiaron los precios, el marketing, la estacionalidad o la mezcla de tráfico al mismo tiempo?
  • ¿Pueden los usuarios cruzar de región o migrar, creando un desbordamiento hacia los controles?
  • ¿El lanzamiento fue simultáneo o escalonado por fecha?
  • ¿La unidad es un usuario, un pedido o una región, y a qué nivel deben agruparse los errores?

Respuesta en 30 segundos

“Primero formularía el cambio como diferencias en diferencias: el cambio en el grupo tratado menos el cambio en el grupo de control. La estimación puntual aquí es de tres puntos porcentuales. Tiene una interpretación causal solo si las tendencias previas al tratamiento son comparables y no hay shocks concurrentes diferenciales ni desbordamientos materiales. Graficaría múltiples periodos previos, controlaría covariables justificadas y agruparía los errores en el nivel de asignación. Para un despliegue escalonado, usaría un estimador diseñado para tratamiento escalonado y compararía la robustez en lugar de confiar en efectos fijos bidireccionales ingenuos”.

Análisis paso a paso

Paso 1: Calcular la estimación descriptiva

Las regiones de tratamiento pasan del 10% al 14%, un aumento de cuatro puntos. Los controles pasan del 8% al 9%, un aumento de un punto. El DiD es de (14%-10%) - (9%-8%) = 3 puntos porcentuales. Ese es un cambio relativo, no una evidencia de que el producto lo haya causado.

Paso 2: Verificar los supuestos de identificación

El supuesto clave son las tendencias paralelas: sin el cambio, la brecha en el resultado habría evolucionado de manera similar. Grafica varias medias y brechas previas al lanzamiento para ver si los grupos ya estaban divergiendo. Comprueba si hubo campañas específicas de la región, cambios logísticos, shocks macroeconómicos y migración. Las tendencias paralelas no se pueden establecer con una sola comparación de antes y después; combina múltiples periodos con una explicación de negocio.

Paso 3: Elegir la estimación y la inferencia

Con un tratamiento simultáneo y una sola fecha de adopción, utiliza efectos fijos de región y tiempo, y agrupa los errores por región. Con pocas regiones tratadas, los errores estándar asintóticos pueden no ser confiables, así que añade inferencia por aleatorización o un método para pocos conglomerados (small-cluster). Para una adopción escalonada, estima primero la dinámica específica de cada cohorte. Las directrices de la NBER sobre adopción escalonada advierten que los efectos fijos bidireccionales simples pueden combinar efectos con ponderaciones problemáticas cuando los efectos varían por cohorte o por tiempo; compara estimadores adecuados para el tratamiento escalonado.

Paso 4: Ejecutar pruebas contrafactuales y de robustez

Prueba fechas de lanzamiento placebo, regiones placebo y ventanas alternativas. Añade covariables justificadas y compara las estimaciones; inspecciona resultados negativos y la retención en busca de cambios inverosímiles. Si el desbordamiento es material, utiliza controles no adyacentes o un tratamiento a un nivel superior. Reporta la estimación puntual, el intervalo, el tamaño de la muestra, el nivel de agrupación y el manejo de datos faltantes, no solo tres puntos porcentuales.

Respuesta de muestra de alta calidad

“El cálculo aritmético es cuatro puntos de crecimiento en las regiones tratadas menos un punto en los controles, por lo que la estimación puntual de DiD es de tres puntos porcentuales. Eso es solo un cambio relativo. Se convierte en un efecto causal del flujo de pago si, en ausencia del lanzamiento, los grupos hubieran seguido tendencias comparables, ningún shock específico de la región coincidió con el lanzamiento y el desbordamiento es limitado.

Utilizaría varios periodos previos al lanzamiento para graficar la conversión y la brecha, verificaría cómo se asignó el tratamiento e investigaría cambios en marketing, precios, tráfico y días festivos. Para un lanzamiento simultáneo, utilizaría efectos fijos de región y tiempo con errores agrupados por región. Con pocas regiones, añadiría inferencia por aleatorización o para pocos conglomerados.

Para un lanzamiento escalonado, estimaría los efectos dinámicos de cohorte y compararía un estimador diseñado para tratamiento escalonado en lugar de depender de efectos fijos bidireccionales ingenuos. Ejecutaría fechas placebo, regiones placebo, ventanas alternativas y verificaciones de resultados negativos, para luego reportar los intervalos y los supuestos. Si las tendencias previas claramente no son paralelas o el desbordamiento no se puede controlar, degradaría el resultado a una asociación y recomendaría un despliegue aleatorizado o mejor aislado”.

Errores comunes

  • Llamar causal a tres puntos → solo se calculó un cambio relativo → declara los supuestos de identificación y la incertidumbre.
  • Verificar un solo punto en el periodo previo → no se pueden evaluar las tendencias paralelas → utiliza múltiples periodos y un gráfico de estudio de eventos.
  • Ignorar el sesgo de asignación → es posible que se hayan seleccionado regiones de alto crecimiento → analiza la asignación y justifica las covariables.
  • Aplicar TWFE ingenuo a un despliegue escalonado → los efectos de cohorte pueden contaminarse entre sí → utiliza estimadores de tratamiento escalonado y comprobaciones de sensibilidad.
  • Agrupar por usuario → el tratamiento se asignó por región → agrupa en el nivel de asignación o utiliza inferencia robusta.
  • Ignorar el desbordamiento → los controles pueden recibir el tratamiento indirectamente → utiliza controles no adyacentes o un despliegue a un nivel superior.
  • Reportar solo una estimación puntual → se ocultan la precisión y los límites de la muestra → reporta intervalos, conteos, datos faltantes y ventanas.

Preguntas de seguimiento

Pregunta de seguimiento 1: Las tendencias previas ya divergían. ¿Aún se puede usar DiD?

Busca un mecanismo y un control más comparable. Una covariable justificada o una ventana más estrecha pueden ayudar, pero la regresión no debe aplanar cosméticamente una divergencia no explicada. Si las tendencias paralelas no son creíbles, utiliza la aleatorización o etiqueta el resultado como asociativo.

Pregunta de seguimiento 2: Solo hay tres regiones tratadas. ¿Cómo infieres la incertidumbre?

No confíes en las propiedades asintóticas de grandes conglomerados. Considera la inferencia por aleatorización, el bootstrap salvaje (wild bootstrap) o un diseño de control sintético adecuado para pocos conglomerados, y reporta la incertidumbre a nivel de región de forma transparente.

Pregunta de seguimiento 3: Los usuarios se desplazan entre regiones. ¿Qué cambia?

Define la exposición, como la primera región estable o la región de residencia de la cuenta. Excluye a los usuarios que claramente se mudan para el análisis de sensibilidad y mide la migración. Un fuerte desbordamiento rompe el contrafactual a nivel regional.

Pregunta de seguimiento 4: El resultado es significativo pero los ingresos se mantienen planos. ¿Cómo lo explicas?

Descompón la conversión en valor del pedido, reembolsos, retención y costo de adquisición, e inspecciona los resultados negativos. DiD identifica el cambio de la métrica objetivo; no establece automáticamente el valor comercial total.

Fuentes públicas

Preguntas relacionadas