La pregunta y cuándo usarla
Un feed muestra 10 recomendaciones por solicitud. Un ranker candidato mejora NDCG@10 en registros históricos de retroalimentación implícita. Diseña la evaluación offline y el experimento online necesarios para decidir si lanzarlo. Cubre la división de datos, el conjunto de candidatos, las métricas de ranking y más allá de la precisión, el sesgo de exposición, el diseño del experimento, las métricas de control (guardrails) y la investigación para cuando el ganador offline pierde online.
Esta es una pregunta representativa en entrevistas de ingeniería de machine learning y ciencia de datos. Evalúa la decisión sobre un modelo, no la arquitectura de toda la plataforma de recomendación. El escenario asume retroalimentación implícita como clics, guardados o tiempo de reproducción. Estos registros guardan resultados de elementos que el sistema anterior expuso; el silencio sobre un elemento no expuesto es una incógnita, no un negativo verificado.
Qué está evaluando el entrevistador
Una respuesta básica enumera precisión, recall y NDCG. Una respuesta sólida primero define la acción del usuario y la superficie de servicio, porque la misma métrica puede significar cosas distintas para resultados de búsqueda, un feed de inicio o "elementos similares". Luego hace que la línea base y el candidato sean comparables: el mismo corte temporal, usuarios, reglas de elegibilidad, grupo de candidatos, etiquetas y valor de K.
La siguiente señal es si el candidato reconoce los límites de la retroalimentación registrada. Una división aleatoria por filas puede filtrar comportamiento futuro en el entrenamiento. El muestreo de negativos puede alterar el orden del modelo. Los registros históricos favorecen a los elementos elegidos por la política anterior y confunden la preferencia con la exposición y la posición. La evaluación offline puede rechazar un modelo débil o inseguro, pero por sí sola no puede establecer el efecto causal en el producto de cambiar la política.
Finalmente, el entrevistador busca un proceso de lanzamiento. Eso incluye asignación aleatorizada estable, registro de exposición, un resultado principal, guardrails para el sistema y daños al usuario, planificación de potencia y duración, criterios de reversión (rollback), comprobaciones por segmentos y un diagnóstico metódico cuando los resultados offline y online discrepan.
Preguntas para aclarar antes de responder
- ¿Qué decisión del usuario debería mejorar? Si el objetivo es encontrar al menos un elemento útil rápidamente, MRR puede importar; si cada posición en un feed de diez elementos aporta valor, NDCG y el engagement acumulado encajan mejor.
- ¿Cómo se definen y maduran las etiquetas? Un clic, una visualización calificada, un guardado, una compra o un "no me gusta" explícito representan utilidades distintas. Las compras diferidas requieren una ventana de observación madura.
- ¿El ranker califica todo el catálogo o los candidatos de un retriever previo? La evaluación debe preservar el límite de candidatos de producción. Un ranker no puede recuperar un elemento relevante que la recuperación nunca suministra.
- ¿Qué elementos eran elegibles en cada momento histórico? Los elementos eliminados, no disponibles o aún no creados no deben aparecer en un conjunto de candidatos anterior.
- ¿Puede el producto ejecutar un experimento aleatorizado? Si no es así, la conclusión debe ser más cautelosa. Las propensiones registradas pueden respaldar estimadores contrafactuales, pero solo donde la política anterior dio a las opciones de la nueva política un soporte adecuado.
- ¿Qué resultados no deben sufrir regresiones? La latencia, los errores, las acciones de ocultar o reportar, la concentración de contenido, la exposición de proveedores y la calidad posterior pueden restringir un modelo incluso cuando el engagement aumenta.
Estructura de respuesta en 30 segundos
“No realizaría el lanzamiento basándome únicamente en un aumento de NDCG@10. Primero congelaría el objetivo de producto, la etiqueta, K, la división temporal, el catálogo elegible, el límite de generación de candidatos y las líneas base de comparación. Sobre los mismos ejemplos reportaría recall@10 y NDCG@10, añadiría cobertura o diversidad donde el producto lo necesite y segmentaría usuarios nuevos, usuarios dispersos, elementos nuevos y mercados clave. Trataría los elementos no expuestos como desconocidos y documentaría cualquier muestreo de negativos. Si el candidato supera las comprobaciones offline, ejecutaría un experimento aleatorizado a nivel de usuario con registros de asignación y exposición, un resultado principal de usuario o de negocio, guardrails de latencia y daño, un efecto mínimo detectable y duración predefinidos, y umbrales de rollback. Una victoria offline hace que el modelo sea apto para una prueba; el resultado online aleatorizado decide si mejora el producto”.
Solución paso a paso
Paso 1: Definir la decisión antes de seleccionar métricas
Escribe un estimando de una sola línea: “Para las solicitudes de feed elegibles de la población objetivo, ¿en cuánto cambia el resultado principal del usuario durante el horizonte del experimento al reemplazar el ranker actual con el candidato?” Esto fija la población, la intervención, el resultado y la ventana de tiempo. También evita elegir después cualquier métrica que parezca favorable.
Usa al menos el ranker de producción y una línea base simple de popularidad o recencia. La línea base simple detecta un pipeline que parece sofisticado pero no puede superar una política económica. Mantén fijos los filtros de elegibilidad y la generación de candidatos cuando la pregunta sea específicamente sobre el ranker. Si la recuperación también cambia, evalúa eso como un tratamiento separado o llama explícitamente al resultado una comparación de sistema de extremo a extremo.
Paso 2: Reconstruir ejemplos offline en un punto en el tiempo
Para cada solicitud de evaluación en el tiempo t, construye características solo a partir de la información disponible para t, usa el catálogo y el estado de elegibilidad en t, y coloca las interacciones posteriores en la ventana de etiquetas. Divide por tiempo para que el entrenamiento preceda a la validación y a la prueba. Agrupa eventos relacionados por usuario o sesión cuando cruzar particiones revelaría la respuesta. Congela las definiciones de características, el filtrado, la deduplicación y la madurez de las etiquetas antes de inspeccionar los resultados de los candidatos.
Ejecuta la línea base y el candidato en los mismos usuarios, solicitudes, grupos de candidatos, etiquetas, corte y K. Reporta la cantidad de tráfico excluido por características faltantes o etiquetas inmaduras; de lo contrario, un modelo puede “mejorar” descartando silenciosamente sus casos difíciles. Evalúa segmentos importantes como usuarios nuevos frente a recurrentes, usuarios dispersos frente a intensivos, elementos nuevos frente a establecidos, región geográfica, dispositivo y categoría de catálogo.
Paso 3: Alinear cada métrica con una afirmación del producto
Supón que los elementos relevantes retenidos son {A, C} y el ranking de los cinco mejores es [A, B, D, C, E]. Precision@5 es 2 / 5 y recall@5 es 2 / 2 = 1. NDCG le da al elemento en el rango 1 más peso que al elemento relevante en el rango 4, por lo que evalúa tanto el orden como la pertenencia. MRR es útil cuando el primer resultado relevante domina la experiencia.
Estos valores responden a diferentes preguntas:
- Recall@K: cuánto del conjunto relevante etiquetado entró en el top
K. - Precision@K: cuántos de los
Kelementos mostrados están etiquetados como relevantes; los registros implícitos pueden contener falsos negativos. - NDCG@K: si los elementos de mayor ganancia aparecen antes, con un descuento por rango.
- MRR@K: qué tan pronto aparece el primer elemento etiquetado como relevante.
- Cobertura, diversidad, novedad o calibración: si la política sirve suficiente parte del catálogo, evita listas repetitivas, expone valor de descubrimiento o alinea la mezcla con los intereses del usuario. Selecciona solo las vinculadas al riesgo del producto.
Añade métricas de servicio (latencia, tasas de error y fallback, disponibilidad de características y distribuciones de puntuación), porque un modelo offline que no puede satisfacer el presupuesto online no se puede lanzar. Ninguna métrica offline individual es una ganadora universal.
Paso 4: Hacer visible el sesgo de la retroalimentación registrada
El sistema anterior eligió lo que los usuarios podían ver. Un clic significa tanto exposición como acción positiva; la ausencia de clics puede significar desinterés, mala posición o falta de exposición. No conviertas cada elemento del catálogo no observado en un negativo seguro. El ranking de catálogo completo es la comparación más limpia cuando es factible. Si la evaluación muestrea negativos, usa el mismo grupo de candidatos, muestreador, tamaño de muestra y semillas aleatorias para cada modelo, repórtalos y no compares los valores de métricas muestreadas con los valores de catálogo completo. Diferentes muestreadores de negativos pueden incluso invertir el orden aparente del modelo.
Los resultados offline siguen condicionados por la política registrada. Si se registraron propensiones de exposición aleatorizadas, las estimaciones por propensión inversa (IPS), autonormalizadas o doblemente robustas pueden reducir el sesgo de la política, pero no generan evidencia donde la política anterior casi nunca expuso un elemento. Reporta la superposición y la varianza de pesos, y recorta o rechaza un estimador cuyo resultado esté impulsado por unos pocos pesos extremos.
Paso 5: Convertir al sobreviviente offline en un experimento online
Aleatoriza por una unidad estable, generalmente usuario o cuenta, antes de la exposición a la recomendación. Usa un clúster como un hogar o un grupo social cuando el tratamiento de una persona pueda afectar el resultado de otra. Registra la asignación, la elegibilidad, la lista generada (slate), la posición, la exposición, la acción, la versión del modelo y el fallback. Analiza por tratamiento asignado —intención de tratar (intent-to-treat)— para que las fallas y los fallbacks no se eliminen del brazo candidato.
Elige un resultado principal de usuario o de negocio que coincida con el objetivo declarado. Predefine el efecto mínimo detectable, el nivel de significancia, la potencia, la asignación, la duración y el horizonte del tratamiento. Los guardrails pueden incluir latencia p95, errores, ocultaciones, reportes, abandono, concentración de contenido y calidad posterior. Antes de leer el impacto, verifica el equilibrio del ratio de muestra (sample-ratio mismatch), la persistencia de la asignación, las tasas de exposición, la integridad de la telemetría y la madurez comparable de las etiquetas.
Comienza con un despliegue pequeño y reversible, luego expande solo mientras se mantengan los guardrails. Predefine condiciones de detención y rollback. La estacionalidad y los resultados diferidos pueden requerir ciclos de negocio completos o una ventana de observación más larga; mirar repetidamente y detenerse en un día favorable invalida una prueba ordinaria de horizonte fijo.
Paso 6: Diagnosticar una victoria offline que pierde online
Investiga los límites en orden en lugar de descartar el modelo inmediatamente:
- Integridad del experimento: desajuste en el ratio de muestra (SRM), asignación inestable, exposiciones faltantes o tasas de fallback desiguales.
- Paridad de servicio: las características online, los filtros, la generación de candidatos, la frescura, la latencia y la versión del modelo coinciden con la reproducción offline.
- Construcción de la evaluación: fuga hacia el futuro, una división aleatoria poco realista, diferentes grupos de candidatos o un muestreador de negativos favorable.
- Desajuste de objetivos: NDCG optimizó los clics históricos mientras que el producto valora la satisfacción, la retención, las compras o el descubrimiento diverso.
- Sesgo de política: el candidato exploró elementos y posiciones no representados en los registros antiguos, por lo que las etiquetas offline los infravaloraron o valoraron incorrectamente.
- Efectos heterogéneos: una ganancia global ocultó pérdidas para nuevos usuarios, un mercado, una clase de elemento o un segmento de alto valor.
- Dinámicas: la novedad desapareció, los creadores o proveedores se adaptaron o la nueva distribución de exposición cambió los datos de entrenamiento futuros.
La regla de decisión tiene tres capas: la evidencia offline indica que el candidato es plausible y seguro bajo condiciones registradas conocidas; un experimento online aleatorizado estima su efecto causal en el producto; el monitoreo en producción comprueba si ese efecto persiste a medida que cambian los usuarios, el inventario y los bucles de retroalimentación.
Ejemplo de una respuesta sólida
“Primero haría comparables los dos rankers. El corte de evaluación, los elementos elegibles, la salida de la recuperación, las etiquetas, los usuarios y K=10 deben ser idénticos, y todas las características deben existir en el momento de la solicitud. Usaría un conjunto de prueba fuera de tiempo y reportaría exclusiones y madurez de etiquetas. Junto al modelo de producción mantendría una línea base de popularidad, porque un candidato complejo que no puede superarla no está listo.
NDCG@10 es útil para el orden, pero no constituye la decisión de lanzamiento. Añadiría recall@10, luego medidas específicas del producto como cobertura de catálogo y diversidad dentro de la lista, además de latencia y tasa de fallback. Los resultados necesitan cortes para usuarios fríos, usuarios dispersos, elementos nuevos y mercados importantes. También expondría cómo se formaron los negativos. La política histórica determinó la exposición, por lo que los elementos no expuestos son desconocidos; si se muestrean negativos, cada modelo debe usar el mismo muestreador y los números no son comparables con las métricas de catálogo completo.
Si el candidato supera esas comprobaciones, aleatorizaría de forma persistente por usuario. La asignación y la exposición se registran antes de los resultados, y el análisis mantiene los fallbacks en el brazo asignado. Predefiniría un resultado principal, el efecto mínimo detectable, la potencia, el horizonte, los guardrails y los criterios de rollback. Verificaría el equilibrio del ratio de muestra y la telemetría antes de interpretar el impacto.
Si el NDCG offline sube pero el resultado online cae, revisaría primero la integridad del experimento y la paridad de servicio. Luego inspeccionaría la fuga temporal, los desajustes de candidatos y muestreo, el fallo de la métrica proxy, el sesgo de exposición y los efectos por segmento. El resultado offline le otorga al candidato un experimento; solo el resultado causal online, junto con los guardrails, le otorga un lanzamiento”.
Errores comunes
- Lanzar basándose únicamente en un mayor NDCG → La calidad del ranking offline está condicionada por las etiquetas históricas y no estima el efecto causal en el producto → Úsalo como una señal de filtrado, luego exige un resultado online aleatorizado y guardrails.
- Dividir filas de interacción aleatoriamente → El comportamiento posterior del usuario o el estado del elemento pueden filtrarse al entrenamiento → Usa una división en un punto en el tiempo y construye características, elegibilidad de catálogo y etiquetas tal como existían entonces.
- Cambiar la recuperación y el ranking juntos sin mencionarlo → No se puede identificar el origen de la ganancia → Mantén fija la generación de candidatos para una comparación de rankers o califica el tratamiento como de extremo a extremo.
- Tratar cada elemento no observado como negativo → Muchos elementos nunca fueron expuestos → Distingue las no acciones expuestas de los elementos desconocidos y documenta el conjunto de candidatos de evaluación.
- Usar diferentes muestras de negativos para cada modelo → La comparación cambia tanto el modelo como la dificultad de la prueba → Comparte el grupo, el muestreador, el tamaño y las semillas, o clasifica el catálogo completo.
- Reportar solo una métrica agregada → Un promedio global puede ocultar fallas en cold-start o en mercados específicos → Reporta segmentos predefinidos e incertidumbre junto con el agregado.
- Optimizar clics sin un objetivo de producto → El sesgo de posición o el clickbait pueden mejorar el proxy mientras perjudican la satisfacción → Define el resultado principal y los guardrails de daño antes de la selección del modelo.
- Eliminar los fallbacks del análisis del tratamiento → Esto oculta una falla real de servicio y rompe la aleatorización → Usa el análisis por intención de tratar (intent-to-treat) y reporta el fallback como un guardrail.
- Hacer comprobaciones reiteradas (peeking) hasta que el experimento sea positivo → Detenerse de forma no planificada y repetida infla los falsos positivos → Fija el horizonte y el plan de análisis o utiliza un diseño secuencial válido.
- Declarar inmediatamente una brecha offline-online como “model drift” → Un registro roto, falta de paridad o problemas de asignación a menudo producen el mismo síntoma → Verifica la integridad del experimento y la paridad de servicio antes del comportamiento del modelo.
Preguntas de seguimiento y respuestas
Pregunta de seguimiento 1: ¿Qué pasa si no puedes ejecutar un experimento online?
Usa una reproducción fuera de tiempo, múltiples ventanas históricas, líneas base sólidas, pruebas por segmentos y un canary en la sombra o limitado para reducir el riesgo operativo, pero aclara que el impacto causal en el producto sigue sin demostrarse. Si se registraron propensiones aleatorizadas y la nueva política tiene suficiente soporte, añade estimaciones IPS, IPS autonormalizadas o doblemente robustas con diagnósticos de superposición y varianza. No las presentes como una autorización para extrapolar más allá del soporte registrado.
Pregunta de seguimiento 2: ¿Cómo evaluarías nuevos usuarios y nuevos elementos?
Crea cohortes explícitas de cold-start en el corte de evaluación. Evita que el historial posterior del usuario o las interacciones de los elementos ingresen a las características. Compara la cobertura de fallback, los resultados de la primera sesión, la exposición de nuevos elementos y el tiempo hasta la primera acción significativa. Una métrica global dominada por usuarios establecidos y elementos populares no responde a la pregunta de cold-start.
Pregunta de seguimiento 3: ¿Qué pasa si el tiempo de reproducción aumenta pero la diversidad cae?
Regresa al objetivo y las restricciones predefinidos. Si la diversidad protege la satisfacción a largo plazo, la salud del catálogo o la elección del usuario, trátala como un guardrail o un objetivo de optimización restringida en lugar de promediar métricas no relacionadas después del resultado. Examina la concentración y las distribuciones de exposición repetida por segmento, luego prueba un reranker o una restricción como un nuevo tratamiento.
Pregunta de seguimiento 4: ¿Cuándo se debe aleatorizar por clúster en lugar de por usuario?
Usa clústeres cuando el tratamiento se propaga entre unidades: los perfiles familiares comparten una pantalla, las recomendaciones sociales afectan a los amigos o la exposición en un marketplace cambia el inventario compartido. Aleatorizar individuos violaría la independencia y contaminaría los brazos. La asignación por clúster reduce el tamaño efectivo de la muestra, por lo que los cálculos de potencia deben incluir la correlación intraclúster.
Pregunta de seguimiento 5: ¿Puede la evaluación contrafactual reemplazar las pruebas A/B?
Puede filtrar políticas cuando se conocen las propensiones a las acciones y la superposición es adecuada. IPS corrige la exposición ponderando las recompensas observadas, la autonormalización cambia algo de sesgo por control de varianza y los métodos doblemente robustos combinan un modelo de recompensa con ponderación de propensión. Todos pueden fallar con propensiones faltantes, superposición deficiente, pesos extremos o un modelo de recompensa incorrecto, por lo que una afirmación de lanzamiento aún se beneficia de una prueba online aleatorizada.
Pregunta de seguimiento 6: ¿Cómo se detecta un bucle de retroalimentación dañino después del lanzamiento?
Monitorea la concentración de exposición, el alcance de creadores o proveedores, la cobertura del catálogo, las impresiones repetidas y la calidad del resultado en cohortes sucesivas, no solo el engagement inmediato. Conserva las versiones del modelo y de la política en los registros, compara la composición de los datos de entrenamiento a lo largo del tiempo y retén una política pequeña de referencia o exploración cuando sea factible. Revierte o restringe la política cuando la concentración o los guardrails de daño superen sus límites predefinidos.