Pregunta y cuándo utilizarla
Un clasificador de fraude se evalúa en 100,000 transacciones. De estas, 1,000 son fraudulentas, por lo que la tasa de positivos es del 1%. El modelo reporta un 99% de exactitud (accuracy). Un equipo de revisión puede investigar como máximo 1,000 alertas por día, y un fraude no detectado, un bloqueo falso y una revisión de alerta tienen costos diferentes. Decide si el modelo es útil, elige un umbral de producción y describe el plan de evaluación fuera de línea y monitoreo en producción.
Esta pregunta se adapta a roles de ciencia de datos, ingeniería de machine learning y riesgo. La tarea no consiste en nombrar una métrica que supuestamente sea "buena para datos desbalanceados". Una respuesta útil convierte la matriz de confusión, la calidad del ranking, los costos de negocio, la capacidad de procesamiento y la calidad de las probabilidades en una única decisión operativa. La tasa de positivos del 1%, los 100,000 ejemplos de validación y la capacidad diaria de 1,000 son supuestos de entrevista, no constantes generales de la industria.
Qué está evaluando el entrevistador
La primera señal es si el candidato detecta la trampa de la exactitud (accuracy). Predecir cada transacción como legítima ya produce un 99% de exactitud y un recall de cero. Simplemente reemplazar la exactitud con F1 es incompleto: F1 da el mismo peso a la precisión y al recall de forma predeterminada y no dice nada sobre los verdaderos negativos, la capacidad de revisión o los costos de error desiguales.
La segunda señal es si el candidato separa el ranking de la decisión de negocio. Métricas como AUROC y la precisión promedio resumen el ranking a través de los umbrales; el sistema de producción aún debe elegir un punto operativo. Una respuesta sólida reporta precisión, recall, tasa de falsos positivos, volumen de alertas y costo a partir de la misma matriz de confusión, y luego explica por qué el umbral seleccionado se ajusta a la capacidad.
La tercera señal es la experimentación libre de fuga de información (leakage). El ajuste del modelo, la calibración de probabilidades, la selección del umbral y la evaluación final no deben consumir repetidamente las mismas etiquetas. Una respuesta sólida selecciona el umbral mediante validación cruzada o en un conjunto de validación separado, deja el conjunto de prueba final intacto hasta que la decisión esté congelada y preserva una proporción de clases similar a la de producción en los datos de validación y prueba.
La cuarta señal es si el candidato puede detectar fallas después del lanzamiento. La tasa base de la clase, la mezcla poblacional, la distribución de puntuaciones y el retraso de las etiquetas pueden alterar los resultados del punto operativo seleccionado. El plan de monitoreo debe utilizar cortes temporales y segmentos importantes en lugar de tratar una puntuación fuera de línea como permanente.
Preguntas para aclarar antes de responder
- ¿Qué significa la clase positiva y qué error es más costoso? Perder un fraude generalmente causa una pérdida, mientras que un falso positivo puede agregar tanto costo de revisión como fricción para el usuario. La detección de enfermedades o el filtrado de spam producirían diferentes significados de error y objetivos.
- ¿El modelo entrega una puntuación de ranking o una probabilidad confiable? Tomar los 1,000 casos con mayor puntuación bajo una capacidad fija requiere principalmente un buen ranking. Calcular la pérdida monetaria esperada requiere una puntuación calibrada que pueda interpretarse como una probabilidad.
- ¿La capacidad de revisión es un límite estricto o un presupuesto promedio? Un límite estricto apunta a top-k, precision@k y recall@k. Una capacidad elástica permite una comparación directa del beneficio y costo incremental de diferentes umbrales.
- ¿Cuánto tiempo se tarda en recibir las etiquetas? Los contracargos pueden tardar semanas en madurar. En ese caso, la precisión del mismo día no está disponible, por lo que el equipo necesita indicadores adelantados sin etiquetas y métricas de resultados recalculadas en una ventana de etiquetas maduras.
- ¿Producción tiene la misma tasa de positivos que validación? La precisión cambia con la tasa base. Si los datos de validación fueron sobremuestreados o submuestreados, el punto operativo debe evaluarse nuevamente en datos que conserven la proporción de producción.
- ¿Los costos de error varían según el valor de la transacción o el segmento de usuario? Omitir un fraude de alto valor no es equivalente a omitir uno de bajo valor. Un único umbral global puede ser inferior a una política segmentada o a una decisión de costo esperado por ejemplo.
Estructura de respuesta de 30 segundos
"Un resultado de 99% de exactitud no demuestra que el modelo funcione. Predecir cada caso como legítimo también alcanza el 99% perdiendo todo el fraude. En un conjunto de validación separado con la tasa base de producción, construiría los conteos de TP, FP, FN y TN para los umbrales candidatos, luego reportaría precisión, recall, tasa de falsos positivos y volumen de alertas. Si el equipo solo puede revisar 1,000 alertas, evaluaría precision@k y recall@k para los 1,000 principales; si los costos son medibles, minimizaría el costo esperado combinado de omisiones, falsos positivos y revisiones. AUROC y precision-recall o la precisión promedio comparan rankings pero no seleccionan el punto operativo. Ajustaría los umbrales y la calibración únicamente en datos fuera del ajuste del modelo, usaría el conjunto de prueba final una sola vez y monitorearía la tasa base, los segmentos, la capacidad y los resultados con etiquetas maduras en producción".
Solución paso a paso
Paso 1: Establecer la línea base sin habilidad y la matriz de confusión completa
Predecir cada caso como legítimo produce 99,000 verdaderos negativos y 1,000 falsos negativos: 99% de exactitud y cero recall. Esta línea base muestra que el 99% de exactitud solo refleja los conteos de clases y no prueba que el modelo encuentre fraude alguno.
Supongamos que dos umbrales candidatos producen estos resultados en el mismo conjunto de validación:
| Umbral de puntuación | TP | FP | FN | TN | Alertas | Precisión | Recall | F1 | Exactitud | Tasa de falsos positivos |
|---|---|---|---|---|---|---|---|---|---|---|
| 0.80 | 700 | 300 | 300 | 98,700 | 1,000 | 70% | 70% | 70% | 99.4% | 0.303% |
| 0.50 | 850 | 1,650 | 150 | 97,350 | 2,500 | 34% | 85% | 48.6% | 98.2% | 1.667% |
Bajar el umbral a 0.50 detecta 150 fraudes adicionales pero crea 1,350 falsos positivos adicionales y 1,500 revisiones adicionales. El umbral de 0.80 tiene mayor exactitud y F1, mientras que 0.50 tiene mayor recall. Estas diferencias no coronan a una métrica; exponen el compromiso (trade-off) de negocio que debe resolverse.
Paso 2: Evaluar el ranking, el punto operativo y la calidad de las probabilidades por separado
AUROC puede interpretarse como la probabilidad de que un positivo aleatorio se clasifique por encima de un negativo aleatorio, por lo que es útil para comparar el ranking a través de los umbrales. Bajo un desbalance severo, un gran número de verdaderos negativos puede hacer que una tasa pequeña de falsos positivos parezca inofensiva incluso cuando el número absoluto de alertas falsas es grande. Por lo tanto, la curva precision-recall y la precisión promedio agregan una visión de cuántas alertas emitidas son correctas y qué parte de la clase positiva se recupera. Las métricas de PR todavía dependen de la prevalencia, por lo que no deben compararse sin la distribución de datos.
La decisión de negocio recae en un umbral o en un corte top-k. Con la capacidad fija en 1,000, el umbral de 0.80 casualmente produce 1,000 alertas de validación, para un precision@1000 del 70% y un recall@1000 del 70%. El volumen de producción y las distribuciones de puntuaciones cambian. Una política de capacidad más confiable clasifica los casos cada día, toma los 1,000 principales y mide continuamente ambas métricas en lugar de asumir que 0.80 siempre producirá el mismo recuento.
La calibración importa cuando una puntuación se utiliza como probabilidad. Un 0.8 calibrado, por ejemplo, debería significar que aproximadamente el 80% de las predicciones comparables son positivas. Los diagramas de confiabilidad y puntuaciones como la puntuación de Brier pueden verificar la calibración, y el calibrador debe ajustarse en datos independientes o en predicciones fuera del pliegue (out-of-fold). Una política fija de top-k requiere principalmente un ranking estable y no exige que cada puntuación esté perfectamente calibrada. Las decisiones monetarias de costo esperado sí requieren probabilidades creíbles.
Paso 3: Convertir la selección del umbral en una regla de costos
Sea C_FN el costo promedio de omitir un fraude, C_FP el costo de fricción del usuario de un falso positivo excluyendo la revisión manual, y C_R el costo de revisar una alerta. El costo de validación en un umbral es FN × C_FN + FP × C_FP + alert count × C_R.
Pasar de 0.80 a 0.50 evita 150 omisiones pero agrega 1,350 falsos positivos y 1,500 revisiones. Bajo este escenario, bajar el umbral vale la pena solo cuando 150 × C_FN > 1,350 × C_FP + 1,500 × C_R, lo cual se reduce a C_FN > 9 × C_FP + 10 × C_R. Este es un límite de decisión derivado de las matrices de confusión del ejemplo, no una constante universal.
Si 1,000 revisiones es un límite inviolable, el umbral de 0.50 no puede ir directamente a producción incluso cuando su valor esperado sea mayor. Las opciones incluyen revisar solo los 1,000 principales, automatizar un subconjunto de alta confianza y bajo riesgo, o enviar diferentes valores y segmentos a colas separadas. Cada opción requiere un nuevo análisis de capacidad, daño al usuario y reversibilidad.
Paso 4: Dar cuenta de los cambios en la tasa base
La precisión depende tanto de la tasa de positivos como del comportamiento del modelo. Dada la tasa de verdaderos positivos TPR, la tasa de falsos positivos FPR y la prevalencia p, la precisión es TPR × p ÷ [TPR × p + FPR × (1 - p)].
En el umbral de 0.80, el TPR del ejemplo es del 70% y el FPR es del 0.303%. Con una prevalencia del 1%, la fórmula da aproximadamente un 70.0% de precisión. Si TPR y FPR se mantienen sin cambios pero la prevalencia cae al 0.5%, la precisión cae a cerca del 53.7%. Por lo tanto, los datos de prueba fuera de línea deben conservar una tasa base similar a la de producción, y el monitoreo en producción debe rastrear la prevalencia y la mezcla de segmentos. El remuestreo puede ayudar al entrenamiento del modelo, pero su proporción artificial de clases no debe convertirse en la distribución de evaluación.
Paso 5: Diseñar una evaluación libre de fugas y monitoreo en producción
Divida los datos de entrenamiento, validación y prueba final por tiempo, agregando agrupación por usuario, dispositivo o evento cuando sea necesario para evitar que ejemplos relacionados crucen particiones. Después de ajustar el modelo, use validación cruzada o datos de validación separados para hiperparámetros, calibración y selección de umbrales. Evalúe el conjunto de prueba final una vez después de que la decisión esté congelada. Si una herramienta de ajuste de umbrales utiliza validación cruzada internamente, verifique que no se esté ajustando en los mismos datos completos utilizados para ajustar ese modelo exacto.
El panel de producción necesita al menos dos capas. La capa inmediata rastrea distribuciones de puntuaciones, recuento de alertas, el corte top-k, la antigüedad de la cola de revisión, segmentos importantes y errores del sistema. La capa de etiquetas maduras recalcula precision@k, recall@k, costo de FN, costo de FP, error de calibración y desviación respecto a las expectativas fuera de línea. Los cambios de umbral deben reutilizar la misma regla de costo y capacidad y reproducirse en un conjunto fuera de tiempo; una fluctuación de un día no debería desencadenar un objetivo móvil.
Ejemplo de una respuesta sólida
"No aceptaría el resultado de 99% de exactitud de entrada. Solo el 1% del conjunto de validación es fraude, por lo que predecir cada transacción como legítima también da un 99% de exactitud y cero recall. Aclararía la definición de la clase positiva, los tres costos, si 1,000 revisiones diarias es un límite estricto y el retraso de las etiquetas.
En el umbral de 0.80, los resultados dados son 700 TP, 300 FP, 300 FN y 98,700 TN. La precisión y el recall son ambos del 70%, y el recuento de alertas es exactamente 1,000. El umbral de 0.50 eleva el recall al 85% pero crea 2,500 alertas, lo que excede la capacidad. Detecta 150 fraudes adicionales mientras agrega 1,350 falsos positivos y 1,500 revisiones. Usaría C_FN > 9 × C_FP + 10 × C_R para probar el valor incremental de bajar el umbral. Con un límite estricto de capacidad, tomaría en su lugar las 1,000 puntuaciones más altas y reportaría precision@1000 y recall@1000.
Utilizaría tanto AUROC como precision-recall o precisión promedio durante la comparación de modelos, luego seleccionaría el punto operativo con la matriz de confusión y los costos. Si las puntuaciones impulsan decisiones monetarias, las calibraría en datos fuera del ajuste del modelo. Si el sistema solo necesita top-k, me enfocaría en la estabilidad del ranking. Los hiperparámetros, la calibración y los umbrales se mantienen dentro de la validación o validación cruzada, mientras que un conjunto de prueba final con la proporción de producción se evalúa una sola vez.
En producción, monitorearía la capacidad de alertas y las métricas de etiquetas maduras en conjunto. Incluso si TPR y FPR se mantienen fijos, reducir la tasa de positivos del 1% al 0.5% reduce la precisión del ejemplo de aproximadamente 70.0% a 53.7%. Es por eso que el plan también rastrea la tasa base, la distribución de puntuaciones, la desviación de calibración y el rendimiento por tiempo y segmento clave".
Errores comunes
- Comparar solo exactitud → Un clasificador de todo negativo ya alcanza el 99%, por lo que la métrica no prueba que se hayan encontrado positivos → Comience con la línea base sin habilidad, luego reporte la matriz de confusión, precisión, recall y recuento absoluto de alertas.
- Elegir automáticamente F1 para datos desbalanceados → F1 implica igual peso para precisión y recall e ignora la capacidad y los verdaderos negativos → Elija F-beta, una función de costo o una métrica de capacidad fija a partir de los costos de error reales.
- Afirmar que PR siempre es mejor que ROC → Responden preguntas diferentes, y PR depende de la prevalencia → Use AUROC para ranking, PR o AP para calidad de alertas positivas, y seleccione el punto operativo por separado.
- Usar el umbral predeterminado de 0.5 → Un valor predeterminado estadístico no es un óptimo de negocio → Ajuste el umbral en datos fuera del ajuste del modelo contra el costo y la capacidad.
- Ajustar el umbral en datos de entrenamiento → El umbral se adapta al error de entrenamiento y produce una evaluación optimista → Use predicciones fuera del pliegue (out-of-fold) o un conjunto de validación separado, conservando un conjunto de prueba final.
- Reportar precisión en un conjunto de prueba remuestreado → La proporción artificial de clases cambia la precisión y el volumen de alertas → Evalúe en una tasa base similar a la de producción y mantenga el remuestreo en la etapa de entrenamiento.
- Tratar una puntuación bruta como probabilidad → Un 0.8 no calibrado no necesariamente significa una tasa de eventos del 80% → Valide y calibre las probabilidades para decisiones de costo esperado; declare la semántica de la puntuación cuando solo ordene por ranking.
- Monitorear solo AUROC después del lanzamiento → Un ranking global estable puede ocultar desbordamiento de capacidad, fallas en segmentos o un cambio en la tasa base → Monitoree también el punto operativo, la cola, los costos y los resultados de etiquetas maduras.
Preguntas de seguimiento y respuestas
Pregunta de seguimiento 1: ¿Qué pasa si la capacidad de revisión cae de 1,000 casos a 500?
Recalcule precision@500, recall@500 y el valor neto esperado para los primeros 500 casos en lugar de escalar el umbral anterior. Si las transacciones de alto valor ofrecen mayor beneficio, ordene por pérdida esperada por ejemplo en lugar de solo por probabilidad de fraude. Verifique si ese ranking impone bloqueos falsos desproporcionados en algún segmento de usuarios.
Pregunta de seguimiento 2: ¿Cómo monitorearía el modelo cuando las etiquetas tardan 60 días en madurar?
Separe los indicadores inmediatos (proxies) de los resultados tardíos. Rastree de inmediato entradas faltantes, distribución de puntuaciones, volumen de alertas, decisiones de los revisores y antigüedad de la cola. Construya ventanas de madurez fijas por fecha de evento y recalcule precisión, recall y costo para la misma cohorte después de 60 días. Los indicadores pueden activar investigaciones pero no deben presentarse como métricas de etiquetas finales.
Pregunta de seguimiento 3: ¿Se puede usar el mismo umbral en un nuevo mercado con una tasa de fraude del 0.5%?
La precisión del 70% del mercado anterior es evidencia insuficiente. Incluso si el 70% de TPR y el 0.303% de FPR se transfieren, la menor tasa base reduce la precisión a cerca del 53.7%; el TPR y FPR reales también pueden cambiar con la población. Reestime la matriz de confusión, la calibración y la capacidad en muestras fuera de tiempo del nuevo mercado, y luego aplique la misma regla de costo.
Pregunta de seguimiento 4: AUROC mejoró, pero la precisión entre los 1,000 principales cayó. ¿Qué modelo gana?
Si producción solo puede actuar sobre los 1,000 principales, la calidad del ranking local controla directamente el valor, por lo que precision@1000, recall@1000 y las restricciones de costo tienen prioridad. AUROC abarca todos los umbrales, y su ganancia puede ocurrir en una región que el negocio nunca utiliza. Los intervalos de confianza o cortes temporales repetidos deben confirmar que la diferencia en top-k no es ruido de muestreo.
Pregunta de seguimiento 5: ¿Las transacciones con diferentes valores deberían compartir un mismo umbral?
Un umbral único es simple pero trata un error de una unidad y un error de diez mil unidades como iguales. Con probabilidades calibradas y costos estimados, use la pérdida esperada por transacción o bandas de valor con umbrales separados, luego valide la capacidad total, la equidad por segmento, la interpretabilidad y la reversión (rollback). Un segmento con muy pocos ejemplos no debería ajustar su propio umbral porque perseguirá ruido.