Prompt y contexto
Un modelo de fraude genera una probabilidad de riesgo de 0 a 1 para cada transacción. El negocio quiere utilizar 0.8 como umbral de revisión manual. Explica cómo evaluar la calibración, separar el ranking de la calidad de la probabilidad, elegir un método de calibración y manejar el desbalance de clases, el drift y los límites de capacidad de revisión.
La pregunta pública de entrevista de machine learning de 2026 de PracHub indaga explícitamente sobre la calibración del modelo, diagramas de fiabilidad, ECE, Brier score y selección de umbrales. La documentación de scikit-learn proporciona los límites de implementación para la calibración, diagramas de fiabilidad agrupados en bins y datos de calibración independientes. Esta pregunta no está vinculada a una empresa específica.
Qué evalúan los entrevistadores
Una respuesta promedio dice "verificar la accuracy o el AUC". Una respuesta sólida define la probabilidad: entre los casos predichos cerca de 0.8, la tasa de positivos a largo plazo debería estar cerca de 0.8. Luego separa fiabilidad, discriminación, tasa base (base rate) y el umbral de negocio, explicando por qué un modelo con alto AUC aún puede ser sobreconfiado.
Los entrevistadores también verifican que se utilicen particiones sin fuga de datos (leakage-free), un conjunto de calibración representativo, suficientes observaciones por bin y una verificación de costos posterior a la calibración. La calibración no hace que el modelo sea más inteligente; hace que el score sea interpretable en una escala de probabilidad.
Preguntas clarificadoras
- ¿Qué decisión utiliza la probabilidad? El ranking puede necesitar AUC y top-k; la asignación de capacidad o las decisiones de pérdida esperada necesitan calibración.
- ¿Cuándo maduran las etiquetas? La confirmación de fraude puede retrasarse, por lo que la ventana de evaluación debe esperar a que las etiquetas maduren.
- ¿La tasa de positivos online coincide con la de entrenamiento? El muestreo, la ponderación y los cambios en el tiempo alteran el prior y requieren una evaluación de la distribución objetivo o una corrección del prior.
- ¿Cada segmento debe tener probabilidades confiables? Los sistemas de alto riesgo deben inspeccionar cortes por región, canal y producto, ya que la calibración agregada puede ocultar errores locales.
- ¿Cuáles son la capacidad de revisión y los costos de error? El umbral es una decisión de negocio, no una salida automática de una curva de calibración.
Respuesta de 30 segundos
"Primero confirmo si las probabilidades guían las decisiones de revisión y espero a que maduren las etiquetas. La calibración significa que los casos predichos en 0.8 tienen una tasa observada de positivos cercana a 0.8. En datos independientes del entrenamiento y representativos de producción, trazo un diagrama de fiabilidad y reporto los conteos por bin, ECE y log loss; Brier es un score compuesto y no puede demostrar la calibración por sí solo. Elijo el umbral a partir del costo y la capacidad de revisión, verifico que la calidad del ranking se mantenga estable, inspecciono segmentos y monitoreo el drift del prior y de la calibración a lo largo del tiempo. Para la descalibración comienzo con escalado sigmoide; con suficientes datos y una forma no lineal pruebo isotonic, y nunca ajusto un calibrador sobre las predicciones de entrenamiento".
Respuesta paso a paso
Paso 1: Separar la calibración del ranking
| Dimensión | Calibración de probabilidad | Ranking o discriminación |
|---|---|---|
| Pregunta | ¿Las probabilidades predichas coinciden con las tasas observadas? | ¿Los positivos se clasifican por encima de los negativos? |
| Herramientas típicas | Diagrama de fiabilidad, ECE, log loss, descomposición de Brier | ROC-AUC, PR-AUC, lift en top-k |
| Uso de negocio | Pérdida esperada, capacidad de revisión, niveles de riesgo | Seleccionar qué casos procesar primero |
| Falla típica | Las probabilidades son altas mientras que el ranking sigue siendo bueno | El ranking es bueno pero 0.8 no tiene un significado confiable |
La calibración binaria requiere que las muestras predichas cerca de p tengan una frecuencia observada de positivos cercana a p. El AUC depende únicamente del ordenamiento, y una transformación monótona de probabilidad puede preservar el AUC, por lo que el AUC no puede reemplazar una verificación de calibración.
Paso 2: Graficar la fiabilidad y reportar la incertidumbre
Agrupa en bins las probabilidades predichas, luego calcula la predicción media y la tasa observada de positivos en cada bin. Grafica la predicción media en el eje x y la tasa de positivos en el eje y; la calibración perfecta se encuentra cerca de la diagonal. Muestra el conteo de cada bin o un histograma para no sobreinterpretar un bin minúsculo con scores altos.
from sklearn.calibration import CalibrationDisplay
from sklearn.metrics import log_loss
display = CalibrationDisplay.from_predictions(
y_true=y_cal,
y_prob=p_cal,
n_bins=10,
strategy="quantile",
)
loss = log_loss(y_cal, p_cal)Los límites de los bins no son una verdad objetiva: los bins de igual ancho pueden estar mayormente vacíos bajo un desbalance severo, mientras que los bins por cuantiles cambian el rango de probabilidad por bin. Con pocas observaciones, muestra intervalos de confianza, une bins dispersos o usa un método de binning optimizado y reproducible en lugar de confiar en una sola línea.
Paso 3: Comprender los límites de ECE, Brier y log-loss
El ECE usualmente calcula una brecha absoluta ponderada entre la predicción media y la frecuencia observada por bin. Es fácil de comunicar, pero depende del número de bins y de la regla utilizada. El Brier score es el error cuadrático de la probabilidad, mientras que log loss penaliza las predicciones incorrectas con alta confianza; ambos mezclan la fiabilidad con la discriminación y la incertidumbre del resultado.
Por lo tanto, "un Brier más bajo significa mejor calibración" no es una conclusión válida. Combina el diagrama, los conteos por bin, el componente de fiabilidad de una descomposición y log loss en la misma ventana de tiempo madura. Las investigaciones sobre diagramas de fiabilidad también demuestran que el binning ingenuo es sensible a las decisiones de implementación, por lo que debes reportar el método y la incertidumbre.
Paso 4: Calibrar en una partición sin fugas (leakage-free)
Las predicciones de entrenamiento fueron vistas por el modelo base, por lo que ajustar un calibrador sobre ellas produce un mapeo optimista. La secuencia segura es: ajustar el modelo base; ajustar el calibrador sobre probabilidades out-of-fold o retenidas (held-out); evaluar una sola vez sobre datos que no participaron en ninguno de los dos ajustes.
train: fit base model
calibration: fit calibrator on out-of-fold or held-out probabilities
test: evaluate calibration, ranking, and business threshold onceUtiliza particiones basadas en tiempo para casos con etiquetas retrasadas o series temporales; no mezcles información futura en el pasado. El conjunto de calibración debe coincidir con la tasa de positivos, la distribución de features y la ventana de madurez de etiquetas de producción, o de lo contrario medirá la muestra de entrenamiento en lugar de la probabilidad que utilizará el negocio.
Paso 5: Elegir la calibración y el umbral operativo
El escalado sigmoide o de Platt ajusta una regresión logística unidimensional sobre los scores crudos y es estable con datos limitados cuando el error tiene una forma aproximadamente de S. La regresión isotónica es más flexible, pero puede sobreajustar cuando el conjunto de calibración es pequeño. Temperature scaling es común para logits multiclase y aun así necesita validación independiente.
La calibración determina la escala de probabilidad; el umbral sigue siendo una decisión de negocio. Si los revisores solo pueden procesar 2,000 casos por día, elije un umbral a partir de la capacidad, el costo de falsos positivos, el costo de falsos negativos y el retraso, en lugar de asumir que 0.8 es significativo. Valida los cambios de umbral con repeticiones representativas (replay) y guardrails online.
Paso 6: Manejar el desbalance y el drift de producción
El sobremuestreo (oversampling), los pesos de clase y la focal loss pueden cambiar el significado probabilístico de un score. Si el entrenamiento tiene una tasa de positivos del 10% pero producción tiene el 2%, el ranking puede mantenerse estable mientras que las probabilidades se descalibran. Reevalúa sobre el prior objetivo, aplica una corrección de prior cuando esté justificado o recalibra.
Después del lanzamiento, calcula de forma continua la fiabilidad rodante, ECE, log loss y la tasa de positivos, con cortes por canal, región y nivel de cliente. La estacionalidad, los cambios de políticas y el retraso de etiquetas causan drift. Dispara una recalibración cuando el error supere la tolerancia del negocio, un segmento crítico sufra drift o el prior se mueva más allá de un umbral, utilizando datos frescos con etiquetas maduras.
Respuesta de muestra de alta calidad
"Primero pregunto si estas probabilidades guían la revisión, cuándo maduran las etiquetas y si la tasa de positivos online coincide con la muestra de entrenamiento. La calibración significa que las transacciones predichas cerca de 0.8 tienen una tasa de fraude a largo plazo cercana a 0.8. El conjunto de evaluación debe ser independiente, consciente del tiempo, con etiquetas maduras y representativo de producción.
Dibujo un diagrama de fiabilidad con conteos de bins e intervalos de confianza, luego reporto ECE, log loss y Brier. Brier no es prueba de calibración porque también incluye discriminación. El AUC responde al ranking, no a si una probabilidad es confiable. Utilizo sigmoide para un error pequeño y con forma aproximada de S, y pruebo isotónica con suficientes datos para un mapeo no lineal, sin ajustar nunca el calibrador sobre las predicciones de entrenamiento.
Finalmente, establezco el umbral a partir de la capacidad de revisión y los costos de error, inspecciono la calibración por segmentos y monitoreo la fiabilidad con etiquetas maduras y log loss a lo largo del tiempo. Un modelo con alto AUC que sobreestima el riesgo aún no puede tratar a 0.8 como un riesgo real".
Errores comunes
- Síntoma → Usar accuracy o AUC para demostrar probabilidades confiables → Por qué falla → Ninguno compara los valores predichos con las frecuencias observadas → Solución → Usar un diagrama de fiabilidad, conteos por bin y métricas de calibración.
- Síntoma → Ajustar un calibrador sobre las predicciones de entrenamiento → Por qué falla → El mapeo se sobreajusta y descalibra nuevas muestras → Solución → Usar predicciones out-of-fold o un conjunto de calibración independiente.
- Síntoma → Reportar un solo número de ECE → Por qué falla → ECE depende del binning y de las observaciones dispersas → Solución → Reportar la regla de bins, el diagrama, los conteos y la incertidumbre.
- Síntoma → Tratar 0.8 como un umbral porque el AUC es alto → Por qué falla → Un buen ordenamiento no implica una escala de probabilidad correcta → Solución → Elegir umbrales a partir de la capacidad y el costo de los errores.
- Síntoma → Ignorar el muestreo y los cambios en la tasa base → Por qué falla → La calibración apunta a la población de entrenamiento en lugar de a la de producción → Solución → Evaluar sobre la distribución objetivo y monitorear el drift del prior.
Preguntas de seguimiento y respuestas
¿Qué pasa si el AUC es alto pero el diagrama de fiabilidad tiene forma de S?
Mantén el ranking del modelo base, ajusta sigmoide o isotónica sobre datos independientes y reevalúa la calibración, el AUC y el costo de negocio. La calibración monótona normalmente preserva el ordenamiento, pero la partición y la implementación aún necesitan pruebas.
¿Qué pasa si las etiquetas positivas se confirman solo después de 30 días?
Define una ventana de madurez de etiquetas y evalúa o ajusta el calibrador únicamente en registros con al menos 30 días de antigüedad. Los registros recientes pueden monitorear el volumen de predicciones y el retraso, pero no pueden tratarse como negativos para la fiabilidad.
¿Qué pasa si las regiones tienen curvas de calibración muy diferentes?
Verifica primero el tamaño de muestra, las definiciones de etiquetas y las tasas base. Luego elije un calibrador global, calibradores por segmento o umbrales por segmento. Si un segmento carece de datos, utiliza un mapeo global estable con monitoreo de intervalos en lugar de ajustar una curva independiente ruidosa.