1. Planteamiento
Tienes un predictor puntual f(x), pero el producto necesita un intervalo como [lower, upper] con una cobertura objetivo de 1 - alpha. Diseña un flujo de trabajo de predicción conformal dividida y explica cómo se utilizan el conjunto de entrenamiento, el conjunto de calibración y el punto de prueba.
2. Restricciones y aclaraciones
- Comienza con regresión y puntuaciones de residuos absolutos; los conjuntos de clasificación, la calibración en línea y la cobertura condicional son extensiones.
- Ajusta el modelo primero y congélalo; no reutilices el conjunto de calibración para ajustar el predictor puntual.
- La cobertura es una garantía marginal sobre un lote intercambiable, no una promesa de que cada subgrupo o punto tenga la misma tasa.
- Distingue entre datos tipo i.i.d., series temporales y desplazamiento de covariables al analizar la validez.
3. Enfoque principal
Divide los datos en conjuntos de entrenamiento y calibración. Ajusta el predictor puntual con los datos de entrenamiento y luego calcula las puntuaciones de no conformidad de calibración s_i = |y_i - f(x_i)|. Para una cobertura objetivo 1 - alpha, toma un cuantil conformal de muestra finita q; para un nuevo x, devuelve [f(x) - q, f(x) + q].
Bajo intercambiabilidad, la construcción ofrece una garantía de cobertura marginal: la nueva etiqueta cae dentro del intervalo con una probabilidad de al menos aproximadamente 1 - alpha, con un estadístico de orden conservador para conjuntos de calibración finitos. No es necesario que el modelo puntual sea correcto, pero sus residuos y el ruido determinan la amplitud del intervalo.
4. Implementación de referencia
def fit_split_conformal(train, calibration, alpha):
model = fit_point_predictor(train.x, train.y)
scores = sorted(
abs(y - model.predict(x))
for x, y in zip(calibration.x, calibration.y)
)
# Use the finite-sample conformal quantile, not a naive percentile.
rank = ceil((len(scores) + 1) * (1 - alpha))
q = scores[min(rank, len(scores)) - 1]
def predict_interval(x):
center = model.predict(x)
return center - q, center + q
return predict_interval5. Corrección y evaluación
Evalúa la cobertura y la amplitud media del intervalo en un conjunto de prueba independiente, luego segmenta por tiempo, región o grupo de usuarios. Una cobertura por debajo del objetivo puede deberse a datos no intercambiables, un conjunto de calibración pequeño, desplazamiento de distribución o un error de implementación; una tasa agregada puede ocultar fallos sistemáticos en un subgrupo.
La amplitud depende de la puntuación. Los residuos absolutos producen intervalos simétricos, mientras que la regresión por cuantiles o las puntuaciones de escala local pueden producir intervalos asimétricos o adaptativos. Un intervalo más estrecho no es automáticamente mejor; compáralo conjuntamente con la cobertura y la pérdida de negocio.
6. Preguntas de seguimiento y trampas
- "Libre de distribución" no significa una garantía incondicional para cualquier distribución; la garantía clásica se basa en la intercambiabilidad entre la calibración y las nuevas muestras.
- La dependencia temporal puede invalidar la predicción conformal dividida ingenua. Utiliza calibración móvil, métodos ponderados o delimita explícitamente la garantía.
- Bajo desplazamiento de covariables, la ponderación por razón de densidad puede ayudar, pero pesos incorrectos afectan la cobertura; no afirmes que la garantía original se mantiene intacta.
- La cobertura marginal no es cobertura condicional. Grupos pequeños o entradas extremas aún pueden recibir intervalos muy amplios o muy estrechos.
7. Lecturas adicionales
Compara los métodos split, cross-conformal, online y conformal ponderado: balancean la reutilización de datos, el costo computacional, la adaptación al desplazamiento y las garantías teóricas. Un sistema en producción debe monitorear la cobertura, la amplitud del intervalo, la deriva de los residuos, la frescura de la calibración y las tasas de rechazo o revisión humana.
8. Criterios de evaluación en entrevistas
Puede separar entrenamiento y calibración
El candidato debe ajustar el predictor puntual únicamente con los datos de entrenamiento, calcular las puntuaciones en datos de calibración retenidos y utilizar un cuantil de muestra finita.
Puede enunciar las suposiciones de cobertura
Debe distinguir entre intercambiabilidad, cobertura marginal y cobertura condicional, sin presentar el resultado como una garantía determinista para cada punto.
Puede manejar la deriva y la dependencia temporal
Debe proponer calibración móvil, ponderada o en línea y explicar las suposiciones adicionales y los cambios en las garantías.
Puede equilibrar la amplitud del intervalo
Debe reportar la cobertura y la amplitud juntas, monitorear los fallos por subgrupos y conectar las métricas estadísticas con la pérdida de negocio.