1. Pregunta y contexto
Esta pregunta evalúa el criterio en plataformas de datos, ingeniería de datos e ingeniería analítica. El enfoque es la salud y el impacto de los datos en sí mismos, no solo si una tarea de orquestación finalizó. Una respuesta sólida cubre dimensiones, líneas base, propiedad, severidad de alertas y recuperación.
2. Qué está evaluando el entrevistador
- Si descompones la observabilidad en frescura, volumen, esquema, completitud, distribución, unicidad e integridad relacional.
- Si las reglas varían según el uso del conjunto de datos, el linaje y el impacto en el negocio en lugar de compartir un único umbral.
- Si las observaciones conservan las versiones de las reglas y la evidencia de ejecución, separando fallas bloqueantes, advertencias y estados desconocidos.
- Si las alertas conducen a cuarentena, backfill, conciliación y revisión en lugar de un mensaje sin un responsable.
La guía pública de entrevistas de ingeniería de datos de MentorCruise pregunta directamente qué significa la observabilidad de datos y enumera frescura, volumen, deriva de esquema (schema drift), nulos, duplicados, distribución y linaje. Great Expectations documenta distribución, frescura, integridad, valores faltantes, esquema, unicidad y volumen como casos de uso de calidad de datos, y define una Expectation como una aserción verificable sobre los datos.
3. Preguntas aclaratorias antes de responder
- ¿El conjunto de datos sirve para reportes, liquidación (settlement), recomendaciones o entrenamiento? ¿Cuáles son los impactos de latencia y error?
- ¿La fuente es por lotes (batch), streaming o híbrida? ¿Cómo se definen el tiempo del evento (event time) y el tiempo de llegada (arrival time)?
- ¿Qué fallas bloquean la publicación y cuáles solo advierten? ¿Hay una instantánea de confianza (trusted snapshot) disponible para degradación controlada?
- ¿Quién es el dueño del activo, el linaje y la alerta? ¿Qué particiones necesitan backfill y a qué consumidores se debe notificar?
4. Estructura de respuesta en 30 segundos
Clasificaría los conjuntos de datos por impacto en el negocio y luego definiría verificaciones de frescura, volumen, esquema, completitud, distribución y relaciones para cada activo crítico. Cada ejecución registra la versión de la regla, el lote, las observaciones, el linaje y el responsable; los resultados se enrutan como bloqueo, advertencia o información. Los lectores posteriores consumen el estado de calidad, aplicando cuarentena o una instantánea de confianza con marca de tiempo cuando sea apropiado. Después de la reparación, vuelvo a ejecutar la misma versión de verificación, concilio registros de entrada, salida, rechazados y consumidos, y ajusto los umbrales durante la revisión.
5. Análisis detallado paso a paso
Paso 1: Definir activos y criticidad
Asigna a las tablas, temas (topics), archivos y entradas de modelos identidades estables, con responsables, consumidores, sensibilidad y linaje. Cubre primero los activos de alto impacto, como la liquidación y las métricas de cara al cliente; de lo contrario, el costo de verificación y el volumen de alertas crecerán sin control.
Paso 2: Elegir señales complementarias
La frescura verifica marcas de tiempo de negocio y de llegada; el volumen verifica filas, archivos o bytes; el esquema verifica campos, tipos y compatibilidad; la completitud verifica valores obligatorios, duplicados y referencias; la distribución verifica rangos, cuantiles o frecuencias de categorías. Conserva el tamaño de la muestra, la ventana, el umbral y la versión de la regla para cada métrica, de modo que una sola puntuación no oculte la dimensión de la falla.
Paso 3: Hacer que las verificaciones sean accionables y explicables
Mantén aserciones declarativas y consultas personalizadas dentro de la revisión de código y el despliegue. Asigna a las reglas críticas una severidad, una acción ante fallas y un responsable; usa líneas base y ventanas consecutivas para activos estacionales o de bajo volumen. Escribe los resultados en un registro de calidad (quality ledger) vinculado a la partición, la ejecución, el cambio aguas arriba y el impacto aguas abajo.
Paso 4: Conectar alertas, cuarentena y recuperación
Bloquea la publicación cuando los datos erróneos contaminarían las finanzas o un modelo. Pon en cuarentena una brecha local y conserva una instantánea de confianza con marca de tiempo cuando no sea necesario un bloqueo más amplio. Las alertas incluyen activo, dimensión, observación, umbral, linaje y acción sugerida. Después de una corrección aguas arriba, realiza el backfill por tiempo de negocio y utiliza escrituras idempotentes junto con conciliación de entrada/salida para demostrar que no hay pérdida ni duplicación.
6. Ejemplo de respuesta de alta calidad
Clasificaría los activos por impacto en el negocio y registraría responsables, consumidores y linaje para los críticos. Cada carga verifica el tiempo de llegada y de negocio, el volumen de filas o bytes, el esquema, los campos obligatorios, los duplicados, las relaciones y las distribuciones de valores clave. Los resultados conservan la versión de la regla, el lote, el tamaño de la muestra, la observación y el impacto aguas abajo; la severidad determina si la publicación se bloquea, genera una advertencia o simplemente se registra.
Si una tabla de liquidación falla en completitud, pongo en cuarentena el lote y bloqueo la publicación. Un panel independiente puede utilizar la instantánea de confianza anterior con su marca de tiempo. La alerta nombra la dimensión que falló y el probable cambio aguas arriba en lugar de exponer una sola puntuación opaca. Después de la reparación, realizo el backfill de las particiones, vuelvo a ejecutar las mismas verificaciones, concilio los registros de entrada, salida, rechazados y consumidos, y cierro el incidente solo después de que las métricas se recuperen. Finalmente, utilizo falsas alarmas, omisiones y el tiempo de resolución para ajustar los umbrales y la cobertura.
7. Modos de falla comunes
- Verificar únicamente si el DAG tuvo éxito, no si los datos son frescos, completos y utilizables.
- Aplicar un único umbral a todos los activos ignorando a los consumidores, la estacionalidad y el tamaño de la muestra.
- Omitir versiones de reglas, lotes o linaje, impidiendo que una alerta se pueda reproducir.
- Bloquear toda la plataforma ante cualquier falla o reintentar automáticamente datos erróneos hacia los sistemas aguas abajo.
- Sobrescribir el historial tras una reparación sin registrar el backfill, la conciliación y la protección contra escrituras duplicadas.
8. Preguntas de seguimiento y respuestas
Pregunta de seguimiento 1: ¿En qué se diferencia la calidad de datos de la observabilidad de datos?
Las verificaciones de calidad comprueban una aserción. La observabilidad también conecta las señales de salud con el contexto de ejecución, linaje, propiedad, impacto y acción. La calidad es una señal dentro del ciclo operativo, no el ciclo completo.
Pregunta de seguimiento 2: ¿Cómo se reducen las falsas alarmas?
Usa líneas base históricas por activo y segmento, conserva el tamaño de la muestra, exige ventanas consecutivas y aplica niveles de severidad. Observa las nuevas reglas en modo sombra (shadow mode) y preserva las versiones anteriores mientras revisas el costo de las falsas alarmas.
Pregunta de seguimiento 3: ¿Cada verificación fallida debería bloquear la publicación?
Decídelo a partir del impacto y el linaje. Una falla que pueda contaminar liquidaciones, compromisos con clientes o entrenamiento debería bloquear la publicación correspondiente; los consumidores de bajo riesgo pueden leer una instantánea de confianza con advertencia. El alcance, el tiempo límite de escalamiento (escalation timeout) y las condiciones de liberación deben ser auditables.