Tema representativo de entrevista

Entrevista de ingeniería de datos: ¿Cómo reconciliar registros de personas entre distintas fuentes?

DatosDifícil
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Los sistemas de CRM, pagos y soporte contienen registros de personas con nombres, correos electrónicos y números de teléfono que pueden faltar o entrar en conflicto. ¿Cómo decidiría qué registros representan a la misma persona y generaría un registro maestro auditable?

1. Pregunta y contexto

Esta pregunta evalúa la resolución de entidades (entity resolution) o la vinculación de registros (record linkage) en la ingeniería de datos. Un ejercicio de entrevista pública pide a los candidatos reconciliar registros ruidosos de personas provenientes de varias fuentes y profundiza en normalización, resolución de conflictos, calidad de datos, precisión y exhaustividad (recall). Es ideal para roles de plataformas de datos, datos maestros (master data) e integración de datos de clientes.

2. Lo que el entrevistador está evaluando

  • Si define el concepto de "misma persona" y los costos de error del negocio antes de elegir las señales.
  • Si reduce el trabajo de todos contra todos (all-pairs) mediante la generación de candidatos y explica el riesgo de exhaustividad en el bloqueo (blocking recall risk).
  • Si utiliza rangos de fusión automática, revisión humana y no coincidencia para controlar las fusiones falsas.
  • Si la elección de cada campo maestro conserva la fuente, la evidencia y el historial de versiones.
  • Si evalúa la precisión y la exhaustividad en pares etiquetados en lugar de limitarse a reportar solo la exactitud (accuracy).

3. Preguntas para aclarar primero

  1. ¿Qué campos son identificadores estables? ¿Están verificados el correo electrónico y el teléfono? ¿Pueden los nombres estar transliterados o tener alias?
  2. ¿Qué resulta más costoso: una fusión falsa o una fusión no detectada? ¿El resultado se utiliza para marketing, pagos, cumplimiento normativo (compliance) o soporte?
  3. ¿Se trata de un backfill histórico o de un flujo incremental diario? ¿Las fuentes emiten eventos de actualización y eliminación?
  4. Cuando los campos entran en conflicto, ¿en qué fuente se confía? ¿Deben los revisores ver cada valor original y su procedencia?

4. Una respuesta de 30 segundos

Primero definiría la unidad de coincidencia, los costos de error y el resultado auditable. Normalizaría los campos de manera determinista, utilizaría el correo electrónico, el teléfono o claves compuestas para generar bloques de candidatos, y evitaría la comparación de todos contra todos. Para cada candidato, evaluaría la evidencia positiva y negativa, estableciendo umbrales diferenciados para fusión automática, revisión humana y no coincidencia. Construiría el registro maestro basándome en la confianza de la fuente, la verificación y la frescura de los datos, conservando a la vez cada valor de origen. Por último, calibraría el sistema con pares etiquetados, reportaría la precisión, la exhaustividad y el volumen de revisión, y monitorearía la desviación (drift) incremental y las fusiones falsas.

5. Solución paso a paso

Paso 1: Definir y normalizar registros

Conserve source, source_id, la hora de llegada y los campos sin procesar para cada entrada. Normalice los nombres aplicando reglas de Unicode, mayúsculas/minúsculas, espacios en blanco y puntuación; recorte los espacios de las direcciones de correo electrónico y aplique una política explícita de mayúsculas/minúsculas; convierta los números de teléfono a un formato canónico con código de país. Los valores normalizados deben ser reproducibles sin sobrescribir los valores sin procesar. Un dato faltante debe significar desconocido, no una evidencia de que dos cadenas vacías coinciden.

Paso 2: Generar candidatos y puntuar coincidencias

Indexe las claves normalizadas de correo electrónico, teléfono o nombre más código postal, y ejecute múltiples pasadas de bloqueo para diferentes patrones de datos faltantes. Luego, compare la distancia de edición, los campos compartidos, el estado de verificación y la evidencia negativa; dos números de teléfono verificados y diferentes deberían reducir la confianza. Puntuar dentro de los bloques hace que el trabajo sea proporcional al recuento de candidatos en lugar de O(n²), pero las omisiones por bloqueo deben muestrearse y medirse.

Paso 3: Establecer umbrales y fusionar de forma segura

Divida las puntuaciones en rangos de fusión automática, revisión humana y no coincidencia. Calibre los umbrales a partir de pares positivos y negativos etiquetados junto con los costos de error del negocio. Registre la regla y la puntuación de cada fusión automática; muestre los campos en conflicto y la evidencia a los revisores; conserve los motivos de rechazo. Si utiliza union-find o componentes conexos, evite que cadenas de aristas débiles fusionen a personas distintas.

Paso 4: Construir el registro maestro y monitorear incrementos

Elija cada campo maestro según la fuente verificada, la precedencia del negocio y la frescura, almacenando al mismo tiempo la procedencia, los valores anteriores y el tiempo efectivo. Compare los registros nuevos únicamente con los bloques relevantes y admita la reejecución (replay) tras cambios en las fuentes o en las reglas. Muestree revisiones periódicamente y monitoree la precisión, la exhaustividad, la tasa de revisión, el tamaño de los componentes y la desviación por fuente, idioma, región y ventana de tiempo. Pause la publicación automática y rastree las claves afectadas cuando aumenten las fusiones falsas.

6. Una respuesta de ejemplo sólida

Modelaría cada entrada como valores sin procesar más normalizados, con la fuente, la clave de origen, el estado de verificación y la hora del evento. Normalizaría nombres, correos electrónicos y teléfonos mediante reglas explicables, y luego generaría candidatos a través de múltiples bloques como correo electrónico, teléfono y nombre más región. Las puntuaciones de los candidatos combinarían campos compartidos, distancia de edición, verificación y penalizaciones por conflicto, produciendo rangos de fusión automática, revisión humana y no coincidencia calibrados con pares etiquetados y costos de negocio.

No reduciría una fusión a una sola fila sobreviviente. Cada campo maestro conservaría su fuente elegida, versión de regla, tiempo efectivo y valores descartados; solo la evidencia sólida crearía un componente conexo, mientras que las aristas débiles se enviarían a revisión. La evaluación fuera de línea reportaría precisión, exhaustividad, F1, tasa de revisión y ejemplos de fusiones falsas. Las ejecuciones incrementales monitorearían la desviación por fuente y ventana de tiempo, de modo que se pueda agregar una nueva fuente de forma segura y una regla defectuosa se pueda rastrear, dividir y reejecutar.

7. Errores comunes

  • Tratar la igualdad exacta de nombres como identidad a pesar de alias, transliteraciones, contactos compartidos y homónimos.
  • Comparar cada par sin describir la generación de candidatos ni medir la exhaustividad del bloqueo.
  • Tratar una puntuación difusa (fuzzy score) como verdad absoluta sin un rango de revisión o penalizaciones por conflicto.
  • Conservar únicamente una fila maestra y descartar los valores de origen, versiones de reglas y evidencias.
  • Reportar solo la exactitud en lugar de precisión, exhaustividad y errores ponderados por el negocio.
  • Permitir que una arista débil cree un componente conexo gigante y una sobrefusión irreversible.

8. Preguntas de seguimiento

Pregunta de seguimiento 1: ¿Por qué no entrenar un clasificador directamente?

Con suficientes etiquetas, un modelo puede aprender puntuaciones de coincidencia, pero aún necesita características explicables, calibración de umbrales, revisión humana y reejecución versionada. Las reglas, los modelos y los revisores deben emitir evidencia para nuevas fuentes y consultas de cumplimiento normativo.

Pregunta de seguimiento 2: ¿Cómo balancea la precisión frente a la exhaustividad?

Traduzca los costos de fusión falsa y de fusión no detectada en un objetivo comparable, y luego inspeccione las curvas de umbral en un conjunto de validación. Los pagos o el cumplimiento normativo suelen priorizar la precisión; la deduplicación puede tolerar una mayor exhaustividad, manteniendo en ambos casos la revisión y el muestreo.

Pregunta de seguimiento 3: ¿Cómo detecta la sobrefusión?

Monitoree el tamaño de los componentes, la proporción de aristas de baja puntuación, los conflictos entre fuentes y la tasa de división manual; expanda los grafos de evidencia para componentes inusualmente grandes. Pause la fusión automática, divida las entidades afectadas por versión de regla y reejecute los resultados incrementales.

Fuentes públicas

Preguntas relacionadas