Tema representativo de entrevista

Entrevista de diseño de sistemas: ¿Cómo diseñarías un sistema de moderación de contenido en tiempo real?

Diseño de sistemasDifícil
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Diseña un sistema de moderación de contenido en tiempo real para una plataforma de videos cortos que procesa millones de cargas por día. ¿Cómo equilibras la latencia de publicación, los falsos positivos, los falsos negativos, el costo de revisión humana y las políticas regionales?

Planteamiento y contexto

Una plataforma acepta texto, imágenes, audio y video. Los usuarios esperan que las publicaciones sean visibles rápidamente, mientras que la plataforma debe actuar antes de que el contenido de alto riesgo se propague ampliamente. Diseña el prefiltrado de carga, el análisis profundo asíncrono, la revisión humana, las apelaciones, el reescaneo posterior a la publicación y la iteración de políticas. No necesitas entrenar un modelo, pero debes explicar cómo las salidas del modelo se convierten en decisiones de negocio auditables.

El material público de entrevistas de diseño de sistemas enmarca este problema como un pipeline por capas con bandas de confianza, una cola humana y una ruta de apelación. Para una suposición de capacidad recalculable, comienza con 1,000,000 de cargas por hora, aproximadamente 278 solicitudes por segundo en promedio y cerca de 2,778 en un pico de 10x; el prefiltrado síncrono puede agregar como máximo 100 ms a la publicación, y los revisores pueden manejar 100,000 casos por día. Reemplaza estos números cuando el entrevistador proporcione otros distintos.

Qué está evaluando el entrevistador

El entrevistador quiere ver si divides la moderación en decisiones con diferente latencia y riesgo, en lugar de dibujar un único clasificador. Una respuesta sólida separa el bloqueo inmediato, la publicación con reescaneo posterior y la revisión humana; establece umbrales por política; registra versiones de modelos y evidencia; y explica cómo se corrige una decisión incorrecta.

Las señales de diseño de sistemas también incluyen la capacidad máxima, la antigüedad de la cola, el trabajo duplicado, las caídas de modelos, las entradas adversarias, la seguridad de los revisores, los plazos de apelación y el aislamiento regional o por inquilinos. La precisión por sí sola no proporciona gobernanza en línea sin valores predeterminados seguros, evidencia reproducible y métricas operativas.

Aclaraciones que se deben hacer primero

Qué debe bloquearse

Pregunta si cada elemento necesita moderación previa a la publicación o si solo las categorías claramente de alto riesgo deben bloquearse de forma síncrona. Con un presupuesto síncrono de aproximadamente 100 ms, el análisis profundo de video pertenece a una ruta asíncrona; si una categoría debe eliminarse sin demora, reserva una verificación síncrona más pesada para ella.

Cómo deben ordenarse los costos de los errores

Pregunta si eliminar expresiones legítimas o pasar por alto contenido de alto daño es más costoso, y si el equilibrio cambia según el país, la edad o la categoría de la política. La respuesta determina los umbrales, el tamaño de la banda humana y si una acción automatizada puede eliminar contenido directamente.

Cuánto tiempo debe conservarse la evidencia de revisión

Aclara los periodos de apelación, la evidencia regulatoria, la retención de medios y los requisitos de eliminación. Si una decisión debe reproducirse, almacena las versiones de la política y del modelo, el resumen de entrada, las puntuaciones, la evidencia citada y la acción del revisor en lugar de solo la etiqueta final.

Cuáles son los límites del modelo y de los revisores

Pregunta si la publicación puede degradarse cuando un modelo no está disponible, cuántos casos pueden procesar los revisores cada día y el tiempo máximo de espera. Cuando la capacidad sea escasa, reduce la admisión asíncrona de bajo riesgo o retrasa el trabajo no crítico; nunca permitas que una cola sin límites libere silenciosamente contenido de alto riesgo.

Una respuesta de 30 segundos

“Dividiría la ruta en un prefiltrado síncrono y una revisión profunda asíncrona. Al cargar, ejecutaría coincidencias de hash, comprobaciones de formato y tamaño, un clasificador ligero y verificaciones de políticas de referencia. Bloquearía los resultados claros de alto riesgo, enviaría la banda de confianza a una cola humana ordenada por riesgo y exposición esperada, y publicaría el contenido de bajo riesgo con un marcador de reescaneo posterior a la publicación. Cada decisión almacena su modelo, política, evidencia y versión, mientras que las apelaciones van a un revisor diferente. Escalaría el prefiltrado para el pico de 2,778 solicitudes por segundo, aislaría las colas por inquilino y riesgo, y monitorearía omisiones, falsos positivos, antigüedad de la cola, tiempo de exposición y carga de revisores. Las fallas de modelos o colas utilizan un valor predeterminado seguro y una alternativa humana explícita”.

Análisis detallado paso a paso

Paso 1: Dividir las decisiones síncronas y asíncronas

Después de aceptar el contenido, el punto de entrada escribe un contentId inmutable y la referencia al medio. La capa síncrona realiza una coincidencia rápida de hashes, comprobaciones de formato y tamaño, un modelo ligero de texto o imagen y verificaciones de políticas regionales. Un resultado claro de alto riesgo se bloquea; un resultado incierto entra en PENDING_REVIEW; un resultado de bajo riesgo puede publicarse con un marcador de reescaneo. El muestreo de fotogramas de video, el reconocimiento de voz y la fusión multimodelo se ejecutan de forma asíncrona para que el análisis profundo no bloquee cada publicación.

Paso 2: Actuar por categorías, no con una única puntuación global

No utilices un único umbral global para cada categoría de política. Una categoría de alto daño puede usar un umbral de bloqueo automático más bajo y enviar casos limítrofes a personas; una categoría fuertemente contextual puede usar una banda humana más amplia para reducir falsos positivos. La configuración de umbrales lleva una versión de política y región, y el evento de decisión almacena la puntuación sin procesar y el umbral para que la acción pueda explicarse más tarde.

Paso 3: Construir una cola de revisión escalable

Escribe las tareas de revisión en una cola duradera y calcula la prioridad a partir del riesgo, la exposición esperada, los reportes de usuarios y el plazo límite. Cada tarea lleva inquilino o región, versión del contenido, versión de la política y un arrendamiento (lease); un revisor la retiene brevemente, y el vencimiento la devuelve a la cola. Realiza sharding por categoría y región para que una categoría popular no agote a todos los revisores. Cuando la antigüedad de la cola cruce un umbral, reduce la admisión para el trabajo asíncrono de bajo riesgo y genera alertas.

Paso 4: Hacer que las apelaciones y la retroalimentación sean reproducibles

Una apelación crea un nuevo caso en lugar de sobrescribir la decisión original. El segundo revisor ve la evidencia original, la política y las versiones del modelo con un conjunto de permisos diferente. Una revocación restaura o mantiene la restricción y emite un evento de auditoría. Los resultados humanos muestreados, las revocaciones de apelaciones y los nuevos ejemplos de evasión alimentan un conjunto de evaluación, no datos de entrenamiento sin revisar que podrían amplificar malas etiquetas.

Paso 5: Observar el riesgo, la experiencia y el costo

Las métricas inmediatas incluyen la latencia del prefiltrado, la tasa de bloqueo por categoría, la longitud y antigüedad de la cola asíncrona, los errores del modelo, el rendimiento del revisor y los errores del servicio. Una vez que las etiquetas maduran, calcula precisión, exhaustividad (recall), falsos positivos, falsos negativos y revocaciones de apelaciones por categoría y región. También mide el recuento de exposiciones de alto riesgo multiplicado por el tiempo en línea, la exposición del revisor y el costo por elemento; la precisión del modelo por sí sola no puede revelar una falla de gobernanza.

Paso 6: Cubrir fallas y entradas adversarias

Cuando un modelo agota el tiempo de espera o no está disponible, conserva el bloqueo por reglas y hashes. El contenido de riesgo desconocido pasa a publicación restringida o a personas; “sin resultado” no es equivalente a seguro. Aplica limitación de tasa y presupuestos a medios recodificados, texto ofuscado, cargas duplicadas e intentos de generar carga artificial en la cola. Cada acción automatizada debe ser reproducible mediante contentId para el análisis de incidentes y la reversión de políticas.

Un ejemplo de respuesta de alta calidad

Primero confirmaría el presupuesto síncrono y las categorías de alto riesgo. Asumiendo un promedio de 278 solicitudes por segundo y 2,778 en el pico, limitaría la ruta síncrona a hashes, comprobaciones de formato, modelos ligeros y reglas regionales, apuntando a no más de 100 ms. El contenido claramente dañino se rechaza de inmediato; la banda intermedia entra en una cola humana duradera; el contenido de bajo riesgo se publica con un marcador de reescaneo. El análisis profundo de video y audio se ejecuta mediante colas y workers en lugar de bloquear a cada usuario.

Los umbrales se configuran por categoría de política, no como una sola puntuación para todos los riesgos. Cada decisión almacena el ID y versión del contenido, las versiones del modelo y de la política, la puntuación, el resumen de evidencia y la acción. Las tareas de revisión se ordenan por exposición esperada, riesgo, reportes y plazo límite, y los arrendamientos evitan reclamos duplicados. La presión en la cola protege primero el trabajo de alto riesgo. Las decisiones y revocaciones de los revisores son eventos inmutables, y las apelaciones son manejadas por un revisor diferente con la evidencia original.

Monitorearía la latencia de prefiltrado, la antigüedad de la cola, los falsos positivos y omisiones por categoría, el tiempo de exposición, las revocaciones de apelaciones, la capacidad de revisores y el costo unitario. Una caída del modelo aún ejecuta el bloqueo por reglas y hashes; los resultados desconocidos utilizan publicación restringida o una alternativa humana. Los cambios de modelo, política y regionales se reproducen fuera de línea y luego se prueban mediante canaries. El objetivo es un sistema explicable y reversible que reduzca continuamente el daño, no un único número de precisión fuera de línea.

Errores comunes

  • Ejecutar un modelo pesado de forma síncrona para cada elemento → La latencia de video y audio satura la ruta de publicación → Mantén el trabajo síncrono en un prefiltrado rápido y traslada el análisis profundo a colas.
  • Usar un solo umbral para cada categoría → Las omisiones de alto daño y los falsos positivos contextuales no pueden controlarse a la vez → Configura umbrales por política y región, con una banda humana.
  • Permitir contenido cuando un modelo no devuelve ningún resultado → Un tiempo de espera agotado se convierte en una omisión no auditada → Conserva el bloqueo por reglas y hashes y enruta los resultados desconocidos a manejo restringido o humano.
  • Almacenar solo la etiqueta final → Una apelación no puede reconstruir la decisión → Almacena versiones de contenido, modelo, política, puntuación, evidencia y acción.
  • Atender la cola estrictamente por FIFO → El tráfico popular o de bajo valor desabastece a los casos de alto riesgo → Ordena por riesgo, exposición esperada y plazo límite mientras aíslas la capacidad.

Preguntas de seguimiento

Pregunta de seguimiento 1: ¿Es suficiente revisar solo el 1% del volumen total?

El porcentaje no es el objetivo. La documentación de AWS utiliza su flujo de trabajo de imágenes y videos como ejemplo donde el filtrado automático puede dejar aproximadamente del 1% al 5% para revisión humana; tu sistema aún valida el recall por categoría, el daño de una omisión, la antigüedad de la cola y el tiempo de exposición en lugar de tratar ese rango como una garantía universal. Si se pasa por alto una categoría de alto riesgo, amplía la banda humana o restringe la admisión de publicación.

Pregunta de seguimiento 2: ¿Qué pasa si la cola de revisión tiene un retraso acumulado de un día?

Reordena por riesgo y exposición esperada, pausa el trabajo por lotes de bajo valor, agrega capacidad de revisión para alto riesgo y activa alertas. Reescanéa y aplica limitación de tasa a los elementos ya publicados; no reduzcas el número acumulado descartando tareas silenciosamente. Si aún no se puede cumplir el plazo de alto riesgo, restringe la publicación y expón el déficit de capacidad al negocio.

Pregunta de seguimiento 3: ¿Cómo evitas que una apelación exitosa se vuelva a clasificar erróneamente?

Conserva las versiones de política y modelo anteriores y posteriores a la apelación, agrega las revocaciones a un conjunto de evaluación independiente por categoría y verifica sesgos regionales, de idioma o de grupo. Reproduce muestras históricas antes de cambiar umbrales o reglas, y luego aplica el cambio mediante canary. El resultado de una apelación no es una etiqueta de entrenamiento sin revisar.

Pregunta de seguimiento 4: ¿Cómo preservas la trazabilidad al cambiar de proveedores de modelos?

Define una salida y versión de adaptador normalizada para cada modelo, y conserva un resumen del resultado del proveedor más la regla de mapeo. Compara el nuevo modelo en un conjunto de reproducción fijo y mediante revisión humana a ciegas para detectar errores de categoría, omisiones, latencia y costo antes de implementar canaries por región o tráfico. Ante una regresión, revierte mediante la versión de política al adaptador anterior.

Fuentes públicas

Preguntas relacionadas

Herramienta de entrevista relacionada

Usa Resolver para una respuesta de diseño de sistemas

Aclara primero los requisitos y luego avanza a través de la escala, la arquitectura, la elección de componentes y las compensaciones (trade-offs).

Ver la herramienta