Tema representativo de entrevista

Entrevista general: ¿Cómo deberían funcionar juntos robots.txt, noindex y canonical?

GeneralIntermedio
Equipo editorial de Offer.ccPublicado Actualizado

Pregunta

Un sitio multilingüe detecta páginas de vista previa en los resultados de búsqueda mientras que algunas páginas de producción tienen el canonical incorrecto. Explique las funciones de robots.txt, meta robots/X-Robots-Tag y rel=canonical, y luego diseñe un plan de despliegue, migración y diagnóstico.

Planteamiento y contexto

Un sitio multilingüe tiene páginas públicas, páginas autenticadas y páginas de vista previa temporales. El equipo agregó la ruta de vista previa a robots.txt con Disallow, agregó noindex a la página y utilizó una única URL canonical para cada idioma. Tras el lanzamiento, las URL de vista previa siguen apareciendo en las búsquedas y algunas páginas de idiomas tienen la URL indexada incorrecta. Explique los límites de las tres señales y proponga un plan de migración y verificación.

Qué está evaluando el entrevistador

  • Si separa el rastreo, la indexación y la selección de la URL preferida.
  • Si sabe que un rastreador bloqueado por robots.txt podría no ver noindex.
  • Si puede manejar meta robots en HTML, el encabezado HTTP X-Robots-Tag, canonical, redirecciones y conflictos.
  • Si puede diseñar comprobaciones multilingües, de caché, de reversión y en Search Console.

Preguntas aclaratorias para hacer primero

  1. ¿El objetivo es bloquear el rastreo, bloquear la indexación o consolidar URL duplicadas?
  2. ¿Debe un rastreador de búsqueda recuperar la página para descubrir su noindex o canonical?
  3. ¿Las páginas de vista previa requieren autenticación y pueden enlaces externos o sitemaps hacer referencia a ellas?
  4. ¿Son las páginas de idiomas traducciones unívocas con su propio canonical y hreflang?
  5. ¿Dónde se configuran estos encabezados y etiquetas: en el CDN, en el servidor de aplicaciones o en la plantilla HTML?

Estructura para una respuesta de 30 segundos

Separo el rastreo, la indexación y la canonicalización. robots.txt controla si un rastreador puede solicitar un recurso; noindex controla si una página recuperada entra en el índice; canonical es una preferencia para URL duplicadas o casi duplicadas, no una redirección. Las páginas de vista previa deben estar autenticadas o ser rastreables con noindex. Las páginas de idioma de producción deben tener canonical autorreferencial e interactuar entre sí con hreflang. Verificaría la respuesta renderizada, el acceso del rastreador, el comportamiento del caché y los informes de Search Console.

Respuesta detallada paso a paso

Paso 1: Definir los tres planos de control

robots.txt en la raíz del sitio responde si un rastreador puede solicitar una ruta. No elimina una URL indexada ni garantiza que una URL descubierta a través de enlaces externos quede fuera de los resultados. noindex es una directiva de indexación a nivel de página para vistas previas, resultados de búsqueda u otras páginas no públicas. canonical es una señal de selección de URL para contenido duplicado o casi duplicado.

Paso 2: No ocultar noindex detrás de Disallow

Cuando una ruta también está bloqueada con Disallow, es posible que el rastreador no recupere la página y, por lo tanto, no pueda ver su etiqueta meta robots o X-Robots-Tag: noindex. Para que noindex sea observable, permita el rastreo y devuelva noindex en HTML o encabezados HTTP. El contenido confidencial necesita autenticación o autorización, no directivas de rastreadores. Durante la migración, elimine el bloqueo de rastreo y espere el nuevo rastreo y las actualizaciones de indexación.

Paso 3: Elegir el portador de noindex a nivel de página

El HTML puede usar meta name="robots" content="noindex,follow"; los recursos que no son HTML y las puertas de enlace pueden usar X-Robots-Tag. Pruebe la plantilla y los encabezados de respuesta, e invalide los objetos obsoletos del CDN. follow puede preservar el descubrimiento de enlaces para una página destinada a permanecer fuera del índice, pero no es un control de acceso y el comportamiento del rastreador sigue aplicando.

Paso 4: Diseñar el mapeo canónico y de idiomas

Cada página de idioma indexable generalmente debe tener un canonical absoluto, accesible y autorreferencial con estado, esquema, host y ruta coherentes. No canonicalice cada traducción al idioma predeterminado o las traducciones podrían consolidarse como duplicadas. Use hreflang para alternancias y haga que los sitemaps, los enlaces internos y los canonicals utilicen el mismo conjunto de URL canónicas.

Paso 5: Manejar migración, redirecciones y cachés

Utilice redirecciones permanentes del lado del servidor para migraciones de URL; el canonical de una página antigua no reemplaza una redirección. Antes de enviar un sitemap, verifique la respuesta 200 de la nueva página, el canonical, las directivas de robots y hreflang. Invalide las respuestas del CDN por URL y encabezados para que los nodos periféricos concuerden. Una reversión debe preservar la redirección y política de indexación anteriores en lugar de exponer versiones mixtas.

Paso 6: Construir una ruta de diagnóstico observable

Verifique primero el acceso de robots.txt, luego inspeccione el HTML en vivo y los encabezados de respuesta para comparar noindex y canonical con la plantilla. A continuación, inspeccione el estado de rastreo e indexación de Search Console, el canonical seleccionado por Google, la hora del último rastreo y el descubrimiento por sitemap. Registre la URL, el idioma, el estado, el canonical, las directivas de robots, la antigüedad de la caché y la versión del despliegue para fines de auditoría.

Paso 7: Definir pruebas de aceptación y regresión

Cree aserciones para cada tipo de página: las vistas previas son rastreables y tienen noindex; las páginas de idioma de producción devuelven 200 y son autorreferenciales; las URL antiguas devuelven 301 a las nuevas URL; las páginas protegidas no filtran contenido. Pruebe las reglas de robots para límites de mayúsculas/minúsculas y barras diagonales finales, conflictos entre HTML/encabezados, invalidación de caché multinodo y estados muestreados de Search Console.

Respuesta de ejemplo de alta calidad

Las señales resuelven problemas diferentes: robots.txt controla las solicitudes, noindex controla la inclusión en el índice y canonical sugiere la URL preferida entre duplicados. Una página de vista previa no puede estar bloqueada y esperar que exponga noindex a la vez; permita que los rastreadores la recuperen con noindex y use autenticación para secretos. Cada página de idioma de producción debe tener un canonical autorreferencial y usar hreflang, asegurando que los sitemaps y enlaces internos coincidan. Use redirecciones 301 para migraciones, luego verifique robots, respuestas en vivo, cachés, registros de rastreo y Search Console capa por capa.

Errores comunes

  • Tratar robots.txt como un mecanismo garantizado de eliminación.
  • Bloquear una página y esperar que los rastreadores lean su noindex.
  • Canonicalizar cada página de idioma hacia un solo idioma.
  • Revisar el HTML de origen ignorando los encabezados del CDN y los objetos obsoletos.
  • Usar canonical en lugar de una redirección requerida o de un control de acceso.

Preguntas de seguimiento y respuestas

Pregunta de seguimiento 1: ¿Por qué puede aparecer una URL bloqueada en los resultados?

Un rastreador puede descubrir la URL a través de enlaces externos pero no poder recuperar su contenido. El motor de búsqueda aún puede mostrar la URL o información limitada. Para bloquear la indexación, haga que la página sea recuperable con noindex o requiera autenticación.

Pregunta de seguimiento 2: ¿Es canonical una directiva obligatoria?

Es una señal que puede ser ignorada. El contenido, las redirecciones, los enlaces internos, los sitemaps y las etiquetas canonical deben coincidir; canonical no es un control de acceso ni una garantía de eliminación.

Pregunta de seguimiento 3: ¿Qué sucede si una vista previa debe seguir siendo detectable a través de enlaces?

Permita el rastreo y devuelva noindex. Si la vista previa es confidencial, use inicio de sesión, URL firmadas u otro mecanismo de control de acceso. No dependa de robots.txt para ocultar secretos.

Pregunta de seguimiento 4: ¿Cómo resuelve un conflicto entre el encabezado HTTP y meta robots?

Genere ambos a partir de una única fuente de política de página y tome muestras de las respuestas del origen y del borde. No adivine qué señal prevaleció; inspeccione la respuesta real, el HTML y la documentación del motor de búsqueda de destino, y luego emita una política explícita única.

Pregunta de seguimiento 5: ¿Cómo prueba los bucles de canonical multilingües?

Recupere cada URL de idioma y verifique un canonical absoluto, accesible y autorreferencial. Luego verifique la reciprocidad de hreflang y los códigos de idioma, y compruebe que los sitemaps y los enlaces internos no apunten a un host antiguo o a un idioma incorrecto.

Fuentes públicas

Preguntas relacionadas