Robots.txt Funcional

Robots.txt Funcional

El archivo robots.txt orienta a los crawlers sobre qué zonas pueden rastrear. Una regla mal escrita puede bloquear secciones críticas o incluso dejar fuera una web completa.

Ilustración del check Robots.txt Funcional de AISEO
Rastreo Área
robots.txt Señal
Básico Nivel

Qué mide este check

Este check revisa si el archivo robots.txt existe, responde correctamente y no contiene reglas que bloqueen por error partes importantes del sitio.

La ubicación estándar del archivo es siempre la raíz del dominio:

https://ejemplo.com/robots.txt

AISEO lo interpreta como una señal inicial de rastreo. No decide por sí solo la calidad del sitio, pero puede impedir que los bots lleguen al contenido.

Por qué importa en AISEO

Robots.txt es pequeño, pero puede hacer mucho daño. Una línea como Disallow: / puede bloquear el rastreo completo del sitio si se deja activa en producción.

Para buscadores, crawlers técnicos y sistemas de IA, robots.txt suele ser una de las primeras señales consultadas antes de rastrear una web.

  • Un bloqueo global puede impedir que los bots accedan a la web.
  • Reglas heredadas de staging pueden quedar activas en producción.
  • Bloquear recursos CSS o JS puede dificultar la interpretación de la página.

Cómo comprobarlo paso a paso

Abre /robots.txt

Accede manualmente a la URL del archivo y comprueba que responde con estado válido. Lo habitual es encontrarlo en la raíz del dominio.

Revisa bloqueos globales

Busca reglas como Disallow: /. En producción, esta directiva solo debería existir si realmente se quiere bloquear todo el sitio.

Comprueba directorios sensibles

Valida que no se estén bloqueando secciones públicas importantes, categorías, artículos, productos o páginas de conversión.

Revisa el sitemap declarado

Si el archivo incluye una línea Sitemap:, comprueba que apunta a un sitemap real, accesible y coherente con el dominio.

Ejemplo de robots.txt correcto

Un robots.txt básico puede permitir el rastreo general y declarar el sitemap principal de la web.

User-agent: * Allow: / Sitemap: https://ejemplo.com/sitemap.xml
  • El archivo responde correctamente en la raíz del dominio.
  • No bloquea el sitio completo por accidente.
  • Declara un sitemap válido cuando existe.

Errores frecuentes

  • Dejar Disallow: / activo después de publicar la web.
  • Bloquear carpetas que contienen contenido público importante.
  • Declarar un sitemap que devuelve error o pertenece a otro dominio.
  • Usar robots.txt como si fuera una medida de seguridad privada.
  • Bloquear recursos necesarios para renderizar correctamente la página.

Checklist final

  • El archivo robots.txt existe o responde de forma controlada.
  • No hay bloqueo global accidental del sitio.
  • No se bloquean secciones públicas estratégicas.
  • El sitemap declarado, si existe, es válido y accesible.
  • Las reglas son simples, comprensibles y coherentes con la arquitectura real.

Preguntas frecuentes

Dudas habituales antes de interpretar o corregir esta señal técnica.

¿Robots.txt sirve para ocultar contenido privado?
No. Robots.txt no protege contenido privado. Solo comunica preferencias de rastreo a bots que deciden respetarlo. Para proteger contenido se necesitan controles de acceso reales.
¿Qué significa Disallow: /?
Indica a los bots que no deberían rastrear ninguna URL del sitio. Es una directiva muy delicada y suele ser peligrosa si aparece en producción por error.
¿Es obligatorio tener robots.txt?
No siempre, pero en una web profesional conviene tenerlo controlado. Aunque permita todo, ayuda a evitar ambigüedad y puede declarar el sitemap.
¿Robots.txt impide indexar una URL?
No de forma directa. Puede impedir el rastreo, pero una URL bloqueada podría aparecer indexada si otros sitios la enlazan. Para controlar indexación se usan otras señales, como noindex.
¿Debe aparecer el sitemap dentro de robots.txt?
No es obligatorio, pero es recomendable. Facilita que crawlers encuentren el mapa XML principal del sitio.