Genera robots.txt con reglas, sitemaps y crawl-delay visualmente
Sin rutas configuradas
Sin rutas configuradas
También podrías necesitar
El archivo robots.txt es el protocolo estándar (Robots Exclusion Protocol) que indica a los crawlers de motores de búsqueda qué partes de tu sitio pueden indexar. Es el primer archivo que consultan Googlebot, Bingbot y cualquier web crawler antes de explorar tu dominio. Una configuración correcta de robots.txt es fundamental para el SEO: permite bloquear rutas sensibles o duplicadas (como `/admin/`, `/api/`, `/staging/`) que no deben aparecer en resultados de búsqueda, y puede incluir la URL del sitemap para que los buscadores descubran tu contenido más eficientemente. Cada regla tiene tres componentes: `User-agent` (a qué bot aplica — `*` para todos, `Googlebot` para Google específicamente), `Allow` (rutas permitidas explícitamente) y `Disallow` (rutas bloqueadas). Puedes tener múltiples bloques de reglas para distintos bots. `Crawl-delay` sugiere al crawler cuántos segundos esperar entre requests (Google lo ignora, Bing lo respeta). Esta herramienta genera el archivo con un editor visual — no necesitas recordar la sintaxis exacta.
¿El robots.txt bloquea el acceso real a las páginas?
No. robots.txt es solo una directriz para crawlers educados (Googlebot, Bingbot). No es un mecanismo de seguridad — cualquier persona o bot puede ignorarlo y acceder a las URLs directamente. Para bloquear acceso real, usa autenticación HTTP, firewall o permisos de servidor. Para bloquear la indexación de forma más segura usa también `<meta name='robots' content='noindex'>` en las páginas sensibles.
¿Por qué Googlebot ignora el Crawl-delay?
Google tiene su propia lógica para gestionar la frecuencia de crawling adaptada a cada sitio, controlable desde Google Search Console (Configuración de rastreo). El estándar Crawl-delay sí es respetado por Bing, Yandex y la mayoría de crawlers de terceros. Si necesitas controlar el crawl rate de Google específicamente, usa Search Console.
¿Puedo tener reglas distintas para Googlebot y otros bots?
Sí. Añade múltiples bloques User-agent en el archivo. Cada bloque se aplica solo al bot especificado. Los bots leen el primer bloque que coincida con su nombre. El bloque con `User-agent: *` aplica a todos los bots que no tienen regla específica. El orden de los bloques importa: más específico primero.
¿Dónde debe estar el archivo robots.txt?
Exactamente en la raíz del dominio: `https://tudominio.com/robots.txt`. No funciona en subdirectorios ni en subdominios de otros dominios. Cada subdominio tiene su propio robots.txt: `https://blog.tudominio.com/robots.txt` es independiente de `https://tudominio.com/robots.txt`. El archivo debe ser accesible públicamente sin autenticación.
¿Cuál es la diferencia entre Disallow: / y Disallow: /ruta/?
`Disallow: /` bloquea todo el sitio — ninguna URL puede ser crawleada. `Disallow: /ruta/` bloquea solo las URLs que comienzan con `/ruta/`. Los paths en robots.txt son prefijos, no expresiones exactas: `Disallow: /admin` bloquea `/admin`, `/admin/`, `/admin/users`, `/adminpanel`, etc. Para bloquear solo una ruta exacta, asegúrate de incluir la barra final: `Disallow: /admin/`.