Generador de robots.txt — gestiona permisos y bloqueos de rastreadores de IA
Tu robots.txt le dice a Google qué páginas puede rastrear e indexar: una regla mal escrita puede ocultar todo tu sitio de la búsqueda. Genera un robots.txt en tu navegador. Pasos: elige los user-agents, añade rutas Allow / Disallow y una línea Sitemap, y copia el resultado en texto plano con las reglas de sintaxis y los user-agents actuales de rastreadores de IA explicados. Corre localmente: no se sube nada. Ejemplo: bloquear GPTBot mientras Googlebot sigue totalmente habilitado.
Marca los rastreadores que quieras incluir y añade rutas para cada grupo.
Cómo funciona
Selecciona los rastreadores objetivo, añade rutas Allow y Disallow para cada grupo, agrega opcionalmente una línea Sitemap y pulsa Generar. La página ensambla el archivo de texto siguiendo el formato de RFC 9309: una línea User-agent por grupo, sus líneas Allow/Disallow debajo, una línea en blanco entre grupos y la línea Sitemap al final. Copia el resultado a la raíz de tu sitio en /robots.txt.
Reglas de sintaxis importantes
Las reglas de robots.txt son prefijos de ruta, no patrones, y un rastreador aplica el último grupo que coincide en el archivo. Estas son las reglas que sigue este generador.
- Orden de grupos: una línea User-agent comienza un grupo para ese rastreador; una línea en blanco lo termina. El último grupo que coincide con un rastreador manda.
- Coincidencia por prefijo: Allow y Disallow coinciden con prefijos de ruta, no subcadenas ni regex. Solo * y $ son especiales (RFC 9309).
- Disallow: / bloquea a ese agente en todo el sitio. Disallow con valor vacío permite todo para ese agente.
- Sitemap es una extensión, no parte de RFC 9309. No distingue mayúsculas y puede ir en cualquier lugar, aunque se suele colocar al final.
Ejemplo
Muestra: Googlebot con Allow: / (totalmente habilitado), GPTBot con Disallow: / (bloqueado) y una línea Sitemap apuntando a /sitemap.xml. La salida refleja este formato: un grupo por rastreador, línea en blanco entre grupos y sitemap al final.
Para qué sirve
- Sitios nuevos: genera un robots.txt inicial que mantiene habilitados los buscadores y oculta rutas de staging privadas.
- Control de rastreadores de IA: bloquea GPTBot, ClaudeBot, Google-Extended, CCBot o PerplexityBot para entrenamiento o extracción de resúmenes sin tocar Googlebot.
- Descubrimiento: combina robots.txt con una línea Sitemap para que los rastreadores encuentren tu sitemap.
Frequently asked questions
¿Qué pasa si escribo Disallow: / ?
Le indica a ese rastreador no buscar ninguna URL bajo la raíz del sitio. Si Googlebot recibe Disallow: /, tus páginas pueden desaparecer de Google Search. Para una ruta de staging usa Disallow: /private/ en su lugar.
¿Cómo bloqueo rastreadores de IA como GPTBot?
Crea un grupo con el User-agent del rastreador (por ejemplo GPTBot, ClaudeBot, Google-Extended, CCBot, PerplexityBot) y añade Disallow: /. Consulta la documentación oficial del rastreador, ya que los rastreadores de IA actualizan sus user-agents y rangos IP de vez en cuando.
¿Dónde debe ir la línea Sitemap?
La posición no afecta cómo la leen los buscadores, pero la convención la sitúa al final del archivo. El generador la añade al final cuando proporcionas una URL.
¿Mi robots.txt se sube a algún sitio?
No. El archivo se genera en tu navegador y nunca se envía a un servidor. Cierra la pestaña y no queda nada guardado.
Consultas o comentarios
¿Algo poco claro, roto o que falte? Redacta un mensaje abajo — leemos cada nota sobre estas herramientas.