Générateur de robots.txt — gérez autorisations et blocages des robots d’IA
Votre robots.txt indique à Google quelles pages explorer et indexer : une règle mal écrite peut cacher tout votre site dans la recherche. Générez un fichier robots.txt dans votre navigateur. Étapes : choisissez les user-agents, ajoutez des chemins Allow / Disallow et une ligne Sitemap, puis copiez le résultat en texte brut avec les règles de syntaxe et les user-agents à jour des robots d’IA expliqués. Fonctionne localement — rien n’est envoyé. Exemple : bloquer GPTBot tout en gardant Googlebot entièrement actif.
Cochez les robots à inclure, puis ajoutez des chemins pour chaque groupe.
Comment ça marche
Sélectionnez les robots ciblés, ajoutez des chemins Allow et Disallow pour chaque groupe, éventuellement une ligne Sitemap, puis cliquez sur Générer. La page assemble le fichier en texte brut selon le format RFC 9309 : une ligne User-agent par groupe, ses lignes Allow/Disallow dessous, une ligne vide entre les groupes et la ligne Sitemap à la fin. Copiez le résultat à la racine de votre site dans /robots.txt.
Règles de syntaxe importantes
Les règles de robots.txt sont des préfixes de chemin, pas des motifs, et un robot applique le dernier groupe qui lui correspond dans le fichier. Voici les règles suivies par ce générateur.
- Ordre des groupes : une ligne User-agent commence un groupe pour ce robot ; une ligne vide le termine. Le dernier groupe correspondant à un robot prime.
- Correspondance par préfixe : Allow et Disallow correspondent à des préfixes de chemin, pas à des sous-chaînes ni des regex. Seuls * et $ sont spéciaux (RFC 9309).
- Disallow: / bloque cet agent sur tout le site. Disallow avec une valeur vide autorise tout pour cet agent.
- Sitemap est une extension, pas une partie de RFC 9309. Elle est insensible à la casse et peut apparaître n’importe où, même si elle est en général placée à la fin.
Exemple
Exemple : Googlebot avec Allow: / (entièrement actif), GPTBot avec Disallow: / (bloqué) et une ligne Sitemap pointant vers /sitemap.xml. La sortie reflète ce format : un groupe par robot, ligne vide entre les groupes, sitemap en dernier.
Quand l’utiliser
- Sites neufs : générez un robots.txt de départ qui garde les moteurs actifs et masque des chemins de staging privés.
- Contrôle des robots d’IA : bloquez GPTBot, ClaudeBot, Google-Extended, CCBot ou PerplexityBot pour l’entraînement ou l’extraction de résumés sans toucher à Googlebot.
- Découverte : associez robots.txt à une ligne Sitemap pour que les robots trouvent votre sitemap.
Frequently asked questions
Que se passe-t-il si j’écris Disallow: / ?
Cela dit à ce robot de ne récupérer aucune URL sous la racine du site. Si Googlebot reçoit Disallow: /, vos pages peuvent disparaître de la recherche Google. Pour un chemin de staging, utilisez plutôt Disallow: /private/.
Comment bloquer les robots d’IA comme GPTBot ?
Créez un groupe avec le User-agent du robot (par exemple GPTBot, ClaudeBot, Google-Extended, CCBot, PerplexityBot) et ajoutez Disallow: /. Consultez la documentation officielle du robot, car les robots d’IA mettent régulièrement à jour leurs user-agents et plages IP.
Où doit se trouver la ligne Sitemap ?
La position n’affecte pas la façon dont les moteurs la lisent, mais la convention la place à la fin du fichier. Le générateur l’ajoute en dernier lorsque vous fournissez une URL.
Mon robots.txt est-il envoyé quelque part ?
Non. Le fichier est généré dans votre navigateur et n’est jamais envoyé à un serveur. Fermez l’onglet et rien n’est conservé.
Questions ou retours
Quelque chose n’est pas clair, cassé ou manquant ? Rédigez un message ci-dessous — nous lisons chaque note.