Robots.txt 生成器 — 管理允许与禁止并配置 AI 爬虫
robots.txt 决定 Google 能抓取并收录哪些页面——规则写错可能让整个站点从搜索结果中消失。在浏览器里生成 robots.txt。步骤:勾选 User-agent,为每个分组添加 Allow / Disallow 路径和 Sitemap 行,然后复制纯文本结果;页面会解释语法规则与常用 AI 爬虫的 User-agent 写法。全部本地完成,内容不上传。示例:阻止 GPTBot 抓取,同时保持 Googlebot 正常抓取。
勾选要包含的爬虫,再为每个分组添加路径。
怎么用
选好要针对的爬虫,为每个分组添加 Allow 与 Disallow 路径,可选地加一行 Sitemap,然后点「生成」。页面按 RFC 9309 的布局组装纯文本:每个分组一行 User-agent,下方是它的 Allow/Disallow 行,分组之间空一行,Sitemap 行放在末尾。复制后放到站点根目录 /robots.txt 即可。
需要记住的语法规则
robots.txt 的规则是路径前缀而非正则,爬虫应用文件中最后一个匹配它的分组。以下是本生成器遵循的规则。
- 分组顺序:User-agent 行开始一个适用于该爬虫的分组,空行结束分组;最后匹配到该爬虫的分组生效。
- 前缀匹配:Allow 与 Disallow 匹配路径前缀,不是子串也不是正则;只有 * 和 $ 是特殊字符(RFC 9309)。
- Disallow: / 会阻止该代理抓取整个站点;Disallow 后面留空表示该代理全部放行。
- Sitemap 是扩展指令,不属于 RFC 9309。它不区分大小写,可以放在任意位置,但惯例是放在文件末尾。
示例
样例:Googlebot 配置 Allow: /(完全放行),GPTBot 配置 Disallow: /(完全禁止),最后一行 Sitemap 指向 /sitemap.xml。输出就是这个布局:每个爬虫一个分组、组间空行、sitemap 在最后。
适合什么场景
- 新站上线:生成一份初始 robots.txt,让搜索引擎正常抓取,同时隐藏私有暂存路径。
- AI 爬虫管控:在不影响 Googlebot 的前提下,阻止 GPTBot、ClaudeBot、Google-Extended、CCBot 或 PerplexityBot 抓取训练语料或做摘要提取。
- 抓取发现:在 robots.txt 里加一行 Sitemap,让爬虫更容易找到你的站点地图。
常见问题
写 Disallow: / 会怎样?
它告诉该爬虫不要抓取站点根目录下的任何 URL。如果 Googlebot 拿到 Disallow: /,你的页面可能从 Google 搜索结果中消失。想隐藏暂存路径请用 Disallow: /private/ 之类的具体路径。
怎么阻止 GPTBot 这类 AI 爬虫?
用该爬虫的 User-agent(例如 GPTBot、ClaudeBot、Google-Extended、CCBot、PerplexityBot)建一个分组,加上 Disallow: /。AI 爬虫会不时更新 User-agent 和 IP 段,请以各家官方文档为准。
Sitemap 行应该放在哪里?
位置不影响搜索引擎读取,但惯例是放在文件末尾。本工具在填写 URL 时会把它追加到最后。
我的 robots.txt 会被上传到任何地方吗?
不会。文件在浏览器里生成,从不发送到服务器。关闭标签页后不会保留任何内容。
咨询与反馈
页面不清、功能异常或想提建议?在下方起草邮件,我们会阅读每一封关于工具的来信。