CodeKitHub
站长工具

Robots.txt 在线生成器

最后更新:

几秒钟生成一份语法正确的 robots.txt:从预设开始(允许全部、禁止全部、或专门屏蔽AI训练爬虫但保留谷歌/必应收录),加上自己的禁止路径和 sitemap 地址,然后复制或下载文件。

下载 robots.txt

工具介绍

robots.txt 是放在网站根目录的纯文本文件,告诉爬虫网站哪些部分可以访问、哪些不可以。谷歌、必应等搜索引擎收录时会遵守它;2026年它还是网站表态"不允许内容被用于训练AI模型"的标准做法,通过 GPTBot、CCBot、Google-Extended 等专门的爬虫名称来实现。

语法写对很重要——一个禁止路径写错,可能意外把整个网站挡在搜索引擎之外;AI屏蔽规则如果位置不对,也可能根本没起到屏蔽作用。本工具为每种场景生成语法正确的结果。

Robots 排除协议自 1994 年起作为非正式约定沿用了近三十年,直到 2022 年才正式标准化为 RFC 9309——本生成器输出的规则(User-agent、Disallow、Allow,外加 Sitemap 扩展)都遵循该规范。

为什么使用它?

  • 专门的AI爬虫屏蔽预设,覆盖 GPTBot、ChatGPT-User、CCBot、Google-Extended、ClaudeBot、Bytespider、anthropic-ai,同时明确保留搜索引擎访问权限。
  • 自定义禁止路径,适用于不想让任何爬虫看到的内容。
  • Sitemap 地址字段——一个小改动,能帮搜索引擎更快发现你的页面。
  • 每次都是正确语法——不会因为手误把整站误封。
  • 免费、即时,直接下载文件或复制文本。

使用方法

  1. 选择预设:允许全部、禁止全部、或只屏蔽AI爬虫。
  2. 按需添加自定义禁止路径,每行一条(比如 /admin/)。
  3. 按需填写 sitemap 地址。
  4. 点"复制"或"下载",把文件上传到网站根目录,命名为 /robots.txt。

示例

输入

预设:屏蔽AI爬虫,保留搜索引擎。Sitemap: https://example.com/sitemap.xml

输出

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

...

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

每个AI爬虫都有单独的屏蔽规则,末尾的通配规则则保留了正常搜索引擎的访问权限。

这个爬虫该不该屏蔽?

不是所有爬虫作用都一样——屏蔽错了对象,可能把搜索流量也一起切断,而不只是拒绝AI训练。

爬虫作用什么情况该屏蔽
Googlebot、Bingbot为搜索结果收录你的网站永远不要屏蔽——挡了这两个等于直接退出谷歌/必应搜索。
GPTBot、ChatGPT-UserOpenAI的爬虫——GPTBot用于训练模型,ChatGPT-User是用户让ChatGPT去抓某个页面时用的不想内容被用于AI训练时屏蔽GPTBot;但ChatGPT-User是响应用户主动分享的链接去抓页面,属于不同情况,有些网站会选择放行。
Google-Extended控制谷歌是否把你的内容用于 Gemini/AI 训练——和 Googlebot 的搜索收录是分开的独立开关想继续被谷歌搜索收录,但不想内容用于谷歌AI训练时——这个指令正好只挡AI训练,不影响排名。
CCBot、Bytespider、anthropic-ai、ClaudeBot分别是 Common Crawl(很多AI数据集的数据来源)、字节跳动、Anthropic 的爬虫和 GPTBot 同样的逻辑——不想内容进入AI训练数据集就屏蔽。

常见问题

robots.txt 真的能阻止AI用我的内容吗?

它靠的是自觉遵守——正规AI公司的爬虫确实会遵守(这正是 GPTBot、CCBot 等专门命名、有文档说明的爬虫存在的意义,就是让网站可以选择退出)。但它拦不住不遵守规则的爬虫,对屏蔽之前已经抓取过的内容也没有追溯效力。

屏蔽AI爬虫会影响谷歌/必应的搜索排名吗?

不会——AI爬虫屏蔽预设只针对指定的AI爬虫,末尾保留了对所有其他爬虫的"Allow: /"通配规则,Googlebot 和 Bingbot 不受影响。

robots.txt 文件放在哪里?

放在域名根目录,确保能通过 yourdomain.com/robots.txt 直接访问——不能放在子文件夹里。大多数网站托管平台和静态站点生成器都有专门的根目录/public目录用来放这个文件。

Sitemap 那一行是干什么的?

它指向你的 sitemap.xml,列出网站所有可收录页面。这一行是可选的,但通常建议加上——多写一行,能加快新页面被发现的速度。

自定义禁止路径能和AI屏蔽预设一起用吗?

可以——AI屏蔽预设会先加上AI爬虫的屏蔽规则,然后把你的自定义禁止路径(如果有)应用在仍然保留搜索引擎访问的通配规则下。

相关工具