跳到主要内容
← 返回

ai-crawler-robots

网络
本地运行 · 不上传

此工具完全在您的浏览器中运行。打开 DevTools → Network 面板,搜索您的输入内容——它不会出现在任何请求中。

使用指南

AI 搜索(ChatGPT/Claude/Perplexity/豆包)正在接管新一代查询入口,你的 robots.txt 决定它们能不能引用你。本工具预置 12 家主流 AI 爬虫的用途科普与建议,勾选式决策后一键生成规范的 robots.txt 片段——纯本地运行,决策不上传。自家站的 AI 爬虫策略就是用同样的决策框架定的,建议写进了每一条。

1. 三态怎么选

  1. 允许(Allow: /):该爬虫可抓全站——公开内容站默认态,被 AI 引用会带回品牌曝光与 referral 流量。
  2. 拦截(Disallow: /):明确拒绝该爬虫——付费墙内容、 crawled 数据只进训练集无回流的(如 Common Crawl)适合拦。
  3. 跟随(不生成组):该爬虫落到 * 通配组——"我还没想好"的诚实选项,也是 Google-Extended/Applebot-Extended 这类"只影响训练不影响分发"爬虫的中性默认。

2. 四条实战判断

  • 区分"训练爬虫"与"用户爬虫":ChatGPT-User/Claude-User 是用户在对话里实时打开你的页面,拦截会让 AI 用户看到打不开的站——除非有硬理由,永远放行。
  • 训练型无回流的(CCBot、meta-externalagent)拦截零损失;有引用回流的(GPTBot、PerplexityBot)放行是免费的 GEO 引流。
  • Google-Extended 拦不拦都不影响 Google 搜索收录——它是独立于 Googlebot 的训练开关,别把"怕影响 SEO"当成拦它的理由。
  • Bytespider(字节)抓取量大且合规声誉一般,按服务器流量成本决定,公开小站拦掉完全合理。

3. 生成之后

输出合并进站点根目录的 robots.txt(若已有其他规则,把生成的各组追加到文件里,注意 User-agent 组之间空一行)。改完用 Google Search Console 的 robots.txt 报告器验证生效。爬虫 UA 名单各厂商季度性更新,建议每季度回来重新过一遍——本工具的名单与建议同步维护。

相关工具

相关文章