AI 爬虫放行还是屏蔽:GPTBot/ClaudeBot/PerplexityBot 的 robots.txt 决策与写法
先搞清楚:你放行/拦截的到底是什么
AI 公司的爬虫分两类,用途完全不同,分开决策:
| 爬虫 | 归属 | 用途 | 影响 |
|---|---|---|---|
| GPTBot | OpenAI | 模型训练 | 不影响 ChatGPT 搜索收录 |
| OAI-SearchBot | OpenAI | ChatGPT 搜索索引 | 拦了就不进 ChatGPT 搜索 |
| ChatGPT-User | OpenAI | 用户实时请求抓取 | 拦了用户让 ChatGPT 看你页面会失败 |
| ClaudeBot | Anthropic | 模型训练 | 不影响 Claude 搜索 |
| Claude-Web / Claude-SearchBot | Anthropic | Claude 搜索/实时 | 搜索与实时抓取 |
| PerplexityBot | Perplexity | 搜索索引 | Perplexity 的答案引用来源 |
| Google-Extended | Gemini 训练 | 不影响 Google 搜索(独立于 Googlebot) | |
| Googlebot | Google 搜索(含 AI Overviews) | 拦它等于退出 Google | |
| Bytespider | 字节跳动 | 豆包等训练 | 抓取量大,负载考量 |
| Applebot-Extended | Apple | Apple Intelligence 训练 | 不影响 Apple 搜索 |
| CCBot | Common Crawl | 开放语料库 | 多数模型的间接语料来源 |
最常见的误区:把「不想被拿去训练」执行成全拦,结果连 AI 搜索的入口一起放弃了——训练与搜索是不同 UA,你可以只拦前者。
决策框架:三类站点三种答案
内容站 / 工具站 / 博客(我们的场景) 放行搜索爬虫 + 默认放行训练爬虫。理由:引用即分发,AI 搜索是新流量入口,训练语料的「回报」是未来被模型知识覆盖。唯一例外是服务器负载扛不住时对高频训练爬虫限流(用 robots.txt 的 Crawl-delay 或 CDN 限速)。
付费内容 / 会员制内容 拦训练爬虫(内容是商品,不能白嫖),放搜索爬虫但配 meta 标签控制摘要展示。注意 robots.txt 只是「君子协定」,付费内容真正的防线是认证墙本身。
内部系统 / 后台
全拦(标准 Disallow: /),本来就不该对公网开放抓取。
可直接复制的 robots.txt 写法
全放行(内容站默认):
User-agent: *
Allow: /
只拦训练、保搜索(付费/谨慎型):
# 拦训练爬虫
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# 其余(含搜索爬虫)放行
User-agent: *
Allow: /
给高频爬虫限速(负载考量):
User-agent: Bytespider
Crawl-delay: 10
Allow: /
注意 robots.txt 的匹配规则:最具体的 UA 段优先于 * 段——所以可以单独给某个爬虫开例外而不影响全局。
放行之后:怎么度量回报
放行不是终点,GEO 的回报要能看到:
- 流量分析里看 AI 渠道:GA4 等工具已把 AI 搜索单列为来源(本站实测会出现 "AI Assistant" 渠道)——见 GEO 入门的数据节
- 服务器日志看爬虫到访:放行后 grep 日志里的 PerplexityBot/OAI-SearchBot 抓取记录,有抓取才有被引用的资格
- 直接问 AI:在 ChatGPT/Perplexity 里搜你的核心关键词,看答案是否引用了你——最原始也最有效
实现注记 / Implementer's note
帮这个站配 robots 时的实际权衡:我们的 robots.txt 极简(全放行),因为工具站的内容本来就是公开分发导向——但配置时逐个核对了每家爬虫的官方 UA 字符串(大小写敏感,写错等于没配)。另一条实操经验:Bytespider 和 YisouSpider 的抓取量级远超其他(日志实证每天数千次),对小型服务器,即使决定放行也值得在 CDN 层做速率限制——「放行」和「无限放行」是两回事。
相关阅读
相关工具
相关文章
GEO 是什么:生成式引擎优化入门,AI 搜索时代的流量新入口
GEO(Generative Engine Optimization)之于 AI 搜索,相当于 SEO 之于 Google——当 ChatGPT、Perplexity、豆包开始直接回答问题,用户不再点击链接,内容如何被 AI 引用成为新战场。本文拆解 GEO 与 SEO 的本质区别、四大核心实践(可抓取/结构化/可引用/事实密度),以及一个真实工具站的 GEO 实测数据。
llms.txt 规范解读:给 LLM 的站点说明书,值不值得放一个
llms.txt 是 2024 年提出的站点根目录 markdown 文件,用结构化的方式告诉大模型这个站有什么值得读。本文拆解它的规范结构(H1+摘要+分层链接)、与 robots.txt/sitemap 的分工、外界的争议(Google 的态度、采用率现状),以及一个自动生成的真实实践——含可参考的文件骨架。
PDF 工具完全指南:合并、拆分、压缩、转换——全程浏览器本地完成
不上传文件处理 PDF 的一切所需:合并与拆分的取舍、PDF 压缩的真实原理、PDF 与图片互转的场景,以及为什么本地处理对合同与证件类文档至关重要。