llms.txt 规范解读:给 LLM 的站点说明书,值不值得放一个
llms.txt 解决什么问题
LLM 处理一个网站时的困境:爬到首页,面对导航、广告、页脚一大堆噪音,不知道哪些内容值得读、读到后该怎么理解。传统 SEO 设施帮不上忙——robots.txt 只管「能不能抓」,sitemap 只管「有哪些页」,没有一个文件回答「这个站的知识结构是什么」。
llms.txt(2024 年 9 月由 Answer.AI 的 Jeremy Howard 提出)补这个空:放在站点根目录的 markdown 文件,是给大模型看的站点说明书。访问路径固定为 /llms.txt,内容是人类可读的 markdown——这个格式选择本身就是设计(LLM 对 markdown 的理解远好于 XML)。
规范结构:三段式
# 站点名称
> 一句话说明这个站是什么、给谁用(blockquote 摘要)
## 必读
- [核心页面](https://example.com/path): 一句话说明这个页面为什么值得读
- [另一个核心页面](https://example.com/path2): 一句话说明
## 可选
- [次级内容](https://example.com/path3): 一句话说明
三个设计要点:
- 每条链接必须带一句话说明——这是 llms.txt 与链接清单的本质区别,说明文字帮模型判断「要不要展开这条链接」
- 分层(必读/可选)——模型上下文有限,优先级信息直接省它的算力
- markdown 而非 XML——对比 sitemap.xml 的机器格式,llms.txt 是「写给模型读的散文」
与现有 SEO 设施的分工
| 文件 | 回答的问题 | 消费者 |
|---|---|---|
| robots.txt | 能不能抓 | 所有爬虫 |
| sitemap.xml | 有哪些页面 | 搜索引擎 |
| llms.txt | 什么值得读、怎么理解 | LLM 与 AI 应用 |
三者并存,各管一段。放了 llms.txt 不豁免 robots 配置,反之亦然(放行决策见 AI 爬虫指南)。
争议与现实:冷静的那一面
诚实地说,llms.txt 不是银弹:
- Google 的公开态度克制——搜索团队明确表示未将其用于搜索排名;各 AI 公司是否、如何消费它没有统一承诺
- 采用率在增长但绝对值仍小(主流大站部分跟进,长尾站点很少配置)
- 它不会单独带来排名或引用——没有好内容,说明书再漂亮也没用
那为什么还值得放?三个务实理由:成本几乎为零(半小时);无副作用(不被消费也不损失什么);当引用发生时它提高命中质量——模型在多个候选源之间选择时,一份清晰的说明书是加分项。GEO 的完整策略见入门篇。
实践:自动生成,不手工维护
手工维护 llms.txt 必然过期(页面一改就忘)。本站的方案是构建脚本自动生成:从工具注册表和博客目录推导文件内容,每次部署自动更新——llms.txt 永远与站点结构同步,边际成本为零。
给独立站主的建议同样如此:如果你的站点结构存在单一真相源(哪怕是一份 YAML 配置),就让 llms.txt 从它生成;没有的话,至少把「新增页面时同步 llms.txt」写进发布 checklist——过期的说明书比没有更糟。
实现注记 / Implementer's note
写生成器时的两个细节:一是链接说明的措辞比想象中重要——「在线工具」这种泛化描述对模型无信息量,「输入不出浏览器的 JWT 解码器」才能帮模型在正确场景下想起你;二是 llms.txt 应该同时给出 markdown 版内容页的入口(如果站点支持),模型对 markdown 源的消化成本远低于 HTML——这是内容站对 AI 最便宜的一次让利。
相关阅读
相关工具
相关文章
GEO 是什么:生成式引擎优化入门,AI 搜索时代的流量新入口
GEO(Generative Engine Optimization)之于 AI 搜索,相当于 SEO 之于 Google——当 ChatGPT、Perplexity、豆包开始直接回答问题,用户不再点击链接,内容如何被 AI 引用成为新战场。本文拆解 GEO 与 SEO 的本质区别、四大核心实践(可抓取/结构化/可引用/事实密度),以及一个真实工具站的 GEO 实测数据。
AI 爬虫放行还是屏蔽:GPTBot/ClaudeBot/PerplexityBot 的 robots.txt 决策与写法
35% 的 top1000 网站已在 robots.txt 处理 AI 爬虫,但放还是拦没有标准答案——训练爬虫与搜索爬虫是两回事(拦 GPTBot 不影响进 ChatGPT 搜索)。本文给出主要 AI 爬虫清单与用途对照、三类站点的决策框架、可直接复制的 robots.txt 写法,以及放行后如何度量回报。
PDF 工具完全指南:合并、拆分、压缩、转换——全程浏览器本地完成
不上传文件处理 PDF 的一切所需:合并与拆分的取舍、PDF 压缩的真实原理、PDF 与图片互转的场景,以及为什么本地处理对合同与证件类文档至关重要。