跳到主要内容
实用工具2026-10-05Begin3 分钟阅读

llms.txt 规范解读:给 LLM 的站点说明书,值不值得放一个

llms.txt 解决什么问题

LLM 处理一个网站时的困境:爬到首页,面对导航、广告、页脚一大堆噪音,不知道哪些内容值得读、读到后该怎么理解。传统 SEO 设施帮不上忙——robots.txt 只管「能不能抓」,sitemap 只管「有哪些页」,没有一个文件回答「这个站的知识结构是什么」。

llms.txt(2024 年 9 月由 Answer.AI 的 Jeremy Howard 提出)补这个空:放在站点根目录的 markdown 文件,是给大模型看的站点说明书。访问路径固定为 /llms.txt,内容是人类可读的 markdown——这个格式选择本身就是设计(LLM 对 markdown 的理解远好于 XML)。

规范结构:三段式

# 站点名称

> 一句话说明这个站是什么、给谁用(blockquote 摘要)

## 必读
- [核心页面](https://example.com/path): 一句话说明这个页面为什么值得读
- [另一个核心页面](https://example.com/path2): 一句话说明

## 可选
- [次级内容](https://example.com/path3): 一句话说明

三个设计要点:

  1. 每条链接必须带一句话说明——这是 llms.txt 与链接清单的本质区别,说明文字帮模型判断「要不要展开这条链接」
  2. 分层(必读/可选)——模型上下文有限,优先级信息直接省它的算力
  3. markdown 而非 XML——对比 sitemap.xml 的机器格式,llms.txt 是「写给模型读的散文」

与现有 SEO 设施的分工

文件回答的问题消费者
robots.txt能不能抓所有爬虫
sitemap.xml有哪些页面搜索引擎
llms.txt什么值得读、怎么理解LLM 与 AI 应用

三者并存,各管一段。放了 llms.txt 不豁免 robots 配置,反之亦然(放行决策见 AI 爬虫指南)。

争议与现实:冷静的那一面

诚实地说,llms.txt 不是银弹:

  • Google 的公开态度克制——搜索团队明确表示未将其用于搜索排名;各 AI 公司是否、如何消费它没有统一承诺
  • 采用率在增长但绝对值仍小(主流大站部分跟进,长尾站点很少配置)
  • 它不会单独带来排名或引用——没有好内容,说明书再漂亮也没用

那为什么还值得放?三个务实理由:成本几乎为零(半小时);无副作用(不被消费也不损失什么);当引用发生时它提高命中质量——模型在多个候选源之间选择时,一份清晰的说明书是加分项。GEO 的完整策略见入门篇。

实践:自动生成,不手工维护

手工维护 llms.txt 必然过期(页面一改就忘)。本站的方案是构建脚本自动生成:从工具注册表和博客目录推导文件内容,每次部署自动更新——llms.txt 永远与站点结构同步,边际成本为零。

给独立站主的建议同样如此:如果你的站点结构存在单一真相源(哪怕是一份 YAML 配置),就让 llms.txt 从它生成;没有的话,至少把「新增页面时同步 llms.txt」写进发布 checklist——过期的说明书比没有更糟。

实现注记 / Implementer's note

写生成器时的两个细节:一是链接说明的措辞比想象中重要——「在线工具」这种泛化描述对模型无信息量,「输入不出浏览器的 JWT 解码器」才能帮模型在正确场景下想起你;二是 llms.txt 应该同时给出 markdown 版内容页的入口(如果站点支持),模型对 markdown 源的消化成本远低于 HTML——这是内容站对 AI 最便宜的一次让利。

相关阅读