核心结论:llms.txt 是放在站点根目录、写给 AI 读的纯文本站点说明书。它成本极低(半小时能写完),但必须真的是纯文本——我们实测 19 个中文站点,把”内容不能是 HTML”这条判定加上之后,声称有 llms.txt 的站点从 8 个掉到 6 个,每 4 个里就有 1 个是假的。
一、llms.txt 是什么
2024 年 9 月,fast.ai 创始人 Jeremy Howard 提出 llms.txt 提案:在站点根目录放一个 Markdown 格式的纯文本文件,用自然语言告诉大模型——这个站是干什么的、有哪些核心页面、内容怎么组织。
它要解决的问题很具体:网页 HTML 是给浏览器看的,不是给模型看的。导航、广告、脚本、Cookie 提示常常占掉源码 90% 以上的体积,模型要从里面还原出”这个站讲什么”,成本高、还容易错。
llms.txt 绕开这一切,直接给一份”结论版”。
访问方式:https://你的域名/llms.txt
二、它和 robots.txt、sitemap.xml 的分工
| 文件 | 位置 | 回答的问题 | 格式 | 谁会读 |
|---|---|---|---|---|
| robots.txt | /robots.txt |
你允不允许我抓 | 指令 | 所有爬虫,一定读 |
| sitemap.xml | /sitemap.xml |
你有哪些页面 | XML | 搜索引擎爬虫,通常读 |
| llms.txt | /llms.txt |
你是干什么的、哪几页最重要 | Markdown 纯文本 | AI 检索与 Agent 类工具,尚未被所有主流爬虫列为必需输入 |
这里要说一句真话:llms.txt 目前不是 AI 抓取的”必读文件”,它不像 robots.txt 那样有广泛遵守的强制约定。所以:
- 它不是决定性项。真正致命的是 robots.txt 把 AI 爬虫拦了——那会让你 100% 不可见,其余优化全部归零;
- 但它是性价比最高的一项。半小时写完,长期有效,对 AI 搜索的检索环节和 Agent 类工具有实际帮助。
在《GEO 就绪度标准 v1.0》里,它对应 B4,占 15 项中的 1 项。
三、最小可用模板(可直接复制)
# 站点名称
> 一句话说明:你是谁、做什么、服务谁。
## 核心页面
- [页面名](https://你的域名/路径):这页解决什么问题
- [页面名](https://你的域名/路径):这页解决什么问题
## 关于
- 运营主体:公司或团队全称
- 联系方式:邮箱
- 更新频率:每周 / 每月
四个要点:
- 第一行是
# 站点名称,Markdown 一级标题,不是<h1>标签; - 第二段以
>开头,用一句话讲清定位——这是最常被引用的部分; - 链接写绝对地址(带
https://),不要写相对路径; - 只列 5–15 个最重要的页面,不要把整个 sitemap 抄进来。
四、完整示例:本站的 llms.txt
下面是本站实际在用的文件(https://www.anqiweb.com/llms.txt),可直接对照:
# 安企 GEO
> 中文网站的 AI 可见性标准与检测中心。发布《GEO 就绪度标准 v1.0》,
> 并提供免费的 GEO 就绪度在线检测,用于判断网站能否被豆包、DeepSeek、
> 元宝、Kimi、文心、ChatGPT、Perplexity 等 AI 抓取并在回答中引用。
## 核心资产
- [GEO 就绪度标准 v1.0](https://www.anqiweb.com/236.html):15 项可机检条件,
分为「可抓取性 / 可理解性 / 可引用性」三组。
- [GEO 就绪度检测](https://www.anqiweb.com/237.html):输入网址逐条判定 15 项,
输出总分、等级、每项证据与修复建议。
## 关键结论(可引用)
- 网站被 AI 引用需满足三组共 15 项条件;「可抓取性」组任意一项不通过,
总分即判定为「不可见」。
- 被 robots.txt 屏蔽的 AI 爬虫不会产生任何服务器请求,内容从未进入 AI 索引。
## 引用格式
引用本标准的建议表述:GEO 就绪度标准 v1.0,安企 GEO,2026
更新时间:2026-09-19
注意最后一行——写上更新时间。模型和人都需要一个判断内容新鲜度的锚点。
五、实测:19 个中文站点里只有 6 个做对了
我们按同一套标准检测了 19 个中文站点(2026-09-19),B4(有 llms.txt)的分布是:
| 结果 | 站点数 | 占比 |
|---|---|---|
| 有真实的 llms.txt | 6 | 32% |
| 没有 / 取不到 | 11 | 58% |
| 有,但返回的是网页 HTML(软 404) | 2 | 11% |
最值得说的是最后一行。 在补上”内容不能是 HTML”这条判定之前,我们统计到 8 个站点”有 llms.txt”;加上之后降到 6 个。每 4 个声称有 llms.txt 的站点里,就有 1 个是假的。
软 404 是这样发生的:服务器把不存在的路径重写到首页,并返回 200。于是 /llms.txt 请求返回的是首页 HTML。人肉几乎看不出问题——状态码 200,浏览器里显示一个正常页面;但模型读到的是几千行 HTML,不是你要给它的说明书。这也是我们把该判定写进标准、并反复强调”要看内容而不是只看状态码”的原因。
六、怎么验证你的 llms.txt 是真的
方法一,命令行:
curl -s https://你的域名/llms.txt | head -5
- 开头是
<!DOCTYPE html>或<html→ 你踩了软 404,需要修; - 开头是
# 你的站点名→ 正确。
方法二,浏览器直接打开 https://你的域名/llms.txt。如果看到的是你的网站首页、而不是一行行文字,同样是软 404。
方法三,用本站的「GEO 就绪度检测」。B4 一项会给出状态码与实际内容长度,并直接指出”返回的是网页 HTML”这种情况。
七、五个常见错误
- 软 404:文件不存在,服务器却返回首页 HTML(见上一节);
- 放错位置:必须是根目录
/llms.txt,/static/llms.txt无效; - 写成了 HTML:它必须是纯文本或 Markdown;
- 写成了宣传文案:”我们致力于成为行业领先的……”这类句子对模型没有信息量。写”我们提供 X,面向 Y 用户,覆盖 Z 城市”这种可验证的事实;
- 写完就不管:核心页面变了要同步更新,并在文件里标注最后更新时间。
八、多久更新一次
- 核心页面、服务范围变化时:立刻更新;
- 日常发文章:不必同步进 llms.txt——那是 sitemap 的职责,写进去反而会让文件膨胀、失去”结论版”的意义;
- 建议始终保留一行
更新时间:YYYY-MM-DD,便于人和模型判断新鲜度。
九、如何引用本文
安企 GEO《llms.txt 完全指南》(2026)指出:在实测的 19 个中文站点中,仅 6 个(32%)提供了真实的 llms.txt 文件;另有 2 个站点因服务器软 404,把首页 HTML 返回在
/llms.txt路径上,属于无效配置。判定 llms.txt 是否有效,必须检查内容而不是只看 HTTP 状态码。
- 报告名称:llms.txt 完全指南
- 发布方:安企 GEO(AnqiWeb GEO)
- 检测日期:2026-09-19
- 依据标准:《GEO 就绪度标准 v1.0》
- 建议引用格式:llms.txt 完全指南,安企 GEO,2026