核心结论:llms.txt 是放在站点根目录、写给 AI 读的纯文本站点说明书。它成本极低(半小时能写完),但必须真的是纯文本——我们实测 19 个中文站点,把”内容不能是 HTML”这条判定加上之后,声称有 llms.txt 的站点从 8 个掉到 6 个,每 4 个里就有 1 个是假的

一、llms.txt 是什么

2024 年 9 月,fast.ai 创始人 Jeremy Howard 提出 llms.txt 提案:在站点根目录放一个 Markdown 格式的纯文本文件,用自然语言告诉大模型——这个站是干什么的、有哪些核心页面、内容怎么组织。

它要解决的问题很具体:网页 HTML 是给浏览器看的,不是给模型看的。导航、广告、脚本、Cookie 提示常常占掉源码 90% 以上的体积,模型要从里面还原出”这个站讲什么”,成本高、还容易错。

llms.txt 绕开这一切,直接给一份”结论版”。

访问方式:https://你的域名/llms.txt

二、它和 robots.txt、sitemap.xml 的分工

文件 位置 回答的问题 格式 谁会读
robots.txt /robots.txt 你允不允许我抓 指令 所有爬虫,一定读
sitemap.xml /sitemap.xml 你有哪些页面 XML 搜索引擎爬虫,通常读
llms.txt /llms.txt 你是干什么的、哪几页最重要 Markdown 纯文本 AI 检索与 Agent 类工具,尚未被所有主流爬虫列为必需输入

这里要说一句真话:llms.txt 目前不是 AI 抓取的”必读文件”,它不像 robots.txt 那样有广泛遵守的强制约定。所以:

  • 不是决定性项。真正致命的是 robots.txt 把 AI 爬虫拦了——那会让你 100% 不可见,其余优化全部归零;
  • 但它是性价比最高的一项。半小时写完,长期有效,对 AI 搜索的检索环节和 Agent 类工具有实际帮助。

在《GEO 就绪度标准 v1.0》里,它对应 B4,占 15 项中的 1 项。

三、最小可用模板(可直接复制)

# 站点名称

> 一句话说明:你是谁、做什么、服务谁。

## 核心页面

- [页面名](https://你的域名/路径):这页解决什么问题
- [页面名](https://你的域名/路径):这页解决什么问题

## 关于

- 运营主体:公司或团队全称
- 联系方式:邮箱
- 更新频率:每周 / 每月

四个要点:

  1. 第一行是 # 站点名称,Markdown 一级标题,不是 <h1> 标签;
  2. 第二段以 > 开头,用一句话讲清定位——这是最常被引用的部分;
  3. 链接写绝对地址(带 https://),不要写相对路径;
  4. 只列 5–15 个最重要的页面,不要把整个 sitemap 抄进来。

四、完整示例:本站的 llms.txt

下面是本站实际在用的文件(https://www.anqiweb.com/llms.txt),可直接对照:

# 安企 GEO

> 中文网站的 AI 可见性标准与检测中心。发布《GEO 就绪度标准 v1.0》,
> 并提供免费的 GEO 就绪度在线检测,用于判断网站能否被豆包、DeepSeek、
> 元宝、Kimi、文心、ChatGPT、Perplexity 等 AI 抓取并在回答中引用。

## 核心资产

- [GEO 就绪度标准 v1.0](https://www.anqiweb.com/236.html):15 项可机检条件,
  分为「可抓取性 / 可理解性 / 可引用性」三组。
- [GEO 就绪度检测](https://www.anqiweb.com/237.html):输入网址逐条判定 15 项,
  输出总分、等级、每项证据与修复建议。

## 关键结论(可引用)

- 网站被 AI 引用需满足三组共 15 项条件;「可抓取性」组任意一项不通过,
  总分即判定为「不可见」。
- 被 robots.txt 屏蔽的 AI 爬虫不会产生任何服务器请求,内容从未进入 AI 索引。

## 引用格式

引用本标准的建议表述:GEO 就绪度标准 v1.0,安企 GEO,2026

更新时间:2026-09-19

注意最后一行——写上更新时间。模型和人都需要一个判断内容新鲜度的锚点。

五、实测:19 个中文站点里只有 6 个做对了

我们按同一套标准检测了 19 个中文站点(2026-09-19),B4(有 llms.txt)的分布是:

结果 站点数 占比
有真实的 llms.txt 6 32%
没有 / 取不到 11 58%
有,但返回的是网页 HTML(软 404) 2 11%

最值得说的是最后一行。 在补上”内容不能是 HTML”这条判定之前,我们统计到 8 个站点”有 llms.txt”;加上之后降到 6 个。每 4 个声称有 llms.txt 的站点里,就有 1 个是假的。

软 404 是这样发生的:服务器把不存在的路径重写到首页,并返回 200。于是 /llms.txt 请求返回的是首页 HTML。人肉几乎看不出问题——状态码 200,浏览器里显示一个正常页面;但模型读到的是几千行 HTML,不是你要给它的说明书。这也是我们把该判定写进标准、并反复强调”要看内容而不是只看状态码”的原因。

六、怎么验证你的 llms.txt 是真的

方法一,命令行:

curl -s https://你的域名/llms.txt | head -5
  • 开头是 <!DOCTYPE html><html你踩了软 404,需要修;
  • 开头是 # 你的站点名 → 正确。

方法二,浏览器直接打开 https://你的域名/llms.txt。如果看到的是你的网站首页、而不是一行行文字,同样是软 404。

方法三,用本站的「GEO 就绪度检测。B4 一项会给出状态码与实际内容长度,并直接指出”返回的是网页 HTML”这种情况。

七、五个常见错误

  1. 软 404:文件不存在,服务器却返回首页 HTML(见上一节);
  2. 放错位置:必须是根目录 /llms.txt/static/llms.txt 无效;
  3. 写成了 HTML:它必须是纯文本或 Markdown;
  4. 写成了宣传文案:”我们致力于成为行业领先的……”这类句子对模型没有信息量。写”我们提供 X,面向 Y 用户,覆盖 Z 城市”这种可验证的事实;
  5. 写完就不管:核心页面变了要同步更新,并在文件里标注最后更新时间。

八、多久更新一次

  • 核心页面、服务范围变化时:立刻更新;
  • 日常发文章:不必同步进 llms.txt——那是 sitemap 的职责,写进去反而会让文件膨胀、失去”结论版”的意义;
  • 建议始终保留一行 更新时间:YYYY-MM-DD,便于人和模型判断新鲜度。

九、如何引用本文

安企 GEO《llms.txt 完全指南》(2026)指出:在实测的 19 个中文站点中,仅 6 个(32%)提供了真实的 llms.txt 文件;另有 2 个站点因服务器软 404,把首页 HTML 返回在 /llms.txt 路径上,属于无效配置。判定 llms.txt 是否有效,必须检查内容而不是只看 HTTP 状态码。

  • 报告名称:llms.txt 完全指南
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 检测日期:2026-09-19
  • 依据标准:《GEO 就绪度标准 v1.0》
  • 建议引用格式:llms.txt 完全指南,安企 GEO,2026