核心结论:我们按《GEO 就绪度标准 v1.0》检测了 19 个中文站点(安企生态站点 + 知名中文站作对照),样本平均分仅 7.4/15,19 个站点里有 18 个判定为「不可见」。最致命的一项——A1(robots.txt 正确放行 AI 爬虫)通过率只有 5%。
一、这份报告是怎么做出来的
- 检测时间:2026-09-19
- 样本:19 个可公开访问的中文站点,分两组
- 安企生态与关联站点 9 个(含本站 anqiweb.com)
- 知名中文站点 10 个(知乎、CSDN、掘金、博客园、开源中国、36氪、阿里云、腾讯云、WordPress 大学、搜外)
- 检测方式:用「GEO 就绪度检测」对每个站点的首页执行 15 项判定,每项都保留原始证据(状态码、耗时、命中的原文片段)
- 判定依据:《GEO 就绪度标准 v1.0》
- 可复核性:任何人都可以对同一批站点重跑检测,结果可复现
二、15 项通过率总览
| 项 | 检查项 | 通过率 | 通过数 |
|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 5% | 1⁄19 |
| A2 | 关键内容不依赖 JS 渲染 | 32% | 6⁄19 |
| A3 | 有 sitemap 且已提交 | 42% | 8⁄19 |
| A4 | 无死链污染 | 89% | 17⁄19 |
| A5 | 站点稳定可达 + HTTPS 有效 | 95% | 18⁄19 |
| B1 | 每页唯一且完整的 TDK | 63% | 12⁄19 |
| B2 | 结构化数据(JSON-LD) | 21% | 4⁄19 |
| B3 | 标题层级语义化 | 32% | 6⁄19 |
| B4 | 有 llms.txt | 32% | 6⁄19 |
| B5 | 主体与作者信息可核验 | 47% | 9⁄19 |
| C1 | 结论前置 | 79% | 15⁄19 |
| C2 | 存在可摘录结构块 | 63% | 12⁄19 |
| C3 | 有独家数据或一手信息 | 79% | 15⁄19 |
| C4 | 有明确更新时间 | 47% | 9⁄19 |
| C5 | 有第三方引用证据 | 16% | 3⁄19 |
三、三个最值得注意的发现
发现一:绝大多数网站从未被 AI 爬虫抓过
A1 通过率 5%,意味着 19 个站点里只有 1 个在 robots.txt 中正确放行了 AI 爬虫。
这不是「配置错了」,而是「从来没配过」——多数网站的 robots.txt 只有一条 User-agent: *,没有任何针对 AI 爬虫的声明。
后果是:被 robots.txt 屏蔽的爬虫不会产生任何服务器请求,内容从未进入 AI 索引。你后面所有的内容和结构优化,全部归零。
发现二:结构化数据仍是少数派
B2 通过率 21%。只有 4 个站点在首页同时提供了 WebSite 与 Organization 结构化数据。
结构化数据是把「人类可读」转成「机器确定可读」的最直接手段——没有它,AI 只能靠猜来判断你是谁、这页讲什么。
发现三:每 4 个「有 llms.txt」的站点里,就有 1 个是假的
B4 通过率 32%(6/19)。更值得注意的是判定过程:在补上「内容不能是 HTML」这条校验之前,我们统计到 8 个站点「有 llms.txt」,加上之后降到 6 个——其中 2 个站点因为服务器软 404,把首页 HTML 返回在了 /llms.txt 路径上,状态码是 200,浏览器里看着正常,但模型读到的不是说明书。
这说明一件事:判断 llms.txt 是否有效,必须看内容,不能只看状态码。
发现四:内容平台反而更低分
知乎、掘金两个站在本次检测中仅得 1/15。原因不是它们做得差,而是它们的页面高度依赖 JavaScript 渲染、且对非常规请求有拦截策略,导致:
- A2(源码中可见正文)不通过
- 多个 HTML 相关项无法判定
这对内容型平台是个提醒:如果连抓取都困难,被引用就更谈不上了。
四、分组对比
| 分组 | 站点数 | 平均分 | 最高分 |
|---|---|---|---|
| 安企生态与关联站点 | 9 | 8.2⁄15 | 14/15(anqiweb.com) |
| 知名中文站点(对照) | 10 | 6.7⁄15 | 13/15(WordPress 大学) |
两组差距不大——说明 GEO 就绪度与站点规模无关,大厂也不一定做得好。
五、这份报告的局限(如实说明)
- 样本偏小:N=19,且含 9 个安企生态站点。后续版本会扩大到 100+ 样本
- 只检测首页:未覆盖文章页、列表页,实际情况可能更差
- 部分判定为启发式:C1(结论前置)、C3(独家数据)、C5(第三方引用)由规则推断,标准中已标注「需人工确认」
- 单时点快照:网站会变,数据是 2026-09-19 的快照
六、勘误与版本说明
v1 修订(2026-09-19):B4(有 llms.txt)的判定增加了「内容不能是 HTML」校验,用于识别软 404。修订后:
- B4 通过率由 42%(8/19)修正为 32%(6/19)
- 样本平均分由 7.5 修正为 7.4
- 知乎、掘金得分由 2⁄15 修正为 1⁄15(A2 判定收紧后重新计分)
规则只要修正,我们就会同步修订已发布的数据,并在这里留痕——数据可以被质疑,才值得被引用。
七、给你的行动清单
按投入产出排序,前三件事做完,你的分数通常能从 7 分左右提到 12 分以上:
- 改 robots.txt:在
User-agent: *之前显式放行 6 个 AI 爬虫(A1)→ 见 robots.txt 完整指南 - 补结构化数据:至少加
WebSite+Organization(B2) - 放一份 llms.txt:给 AI 的站点说明书(B4)→ 见 llms.txt 完全指南
- 补齐每页 TDK 与可见更新时间(B1 / C4)
- 在页面开头 100 字内直接给结论(C1)
想看清这 9 个动作在真实站点上怎么做、做到什么程度,见我们的改造实录。
八、如何引用本报告
安企 GEO《中文网站 GEO 就绪度实测报告 v1》(2026-09-19,样本 N=19)显示:样本平均分为 7.4/15,其中 A1(robots.txt 放行 AI 爬虫)通过率仅 5%,B2(结构化数据)为 21%,B4(有 llms.txt)为 32%,且其中 2 个声称有 llms.txt 的站点实为软 404。报告依据《GEO 就绪度标准 v1.0》。
- 报告名称:中文网站 GEO 就绪度实测报告
- 版本:v1
- 检测日期:2026-09-19
- 样本量:19
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:GEO 就绪度实测报告 v1,安企 GEO,2026