核心结论:我们按《GEO 就绪度标准 v1.0》检测了 19 个中文站点(安企生态站点 + 知名中文站作对照),样本平均分仅 7.4/15,19 个站点里有 18 个判定为「不可见」。最致命的一项——A1(robots.txt 正确放行 AI 爬虫)通过率只有 5%

一、这份报告是怎么做出来的

  • 检测时间:2026-09-19
  • 样本:19 个可公开访问的中文站点,分两组
    • 安企生态与关联站点 9 个(含本站 anqiweb.com)
    • 知名中文站点 10 个(知乎、CSDN、掘金、博客园、开源中国、36氪、阿里云、腾讯云、WordPress 大学、搜外)
  • 检测方式:用「GEO 就绪度检测」对每个站点的首页执行 15 项判定,每项都保留原始证据(状态码、耗时、命中的原文片段)
  • 判定依据《GEO 就绪度标准 v1.0》
  • 可复核性:任何人都可以对同一批站点重跑检测,结果可复现

二、15 项通过率总览

检查项 通过率 通过数
A1 robots.txt 正确放行 AI 爬虫 5% 119
A2 关键内容不依赖 JS 渲染 32% 619
A3 有 sitemap 且已提交 42% 819
A4 无死链污染 89% 1719
A5 站点稳定可达 + HTTPS 有效 95% 1819
B1 每页唯一且完整的 TDK 63% 1219
B2 结构化数据(JSON-LD) 21% 419
B3 标题层级语义化 32% 619
B4 有 llms.txt 32% 619
B5 主体与作者信息可核验 47% 919
C1 结论前置 79% 1519
C2 存在可摘录结构块 63% 1219
C3 有独家数据或一手信息 79% 1519
C4 有明确更新时间 47% 919
C5 有第三方引用证据 16% 319

三、三个最值得注意的发现

发现一:绝大多数网站从未被 AI 爬虫抓过

A1 通过率 5%,意味着 19 个站点里只有 1 个在 robots.txt 中正确放行了 AI 爬虫

这不是「配置错了」,而是「从来没配过」——多数网站的 robots.txt 只有一条 User-agent: *,没有任何针对 AI 爬虫的声明。

后果是:被 robots.txt 屏蔽的爬虫不会产生任何服务器请求,内容从未进入 AI 索引。你后面所有的内容和结构优化,全部归零。

发现二:结构化数据仍是少数派

B2 通过率 21%。只有 4 个站点在首页同时提供了 WebSiteOrganization 结构化数据。

结构化数据是把「人类可读」转成「机器确定可读」的最直接手段——没有它,AI 只能靠猜来判断你是谁、这页讲什么。

发现三:每 4 个「有 llms.txt」的站点里,就有 1 个是假的

B4 通过率 32%(6/19)。更值得注意的是判定过程:在补上「内容不能是 HTML」这条校验之前,我们统计到 8 个站点「有 llms.txt」,加上之后降到 6 个——其中 2 个站点因为服务器软 404,把首页 HTML 返回在了 /llms.txt 路径上,状态码是 200,浏览器里看着正常,但模型读到的不是说明书。

这说明一件事:判断 llms.txt 是否有效,必须看内容,不能只看状态码。

发现四:内容平台反而更低分

知乎、掘金两个站在本次检测中仅得 1/15。原因不是它们做得差,而是它们的页面高度依赖 JavaScript 渲染、且对非常规请求有拦截策略,导致:

  • A2(源码中可见正文)不通过
  • 多个 HTML 相关项无法判定

这对内容型平台是个提醒:如果连抓取都困难,被引用就更谈不上了。

四、分组对比

分组 站点数 平均分 最高分
安企生态与关联站点 9 8.215 14/15(anqiweb.com)
知名中文站点(对照) 10 6.715 13/15(WordPress 大学)

两组差距不大——说明 GEO 就绪度与站点规模无关,大厂也不一定做得好。

五、这份报告的局限(如实说明)

  1. 样本偏小:N=19,且含 9 个安企生态站点。后续版本会扩大到 100+ 样本
  2. 只检测首页:未覆盖文章页、列表页,实际情况可能更差
  3. 部分判定为启发式:C1(结论前置)、C3(独家数据)、C5(第三方引用)由规则推断,标准中已标注「需人工确认」
  4. 单时点快照:网站会变,数据是 2026-09-19 的快照

六、勘误与版本说明

v1 修订(2026-09-19):B4(有 llms.txt)的判定增加了「内容不能是 HTML」校验,用于识别软 404。修订后:

  • B4 通过率由 42%(8/19)修正为 32%(6/19)
  • 样本平均分由 7.5 修正为 7.4
  • 知乎、掘金得分由 215 修正为 115(A2 判定收紧后重新计分)

规则只要修正,我们就会同步修订已发布的数据,并在这里留痕——数据可以被质疑,才值得被引用。

七、给你的行动清单

按投入产出排序,前三件事做完,你的分数通常能从 7 分左右提到 12 分以上:

  1. 改 robots.txt:在 User-agent: * 之前显式放行 6 个 AI 爬虫(A1)→ 见 robots.txt 完整指南
  2. 补结构化数据:至少加 WebSite + Organization(B2)
  3. 放一份 llms.txt:给 AI 的站点说明书(B4)→ 见 llms.txt 完全指南
  4. 补齐每页 TDK 与可见更新时间(B1 / C4)
  5. 在页面开头 100 字内直接给结论(C1)

想看清这 9 个动作在真实站点上怎么做、做到什么程度,见我们的改造实录

八、如何引用本报告

安企 GEO《中文网站 GEO 就绪度实测报告 v1》(2026-09-19,样本 N=19)显示:样本平均分为 7.4/15,其中 A1(robots.txt 放行 AI 爬虫)通过率仅 5%,B2(结构化数据)为 21%,B4(有 llms.txt)为 32%,且其中 2 个声称有 llms.txt 的站点实为软 404。报告依据《GEO 就绪度标准 v1.0》。

  • 报告名称:中文网站 GEO 就绪度实测报告
  • 版本:v1
  • 检测日期:2026-09-19
  • 样本量:19
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 建议引用格式:GEO 就绪度实测报告 v1,安企 GEO,2026