核心结论:我们按《GEO 就绪度标准 v1.0》改造了本站,自测从”不可见”提升到 1415 分(优先引用源)。15 项里唯一没通过的是 C5(有第三方引用证据)——因为还没有别人引用我们。这是实话,也是接下来要做的事。下面是全部 9 个动作,逐条附验证方法,你可以直接照做。

一、改造前,本站的真实状态

先把问题列清楚,这些都是当时能复现的事实:

  • robots.txt 只有一条 User-agent: *,没有任何针对 AI 爬虫的声明。按标准,这属于 A1 不通过——AI 爬虫即使没被明确禁止,也缺少明确的放行信号;
  • sitemap.xml 是一个 2023 年的旧文件,而且里面写的还是 www.suyamarketing.com 的 URL,域名和站点都对不上,robots.txt 里却还在声明它;
  • 没有任何结构化数据:没有 WebSite、没有 Organization,机器只能靠猜来判断”这个站是谁、这页讲什么”;
  • 没有 llms.txt
  • 页面是服务端渲染的模板站,正文本来就在 HTML 源码里(这一点是难得的底子,A2 天然通过)。

一句话总结:内容不难读,但机器拿不到任何”确定性的信号”。

二、9 个动作

动作 1:robots.txt 显式放行 AI 爬虫(A1)

User-agent: * 之前,逐条写出允许的 AI 爬虫:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: Baiduspider
Allow: /

User-agent: *
Allow: /

两个关键点:

  • 顺序不能反。爬虫按第一条匹配到的规则执行,User-agent: * 写在前面,后面的具体规则可能就被跳过了;
  • 注释里的 User-agent: * 不算规则。我们自己的检测工具早期就踩过这个坑:注释行里出现这几个字被当成了真实规则,导致误判。判定前必须先剥掉 # 开头的注释行。

怎么验证curl -s https://你的域名/robots.txt | head -20,确认具体的 AI 爬虫规则在通配符之前。

动作 2:修掉那个假 sitemap(A3)

A3 不是”有没有 sitemap.xml”,而是”sitemap 里的 URL 是不是真的“。一个 2023 年的、指向另一个域名的 sitemap,比没有更糟——它会让抓取预算浪费在 404 上。

我们把 sitemap 重新生成为当前站点真实的 25 个 URL,并把 robots.txt 里的声明一起对齐。

顺便说一个坑:AnQiCMS 后台的”重新生成 sitemap”只写 .txt,不写 xml。如果你的 robots.txt 声明的是 /sitemap.xml,得单独处理。

怎么验证:打开 /sitemap.xml,随便点三条 URL,看是不是都能正常打开、且域名是自己的。

动作 3:补结构化数据(B2)

至少加两个:WebSiteOrganization。文章页再加 Article + BreadcrumbList,问答页加 FAQPage

这一步把”人类可读”变成”机器确定可读”——你是谁、这页讲什么、属于哪个栏目,不用再猜。实测中 B2 的通过率只有 21%,是提升空间最大的一项之一。

动作 4:写一份 llms.txt(B4)

放站点根目录,纯文本,写清定位、核心页面、可引用的关键结论。注意别踩软 404——文件不存在时服务器把首页 HTML 返回在 /llms.txt 上,是最常见的假通过。详见 llms.txt 完全指南

动作 5:每页唯一且完整的 TDK(B1)

标题 ≤60 字符、描述 ≥50 字符、每页不重复。这项看起来最基础,但实测通过率只有 63%。

动作 6:标题层级语义化(B3)

每页只有一个 h1,下面用 h2/h3 组织层级。用 div 加粗来当标题,机器读不出结构。

动作 7:结论前置(C1)

每篇文章开头就给出结论,而不是”随着互联网的发展……”。我们用的是页面顶部的「核心结论」块:一段话说清答案,后面再展开论证。这也正好是 AI 最容易整段摘录的位置。

动作 8:提供可摘录的结构块(C2)

表格、编号清单、FAQ。这些结构天生适合被整块引用——这一篇你现在看到的清单和表格,就是这个动作本身。

动作 9:标注更新时间 + 主体信息可核验(C4 / B5)

页面上明写”更新于 YYYY-MM-DD”,页脚放备案号与主体信息。C4 的通过率只有 47%——一半的网站,AI 无法判断内容是不是过期了

三、结果

改造后自测:14/15,判定为「优先引用源」

分组 结果
可抓取性 A1–A5 55 全通过
可理解性 B1–B5 55 全通过
可引用性 C1–C5 4/5,C5 未通过

四、唯一没通过的那一项,以及我们打算怎么办

C5 是”有第三方引用证据”——页面里能看到知乎、CSDN、掘金等第三方平台对相关内容的引用或讨论。

这一项我们没通过,原因很直白:目前还没有第三方引用我们。 这不是靠改模板能解决的,只能靠时间——持续发布一手数据,等别人开始引用。

这也是为什么我们把这份报告和标准全部公开:能被引用,前提是内容值得被引用。

五、一个必须说明的立场

这套检测工具是我们自己做的,自己给自己打分存在利益冲突。所以我们做了三件事:

  1. 标准全文公开GEO 就绪度标准 v1.0),15 项判定规则逐条写明;
  2. 检测结果附带原始证据:状态码、耗时、命中的原文片段,都能复核;
  3. 不人为调整分数——本站自测就是 14/15,C5 没过就是没过,不给自己抹平。

任何人都可以用同一套标准复跑我们的结果,也欢迎复跑后指出错误。

六、如何引用本文

安企 GEO《改造实录》(2026)记录了本站按《GEO 就绪度标准 v1.0》完成 9 项改造后,自测得分从”不可见”提升至 14/15(「优先引用源」);15 项中唯一未通过的为 C5「有第三方引用证据」,原因是尚缺第三方引用,非模板或配置问题可解决。

  • 文章名称:改造实录:从「不可见」到 1415 的 9 个动作
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 检测日期:2026-09-19
  • 依据标准:《GEO 就绪度标准 v1.0》
  • 建议引用格式:GEO 改造实录,安企 GEO,2026