检测结论:
buchina.net在《GEO 就绪度标准 v1.0》的 15 项判定中通过 12 项,得分 12 分(满分 15),判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
buchina.net 是一个面向高考志愿填报与分数线查询的中文站点,本次 GEO 就绪度检测得 12 分(满分 15),判定等级为「不可见」。站点的基本盘是扎实的:正文不依赖 JS 渲染、sitemap 有效、HTTPS 稳定、TDK 与标题层级规范、JSON-LD 已部署 WebSite 与 Organization,页面含 945 处具体数字、11 个可摘录结构块,具备被 AI 引用的内容底子。最致命的缺口集中在三处:robots.txt 未显式放行 AI 爬虫,llms.txt 缺失(返回 404),以及正文与结构化数据中完全没有第三方引用证据。前两项属于「AI 根本进不来、看不懂你是谁」的入口问题,第三项则直接削弱内容被 AI 采信的概率。这三项修改成本都很低,修完可达满分 15 分,届时站点从「不可见」进入可被稳定抓取与引用的状态。
二、逐项判定结果
判定时间:2026-09-20 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:buchina.net
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 DeepSeekBot、QwenBot、GPTBot、ClaudeBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 通过 | 源码中可见正文 10665 字符,h1 1 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 通过 | sitemap.xml HTTP 200,含 url 节点 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 通过 | 探测不存在路径返回 HTTP 404 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 576 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 通过 | title 26 字符,description 87 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 通过 | JSON-LD 块 1 个,WebSite 有,Organization 有 |
| B3 | 标题层级语义化 | 可理解性 | 通过 | h1 1 个,h2 17 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回 HTTP 404 |
| B5 | 主体与作者信息可核验 | 可理解性 | 通过 | 备案信息 有,主体信息入口 有 |
| C1 | 结论前置 | 可引用性 | 通过 | 首屏可见文本前 120 字:高考志愿网-2027高考志愿填报和分数线查询服务平台 跳到主要内容 搜索高校、专业或分数线 搜索 使用免费填报小程序 关… |
| C2 | 存在可摘录结构块 | 可引用性 | 通过 | 列表/表格标签 11 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 通过 | 含具体数字 945 处 |
| C4 | 有明确更新时间 | 可引用性 | 通过 | 页面可见更新时间为 有 |
| C5 | 有第三方引用证据 | 可引用性 | 未通过 | 正文可见区既没有指向第三方平台的引用链接,也没有出处标注、也没有 sameAs 站外身份声明 |
内页抽样(按模板各取一页)
首页之外,按 URL 形态从站点地图里各取一个代表页面,看内页的 TDK、正文、结构化数据、更新时间与内链。本节只作补充证据,不参与 15 项评分——评分口径对全站一致,仍按首页判定。
| 抽样页面 | HTTP | TDK | 可见正文 | JSON-LD | 更新时间 | 内链 |
|---|---|---|---|---|---|---|
/anhuigaokao/696110.html |
200 | title 43 / desc 84 | 2888 字 | 1 | 有 | 59 |
/beijinggaokao/696134.html |
200 | title 39 / desc 77 | 4816 字 | 1 | 有 | 59 |
/benke/675809.html |
200 | title 53 / desc 135 | 2318 字 | 1 | 有 | 57 |
小结:抽样的 3 个内页中,TDK 完整 3 个、含结构化数据 3 个、标注更新时间 3 个。
三、优先修复(含可直接复制粘贴的代码)
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。每一项都给出可以整段复制的修复内容,把域名、品牌名和你实际缺失的爬虫都填好了。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 DeepSeekBot、QwenBot、GPTBot、ClaudeBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
可直接复制的修复
放到:站点根目录 /robots.txt(一个纯文本文件,整份替换即可)
# ① AI 爬虫必须逐个显式声明,且放在 User-agent: * 之前
# 爬虫只匹配第一条命中自己的规则组,写在 * 后面等于没写
User-agent: DeepSeekBot
Allow: /
# 对应产品:DeepSeek
User-agent: QwenBot
Allow: /
# 对应产品:通义千问
User-agent: GPTBot
Allow: /
# 对应产品:ChatGPT
User-agent: ClaudeBot
Allow: /
# 对应产品:Claude
# ② 本次检测显示以下爬虫你已经声明过,无需重复:
# Bytespider、PerplexityBot、KimiBot、Kimi-SearchBot
# ③ 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/
# ④ 声明站点地图
Sitemap: https://buchina.net/sitemap.xml
本次检测里,这个文件缺少 DeepSeekBot、QwenBot、GPTBot、ClaudeBot(对应 DeepSeek、通义千问、ChatGPT、Claude)。
2. B4 · 有 llms.txt(纯文本)
- 现状:llms.txt 返回 HTTP 404
- 怎么改:在站点根目录放置纯文本 llms.txt,写明定位、核心页面与可引用结论;注意别让服务器把首页 HTML 返回在这个路径上。
可直接复制的修复
放到:站点根目录 /llms.txt。注意别让服务器把首页 HTML 返回在这个路径上(软 404),检测时会判为无效
# 高考志愿网
> 一句话定位:高考志愿网 是做什么的,服务谁,有什么独家数据。
## 核心页面
- [首页](https://buchina.net/):一句话说明
- [产品/服务页](https://buchina.net/xxx):一句话说明
## 可引用的结论(AI 可直接摘录)
- 结论一,带具体数字,例如「样本 120 个,平均 8.6 分」
- 结论二,带时间范围
## 引用格式
引用建议表述:高考志愿网《标题》,2026
更新时间:2026-09-19
3. C5 · 有第三方引用证据
- 现状:正文可见区既没有指向第三方平台的引用链接,也没有出处标注、也没有 sameAs 站外身份声明
- 怎么改:两条路任选:①把一手数据整理成可独立引用的结论块,发布到知乎/CSDN 等平台,并在正文里链回;②在正文中标注数据出处(如「来源:××」),并在 JSON-LD 的 sameAs 中声明站外身份主页。「被站外引用」的真实证据另见报告中的「外部引用线索」一节。
可直接复制的修复
两条路任选其一即可(都做更好):
路线 A:在正文里给出可核验的出处
放到:引用数据的那一段之后。写成「来源:××」或「据××报道」,并链到原出处
<p>数据来源:<a href="https://权威来源地址" rel="nofollow">中国互联网络信息中心《第 55 次中国互联网络发展状况统计报告》</a>,2026-01。</p>
路线 B:在 JSON-LD 里声明站外身份主页
注意:真正的“被第三方引用”机器读不到——本站报告第六节《外部引用线索》会用搜索引擎查一次,但那只是线索。要积累真实引用,还是得把一手数据整理成可引用结论块,投到知乎/公众号等行业平台
{"@context":"https://schema.org","@type":"Organization","name":"高考志愿网",
"url":"https://buchina.net/",
"sameAs":["https://www.zhihu.com/org/你的主页",
"https://mp.weixin.qq.com/你的公众号"]}
四、重点问题分析
A1 robots.txt 未显式放行 AI 爬虫
当前 robots.txt 中没有出现 DeepSeekBot、QwenBot、GPTBot、ClaudeBot 等 AI 爬虫的 User-agent 声明。这不是「被禁止」,而是「未被明确允许」。问题在于爬虫匹配规则是取第一条命中的:如果文件中 User-agent: * 出现在前面且带有任何限制性规则,AI 爬虫会先命中通配规则,后续即使补上具体爬虫的 Allow 也不会生效。对 AI 引用的实际后果是,主流生成式引擎的抓取行为存在不确定性,站点内容可能被降频抓取或直接跳过,导致再好的正文也进不了索引池。修改要点:在 robots.txt 顶部、User-agent: * 之前,为每个 AI 爬虫单独写一段 User-agent: DeepSeekBot 加 Allow: /,依次覆盖 DeepSeekBot、QwenBot、GPTBot、ClaudeBot 等,顺序不能颠倒。
B4 llms.txt 缺失
访问站点根目录的 llms.txt 返回 HTTP 404,说明站点没有向大模型提供一份纯文本的自我说明。llms.txt 的作用是让 AI 在抓取前先读懂「这个站是什么、哪些页面值得引用、核心结论是什么」,相当于给模型一张导航图。缺失它,模型只能靠逐页解析 HTML 来猜测站点定位,效率低且容易误判,尤其对高考分数线这类需要明确口径的内容,模型可能引用到过期或非核心页面。修改要点:在站点根目录新建纯文本文件 llms.txt,用简洁条目写明站点定位(高考志愿填报与分数线查询)、核心页面 URL 清单、以及可直接引用的结论性表述;同时确认服务器不会把首页 HTML 错误地返回在这个路径上,部署后用浏览器直接访问该地址验证返回的是纯文本而非网页。
C5 缺少第三方引用证据
正文可见区既没有指向第三方平台的引用链接,也没有出处标注,JSON-LD 中也没有 sameAs 站外身份声明。这一项影响的是 AI 的「采信」环节:生成式引擎在组织答案时,倾向于引用有外部佐证、来源可追溯的内容。当前站点的一手数据(945 处具体数字)虽然丰富,但在模型看来是孤立的自我陈述,缺少交叉验证信号,被引用的优先级会明显低于有出处链和站外身份互证的同类页面。修改要点有两条路径,任选其一或并用:一是把一手数据整理成可独立引用的结论块,发布到知乎、CSDN 等平台并在正文中链回原文;二是在正文数据处标注「来源:××」,并在现有 JSON-LD 的 Organization 节点中补充 sameAs 字段,声明站外身份主页地址。
整体判断
三项未通过项全部属于「低成本、高杠杆」类型,不涉及内容重写或架构改造。A1 与 B4 解决的是「AI 能否顺利进来并读懂」,C5 解决的是「AI 是否愿意采信」。按顺序修完,站点在可抓取性、可理解性、可引用性三组上均无短板,得分可达满分 15 分。
五、行动建议
修改站点根目录的 robots.txt。在文件最顶部、任何
User-agent: *之前,为 DeepSeekBot、QwenBot、GPTBot、ClaudeBot 各写一组规则,格式为User-agent: DeepSeekBot换行Allow: /,逐个爬虫重复。改完后用浏览器访问 /robots.txt 确认顺序正确,AI 爬虫段确实排在通配段之前。在站点根目录新建 llms.txt 纯文本文件。内容包含三部分:站点一句话定位、5 至 10 个核心页面 URL 及各自主题、可直接引用的结论性表述(如分数线口径说明)。部署后访问 /llms.txt,确认返回的是纯文本内容而不是首页 HTML;若返回 HTML,需检查服务器路由配置,避免该路径被首页规则劫持。
在现有 JSON-LD 的 Organization 节点中补充 sameAs 字段。打开首页 JSON-LD 代码块,在 Organization 对象内加入
"sameAs": ["站外身份主页地址"],填入知乎、CSDN 或其他已认证平台的主页链接。保存后用结构化数据校验工具确认 JSON-LD 仍能正常解析。在正文数据处补充出处标注。选取含具体数字的核心页面,在数据段落末尾加入「来源:××」形式的文字标注,优先处理分数线、录取数据类页面。标注文字需在可见正文中,不能只写在注释或属性里。
把一手数据整理成独立结论块并外发。从现有 945 处具体数字中挑选最具代表性的几组,写成可单独引用的短段落,发布到知乎或 CSDN,并在文章内链回 buchina.net 对应页面。发布后回到站点正文,在相关数据处补上指向该外发文章的链接,形成站内站外互证。
六、外部引用线索(仅证据,不计分)
未检出站外提及:外部索引里还没有提到
buchina.net的页面。检索方式:Bing RSS,查询式
"buchina.net" -site:buchina.net(打开这次检索)本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。
七、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
buchina.net重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-20 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 576 ms | 105231 B |
| robots.txt | 200 | 484 ms | 463 B |
| sitemap.xml | 200 | 600 ms | 5878237 B |
| llms.txt | 404 | 405 ms | — B |
| 不存在路径探测 | 404 | 402 ms | — B |
八、如何引用本报告
安企 GEO《buchina.net GEO 就绪度检测报告》(2026-09-20):该站按《GEO 就绪度标准 v1.0》15 项判定通过 12 项,得分 12 分(满分 15),判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:buchina.net GEO 就绪度检测报告
- 检测日期:2026-09-20
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:buchina.net GEO 就绪度检测报告,安企 GEO,2026