检测结论:
www.baidu.com在《GEO 就绪度标准 v1.0》的 15 项判定中通过 2 项,得分 2⁄15,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
本次检测针对 www.baidu.com,依据《GEO 就绪度标准 v1.0》的 15 项检查,得分 2/15,判定等级为「不可见」。站点在基础可达性上没有硬伤:A4(无软 404)、A5(HTTPS 有效、首页 200、响应 204 ms)均通过,说明服务器与协议层是健康的。但除此之外,从抓取到引用三层几乎全部失守,最致命的缺口集中在两点:一是源码层面没有可被 AI 爬虫读到的正文,A2 显示源码可见正文 0 字符、h1 0 个,B1 的 title 与 description 均为 0 字符,意味着 AI 抓到的是一副空壳;二是站点没有对 AI 生态做任何显式声明,A1 未放行 Bytespider、DeepSeekBot、QwenBot、GPTBot,A3 的 sitemap.xml 与 B4 的 llms.txt 均返回 404。可引用性一组(C1–C5)全部未通过,说明即便内容被抓到,也缺少结论前置、结构块、一手数据、更新时间与第三方引用这些被引用的必要条件。这些问题的修复不涉及内容质量本身,主要是工程与服务端渲染层面的补齐。按优先级修完 A2、A1、A3/B4、B1/B2/B3 后,站点可从「不可见」进入「可抓取、可理解」区间,预计得分可提升至 9–11 分,具备被 AI 正常收录的基础条件,再叠加 C 组的内容改造才谈得上被稳定引用。
二、逐项判定结果
判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:www.baidu.com
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 未通过 | 源码中可见正文 0 字符,h1 0 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 未通过 | sitemap.xml HTTP 404 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 通过 | 探测不存在路径返回 HTTP 404 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 204 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 未通过 | title 0 字符,description 0 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 未通过 | JSON-LD 块 0 个,WebSite 无,Organization 无 |
| B3 | 标题层级语义化 | 可理解性 | 未通过 | h1 0 个,h2 0 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回 HTTP 404 |
| B5 | 主体与作者信息可核验 | 可理解性 | 未通过 | 备案信息 无,主体信息入口 无 |
| C1 | 结论前置 | 可引用性 | 未通过 | 首屏可见文本前 120 字: |
| C2 | 存在可摘录结构块 | 可引用性 | 未通过 | 列表/表格标签 0 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 未通过 | 含具体数字 0 处 |
| C4 | 有明确更新时间 | 可引用性 | 未通过 | 页面可见更新时间为 无 |
| C5 | 有第三方引用证据 | 可引用性 | 未通过 | 第三方平台引用 无 |
三、优先修复的三件事
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
2. A2 · 关键内容不依赖 JS 渲染
- 现状:源码中可见正文 0 字符,h1 0 个
- 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。
3. A3 · 有 sitemap 且内容有效
- 现状:sitemap.xml HTTP 404
- 怎么改:生成 sitemap.xml(sitemapindex 亦可),并在 robots.txt 中声明它的地址。
四、重点问题分析
A2 源码中无正文,AI 爬虫抓到的是空壳
这是当前最底层、也最致命的问题。证据显示源码中可见正文 0 字符、h1 0 个,而 A5 表明首页 HTTP 200、响应 204 ms。两者结合说明:页面能返回,但返回的 HTML 里没有内容,正文很可能依赖客户端 JS 在浏览器中渲染后才出现。主流 AI 爬虫(GPTBot、Bytespider、DeepSeekBot 等)通常只取原始 HTML,不执行页面脚本,因此它们看到的就是一个没有文字、没有标题的空文档。后果是:无论后续的 TDK、结构化数据、结论前置做得多好,AI 都没有可读的素材,引用无从谈起。修改要点是把关键内容改为服务端渲染(SSR)或静态生成,确保原始 HTML 中直接包含正文段落与唯一的 h1;对必须由 JS 加载的部分,至少提供 noscript 兜底或预渲染快照。
A1 robots.txt 未放行 AI 爬虫
证据显示 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 UA。标准要求把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前,因为爬虫只匹配第一条命中的规则。若站点当前的通用规则是 Disallow 或存在限制性配置,AI 爬虫会在第一步就被挡在门外,后续所有优化都不会被看到。修改要点是打开 robots.txt,在文件顶部为每个目标 AI 爬虫单独写一组规则并显式 Allow: /,再保留通配规则;同时确认没有对上述 UA 做服务端层面的拦截或限流。
A3 与 B4 缺少 sitemap 与 llms.txt
证据显示 sitemap.xml 返回 HTTP 404,llms.txt 同样返回 404。sitemap 是 AI 爬虫发现全站 URL 的主要入口,缺失会导致抓取依赖外链、覆盖面不可控;llms.txt 则是站点向大模型主动说明「我是谁、哪些页面值得引用」的纯文本清单,缺失意味着放弃了这一低成本的定义权。修改要点是生成 sitemap.xml(或 sitemapindex)并在 robots.txt 中声明其地址;在根目录放置纯文本 llms.txt,写明站点定位、核心页面链接与可引用结论,并确认服务器没有把首页 HTML 错误地返回在这个路径上。
B1 与 B3 缺失 TDK 与标题层级
证据显示 title 0 字符、description 0 字符,h1 0 个、h2 0 个。TDK 是 AI 判断页面主题最直接的信号,标题层级则决定内容结构能否被解析成段落与要点。两者同时缺失,加上 A2 的无正文,等于页面在语义层完全空白。修改要点是每页补全唯一的 title(≤60 字符)与 description(≥50 字符),并保证互不重复;正文中只保留一个 h1,用 h2/h3 组织层级,避免用加粗 div 冒充标题。
C 组整体失守带来的引用障碍
C1–C5 全部未通过:首屏前 120 字为空、列表与表格标签 0 个、含具体数字 0 处、无更新时间、无第三方引用。即便抓取与理解层修好,AI 仍缺少可整段摘录的结构块和可核查的一手数据,引用意愿会很低。这部分属于内容改造,建议在工程问题解决后再推进。
五、行动建议
先解决正文渲染(对应 A2,投入产出最高):把首页及核心内容页从客户端渲染改为服务端渲染或静态生成,确保直接请求页面时返回的 HTML 源码中就包含正文文字与一个 h1。改完后用 curl 或查看源代码的方式复核「源码可见正文字符数」是否大于 0。
修改 robots.txt 放行 AI 爬虫(对应 A1):在 robots.txt 文件最顶部,为 GPTBot、Bytespider、DeepSeekBot、QwenBot 等分别写入一组
User-agent: <名称>+Allow: /,务必放在User-agent: *之前,因为爬虫只匹配第一条命中的规则;同时确认服务器未对这些 UA 做拦截。补齐 sitemap.xml 与 llms.txt(对应 A3、B4):生成 sitemap.xml(可用 sitemapindex 组织),并在 robots.txt 中加一行
Sitemap: https://www.baidu.com/sitemap.xml;在站点根目录新增纯文本llms.txt,写明站点定位、核心页面 URL 与可引用结论,并确认访问该路径返回的是文本而非首页 HTML。补全 TDK 与标题层级(对应 B1、B3):在页面模板的 head 中补齐 title(≤60 字符)与 meta description(≥50 字符),确保每页唯一;正文模板中只保留一个 h1,用 h2/h3 组织层级,移除用加粗 div 充当标题的写法。
补结构化数据与主体信息(对应 B2、B5):在 head 中注入 JSON-LD,至少包含 WebSite 与 Organization 两个块,文章页再加 Article、问答页加 FAQPage;在页脚展示备案号,并提供「关于我们」或联系方式入口,使主体信息可核验。
六、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
www.baidu.com重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C1/C3/C5 三项由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 204 ms | 227 B |
| robots.txt | 200 | 142 ms | 2814 B |
| sitemap.xml | 404 | 153 ms | — B |
| llms.txt | 404 | 171 ms | — B |
| 不存在路径探测 | 404 | 129 ms | — B |
七、如何引用本报告
安企 GEO《www.baidu.com GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 2 项,得分 2/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:www.baidu.com GEO 就绪度检测报告
- 检测日期:2026-09-19
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:www.baidu.com GEO 就绪度检测报告,安企 GEO,2026