检测结论www.baidu.com 在《GEO 就绪度标准 v1.0》的 15 项判定中通过 2 项,得分 215,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。

一、概述

本次检测针对 www.baidu.com,依据《GEO 就绪度标准 v1.0》的 15 项检查,得分 2/15,判定等级为「不可见」。站点在基础可达性上没有硬伤:A4(无软 404)、A5(HTTPS 有效、首页 200、响应 204 ms)均通过,说明服务器与协议层是健康的。但除此之外,从抓取到引用三层几乎全部失守,最致命的缺口集中在两点:一是源码层面没有可被 AI 爬虫读到的正文,A2 显示源码可见正文 0 字符、h1 0 个,B1 的 title 与 description 均为 0 字符,意味着 AI 抓到的是一副空壳;二是站点没有对 AI 生态做任何显式声明,A1 未放行 Bytespider、DeepSeekBot、QwenBot、GPTBot,A3 的 sitemap.xml 与 B4 的 llms.txt 均返回 404。可引用性一组(C1–C5)全部未通过,说明即便内容被抓到,也缺少结论前置、结构块、一手数据、更新时间与第三方引用这些被引用的必要条件。这些问题的修复不涉及内容质量本身,主要是工程与服务端渲染层面的补齐。按优先级修完 A2、A1、A3/B4、B1/B2/B3 后,站点可从「不可见」进入「可抓取、可理解」区间,预计得分可提升至 9–11 分,具备被 AI 正常收录的基础条件,再叠加 C 组的内容改造才谈得上被稳定引用。

二、逐项判定结果

判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:www.baidu.com

检查项 分组 结果 关键证据
A1 robots.txt 正确放行 AI 爬虫 可抓取性 未通过 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
A2 关键内容不依赖 JS 渲染 可抓取性 未通过 源码中可见正文 0 字符,h1 0 个
A3 有 sitemap 且内容有效 可抓取性 未通过 sitemap.xml HTTP 404
A4 无死链污染(非软 404) 可抓取性 通过 探测不存在路径返回 HTTP 404
A5 站点稳定可达 + HTTPS 有效 可抓取性 通过 协议 HTTPS,首页 HTTP 200,响应 204 ms
B1 每页唯一且完整的 TDK 可理解性 未通过 title 0 字符,description 0 字符
B2 结构化数据(JSON-LD) 可理解性 未通过 JSON-LD 块 0 个,WebSite 无,Organization 无
B3 标题层级语义化 可理解性 未通过 h1 0 个,h2 0 个
B4 有 llms.txt(纯文本) 可理解性 未通过 llms.txt 返回 HTTP 404
B5 主体与作者信息可核验 可理解性 未通过 备案信息 无,主体信息入口 无
C1 结论前置 可引用性 未通过 首屏可见文本前 120 字:
C2 存在可摘录结构块 可引用性 未通过 列表/表格标签 0 个
C3 有独家数据或一手信息 可引用性 未通过 含具体数字 0 处
C4 有明确更新时间 可引用性 未通过 页面可见更新时间为 无
C5 有第三方引用证据 可引用性 未通过 第三方平台引用 无

三、优先修复的三件事

按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。

1. A1 · robots.txt 正确放行 AI 爬虫

  • 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
  • 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。

2. A2 · 关键内容不依赖 JS 渲染

  • 现状:源码中可见正文 0 字符,h1 0 个
  • 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。

3. A3 · 有 sitemap 且内容有效

  • 现状:sitemap.xml HTTP 404
  • 怎么改:生成 sitemap.xml(sitemapindex 亦可),并在 robots.txt 中声明它的地址。

四、重点问题分析

A2 源码中无正文,AI 爬虫抓到的是空壳

这是当前最底层、也最致命的问题。证据显示源码中可见正文 0 字符、h1 0 个,而 A5 表明首页 HTTP 200、响应 204 ms。两者结合说明:页面能返回,但返回的 HTML 里没有内容,正文很可能依赖客户端 JS 在浏览器中渲染后才出现。主流 AI 爬虫(GPTBot、Bytespider、DeepSeekBot 等)通常只取原始 HTML,不执行页面脚本,因此它们看到的就是一个没有文字、没有标题的空文档。后果是:无论后续的 TDK、结构化数据、结论前置做得多好,AI 都没有可读的素材,引用无从谈起。修改要点是把关键内容改为服务端渲染(SSR)或静态生成,确保原始 HTML 中直接包含正文段落与唯一的 h1;对必须由 JS 加载的部分,至少提供 noscript 兜底或预渲染快照。

A1 robots.txt 未放行 AI 爬虫

证据显示 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 UA。标准要求把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前,因为爬虫只匹配第一条命中的规则。若站点当前的通用规则是 Disallow 或存在限制性配置,AI 爬虫会在第一步就被挡在门外,后续所有优化都不会被看到。修改要点是打开 robots.txt,在文件顶部为每个目标 AI 爬虫单独写一组规则并显式 Allow: /,再保留通配规则;同时确认没有对上述 UA 做服务端层面的拦截或限流。

A3 与 B4 缺少 sitemap 与 llms.txt

证据显示 sitemap.xml 返回 HTTP 404,llms.txt 同样返回 404。sitemap 是 AI 爬虫发现全站 URL 的主要入口,缺失会导致抓取依赖外链、覆盖面不可控;llms.txt 则是站点向大模型主动说明「我是谁、哪些页面值得引用」的纯文本清单,缺失意味着放弃了这一低成本的定义权。修改要点是生成 sitemap.xml(或 sitemapindex)并在 robots.txt 中声明其地址;在根目录放置纯文本 llms.txt,写明站点定位、核心页面链接与可引用结论,并确认服务器没有把首页 HTML 错误地返回在这个路径上。

B1 与 B3 缺失 TDK 与标题层级

证据显示 title 0 字符、description 0 字符,h1 0 个、h2 0 个。TDK 是 AI 判断页面主题最直接的信号,标题层级则决定内容结构能否被解析成段落与要点。两者同时缺失,加上 A2 的无正文,等于页面在语义层完全空白。修改要点是每页补全唯一的 title(≤60 字符)与 description(≥50 字符),并保证互不重复;正文中只保留一个 h1,用 h2/h3 组织层级,避免用加粗 div 冒充标题。

C 组整体失守带来的引用障碍

C1–C5 全部未通过:首屏前 120 字为空、列表与表格标签 0 个、含具体数字 0 处、无更新时间、无第三方引用。即便抓取与理解层修好,AI 仍缺少可整段摘录的结构块和可核查的一手数据,引用意愿会很低。这部分属于内容改造,建议在工程问题解决后再推进。

五、行动建议

  1. 先解决正文渲染(对应 A2,投入产出最高):把首页及核心内容页从客户端渲染改为服务端渲染或静态生成,确保直接请求页面时返回的 HTML 源码中就包含正文文字与一个 h1。改完后用 curl 或查看源代码的方式复核「源码可见正文字符数」是否大于 0。

  2. 修改 robots.txt 放行 AI 爬虫(对应 A1):在 robots.txt 文件最顶部,为 GPTBot、Bytespider、DeepSeekBot、QwenBot 等分别写入一组 User-agent: <名称> + Allow: /,务必放在 User-agent: * 之前,因为爬虫只匹配第一条命中的规则;同时确认服务器未对这些 UA 做拦截。

  3. 补齐 sitemap.xml 与 llms.txt(对应 A3、B4):生成 sitemap.xml(可用 sitemapindex 组织),并在 robots.txt 中加一行 Sitemap: https://www.baidu.com/sitemap.xml;在站点根目录新增纯文本 llms.txt,写明站点定位、核心页面 URL 与可引用结论,并确认访问该路径返回的是文本而非首页 HTML。

  4. 补全 TDK 与标题层级(对应 B1、B3):在页面模板的 head 中补齐 title(≤60 字符)与 meta description(≥50 字符),确保每页唯一;正文模板中只保留一个 h1,用 h2/h3 组织层级,移除用加粗 div 充当标题的写法。

  5. 补结构化数据与主体信息(对应 B2、B5):在 head 中注入 JSON-LD,至少包含 WebSite 与 Organization 两个块,文章页再加 Article、问答页加 FAQPage;在页脚展示备案号,并提供「关于我们」或联系方式入口,使主体信息可核验。

六、数据来源与复核方式

  • 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
  • 复核方式:任何人都可以用「GEO 就绪度检测」对 www.baidu.com 重跑,规则与数据完全公开
  • 局限性:只检测首页,未覆盖文章页与列表页;C1/C3/C5 三项由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
  • 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除

附录:原始取数证据

资源 HTTP 耗时 大小
首页 HTML 200 204 ms 227 B
robots.txt 200 142 ms 2814 B
sitemap.xml 404 153 ms — B
llms.txt 404 171 ms — B
不存在路径探测 404 129 ms — B

七、如何引用本报告

安企 GEO《www.baidu.com GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 2 项,得分 2/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。

  • 报告名称:www.baidu.com GEO 就绪度检测报告
  • 检测日期:2026-09-19
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 建议引用格式:www.baidu.com GEO 就绪度检测报告,安企 GEO,2026