检测结论:
qq.com在《GEO 就绪度标准 v1.0》的 15 项判定中通过 6 项,得分 6 分(满分 15),判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
本次检测依据《GEO 就绪度标准 v1.0》对 qq.com 的 15 项指标进行核验,通过 6 项,得分 6 分,判定为「不可见」等级。站点基础可达性没有问题,HTTPS 有效、首页响应 257 ms,内容侧也具备一定优势:正文含具体数字 1339 处,存在可摘录结构块与指向微信的第三方引用链接。最致命的缺口集中在可抓取性与可理解性两组:robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,源码中 h1 为 0 个、标题层级缺失,JSON-LD 结构化数据为 0 块,llms.txt 路径实际返回网页 HTML 形成软 404,sitemap 虽有 HTTP 200 但未被有效声明,不存在的路径也返回 200 形成软 404 污染。这些问题叠加,使 AI 既难以稳定抓取,也难以准确理解页面主体与内容归属。优先修复 A1、A4、B2、B3 四项后,抓取与理解链路即可打通,配合补全 llms.txt 与更新时间,修完可达满分 15 分。
二、逐项判定结果
判定时间:2026-09-20 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:qq.com
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 未通过 | 源码中可见正文 1322 字符,h1 0 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 未通过 | sitemap.xml HTTP 200 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 未通过 | 探测不存在路径返回 HTTP 200 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 257 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 通过 | title 3 字符,description 159 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 未通过 | JSON-LD 块 0 个,WebSite 无,Organization 无 |
| B3 | 标题层级语义化 | 可理解性 | 未通过 | h1 0 个,h2 0 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回的是网页 HTML(软 404),并非纯文本 |
| B5 | 主体与作者信息可核验 | 可理解性 | 未通过 | 备案信息 无,主体信息入口 有 |
| C1 | 结论前置 | 可引用性 | 通过 | 首屏可见文本前 120 字:腾讯网 搜索 问AI 邮箱 网页设置 快捷访问 安装电脑版 内容更精彩 要闻 科技 财经 AI 热问 教育 国际 军事 … |
| C2 | 存在可摘录结构块 | 可引用性 | 通过 | 列表/表格标签 1 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 通过 | 含具体数字 1339 处 |
| C4 | 有明确更新时间 | 可引用性 | 未通过 | 页面可见更新时间为 无 |
| C5 | 有第三方引用证据 | 可引用性 | 通过 | 正文可见区有指向 微信 的引用链接 |
内页抽样(按模板各取一页)
首页之外,按 URL 形态从站点地图里各取一个代表页面,看内页的 TDK、正文、结构化数据、更新时间与内链。本节只作补充证据,不参与 15 项评分——评分口径对全站一致,仍按首页判定。
| 抽样页面 | HTTP | TDK | 可见正文 | JSON-LD | 更新时间 | 内链 |
|---|---|---|---|---|---|---|
/ch/tech/ |
200 | title 3 / desc 159 | 3 字 | 0 | 无 | 0 |
/ch/finance/ |
200 | title 3 / desc 159 | 3 字 | 0 | 无 | 0 |
/ch/fx |
200 | title 3 / desc 159 | 3 字 | 0 | 无 | 0 |
小结:抽样的 3 个内页中,TDK 完整 3 个、含结构化数据 0 个、标注更新时间 0 个。
三、优先修复(含可直接复制粘贴的代码)
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。每一项都给出可以整段复制的修复内容,把域名、品牌名和你实际缺失的爬虫都填好了。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
可直接复制的修复
放到:站点根目录 /robots.txt(一个纯文本文件,整份替换即可)
# ① AI 爬虫必须逐个显式声明,且放在 User-agent: * 之前
# 爬虫只匹配第一条命中自己的规则组,写在 * 后面等于没写
User-agent: Bytespider
Allow: /
# 对应产品:豆包
User-agent: DeepSeekBot
Allow: /
# 对应产品:DeepSeek
User-agent: QwenBot
Allow: /
# 对应产品:通义千问
User-agent: GPTBot
Allow: /
# 对应产品:ChatGPT
# ② 本次检测显示以下爬虫你已经声明过,无需重复:
# ClaudeBot、PerplexityBot、KimiBot、Kimi-SearchBot
# ③ 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/
# ④ 声明站点地图
Sitemap: https://qq.com/sitemap.xml
本次检测里,这个文件缺少 Bytespider、DeepSeekBot、QwenBot、GPTBot(对应 豆包、DeepSeek、通义千问、ChatGPT)。
2. A2 · 关键内容不依赖 JS 渲染
- 现状:源码中可见正文 1322 字符,h1 0 个
- 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。
可直接复制的修复
若源码里几乎没有正文,三种改法(任选):
- Next.js:
getServerSideProps/ Server Component 输出内容; - Nuxt:
ssr: true(默认)并把关键内容放在服务端; - 静态站:构建时预渲染(
nuxt generate/next export/ 或纯 HTML)。 同时给不执行 JS 的客户端留一份<noscript>说明。
# 先用这条确认正文是否出现在源码里(AI 爬虫大多不执行 JS)
curl -s https://qq.com/ | grep -c "<h1"
curl -s https://qq.com/ | wc -c
3. A3 · 有 sitemap 且内容有效
- 现状:sitemap.xml HTTP 200
- 怎么改:生成 sitemap.xml(sitemapindex 亦可),并在 robots.txt 中声明它的地址。
可直接复制的修复
放到:站点根目录 /sitemap.xml,并在 robots.txt 里加一行 Sitemap: https://qq.com/sitemap.xml。文章量大的站建议用 sitemapindex 分片
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://qq.com/</loc>
<lastmod>2026-09-19</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>
四、重点问题分析
robots.txt 未放行 AI 爬虫,抓取入口被默认规则拦截
站点 robots.txt 中未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫的 User-agent 与 Allow 规则。按爬虫匹配逻辑,只命中第一条生效规则,若这些爬虫落入 User-agent: * 的分支,其抓取权限就由通配规则决定,而不是站点主动授予。对 AI 引擎而言,这意味着内容可能被直接跳过或在抓取阶段被降权,后续所有理解与引用都无从谈起。修改要点:在 robots.txt 中把每个 AI 爬虫的 User-agent 加 Allow: / 逐条写在 User-agent: * 之前,并显式声明 sitemap 地址。
标题层级缺失,正文结构无法被解析
源码中可见正文 1322 字符,但 h1 为 0 个、h2 为 0 个。正文虽然存在于 HTML 中,却没有语义化标题来界定主题与段落归属。AI 抽取答案时依赖标题判断「这一页在讲什么」「哪一段是核心结论」,缺少 h1 会导致页面主题无法被稳定识别,h2 缺失则让长正文退化为无结构文本,摘录时容易断章取义。修改要点:每页保留唯一 h1,用 h2/h3 组织层级,不要用加粗的 div 冒充标题,并确保标题文本与页面主题一致。
结构化数据为 0,实体与内容类型无法声明
检测显示 JSON-LD 块 0 个,WebSite 与 Organization 均无。这意味着 AI 无法从机器可读层面确认站点身份、主体归属与页面类型,只能靠正文猜测。对于聚合型站点,缺少 WebSite 与 Organization 会削弱品牌实体与内容之间的关联,文章页与问答页也无法被识别为 Article 或 FAQPage,直接影响引用时的来源标注。修改要点:全站模板补 WebSite 与 Organization 的 JSON-LD,文章页加 Article(含 headline、datePublished、dateModified),问答页加 FAQPage。
软 404 污染抓取预算,llms.txt 路径被错误重写
探测不存在路径返回 HTTP 200,说明服务器把未知 URL 重写到了首页,形成软 404;llms.txt 同样返回网页 HTML 而非纯文本,属于同一类问题。对 AI 抓取而言,软 404 会让爬虫把大量不存在的地址当作有效页面反复抓取,浪费抓取预算,也稀释真实内容的权重;llms.txt 被重写则使站点失去一个直接向模型说明定位与核心页面的入口。修改要点:让不存在的路径返回 404,不要重写到首页;在站点根目录放置纯文本 llms.txt,写明站点定位、核心页面与可引用结论,并确认服务器不会把首页 HTML 返回在该路径上。
五、行动建议
修改根目录 robots.txt:在
User-agent: *之前逐条写入User-agent: Bytespider、User-agent: DeepSeekBot、User-agent: QwenBot、User-agent: GPTBot,每条下加Allow: /;同时在文件末尾加一行Sitemap: https://qq.com/sitemap.xml,让 AI 爬虫既能抓取也能发现站点地图。修复软 404:检查服务器与 CDN 的重写规则,把未匹配到真实页面的请求改为返回 HTTP 404 状态码,而不是 200 重写到首页;单独检查 llms.txt 路径的规则,确保它返回纯文本而不是首页 HTML。
在站点根目录新增纯文本 llms.txt:用 Markdown 或纯文本写明站点定位、核心栏目链接与可引用结论,避免在该路径返回任何 HTML 内容;同步确认 sitemap.xml 可正常访问且被 robots.txt 声明。
改造页面模板的标题层级:确保每页输出唯一 h1,正文用 h2/h3 分节,替换掉目前用加粗 div 充当标题的写法;对依赖 JS 渲染的正文,改为服务端渲染或在源码中直接输出可读正文与 h1。
在全站模板注入 JSON-LD:首页补 WebSite 与 Organization,文章页补 Article(含 headline、datePublished、dateModified),问答页补 FAQPage;同时在页脚展示备案号与主体信息入口,并在页面显著位置标注「更新于 YYYY-MM-DD」,让 AI 能判断内容新鲜度与来源可信度。
六、外部引用线索(仅证据,不计分)
未检出站外提及:外部索引里还没有提到
qq.com的页面。检索方式:Bing RSS,查询式
"qq.com" -site:qq.com(打开这次检索)本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。
七、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
qq.com重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-20 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 257 ms | 121445 B |
| robots.txt | 200 | 465 ms | 71 B |
| sitemap.xml | 200 | 705 ms | 4183 B |
| llms.txt | 200 | 647 ms | 4183 B |
| 不存在路径探测 | 200 | 702 ms | 4183 B |
八、如何引用本报告
安企 GEO《qq.com GEO 就绪度检测报告》(2026-09-20):该站按《GEO 就绪度标准 v1.0》15 项判定通过 6 项,得分 6 分(满分 15),判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:qq.com GEO 就绪度检测报告
- 检测日期:2026-09-20
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:qq.com GEO 就绪度检测报告,安企 GEO,2026