检测结论qq.com 在《GEO 就绪度标准 v1.0》的 15 项判定中通过 6 项得分 6 分(满分 15),判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。

一、概述

本次检测依据《GEO 就绪度标准 v1.0》对 qq.com 的 15 项指标进行核验,通过 6 项,得分 6 分,判定为「不可见」等级。站点基础可达性没有问题,HTTPS 有效、首页响应 257 ms,内容侧也具备一定优势:正文含具体数字 1339 处,存在可摘录结构块与指向微信的第三方引用链接。最致命的缺口集中在可抓取性与可理解性两组:robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,源码中 h1 为 0 个、标题层级缺失,JSON-LD 结构化数据为 0 块,llms.txt 路径实际返回网页 HTML 形成软 404,sitemap 虽有 HTTP 200 但未被有效声明,不存在的路径也返回 200 形成软 404 污染。这些问题叠加,使 AI 既难以稳定抓取,也难以准确理解页面主体与内容归属。优先修复 A1、A4、B2、B3 四项后,抓取与理解链路即可打通,配合补全 llms.txt 与更新时间,修完可达满分 15 分。

二、逐项判定结果

判定时间:2026-09-20 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:qq.com

检查项 分组 结果 关键证据
A1 robots.txt 正确放行 AI 爬虫 可抓取性 未通过 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
A2 关键内容不依赖 JS 渲染 可抓取性 未通过 源码中可见正文 1322 字符,h1 0 个
A3 有 sitemap 且内容有效 可抓取性 未通过 sitemap.xml HTTP 200
A4 无死链污染(非软 404) 可抓取性 未通过 探测不存在路径返回 HTTP 200
A5 站点稳定可达 + HTTPS 有效 可抓取性 通过 协议 HTTPS,首页 HTTP 200,响应 257 ms
B1 每页唯一且完整的 TDK 可理解性 通过 title 3 字符,description 159 字符
B2 结构化数据(JSON-LD) 可理解性 未通过 JSON-LD 块 0 个,WebSite 无,Organization 无
B3 标题层级语义化 可理解性 未通过 h1 0 个,h2 0 个
B4 有 llms.txt(纯文本) 可理解性 未通过 llms.txt 返回的是网页 HTML(软 404),并非纯文本
B5 主体与作者信息可核验 可理解性 未通过 备案信息 无,主体信息入口 有
C1 结论前置 可引用性 通过 首屏可见文本前 120 字:腾讯网 搜索 问AI 邮箱 网页设置 快捷访问 安装电脑版 内容更精彩 要闻 科技 财经 AI 热问 教育 国际 军事 …
C2 存在可摘录结构块 可引用性 通过 列表/表格标签 1 个
C3 有独家数据或一手信息 可引用性 通过 含具体数字 1339 处
C4 有明确更新时间 可引用性 未通过 页面可见更新时间为 无
C5 有第三方引用证据 可引用性 通过 正文可见区有指向 微信 的引用链接

内页抽样(按模板各取一页)

首页之外,按 URL 形态从站点地图里各取一个代表页面,看内页的 TDK、正文、结构化数据、更新时间与内链。本节只作补充证据,不参与 15 项评分——评分口径对全站一致,仍按首页判定。

抽样页面 HTTP TDK 可见正文 JSON-LD 更新时间 内链
/ch/tech/ 200 title 3 / desc 159 3 字 0 0
/ch/finance/ 200 title 3 / desc 159 3 字 0 0
/ch/fx 200 title 3 / desc 159 3 字 0 0

小结:抽样的 3 个内页中,TDK 完整 3 个、含结构化数据 0 个、标注更新时间 0 个。

三、优先修复(含可直接复制粘贴的代码)

按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。每一项都给出可以整段复制的修复内容,把域名、品牌名和你实际缺失的爬虫都填好了。

1. A1 · robots.txt 正确放行 AI 爬虫

  • 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
  • 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。

可直接复制的修复

放到:站点根目录 /robots.txt(一个纯文本文件,整份替换即可)

# ① AI 爬虫必须逐个显式声明,且放在 User-agent: * 之前
#    爬虫只匹配第一条命中自己的规则组,写在 * 后面等于没写

User-agent: Bytespider
Allow: /
# 对应产品:豆包

User-agent: DeepSeekBot
Allow: /
# 对应产品:DeepSeek

User-agent: QwenBot
Allow: /
# 对应产品:通义千问

User-agent: GPTBot
Allow: /
# 对应产品:ChatGPT

# ② 本次检测显示以下爬虫你已经声明过,无需重复:
#    ClaudeBot、PerplexityBot、KimiBot、Kimi-SearchBot

# ③ 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/

# ④ 声明站点地图
Sitemap: https://qq.com/sitemap.xml

本次检测里,这个文件缺少 Bytespider、DeepSeekBot、QwenBot、GPTBot(对应 豆包、DeepSeek、通义千问、ChatGPT)。

2. A2 · 关键内容不依赖 JS 渲染

  • 现状:源码中可见正文 1322 字符,h1 0 个
  • 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。

可直接复制的修复

若源码里几乎没有正文,三种改法(任选):

  1. Next.jsgetServerSideProps / Server Component 输出内容;
  2. Nuxtssr: true(默认)并把关键内容放在服务端;
  3. 静态站:构建时预渲染(nuxt generate / next export / 或纯 HTML)。 同时给不执行 JS 的客户端留一份 <noscript> 说明。
# 先用这条确认正文是否出现在源码里(AI 爬虫大多不执行 JS)
curl -s https://qq.com/ | grep -c "<h1"
curl -s https://qq.com/ | wc -c

3. A3 · 有 sitemap 且内容有效

  • 现状:sitemap.xml HTTP 200
  • 怎么改:生成 sitemap.xml(sitemapindex 亦可),并在 robots.txt 中声明它的地址。

可直接复制的修复

放到:站点根目录 /sitemap.xml,并在 robots.txt 里加一行 Sitemap: https://qq.com/sitemap.xml。文章量大的站建议用 sitemapindex 分片

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://qq.com/</loc>
    <lastmod>2026-09-19</lastmod>
    <changefreq>daily</changefreq>
    <priority>1.0</priority>
  </url>
</urlset>

四、重点问题分析

robots.txt 未放行 AI 爬虫,抓取入口被默认规则拦截

站点 robots.txt 中未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫的 User-agent 与 Allow 规则。按爬虫匹配逻辑,只命中第一条生效规则,若这些爬虫落入 User-agent: * 的分支,其抓取权限就由通配规则决定,而不是站点主动授予。对 AI 引擎而言,这意味着内容可能被直接跳过或在抓取阶段被降权,后续所有理解与引用都无从谈起。修改要点:在 robots.txt 中把每个 AI 爬虫的 User-agentAllow: / 逐条写在 User-agent: * 之前,并显式声明 sitemap 地址。

标题层级缺失,正文结构无法被解析

源码中可见正文 1322 字符,但 h1 为 0 个、h2 为 0 个。正文虽然存在于 HTML 中,却没有语义化标题来界定主题与段落归属。AI 抽取答案时依赖标题判断「这一页在讲什么」「哪一段是核心结论」,缺少 h1 会导致页面主题无法被稳定识别,h2 缺失则让长正文退化为无结构文本,摘录时容易断章取义。修改要点:每页保留唯一 h1,用 h2/h3 组织层级,不要用加粗的 div 冒充标题,并确保标题文本与页面主题一致。

结构化数据为 0,实体与内容类型无法声明

检测显示 JSON-LD 块 0 个,WebSite 与 Organization 均无。这意味着 AI 无法从机器可读层面确认站点身份、主体归属与页面类型,只能靠正文猜测。对于聚合型站点,缺少 WebSite 与 Organization 会削弱品牌实体与内容之间的关联,文章页与问答页也无法被识别为 Article 或 FAQPage,直接影响引用时的来源标注。修改要点:全站模板补 WebSite 与 Organization 的 JSON-LD,文章页加 Article(含 headline、datePublished、dateModified),问答页加 FAQPage。

软 404 污染抓取预算,llms.txt 路径被错误重写

探测不存在路径返回 HTTP 200,说明服务器把未知 URL 重写到了首页,形成软 404;llms.txt 同样返回网页 HTML 而非纯文本,属于同一类问题。对 AI 抓取而言,软 404 会让爬虫把大量不存在的地址当作有效页面反复抓取,浪费抓取预算,也稀释真实内容的权重;llms.txt 被重写则使站点失去一个直接向模型说明定位与核心页面的入口。修改要点:让不存在的路径返回 404,不要重写到首页;在站点根目录放置纯文本 llms.txt,写明站点定位、核心页面与可引用结论,并确认服务器不会把首页 HTML 返回在该路径上。

五、行动建议

  1. 修改根目录 robots.txt:在 User-agent: * 之前逐条写入 User-agent: BytespiderUser-agent: DeepSeekBotUser-agent: QwenBotUser-agent: GPTBot,每条下加 Allow: /;同时在文件末尾加一行 Sitemap: https://qq.com/sitemap.xml,让 AI 爬虫既能抓取也能发现站点地图。

  2. 修复软 404:检查服务器与 CDN 的重写规则,把未匹配到真实页面的请求改为返回 HTTP 404 状态码,而不是 200 重写到首页;单独检查 llms.txt 路径的规则,确保它返回纯文本而不是首页 HTML。

  3. 在站点根目录新增纯文本 llms.txt:用 Markdown 或纯文本写明站点定位、核心栏目链接与可引用结论,避免在该路径返回任何 HTML 内容;同步确认 sitemap.xml 可正常访问且被 robots.txt 声明。

  4. 改造页面模板的标题层级:确保每页输出唯一 h1,正文用 h2/h3 分节,替换掉目前用加粗 div 充当标题的写法;对依赖 JS 渲染的正文,改为服务端渲染或在源码中直接输出可读正文与 h1。

  5. 在全站模板注入 JSON-LD:首页补 WebSite 与 Organization,文章页补 Article(含 headline、datePublished、dateModified),问答页补 FAQPage;同时在页脚展示备案号与主体信息入口,并在页面显著位置标注「更新于 YYYY-MM-DD」,让 AI 能判断内容新鲜度与来源可信度。

六、外部引用线索(仅证据,不计分)

  • 未检出站外提及:外部索引里还没有提到 qq.com 的页面。

  • 检索方式:Bing RSS,查询式 "qq.com" -site:qq.com打开这次检索

  • 本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。

七、数据来源与复核方式

  • 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
  • 复核方式:任何人都可以用「GEO 就绪度检测」对 qq.com 重跑,规则与数据完全公开
  • 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-20 的单时点快照,站点改版后结论可能变化
  • 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除

附录:原始取数证据

资源 HTTP 耗时 大小
首页 HTML 200 257 ms 121445 B
robots.txt 200 465 ms 71 B
sitemap.xml 200 705 ms 4183 B
llms.txt 200 647 ms 4183 B
不存在路径探测 200 702 ms 4183 B

八、如何引用本报告

安企 GEO《qq.com GEO 就绪度检测报告》(2026-09-20):该站按《GEO 就绪度标准 v1.0》15 项判定通过 6 项,得分 6 分(满分 15),判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。

  • 报告名称:qq.com GEO 就绪度检测报告
  • 检测日期:2026-09-20
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 建议引用格式:qq.com GEO 就绪度检测报告,安企 GEO,2026