检测结论:
www.seowhy.com在《GEO 就绪度标准 v1.0》的 15 项判定中通过 10 项,得分 10⁄15,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
www.seowhy.com 在《GEO 就绪度标准 v1.0》15 项检测中通过 10 项,判定为「不可见」。站点基础条件不差:HTTPS 与首页可达性正常,sitemap 有效,无软 404 污染,TDK 完整,且已具备结论前置、可摘录结构块、85 处具体数字与可见更新时间,第三方引用也有(mp.weixin.qq.com)。最致命的缺口集中在两处:一是 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,等于在入口处放弃被索引;二是页面源码中 h1 为 0、h2 为 0,正文与标题层级依赖 JS 渲染,AI 抓取端拿到的是一份没有结构骨架的文本。此外 JSON-LD 为 0 个、llms.txt 返回 404,使站点无法被机器明确识别为「谁、做什么、哪些内容可引用」。这四项修完后,站点应能从「不可见」推进到可抓取、可理解、可引用的合格区间。
二、逐项判定结果
判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:www.seowhy.com
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 未通过 | 源码中可见正文 1717 字符,h1 0 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 通过 | sitemap.xml HTTP 200,含 url 节点 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 通过 | 探测不存在路径返回 HTTP 404 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 315 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 通过 | title 37 字符,description 93 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 未通过 | JSON-LD 块 0 个,WebSite 无,Organization 无 |
| B3 | 标题层级语义化 | 可理解性 | 未通过 | h1 0 个,h2 0 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回 HTTP 404 |
| B5 | 主体与作者信息可核验 | 可理解性 | 通过 | 备案信息 有,主体信息入口 有 |
| C1 | 结论前置 | 可引用性 | 通过 | 首屏可见文本前 120 字:搜外网:2025开启Google SEO培训,与夫唯一起探索独立站出海之旅 首页 SEO教程 视频课程 工具服务 6系统… |
| C2 | 存在可摘录结构块 | 可引用性 | 通过 | 列表/表格标签 14 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 通过 | 含具体数字 85 处 |
| C4 | 有明确更新时间 | 可引用性 | 通过 | 页面可见更新时间为 有 |
| C5 | 有第三方引用证据 | 可引用性 | 通过 | 第三方平台引用 有(mp.weixin.qq.com) |
三、优先修复的三件事
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
2. A2 · 关键内容不依赖 JS 渲染
- 现状:源码中可见正文 1717 字符,h1 0 个
- 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。
3. B2 · 结构化数据(JSON-LD)
- 现状:JSON-LD 块 0 个,WebSite 无,Organization 无
- 怎么改:至少补 WebSite + Organization;文章页加 Article,问答页加 FAQPage。
四、重点问题分析
A1 robots.txt 未放行 AI 爬虫:入口即被拦截
当前 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等主流 AI 爬虫。按标准要求,需要为每个爬虫单独写 User-agent + Allow: /,并放在 User-agent: * 之前——爬虫只匹配第一条命中的规则,顺序错了等于没写。
实际后果是:即便站点内容质量达标,AI 侧在抓取阶段就可能直接跳过,后续的可理解性与可引用性优化全部失效。这是所有问题中优先级最高的一项,因为它决定其他 14 项是否有机会被读取。
修改要点:在 robots.txt 顶部逐条列出目标 AI 爬虫并显式 Allow,保留原有 User-agent: * 规则于其后;改完用各爬虫的 UA 做一次实际请求验证,确认返回 200 而非 403。
A2/B3 正文依赖 JS 渲染、标题层级缺失:AI 拿到的是无骨架文本
证据显示,源码中可见正文 1717 字符,但 h1 为 0 个;B3 同样记录 h1 0 个、h2 0 个。这说明页面虽然有一定量可读文本,但标题层级完全没有进入源码,结构信息依赖客户端渲染补全。
对 AI 抓取的实际影响有两层:一是渲染不完整的抓取器只能拿到 1717 字符的平铺文本,无法判断哪一句是主题、哪一段是支撑;二是零 h1、零 h2 意味着分块与摘要时缺少天然切分点,模型更容易把导航文本和正文混在一起。C1 通过(首屏前 120 字为「搜外网:2025开启Google SEO培训…」)说明内容本身有结论前置意识,但结构没跟上,这一优势会被稀释。
修改要点:将正文与标题改为服务端渲染,确保源码中直接可见 h1 与 h2/h3;每页只保留一个 h1,用 h2 组织章节、h3 组织子项;不要用加粗的 div 冒充标题,语义标签必须真实存在。
B2 缺少 JSON-LD:机器无法确认站点身份
当前 JSON-LD 块为 0 个,WebSite 无,Organization 无。这意味着 AI 侧无法从结构化数据中确认站点名称、主体归属与页面类型,只能靠正文猜测。在 C5 已有第三方引用(mp.weixin.qq.com)的情况下,缺少 Organization 标记会让「这个域名属于谁、是否可信」这一判断失去锚点。
修改要点:至少补齐 WebSite 与 Organization 两类 JSON-LD,放在全站模板中;文章页追加 Article,问答页追加 FAQPage;字段中的名称、URL、logo 需与页面可见内容一致,避免自相矛盾。
B4 llms.txt 返回 404:缺少面向模型的站点说明书
llms.txt 返回 HTTP 404,站点没有为 AI 提供纯文本形式的定位说明与核心页面清单。相比 sitemap 只列 URL,llms.txt 能直接写明站点定位、核心页面与可引用结论,是提升引用准确率的低成本手段。
修改要点:在站点根目录放置纯文本 llms.txt,写明定位、核心页面与可引用结论;配置时注意不要让服务器把首页 HTML 返回在该路径上,需确认真实返回 200 且 Content-Type 为 text/plain。
五、行动建议
修改根目录 robots.txt:在文件最顶部依次写入
User-agent: Bytespider+Allow: /、User-agent: DeepSeekBot+Allow: /、User-agent: QwenBot+Allow: /、User-agent: GPTBot+Allow: /,全部置于现有User-agent: *规则之前。改完后分别用四个 UA 请求首页,确认返回 200。改造页面模板实现标题层级 SSR:在页面模板中把主标题输出为唯一的
<h1>,章节标题输出为<h2>,子项输出为<h3>,确保这些标签出现在服务端返回的源码中而非由 JS 注入。改完用「查看源代码」核对 h1 数量为 1、h2 数量大于 0。在全站模板中注入 JSON-LD:新增
WebSite与Organization两个<script type="application/ld+json">块,字段包含站点名称、URL、logo 与主体信息;在文章详情模板追加Article,在问答类模板追加FAQPage。上线后用结构化数据校验工具确认无报错。在站点根目录新增 llms.txt:以纯文本写明站点定位、核心页面链接与可引用结论,保存为 UTF-8 无 BOM。部署后直接访问
/llms.txt,确认返回 200、Content-Type 为 text/plain,且内容不是首页 HTML。复核 sitemap 与正文渲染的一致性:确认 sitemap.xml 中列出的 URL 在 SSR 改造后仍返回 200,并抽查若干页面源码中的正文字符数是否与渲染后一致,避免出现「sitemap 有、源码无」的落差。
六、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
www.seowhy.com重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C1/C3/C5 三项由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 315 ms | 21619 B |
| robots.txt | 200 | 500 ms | 241 B |
| sitemap.xml | 200 | 661 ms | 254355 B |
| llms.txt | 404 | 272 ms | — B |
| 不存在路径探测 | 404 | 507 ms | — B |
七、如何引用本报告
安企 GEO《www.seowhy.com GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 10 项,得分 10/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:www.seowhy.com GEO 就绪度检测报告
- 检测日期:2026-09-19
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:www.seowhy.com GEO 就绪度检测报告,安企 GEO,2026