检测结论www.okmao.com 在《GEO 就绪度标准 v1.0》的 15 项判定中通过 10 项得分 10 分(满分 15),判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。

一、概述

www.okmao.com 这次 GEO 就绪度检测拿到 10 分,判定为不可见。站点的可抓取性基础尚可:HTTPS 有效、首页 490 ms 返回 200、sitemap 与 404 处理正常;可理解性一侧 TDK、JSON-LD、llms.txt、主体备案信息都已具备。真正拖后腿的是三处结构性缺口。最致命的是 A2 与 B3:源码里虽有 4136 字符正文,但 h1 与 h2 均为 0,页面没有标题层级,AI 抓到的是一堆无法判断主题归属的文本。其次是 A1,robots.txt 没有为 Bytespider、DeepSeekBot、QwenBot、GPTBot 单独放行,规则一旦被通配条目先命中,这些爬虫可能直接不抓。C2 与 C5 则让内容缺少可摘录结构与站外佐证。这五项都属于改配置、改模板即可完成的动作,修完可达满分 15 分。

二、逐项判定结果

判定时间:2026-09-20 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:www.okmao.com

检查项 分组 结果 关键证据
A1 robots.txt 正确放行 AI 爬虫 可抓取性 未通过 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
A2 关键内容不依赖 JS 渲染 可抓取性 未通过 源码中可见正文 4136 字符,h1 0 个
A3 有 sitemap 且内容有效 可抓取性 通过 sitemap.xml HTTP 200,含 url 节点
A4 无死链污染(非软 404) 可抓取性 通过 探测不存在路径返回 HTTP 404
A5 站点稳定可达 + HTTPS 有效 可抓取性 通过 协议 HTTPS,首页 HTTP 200,响应 490 ms
B1 每页唯一且完整的 TDK 可理解性 通过 title 58 字符,description 105 字符
B2 结构化数据(JSON-LD) 可理解性 通过 JSON-LD 块 1 个,WebSite 有,Organization 有
B3 标题层级语义化 可理解性 未通过 h1 0 个,h2 0 个
B4 有 llms.txt(纯文本) 可理解性 通过 llms.txt 正常,159 字符
B5 主体与作者信息可核验 可理解性 通过 备案信息 有,主体信息入口 有
C1 结论前置 可引用性 通过 首屏可见文本前 120 字: 中网机械 - 中国机械网_机械行业综合门户_工程机械_汽车机械_医用机械_供求展会商铺人才平台 -okmao.com…
C2 存在可摘录结构块 可引用性 未通过 列表/表格标签 0 个
C3 有独家数据或一手信息 可引用性 通过 含具体数字 1024 处
C4 有明确更新时间 可引用性 通过 页面可见更新时间为 有
C5 有第三方引用证据 可引用性 未通过 正文可见区既没有指向第三方平台的引用链接,也没有出处标注、也没有 sameAs 站外身份声明

内页抽样(按模板各取一页)

首页之外,按 URL 形态从站点地图里各取一个代表页面,看内页的 TDK、正文、结构化数据、更新时间与内链。本节只作补充证据,不参与 15 项评分——评分口径对全站一致,仍按首页判定。

抽样页面 HTTP TDK 可见正文 JSON-LD 更新时间 内链
/news/list_101_0_1.html 200 title 63 / desc 105 2552 字 1 164

小结:抽样的 1 个内页中,TDK 完整 1 个、含结构化数据 1 个、标注更新时间 1 个。

三、优先修复(含可直接复制粘贴的代码)

按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。每一项都给出可以整段复制的修复内容,把域名、品牌名和你实际缺失的爬虫都填好了。

1. A1 · robots.txt 正确放行 AI 爬虫

  • 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
  • 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。

可直接复制的修复

放到:站点根目录 /robots.txt(一个纯文本文件,整份替换即可)

# ① AI 爬虫必须逐个显式声明,且放在 User-agent: * 之前
#    爬虫只匹配第一条命中自己的规则组,写在 * 后面等于没写

User-agent: Bytespider
Allow: /
# 对应产品:豆包

User-agent: DeepSeekBot
Allow: /
# 对应产品:DeepSeek

User-agent: QwenBot
Allow: /
# 对应产品:通义千问

User-agent: GPTBot
Allow: /
# 对应产品:ChatGPT

# ② 本次检测显示以下爬虫你已经声明过,无需重复:
#    ClaudeBot、PerplexityBot、KimiBot、Kimi-SearchBot

# ③ 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/

# ④ 声明站点地图
Sitemap: https://www.okmao.com/sitemap.xml

本次检测里,这个文件缺少 Bytespider、DeepSeekBot、QwenBot、GPTBot(对应 豆包、DeepSeek、通义千问、ChatGPT)。

2. A2 · 关键内容不依赖 JS 渲染

  • 现状:源码中可见正文 4136 字符,h1 0 个
  • 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。

可直接复制的修复

若源码里几乎没有正文,三种改法(任选):

  1. Next.jsgetServerSideProps / Server Component 输出内容;
  2. Nuxtssr: true(默认)并把关键内容放在服务端;
  3. 静态站:构建时预渲染(nuxt generate / next export / 或纯 HTML)。 同时给不执行 JS 的客户端留一份 <noscript> 说明。
# 先用这条确认正文是否出现在源码里(AI 爬虫大多不执行 JS)
curl -s https://www.okmao.com/ | grep -c "<h1"
curl -s https://www.okmao.com/ | wc -c

3. B3 · 标题层级语义化

  • 现状:h1 0 个,h2 0 个
  • 怎么改:每页只保留一个 h1,用 h2/h3 组织层级;不要用加粗的 div 冒充标题。

可直接复制的修复

不要用加粗的 div 冒充标题——AI 靠标签层级判断哪句话是结论、哪些是支撑

<h1>中网机械:这一页的主题(每页只准有 1 个 h1)</h1>
  <h2>第一部分</h2>
    <h3>小节</h3>
  <h2>第二部分</h2>

四、重点问题分析

A1 robots.txt 未显式放行主流 AI 爬虫

当前 robots.txt 中没有出现 Bytespider、DeepSeekBot、QwenBot、GPTBot 这些 UA 的独立规则。爬虫匹配遵循「第一条命中即生效」的逻辑:如果 User-agent: * 写在前面并带有任何限制,后面再补的 Allow 不会被这些爬虫读到。结果是站点可能在不知情的情况下被主流生成式引擎排除在抓取范围之外,A2、B3 再怎么修也没有入口。修改要点是把每个 AI 爬虫的 User-agentAllow: / 逐条写在 User-agent: * 之前,并确认没有 Disallow 通配条目覆盖这些路径。

A2 与 B3 正文可见但无标题层级

源码中可读正文有 4136 字符,说明内容本身存在,但 h1 与 h2 数量都是 0。这意味着页面缺少主题声明与段落归属:AI 无法判断这 4136 字符围绕什么主题、哪些段落属于同一议题、哪一句是总起。B3 的判定与 A2 同源,两项一起失分。对生成式引擎来说,这类页面在检索阶段可能被召回,但在抽取阶段很难被选中作为答案来源,因为引用它需要模型自己猜测结构,成本高且易出错。修改要点是在模板层把页面主标题输出为唯一的 h1,把栏目名、小节名输出为 h2/h3,替换掉目前用加粗 div 或纯样式模拟标题的做法;如果标题由前端 JS 注入,需要改为服务端渲染,确保源码中就能读到。

C2 缺少可摘录结构块

全页列表与表格标签数量为 0。AI 引用一段内容时,偏好边界清晰、可整段搬运的单元,编号清单、对比表格、问答对是命中率最高的三种形态。目前站点内容以连续段落呈现,模型要么整段照搬(风险高、往往放弃),要么自己重组成列表(改变原意、站点得不到归属)。修改要点是把页面中的关键要点、参数对比、常见问题改写为 ul/ol、table 或 FAQ 结构,并保证这些标签出现在服务端渲染的源码中,而不是靠 JS 生成。

C5 缺少第三方引用证据

正文可见区没有指向第三方平台的引用链接,没有出处标注,JSON-LD 中也没有 sameAs 站外身份声明。生成式引擎在多个来源之间做交叉验证时,会优先采用能被外部佐证的说法。一个只在自己站内自证的页面,在模型看来可信度权重偏低,即便被召回也容易排在已有外部引用支撑的竞品之后。修改要点有两条路径:一是把站内的一手数据整理成可独立引用的结论块,发布到知乎、CSDN 等平台并在正文中链回;二是在正文标注数据出处,并在现有 JSON-LD 的 Organization 节点中补 sameAs,指向站外身份主页。两条都做效果更好。

五、行动建议

  1. 修改根目录 robots.txt。为 GPTBot、Bytespider、DeepSeekBot、QwenBot 各写一组 User-agent: <名称>Allow: /,全部放在 User-agent: * 之前;检查文件中是否存在 Disallow 通配规则,若有需确认不会覆盖这些爬虫的抓取路径。

  2. 修改页面模板,补齐标题层级。在生成正文的模板文件中,把页面主标题输出为唯一的 <h1>,把栏目名与小节名输出为 <h2><h3>,删除目前用于冒充标题的加粗 div 或纯 CSS 样式块。改完后查看页面源码,确认 h1 数量为 1、h2 数量大于 0,且不依赖 JS 注入。

  3. 在正文中引入可摘录结构。选取流量最高的若干栏目页,把要点清单改为 <ul>/<ol>,把参数或规格对比改为 <table>,把常见问题改为问答结构。确保这些标签在服务端渲染的 HTML 源码中直接可见,而不是由前端脚本生成。

  4. 补充第三方引用证据。在现有 JSON-LD 的 Organization 节点中增加 sameAs 字段,填入站外身份主页地址;同时在正文涉及数据的段落末尾加上「来源:××」标注。若已有可公开的一手数据,整理成独立结论块发布到知乎或 CSDN,并在对应页面正文中加一条指向该内容的链接。

  5. 复核 sitemap 与 llms.txt 的一致性。sitemap.xml 已返回 200 且含 url 节点,llms.txt 也已存在,建议在补齐 h1 与结构块后,确认 sitemap 中的 URL 均为可服务端渲染的最终地址,避免把依赖 JS 的路径提交给爬虫。

六、外部引用线索(仅证据,不计分)

  • 未检出站外提及:外部索引里还没有提到 www.okmao.com 的页面。

  • 检索方式:Bing RSS,查询式 "www.okmao.com" -site:www.okmao.com打开这次检索

  • 本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。

七、数据来源与复核方式

  • 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
  • 复核方式:任何人都可以用「GEO 就绪度检测」对 www.okmao.com 重跑,规则与数据完全公开
  • 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-20 的单时点快照,站点改版后结论可能变化
  • 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除

附录:原始取数证据

资源 HTTP 耗时 大小
首页 HTML 200 490 ms 89844 B
robots.txt 200 281 ms 79 B
sitemap.xml 200 239 ms 10424 B
llms.txt 200 234 ms 163 B
不存在路径探测 404 209 ms — B

八、如何引用本报告

安企 GEO《www.okmao.com GEO 就绪度检测报告》(2026-09-20):该站按《GEO 就绪度标准 v1.0》15 项判定通过 10 项,得分 10 分(满分 15),判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。

  • 报告名称:www.okmao.com GEO 就绪度检测报告
  • 检测日期:2026-09-20
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 建议引用格式:www.okmao.com GEO 就绪度检测报告,安企 GEO,2026