检测结论sfyu.org 在《GEO 就绪度标准 v1.0》的 15 项判定中通过 9 项,得分 915,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。

一、概述

sfyu.org 在《GEO 就绪度标准 v1.0》15 项检查中通过 9 项,判定为「不可见」。内容层表现尚可:正文不依赖 JS 渲染、sitemap 有效、HTTPS 正常、TDK 完整、结论前置、含一手数字与明确出处,说明站点具备被 AI 引用的素材基础。最致命的缺口集中在可抓取性与可理解性:robots.txt 未显式放行 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,等于把入口让给了通配规则;不存在的路径返回 HTTP 200 形成软 404,持续消耗抓取预算;全站 JSON-LD 为 0,缺少 WebSite 与 Organization 实体声明,AI 无法确认站点身份;h2 数量为 0,层级语义缺失;llms.txt 路径返回的是网页 HTML。这些属于低成本、可一次性修复的工程项。补齐后预计可升至 13-14 项通过,进入「可被引用」区间。

二、逐项判定结果

判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:sfyu.org

检查项 分组 结果 关键证据
A1 robots.txt 正确放行 AI 爬虫 可抓取性 未通过 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
A2 关键内容不依赖 JS 渲染 可抓取性 通过 源码中可见正文 8674 字符,h1 1 个
A3 有 sitemap 且内容有效 可抓取性 通过 sitemap.xml HTTP 200,含 url 节点
A4 无死链污染(非软 404) 可抓取性 未通过 探测不存在路径返回 HTTP 200
A5 站点稳定可达 + HTTPS 有效 可抓取性 通过 协议 HTTPS,首页 HTTP 200,响应 3080 ms
B1 每页唯一且完整的 TDK 可理解性 通过 title 11 字符,description 90 字符
B2 结构化数据(JSON-LD) 可理解性 未通过 JSON-LD 块 0 个,WebSite 无,Organization 无
B3 标题层级语义化 可理解性 未通过 h1 1 个,h2 0 个
B4 有 llms.txt(纯文本) 可理解性 未通过 llms.txt 返回的是网页 HTML(软 404),并非纯文本
B5 主体与作者信息可核验 可理解性 未通过 备案信息 无,主体信息入口 有
C1 结论前置 可引用性 通过 首屏可见文本前 120 字:四方鱼 - 探索与记录 四方鱼 PAGE_NAME 搜索 微信 支付宝 互动 最新评论 正在加载中… 兴趣点 寻找你…
C2 存在可摘录结构块 可引用性 通过 列表/表格标签 3 个
C3 有独家数据或一手信息 可引用性 通过 含具体数字 8308 处
C4 有明确更新时间 可引用性 通过 页面可见更新时间为 有
C5 有第三方引用证据 可引用性 通过 正文标注了明确出处「来源:K」

三、优先修复的三件事

按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。

1. A1 · robots.txt 正确放行 AI 爬虫

  • 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
  • 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。

2. A4 · 无死链污染(非软 404)

  • 现状:探测不存在路径返回 HTTP 200
  • 怎么改:让不存在的路径返回 404,而不是 200 重写到首页——软 404 会让抓取预算浪费在假页面上。

3. B2 · 结构化数据(JSON-LD)

  • 现状:JSON-LD 块 0 个,WebSite 无,Organization 无
  • 怎么改:至少补 WebSite + Organization;文章页加 Article,问答页加 FAQPage。

四、重点问题分析

A1 AI 爬虫未被显式放行

当前 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等主流 AI 爬虫。按标准要求,爬虫只匹配第一条命中的规则,因此若 User-agent: * 出现在文件开头,后续针对具体爬虫的 Allow 规则不会生效。对 AI 抓取的实际后果是:抓取方无法从 robots.txt 获得明确的授权信号,部分引擎会按保守策略降低抓取频率或直接跳过。修改要点是把每个 AI 爬虫的 User-agentAllow: / 逐条写在 User-agent: * 之前,保持每条规则独立成段,不与通配规则混排。

A4 软 404 污染抓取预算

探测不存在的路径时,服务器返回 HTTP 200,而非 404。这通常来自把未匹配请求重写到首页的配置。对 AI 抓取的实际后果是:爬虫会把大量不存在的 URL 当作有效页面收录,抓取预算被消耗在无内容页面上,真实页面的更新发现速度随之下降;同时,AI 在检索时可能引用到实际不存在的地址,降低引用可信度。修改要点是在服务器或 CDN 层面关闭「未匹配即重写到首页」的规则,让不存在的路径返回标准 404 状态码,并保留自定义 404 页面承载导航。

B2 缺少结构化数据,实体无法被识别

全站 JSON-LD 块数量为 0,WebSite 与 Organization 均未声明。对 AI 抓取的实际后果是:生成式引擎在构建知识图谱时缺少站点名称、URL、组织主体等机器可读字段,只能靠正文猜测站点身份,导致品牌实体难以被稳定关联,站点内容在被引用时也更难挂到正确的来源上。修改要点是在全站模板的 <head> 中注入 WebSite 与 Organization 两个 JSON-LD 块,文章页补充 Article,问答页补充 FAQPage,字段中的名称与 URL 须与页面可见内容一致。

B3 标题层级缺失,内容结构不可解析

页面 h1 为 1 个,h2 为 0 个,正文层级完全依赖视觉样式而非语义标签。对 AI 抓取的实际后果是:引擎无法判断段落之间的从属关系,长文被切分为无结构的文本块,摘录时容易断章取义或漏掉关键结论。修改要点是每页只保留一个 h1,用 h2 划分主要章节、h3 划分子节,禁止用加粗 div 或字号样式冒充标题,标题文本需概括该节结论而非泛化词。

B4 与 B5 可核验信息缺位

llms.txt 路径返回的是网页 HTML(软 404),并非纯文本,等于该入口不存在;页脚无备案信息,仅有主体信息入口。对 AI 抓取的实际后果是:llms.txt 是当前引擎读取站点定位与核心页面的快捷通道,缺失会拉长理解路径;备案号与主体信息缺位则削弱站点可信度判定,影响引用优先级。修改要点是在根目录放置纯文本 llms.txt,写明站点定位、核心页面清单与可引用结论,并在服务器配置中排除该路径的 HTML 重写;页脚补充备案号,并保证「关于我们」或联系方式页面可达。

五、行动建议

  1. 修改站点根目录的 robots.txt:在 User-agent: * 之前,为 Bytespider、DeepSeekBot、QwenBot、GPTBot 各写一段 User-agent: <名称>Allow: /,每条规则独立成段,保存后逐条请求验证返回内容。

  2. 调整服务器重写规则:定位将未匹配路径重写到首页的配置项(常见于 Nginx 的 try_files 或 CDN 回源规则),改为返回 404 状态码,并保留自定义 404 页面;随后用随机路径验证响应头状态码为 404。

  3. 在全站模板 <head> 中注入 JSON-LD:先补 WebSite(含 name、url)与 Organization(含 name、url、logo)两个块;文章详情页模板追加 Article,问答页模板追加 FAQPage,字段值与页面可见文本保持一致。

  4. 重建标题层级:检查文章与页面模板,确保每页仅一个 h1,正文按章节使用 h2、按子节使用 h3,替换现有用于视觉加粗的 div 或 span 标题写法。

  5. 新建纯文本 llms.txt 置于站点根目录:写明站点定位、核心页面链接与可引用结论;同时在服务器配置中排除该路径的 HTML 重写,验证返回内容为 text/plain。页脚补充备案号并确保「关于我们」页面可访问。

六、外部引用线索(仅证据,不计分)

  • 未检出站外提及:外部索引里还没有提到 sfyu.org 的页面。

  • 检索方式:Bing RSS,查询式 "sfyu.org" -site:sfyu.org打开这次检索

  • 本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。

七、数据来源与复核方式

  • 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
  • 复核方式:任何人都可以用「GEO 就绪度检测」对 sfyu.org 重跑,规则与数据完全公开
  • 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
  • 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除

附录:原始取数证据

资源 HTTP 耗时 大小
首页 HTML 200 3080 ms 229646 B
robots.txt 200 2272 ms 129 B
sitemap.xml 200 1717 ms 11768 B
llms.txt 200 2487 ms 228708 B
不存在路径探测 200 2567 ms 229646 B

八、如何引用本报告

安企 GEO《sfyu.org GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 9 项,得分 9/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。

  • 报告名称:sfyu.org GEO 就绪度检测报告
  • 检测日期:2026-09-19
  • 发布方:安企 GEO(AnqiWeb GEO)
  • 建议引用格式:sfyu.org GEO 就绪度检测报告,安企 GEO,2026