检测结论:
sfyu.org在《GEO 就绪度标准 v1.0》的 15 项判定中通过 9 项,得分 9⁄15,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
sfyu.org 在《GEO 就绪度标准 v1.0》15 项检查中通过 9 项,判定为「不可见」。内容层表现尚可:正文不依赖 JS 渲染、sitemap 有效、HTTPS 正常、TDK 完整、结论前置、含一手数字与明确出处,说明站点具备被 AI 引用的素材基础。最致命的缺口集中在可抓取性与可理解性:robots.txt 未显式放行 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,等于把入口让给了通配规则;不存在的路径返回 HTTP 200 形成软 404,持续消耗抓取预算;全站 JSON-LD 为 0,缺少 WebSite 与 Organization 实体声明,AI 无法确认站点身份;h2 数量为 0,层级语义缺失;llms.txt 路径返回的是网页 HTML。这些属于低成本、可一次性修复的工程项。补齐后预计可升至 13-14 项通过,进入「可被引用」区间。
二、逐项判定结果
判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:sfyu.org
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 通过 | 源码中可见正文 8674 字符,h1 1 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 通过 | sitemap.xml HTTP 200,含 url 节点 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 未通过 | 探测不存在路径返回 HTTP 200 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 3080 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 通过 | title 11 字符,description 90 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 未通过 | JSON-LD 块 0 个,WebSite 无,Organization 无 |
| B3 | 标题层级语义化 | 可理解性 | 未通过 | h1 1 个,h2 0 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回的是网页 HTML(软 404),并非纯文本 |
| B5 | 主体与作者信息可核验 | 可理解性 | 未通过 | 备案信息 无,主体信息入口 有 |
| C1 | 结论前置 | 可引用性 | 通过 | 首屏可见文本前 120 字:四方鱼 - 探索与记录 四方鱼 PAGE_NAME 搜索 微信 支付宝 互动 最新评论 正在加载中… 兴趣点 寻找你… |
| C2 | 存在可摘录结构块 | 可引用性 | 通过 | 列表/表格标签 3 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 通过 | 含具体数字 8308 处 |
| C4 | 有明确更新时间 | 可引用性 | 通过 | 页面可见更新时间为 有 |
| C5 | 有第三方引用证据 | 可引用性 | 通过 | 正文标注了明确出处「来源:K」 |
三、优先修复的三件事
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
2. A4 · 无死链污染(非软 404)
- 现状:探测不存在路径返回 HTTP 200
- 怎么改:让不存在的路径返回 404,而不是 200 重写到首页——软 404 会让抓取预算浪费在假页面上。
3. B2 · 结构化数据(JSON-LD)
- 现状:JSON-LD 块 0 个,WebSite 无,Organization 无
- 怎么改:至少补 WebSite + Organization;文章页加 Article,问答页加 FAQPage。
四、重点问题分析
A1 AI 爬虫未被显式放行
当前 robots.txt 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等主流 AI 爬虫。按标准要求,爬虫只匹配第一条命中的规则,因此若 User-agent: * 出现在文件开头,后续针对具体爬虫的 Allow 规则不会生效。对 AI 抓取的实际后果是:抓取方无法从 robots.txt 获得明确的授权信号,部分引擎会按保守策略降低抓取频率或直接跳过。修改要点是把每个 AI 爬虫的 User-agent 加 Allow: / 逐条写在 User-agent: * 之前,保持每条规则独立成段,不与通配规则混排。
A4 软 404 污染抓取预算
探测不存在的路径时,服务器返回 HTTP 200,而非 404。这通常来自把未匹配请求重写到首页的配置。对 AI 抓取的实际后果是:爬虫会把大量不存在的 URL 当作有效页面收录,抓取预算被消耗在无内容页面上,真实页面的更新发现速度随之下降;同时,AI 在检索时可能引用到实际不存在的地址,降低引用可信度。修改要点是在服务器或 CDN 层面关闭「未匹配即重写到首页」的规则,让不存在的路径返回标准 404 状态码,并保留自定义 404 页面承载导航。
B2 缺少结构化数据,实体无法被识别
全站 JSON-LD 块数量为 0,WebSite 与 Organization 均未声明。对 AI 抓取的实际后果是:生成式引擎在构建知识图谱时缺少站点名称、URL、组织主体等机器可读字段,只能靠正文猜测站点身份,导致品牌实体难以被稳定关联,站点内容在被引用时也更难挂到正确的来源上。修改要点是在全站模板的 <head> 中注入 WebSite 与 Organization 两个 JSON-LD 块,文章页补充 Article,问答页补充 FAQPage,字段中的名称与 URL 须与页面可见内容一致。
B3 标题层级缺失,内容结构不可解析
页面 h1 为 1 个,h2 为 0 个,正文层级完全依赖视觉样式而非语义标签。对 AI 抓取的实际后果是:引擎无法判断段落之间的从属关系,长文被切分为无结构的文本块,摘录时容易断章取义或漏掉关键结论。修改要点是每页只保留一个 h1,用 h2 划分主要章节、h3 划分子节,禁止用加粗 div 或字号样式冒充标题,标题文本需概括该节结论而非泛化词。
B4 与 B5 可核验信息缺位
llms.txt 路径返回的是网页 HTML(软 404),并非纯文本,等于该入口不存在;页脚无备案信息,仅有主体信息入口。对 AI 抓取的实际后果是:llms.txt 是当前引擎读取站点定位与核心页面的快捷通道,缺失会拉长理解路径;备案号与主体信息缺位则削弱站点可信度判定,影响引用优先级。修改要点是在根目录放置纯文本 llms.txt,写明站点定位、核心页面清单与可引用结论,并在服务器配置中排除该路径的 HTML 重写;页脚补充备案号,并保证「关于我们」或联系方式页面可达。
五、行动建议
修改站点根目录的 robots.txt:在
User-agent: *之前,为 Bytespider、DeepSeekBot、QwenBot、GPTBot 各写一段User-agent: <名称>加Allow: /,每条规则独立成段,保存后逐条请求验证返回内容。调整服务器重写规则:定位将未匹配路径重写到首页的配置项(常见于 Nginx 的 try_files 或 CDN 回源规则),改为返回 404 状态码,并保留自定义 404 页面;随后用随机路径验证响应头状态码为 404。
在全站模板
<head>中注入 JSON-LD:先补 WebSite(含 name、url)与 Organization(含 name、url、logo)两个块;文章详情页模板追加 Article,问答页模板追加 FAQPage,字段值与页面可见文本保持一致。重建标题层级:检查文章与页面模板,确保每页仅一个 h1,正文按章节使用 h2、按子节使用 h3,替换现有用于视觉加粗的 div 或 span 标题写法。
新建纯文本 llms.txt 置于站点根目录:写明站点定位、核心页面链接与可引用结论;同时在服务器配置中排除该路径的 HTML 重写,验证返回内容为 text/plain。页脚补充备案号并确保「关于我们」页面可访问。
六、外部引用线索(仅证据,不计分)
未检出站外提及:外部索引里还没有提到
sfyu.org的页面。检索方式:Bing RSS,查询式
"sfyu.org" -site:sfyu.org(打开这次检索)本节只作证据、不计分:搜索结果随时变化,把它纳入评分会破坏本报告「同一站点重复检测结果一致」的承诺。
七、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
sfyu.org重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C5 只认站内可核验的引用痕迹(指向第三方平台的正文链接、出处标注、JSON-LD sameAs),真正的「被站外引用」见第六节,该节由搜索引擎查询得出、只作证据不计分;C1/C3 由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 3080 ms | 229646 B |
| robots.txt | 200 | 2272 ms | 129 B |
| sitemap.xml | 200 | 1717 ms | 11768 B |
| llms.txt | 200 | 2487 ms | 228708 B |
| 不存在路径探测 | 200 | 2567 ms | 229646 B |
八、如何引用本报告
安企 GEO《sfyu.org GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 9 项,得分 9/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:sfyu.org GEO 就绪度检测报告
- 检测日期:2026-09-19
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:sfyu.org GEO 就绪度检测报告,安企 GEO,2026