检测结论:
www.shidianguwen.com在《GEO 就绪度标准 v1.0》的 15 项判定中通过 7 项,得分 7⁄15,判定为「不可见」。其中 A1(robots.txt 正确放行 AI 爬虫) 是最关键的缺口。
一、概述
该站在可抓取性与可引用性上具备基础条件:robots.txt 放行情况以外的抓取通道基本正常,sitemap 有效、无软 404、HTTPS 稳定(响应 105 ms),TDK 完整,正文源码可见 7918 字符,并包含 547 处具体数字和 15 个列表/表格结构块,说明内容本身有被 AI 引用的潜力。但当前 15 项中仅通过 7 项,判定为「不可见」,最致命的缺口集中在三处:一是 robots.txt 未显式放行 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 AI 爬虫,等于主动放弃入口;二是全站 h1 为 0、JSON-LD 为 0、llms.txt 返回 404,AI 既读不到页面主题,也拿不到结构化事实;三是页面无更新时间、无第三方引用、无主体信息入口,内容无法被判定为可信与新鲜。这些项修完后,站点可从「不可见」进入「可引用」区间,具备被生成式引擎稳定引用的基础条件。
二、逐项判定结果
判定时间:2026-09-19 | 依据:《GEO 就绪度标准 v1.0》 | 检测对象:www.shidianguwen.com
| 项 | 检查项 | 分组 | 结果 | 关键证据 |
|---|---|---|---|---|
| A1 | robots.txt 正确放行 AI 爬虫 | 可抓取性 | 未通过 | 未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等 |
| A2 | 关键内容不依赖 JS 渲染 | 可抓取性 | 未通过 | 源码中可见正文 7918 字符,h1 0 个 |
| A3 | 有 sitemap 且内容有效 | 可抓取性 | 通过 | sitemap.xml HTTP 200,含 url 节点 |
| A4 | 无死链污染(非软 404) | 可抓取性 | 通过 | 探测不存在路径返回 HTTP 404 |
| A5 | 站点稳定可达 + HTTPS 有效 | 可抓取性 | 通过 | 协议 HTTPS,首页 HTTP 200,响应 105 ms |
| B1 | 每页唯一且完整的 TDK | 可理解性 | 通过 | title 15 字符,description 109 字符 |
| B2 | 结构化数据(JSON-LD) | 可理解性 | 未通过 | JSON-LD 块 0 个,WebSite 无,Organization 无 |
| B3 | 标题层级语义化 | 可理解性 | 未通过 | h1 0 个,h2 50 个 |
| B4 | 有 llms.txt(纯文本) | 可理解性 | 未通过 | llms.txt 返回 HTTP 404 |
| B5 | 主体与作者信息可核验 | 可理解性 | 未通过 | 备案信息 有,主体信息入口 无 |
| C1 | 结论前置 | 可引用性 | 通过 | 首屏可见文本前 120 字:诗典古文分享 - 诗典古文分享 诗典古文 首页 古诗词 词牌名 诗词名句 诗句赏析 古诗考题 专题 古籍 诗典古文导航 … |
| C2 | 存在可摘录结构块 | 可引用性 | 通过 | 列表/表格标签 15 个 |
| C3 | 有独家数据或一手信息 | 可引用性 | 通过 | 含具体数字 547 处 |
| C4 | 有明确更新时间 | 可引用性 | 未通过 | 页面可见更新时间为 无 |
| C5 | 有第三方引用证据 | 可引用性 | 未通过 | 第三方平台引用 无 |
三、优先修复的三件事
按投入产出排序——「可抓取性」组的问题优先,不修完这一组,后面的优化都不会被 AI 看到。
1. A1 · robots.txt 正确放行 AI 爬虫
- 现状:未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot等
- 怎么改:把每个 AI 爬虫的 User-agent + Allow: / 放在 User-agent: * 之前——爬虫只匹配第一条命中的规则。
2. A2 · 关键内容不依赖 JS 渲染
- 现状:源码中可见正文 7918 字符,h1 0 个
- 怎么改:把正文与标题改为服务端渲染(SSR),或在源码中提供可读的正文与 h1。
3. B2 · 结构化数据(JSON-LD)
- 现状:JSON-LD 块 0 个,WebSite 无,Organization 无
- 怎么改:至少补 WebSite + Organization;文章页加 Article,问答页加 FAQPage。
四、重点问题分析
一、AI 爬虫未被显式放行,入口即被截断
robots.txt 中未声明 Bytespider、DeepSeekBot、QwenBot、GPTBot 等 User-agent。按标准要求,爬虫只匹配第一条命中的规则,若 User-agent: * 出现在前面且带有任何限制,后续针对具体 AI 爬虫的 Allow 规则将不会生效。这意味着站点即便内容质量不错,也可能在抓取阶段就被排除在 AI 语料之外。修改要点是把每个 AI 爬虫的 User-agent 加 Allow: / 放在 User-agent: * 之前,逐条列出,不要合并。
二、页面无 h1、无 JSON-LD,AI 无法确定页面主题
源码中可见正文 7918 字符,但 h1 为 0 个、h2 为 50 个;JSON-LD 块 0 个,WebSite 与 Organization 均缺失。对 AI 而言,h1 是判断页面核心主题的第一信号,JSON-LD 是判断站点性质与内容类型的第一信号。两者同时缺失,AI 只能从 50 个平级 h2 和正文中自行猜测,引用时容易张冠李戴或干脆不引用。修改要点:每页保留唯一 h1,用 h2/h3 组织层级,不要用加粗 div 冒充标题;同时在首页补 WebSite + Organization,在文章页补 Article,在问答页补 FAQPage,字段至少包含名称、URL、作者、发布时间。
三、llms.txt 缺失,缺少面向 AI 的站点说明
llms.txt 返回 HTTP 404。该文件是 AI 快速理解站点定位、核心页面与可引用结论的入口。缺失后,AI 需要自行遍历全站才能建立站点画像,成本高、误差大。修改要点:在站点根目录放置纯文本 llms.txt,写明站点定位、核心栏目与可引用结论;同时检查服务器配置,避免把首页 HTML 返回在该路径上,否则会被误判为无效文件。
四、无更新时间、无第三方引用、无主体信息入口,可信度不足
页面可见更新时间为无,第三方平台引用为无,主体信息入口为无(备案信息有)。AI 在决定是否引用时,会综合判断内容新鲜度与来源可信度。三项同时缺失,内容即便准确,也容易被判定为低可信来源。修改要点:在页面显著位置标注「更新于 YYYY-MM-DD」;页脚展示备案号并补充「关于我们」或联系方式;把一手数据整理成可引用的结论块,投稿到知乎、CSDN 等平台,逐步积累第三方引用证据。
五、行动建议
修改根目录
robots.txt:在User-agent: *之前,逐条添加User-agent: Bytespider、User-agent: DeepSeekBot、User-agent: QwenBot、User-agent: GPTBot,每条下方加Allow: /。顺序不能颠倒,否则规则不生效。在模板层修复标题层级:确保每个页面只输出一个
<h1>,把当前 50 个<h2>中属于页面主标题的改为<h1>,其余保留<h2>或降为<h3>;检查是否存在用加粗<div>冒充标题的情况,一并替换为语义标签。在
<head>中注入 JSON-LD:首页加WebSite与Organization,字段包含name、url、logo;文章页加Article,字段包含headline、author、datePublished、dateModified;问答页加FAQPage。可先做一个公共组件,按页面类型传入参数。在站点根目录新建纯文本
llms.txt:写明站点定位、核心栏目 URL、可引用结论清单;同时检查服务器路由,确保该路径返回的是纯文本文件而不是首页 HTML。在页面模板中补充三项可信度信号:正文顶部或底部加「更新于 YYYY-MM-DD」;页脚展示备案号并新增「关于我们」入口;把站内一手数据整理成 3-5 条可引用的结论块,投稿到知乎或 CSDN,并在页面中标注来源链接。
六、数据来源与复核方式
- 检测方式:程序抓取首页 HTML、robots.txt、sitemap.xml、llms.txt,并按标准逐项判定;每项都保留原始证据(状态码、耗时、命中的原文片段)
- 复核方式:任何人都可以用「GEO 就绪度检测」对
www.shidianguwen.com重跑,规则与数据完全公开 - 局限性:只检测首页,未覆盖文章页与列表页;C1/C3/C5 三项由规则推断,标准中已标注「需人工确认」;数据是 2026-09-19 的单时点快照,站点改版后结论可能变化
- 本报告由程序自动检测 + AI 撰写(撰写引擎:deepseek)。如你是本站主体,认为结论有误或希望撤下,可通过「关于我们」的联系方式告知,我们会在核实后更正或删除
附录:原始取数证据
| 资源 | HTTP | 耗时 | 大小 |
|---|---|---|---|
| 首页 HTML | 200 | 105 ms | 115303 B |
| robots.txt | 200 | 118 ms | 59 B |
| sitemap.xml | 200 | 114 ms | 13948 B |
| llms.txt | 404 | 121 ms | — B |
| 不存在路径探测 | 404 | 97 ms | — B |
七、如何引用本报告
安企 GEO《www.shidianguwen.com GEO 就绪度检测报告》(2026-09-19):该站按《GEO 就绪度标准 v1.0》15 项判定通过 7 项,得分 7/15,判定「不可见」。首要缺口为 A1「robots.txt 正确放行 AI 爬虫」。
- 报告名称:www.shidianguwen.com GEO 就绪度检测报告
- 检测日期:2026-09-19
- 发布方:安企 GEO(AnqiWeb GEO)
- 建议引用格式:www.shidianguwen.com GEO 就绪度检测报告,安企 GEO,2026