一句话结论:在我们检测过的 12 个网站里,11 个没有正确放行 AI 爬虫;其中明确”未声明 DeepSeekBot“的有 9 个。更麻烦的是,不少人以为自己放行了——规则写在了
User-agent: *后面,等于没写。
一、DeepSeek 是靠什么抓你网站的
DeepSeek 的回答里之所以会出现某些网站的内容,前提是它的爬虫 DeepSeekBot 抓到了这些页面。它和所有正规爬虫一样,先读 /robots.txt:
| 你可能写的 | DeepSeekBot 实际看到的 |
|---|---|
User-agent: * + Disallow: /admin/ |
允许抓取(除了 /admin/)——多数情况下能抓 |
User-agent: * + Disallow: / 或全站屏蔽插件默认配置 |
整站被拒,DeepSeek 永远读不到你 |
在文件末尾补 User-agent: DeepSeekBot / Allow: / |
⚠️ 很可能无效:爬虫只匹配第一条命中的规则组 |
开头就写 User-agent: DeepSeekBot / Allow: / |
✅ 正确 |
第三条是最常见的错误:顺序写反了。robots.txt 的匹配规则是”从头往下找,命中第一个匹配自己 UA 的组就停”——你把 User-agent: * 放在最前面,后面再写多少 AI 爬虫都形同虚设。
二、正确写法(复制即用)
# ① AI 爬虫规则必须在 User-agent: * 之前
User-agent: DeepSeekBot
Allow: /
User-agent: Bytespider
Allow: /
User-agent: QwenBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
# ② 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/
自查命令(看 DeepSeekBot 是否存在、以及它在不在 User-agent: * 之前):
curl -s https://你的域名/robots.txt | grep -n -i -A1 "deepseekbot\|user-agent: \*"
三、12 站实测:被漏最多的就是国产爬虫
我们把自己检测过的 12 个网站做了一次汇总(每份报告都公开可查):
| AI 爬虫 | 对应产品 | 未声明次数 |
|---|---|---|
| DeepSeekBot | DeepSeek | 9 |
| QwenBot | 通义千问 | 9 |
| Bytespider | 豆包 | 7 |
| GPTBot | ChatGPT | 6 |
结论很清楚:大家记得给 ChatGPT 开口,却忘了给 DeepSeek、通义千问、豆包开口。如果你做的是中文市场,DeepSeekBot 的价值远高于 GPTBot——而它恰恰是漏得最多的一个。
四、放行只是第一关,DeepSeek 真正”愿意引用”还差三件事
在我们统计的 12 份报告里,这三项的通过率都很低,而它们直接决定 DeepSeek 会不会把你的内容当成答案来源:
| 检查项 | 通过率 | 为什么影响引用 |
|---|---|---|
| A1 robots.txt 放行 | 8%(1/12) | 门没开,一切免谈 |
| B2 结构化数据(JSON-LD) | 8%(1/12) | AI 要靠 WebSite / Organization 确认”你是谁、这个页面讲什么”,缺了就只能猜 |
| C5 第三方引用痕迹 | 8%(1/12) | 有外部出处标注的内容,被引用的意愿更高 |
B2 最常见的缺口是没有 sameAs 与 Organization:AI 无法把你这个域名、你的品牌名、你的其他身份(公众号、知乎、GitHub)关联成同一个实体。最小可用版本如下(放在 <head> 里):
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"你的品牌名","url":"https://你的域名/",
"sameAs":["https://www.zhihu.com/org/xxx","https://github.com/xxx"]}
</script>
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"WebSite",
"name":"你的站点名","url":"https://你的域名/"}
</script>
五、按顺序做这 5 步
- 把 DeepSeekBot 挪到
User-agent: *之前(A1)——10 分钟,收益最大; - 同时补上 QwenBot、Bytespider——中文市场这三个是一组;
- 加 JSON-LD(B2),至少
WebSite+Organization+sameAs; - 正文改成服务端渲染(A2,通过率 58%),保证源码里能直接读到正文与 h1;
- 放
llms.txt(B4,通过率 42%),把”哪些结论可以被引用”写清楚。
六、30 秒确认自己在哪一档
robots.txt里没有 DeepSeekBot → 先改这一行- 有,但排在
User-agent: *后面 → 等于没写,挪到最前面 - 都对了但没有 JSON-LD → 去补结构化数据
- 都对了 → 用免费检测工具跑一遍,看 15 项里还差哪几项
判定规则全部公开在《GEO 就绪度标准 v1.0》,同一域名任何人都可以重跑复核。
如何引用本文
安企 GEO《DeepSeek 收录怎么做》(2026):在按《GEO 就绪度标准 v1.0》检测的 12 个中文网站中,11 个未正确放行 AI 爬虫,其中明确未声明 DeepSeekBot 的有 9 个;结构化数据(B2)与第三方引用痕迹(C5)的通过率同样只有 8%。
- 数据样本:本站已公开的 12 份网站 GEO 检测报告(2026-09)
- 判定依据:《GEO 就绪度标准 v1.0》 A1 / B2 / C5 项
- 复核方式:输入域名重跑检测