一句话结论:在我们检测过的 12 个网站里,11 个没有正确放行 AI 爬虫;其中明确”未声明 DeepSeekBot“的有 9 个。更麻烦的是,不少人以为自己放行了——规则写在了 User-agent: * 后面,等于没写。

一、DeepSeek 是靠什么抓你网站的

DeepSeek 的回答里之所以会出现某些网站的内容,前提是它的爬虫 DeepSeekBot 抓到了这些页面。它和所有正规爬虫一样,先读 /robots.txt

你可能写的 DeepSeekBot 实际看到的
User-agent: * + Disallow: /admin/ 允许抓取(除了 /admin/)——多数情况下能抓
User-agent: * + Disallow: / 或全站屏蔽插件默认配置 整站被拒,DeepSeek 永远读不到你
在文件末尾补 User-agent: DeepSeekBot / Allow: / ⚠️ 很可能无效:爬虫只匹配第一条命中的规则组
开头就写 User-agent: DeepSeekBot / Allow: / ✅ 正确

第三条是最常见的错误:顺序写反了。robots.txt 的匹配规则是”从头往下找,命中第一个匹配自己 UA 的组就停”——你把 User-agent: * 放在最前面,后面再写多少 AI 爬虫都形同虚设。

二、正确写法(复制即用)

# ① AI 爬虫规则必须在 User-agent: * 之前
User-agent: DeepSeekBot
Allow: /

User-agent: Bytespider
Allow: /

User-agent: QwenBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# ② 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /api/

自查命令(看 DeepSeekBot 是否存在、以及它在不在 User-agent: * 之前):

curl -s https://你的域名/robots.txt | grep -n -i -A1 "deepseekbot\|user-agent: \*"

三、12 站实测:被漏最多的就是国产爬虫

我们把自己检测过的 12 个网站做了一次汇总(每份报告都公开可查):

AI 爬虫 对应产品 未声明次数
DeepSeekBot DeepSeek 9
QwenBot 通义千问 9
Bytespider 豆包 7
GPTBot ChatGPT 6

结论很清楚:大家记得给 ChatGPT 开口,却忘了给 DeepSeek、通义千问、豆包开口。如果你做的是中文市场,DeepSeekBot 的价值远高于 GPTBot——而它恰恰是漏得最多的一个。

四、放行只是第一关,DeepSeek 真正”愿意引用”还差三件事

在我们统计的 12 份报告里,这三项的通过率都很低,而它们直接决定 DeepSeek 会不会把你的内容当成答案来源

检查项 通过率 为什么影响引用
A1 robots.txt 放行 8%(1/12) 门没开,一切免谈
B2 结构化数据(JSON-LD) 8%(1/12) AI 要靠 WebSite / Organization 确认”你是谁、这个页面讲什么”,缺了就只能猜
C5 第三方引用痕迹 8%(1/12) 有外部出处标注的内容,被引用的意愿更高

B2 最常见的缺口是没有 sameAsOrganization:AI 无法把你这个域名、你的品牌名、你的其他身份(公众号、知乎、GitHub)关联成同一个实体。最小可用版本如下(放在 <head> 里):

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"你的品牌名","url":"https://你的域名/",
 "sameAs":["https://www.zhihu.com/org/xxx","https://github.com/xxx"]}
</script>
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"WebSite",
 "name":"你的站点名","url":"https://你的域名/"}
</script>

五、按顺序做这 5 步

  1. 把 DeepSeekBot 挪到 User-agent: * 之前(A1)——10 分钟,收益最大;
  2. 同时补上 QwenBot、Bytespider——中文市场这三个是一组;
  3. 加 JSON-LD(B2),至少 WebSite + Organization + sameAs
  4. 正文改成服务端渲染(A2,通过率 58%),保证源码里能直接读到正文与 h1;
  5. llms.txt(B4,通过率 42%),把”哪些结论可以被引用”写清楚。

六、30 秒确认自己在哪一档

  • robots.txt 里没有 DeepSeekBot → 先改这一行
  • 有,但排在 User-agent: * 后面 → 等于没写,挪到最前面
  • 都对了但没有 JSON-LD → 去补结构化数据
  • 都对了 → 用免费检测工具跑一遍,看 15 项里还差哪几项

判定规则全部公开在《GEO 就绪度标准 v1.0》,同一域名任何人都可以重跑复核。

如何引用本文

安企 GEO《DeepSeek 收录怎么做》(2026):在按《GEO 就绪度标准 v1.0》检测的 12 个中文网站中,11 个未正确放行 AI 爬虫,其中明确未声明 DeepSeekBot 的有 9 个;结构化数据(B2)与第三方引用痕迹(C5)的通过率同样只有 8%。