一句话结论:豆包能不能收录你,第一步不在内容好不好,而在 robots.txt 里有没有显式放行字节的爬虫 Bytespider。我们按《GEO 就绪度标准 v1.0》检测过的 12 个网站里,只有 1 个把这一步做对了——其余 11 个的内容写得再好,豆包也读不到。

一、豆包是怎么”看”到你网站的

豆包(以及字节系其他 AI 产品)靠爬虫 Bytespider 抓网页。它和所有正规爬虫一样:先读 /robots.txt,确认自己有没有被允许,然后才决定抓不抓。三种常见写法会让它白跑一趟:

写法 实际结果
Disallow: / 且没有为 Bytespider 单独开口 整站被拒,豆包一个页面都拿不到
只写了 User-agent: *,AI 爬虫规则写在它后面 爬虫只匹配第一条命中的规则组,后面的规则它根本不看
没有 robots.txt 多数爬虫按”默认可抓”处理,但你的抓取优先级和预算没有任何引导

第二条是最隐蔽的坑:很多人把 User-agent: * 写在文件开头,再在后面补一堆 AI 爬虫规则,觉得自己”放行了”,实际上一条都没生效。

二、正确的写法(可直接复制)

# 放在 User-agent: * 之前,逐个显式声明
User-agent: Bytespider
Allow: /

User-agent: DeepSeekBot
Allow: /

User-agent: QwenBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /search/

三个要点:

  1. 逐个显式声明,不要指望 User-agent: * 覆盖到——不同爬虫对这个通配符的处理并不一致;
  2. 每个 AI 爬虫的规则块必须写在 User-agent: * 之前
  3. 放行用 Allow: /;要挡后台,就把 Disallow 指到具体目录,别一刀切整站。

改完用这条命令自查(把域名换成你的):

curl -s https://你的域名/robots.txt | head -40

看两件事:Bytespider 在不在里面,以及它在不在 User-agent: * 之前。

三、12 站实测:被漏最多的是哪几个爬虫

我们对自己检测过的 12 个网站做了统计(每份报告都公开可查):A1「robots.txt 正确放行 AI 爬虫」通过率只有 8%(1/12)。在 11 份未通过的报告里,明确”未声明”的爬虫次数如下:

AI 爬虫 对应产品 被漏次数
DeepSeekBot DeepSeek 9
QwenBot 通义千问 9
Bytespider 豆包 7
GPTBot ChatGPT 6
ClaudeBot Claude
PerplexityBot Perplexity

有个反直觉的点:被漏最多的不是国外的 GPTBot,而是国产的 DeepSeekBot 和 QwenBot(各 9 次)。原因也很直白——大家会记得给”ChatGPT”开口,却忘了自己真正想让哪些国产 AI 来抓。如果你做的是中文市场,DeepSeekBot / QwenBot / Bytespider 这三个比 GPTBot 重要得多

四、把豆包收录做成的 5 个动作

按投入产出排序,前两步不做完,后面都是白做:

  1. 放行 Bytespider(标准 A1)。这是”门”,门没开,内容优化不会被任何 AI 看到。
  2. 让正文不依赖 JS 渲染(A2)。很多 AI 爬虫不执行 JavaScript,如果正文是前端渲染出来的,源码里就是空的。实测里这项通过率 58%——自检方法:curl -s 你的首页 | grep -c "<h1",源码里应该有正文和 h1。
  3. 放一个 llms.txt(B4)。实测通过率只有 42%。它是一份纯文本站点说明书,放在根目录,写明”我是谁、核心页面有哪些、哪些结论可以引用”。成本半小时,是 AI 时代性价比最高的一件事,写法见《llms.txt 完全指南》
  4. 结论前置(C1,通过率 83%)。把结论放在正文前 120 字内,别用”随着互联网的飞速发展”起头——AI 摘录时只会带走最前面那段。
  5. 标注更新时间与主体信息(C4/B5,通过率均 58%)。页面上写清”更新于 YYYY-MM-DD”,并在页脚给出备案号与联系方式,AI 才敢把这段内容当成可信来源引用。

五、30 秒判断自己的站处在哪一档

  • robots.txt 里没有 Bytespider → 先别谈收录,去改这一行
  • 有 Bytespider 但写在 User-agent: * 之后 → 等于没生效,挪到前面
  • 都对了,但正文要靠 JS 才显示 → 去把内容改成服务端渲染,加个 llms.txt
  • 都对了 → 去检测一下 15 项里还差哪几项

不想手动查,可以直接用我们的免费检测工具:输入域名,15 项逐条判定,给出得分、扣分原因和修复建议;同一域名任何人可以重跑复核,规则与数据都公开在《GEO 就绪度标准 v1.0》

六、两个常见问题

Q:放行了爬虫,为什么还是没被豆包收录? robots.txt 只是”允许抓”,不等于”一定抓”。抓取还要看内容质量、外链、站点权重和抓取预算。但反过来说,门没开就一定不会被收录——所以这一步是必要条件,不是充分条件。

Q:放行这么多 AI 爬虫,会不会把服务器爬崩? 这些爬虫都有速率控制,正常站点不会有压力。真担心的话,先在服务器层面封住后台路径,而不是整站拒绝 AI 爬虫——那等于为了省一点带宽,放弃了整个 AI 流量入口。

如何引用本文

安企 GEO《豆包收录怎么弄:robots.txt 放行 Bytespider 是第一步》(2026):在按《GEO 就绪度标准 v1.0》检测的 12 个中文网站中,A1「robots.txt 正确放行 AI 爬虫」通过率仅 8%(1/12);明确未声明 Bytespider(豆包爬虫)的有 7 个,未声明 DeepSeekBot 的有 9 个。