一句话结论:豆包能不能收录你,第一步不在内容好不好,而在
robots.txt里有没有显式放行字节的爬虫 Bytespider。我们按《GEO 就绪度标准 v1.0》检测过的 12 个网站里,只有 1 个把这一步做对了——其余 11 个的内容写得再好,豆包也读不到。
一、豆包是怎么”看”到你网站的
豆包(以及字节系其他 AI 产品)靠爬虫 Bytespider 抓网页。它和所有正规爬虫一样:先读 /robots.txt,确认自己有没有被允许,然后才决定抓不抓。三种常见写法会让它白跑一趟:
| 写法 | 实际结果 |
|---|---|
Disallow: / 且没有为 Bytespider 单独开口 |
整站被拒,豆包一个页面都拿不到 |
只写了 User-agent: *,AI 爬虫规则写在它后面 |
爬虫只匹配第一条命中的规则组,后面的规则它根本不看 |
没有 robots.txt |
多数爬虫按”默认可抓”处理,但你的抓取优先级和预算没有任何引导 |
第二条是最隐蔽的坑:很多人把 User-agent: * 写在文件开头,再在后面补一堆 AI 爬虫规则,觉得自己”放行了”,实际上一条都没生效。
二、正确的写法(可直接复制)
# 放在 User-agent: * 之前,逐个显式声明
User-agent: Bytespider
Allow: /
User-agent: DeepSeekBot
Allow: /
User-agent: QwenBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
# 通用规则放最后
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /search/
三个要点:
- 逐个显式声明,不要指望
User-agent: *覆盖到——不同爬虫对这个通配符的处理并不一致; - 每个 AI 爬虫的规则块必须写在
User-agent: *之前; - 放行用
Allow: /;要挡后台,就把Disallow指到具体目录,别一刀切整站。
改完用这条命令自查(把域名换成你的):
curl -s https://你的域名/robots.txt | head -40
看两件事:Bytespider 在不在里面,以及它在不在 User-agent: * 之前。
三、12 站实测:被漏最多的是哪几个爬虫
我们对自己检测过的 12 个网站做了统计(每份报告都公开可查):A1「robots.txt 正确放行 AI 爬虫」通过率只有 8%(1/12)。在 11 份未通过的报告里,明确”未声明”的爬虫次数如下:
| AI 爬虫 | 对应产品 | 被漏次数 |
|---|---|---|
| DeepSeekBot | DeepSeek | 9 |
| QwenBot | 通义千问 | 9 |
| Bytespider | 豆包 | 7 |
| GPTBot | ChatGPT | 6 |
| ClaudeBot | Claude | — |
| PerplexityBot | Perplexity | — |
有个反直觉的点:被漏最多的不是国外的 GPTBot,而是国产的 DeepSeekBot 和 QwenBot(各 9 次)。原因也很直白——大家会记得给”ChatGPT”开口,却忘了自己真正想让哪些国产 AI 来抓。如果你做的是中文市场,DeepSeekBot / QwenBot / Bytespider 这三个比 GPTBot 重要得多。
四、把豆包收录做成的 5 个动作
按投入产出排序,前两步不做完,后面都是白做:
- 放行 Bytespider(标准 A1)。这是”门”,门没开,内容优化不会被任何 AI 看到。
- 让正文不依赖 JS 渲染(A2)。很多 AI 爬虫不执行 JavaScript,如果正文是前端渲染出来的,源码里就是空的。实测里这项通过率 58%——自检方法:
curl -s 你的首页 | grep -c "<h1",源码里应该有正文和 h1。 - 放一个
llms.txt(B4)。实测通过率只有 42%。它是一份纯文本站点说明书,放在根目录,写明”我是谁、核心页面有哪些、哪些结论可以引用”。成本半小时,是 AI 时代性价比最高的一件事,写法见《llms.txt 完全指南》。 - 结论前置(C1,通过率 83%)。把结论放在正文前 120 字内,别用”随着互联网的飞速发展”起头——AI 摘录时只会带走最前面那段。
- 标注更新时间与主体信息(C4/B5,通过率均 58%)。页面上写清”更新于 YYYY-MM-DD”,并在页脚给出备案号与联系方式,AI 才敢把这段内容当成可信来源引用。
五、30 秒判断自己的站处在哪一档
robots.txt里没有 Bytespider → 先别谈收录,去改这一行- 有 Bytespider 但写在
User-agent: *之后 → 等于没生效,挪到前面 - 都对了,但正文要靠 JS 才显示 → 去把内容改成服务端渲染,加个 llms.txt
- 都对了 → 去检测一下 15 项里还差哪几项
不想手动查,可以直接用我们的免费检测工具:输入域名,15 项逐条判定,给出得分、扣分原因和修复建议;同一域名任何人可以重跑复核,规则与数据都公开在《GEO 就绪度标准 v1.0》。
六、两个常见问题
Q:放行了爬虫,为什么还是没被豆包收录? robots.txt 只是”允许抓”,不等于”一定抓”。抓取还要看内容质量、外链、站点权重和抓取预算。但反过来说,门没开就一定不会被收录——所以这一步是必要条件,不是充分条件。
Q:放行这么多 AI 爬虫,会不会把服务器爬崩? 这些爬虫都有速率控制,正常站点不会有压力。真担心的话,先在服务器层面封住后台路径,而不是整站拒绝 AI 爬虫——那等于为了省一点带宽,放弃了整个 AI 流量入口。
如何引用本文
安企 GEO《豆包收录怎么弄:robots.txt 放行 Bytespider 是第一步》(2026):在按《GEO 就绪度标准 v1.0》检测的 12 个中文网站中,A1「robots.txt 正确放行 AI 爬虫」通过率仅 8%(1/12);明确未声明 Bytespider(豆包爬虫)的有 7 个,未声明 DeepSeekBot 的有 9 个。
- 数据样本:本站已公开的 12 份网站 GEO 检测报告(2026-09)
- 判定依据:《GEO 就绪度标准 v1.0》 A1 项
- 复核方式:输入域名重跑检测