一句话结论:想让网站出现在 Kimi 的搜索结果里,robots.txt 必须显式放行
Kimi-SearchBot。只放行KimiBot是不够的——那是训练爬虫,和「能不能被引用」是两件事。Kimi 官方把爬虫按用途拆成了三个,分开配置。
一、Kimi 的三个爬虫,用途完全不同
依据 Kimi 官方爬虫政策页(kimi.ai/policies/kimi-crawlers):
| 爬虫 | 用途 | 不放行的后果 |
|---|---|---|
KimiBot |
抓取内容,用于训练 Kimi 的基础模型 | 你的内容不会被用于训练;不影响你在 Kimi 搜索里的可见性 |
Kimi-User |
用户触发的实时抓取(用户让 Kimi 总结某篇文章、回答一个需要联网的问题) | 可能降低站点在用户发起检索时的可见性。官方明确说明:因为是用户触发,robots.txt 规则不一定适用 |
Kimi-SearchBot |
分析页面相关性、构建 Kimi 的搜索索引 | 站点不会出现在 Kimi 搜索结果中 |
关键点:决定「AI 答案里有没有你」的是 Kimi-SearchBot。它和豆包的 Bytespider、DeepSeek 的 DeepSeekBot 是同一类角色。
二、正确的 robots.txt 写法
精确放行必须写在 User-agent: * 之前——爬虫只匹配第一条命中自己的规则组,写在通配规则之后等于没写:
# AI 搜索引用型:决定 AI 答案里有没有你
User-agent: Bytespider
Allow: /
User-agent: DeepSeekBot
Allow: /
User-agent: QwenBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Kimi:三个爬虫按用途分开
User-agent: Kimi-SearchBot
Allow: /
User-agent: KimiBot
Allow: /
User-agent: Kimi-User
Allow: /
# 通配规则放最后,避免覆盖上面的精确放行
User-agent: *
Disallow: /system
Disallow: /static
想只做训练授权、不要搜索结果?那就反过来,只放行 Kimi-SearchBot、Disallow 掉 KimiBot。两个方向都能配,关键是你知道自己在授权什么。
三、三步自查
- 看文件:浏览器打开
你的域名/robots.txt,搜Kimi,确认三件事——名字拼写、Allow: /存在、位置在User-agent: *之前。 - 看请求:在服务器访问日志里检索
Kimi-SearchBot,长期为 0 说明入口没通(或是还没被抓过)。 - 核来源:Kimi 公开了各爬虫的 IP 段(
kimibot.json、kimi-user.json、kimi-searchbot.json,都在政策页同目录下),命中这些段的请求才是真 Kimi。
四、三个真实踩坑点
坑一:只放行 KimiBot。 训练授权和搜索索引是两条独立通道,配了一个不等于开了另一个。这是最常见的误解。
坑二:robots.txt 放行了,但 CDN/WAF 按 UA 拦。 文件是说明,请求能不能进来由边缘决定。有些云 WAF 默认规则会把「非浏览器 UA」当爬虫拦掉,此时 robots.txt 再正确也没用——要在日志里看到 200 的抓取记录才算通。
坑三:屏蔽 Kimi 的 IP 段。 官方明确提示:他们从动态 IP 段运营,屏蔽 IP 可能导致爬虫读不到你最新的 robots.txt。想控制抓取,用 robots.txt,别用防火墙。同理,Kimi-User 是用户发起的行为,robots.txt 对它不一定生效——真要限制,得上访问控制。
五、我们实测到的情况
截至 2026-09-20,GEO 就绪度榜收录 16 个中文站点,A1(robots.txt 正确放行 AI 爬虫)通过率 1⁄16。榜单里 8 项爬虫逐一列出,缺哪一个直接看得见——A1 未通过 15 这个数字背后,多数站点是「一个都没写」,少数是「写了但位置在通配规则之后」。
本次我们同步做了一件事:把 KimiBot 与 Kimi-SearchBot 加进了《GEO 就绪度标准 v1.0》的 A1 清单(原为 6 个爬虫,现为 8 个),本站 robots.txt 也已按上面的写法放行。此前出具的报告按旧清单判定,会在下次复检时按新清单重判——这也是我们给每份报告做复检机制的原因:标准改了,旧结论不能一直挂着。
六、常见问题
Q:放行了 Kimi-SearchBot,多久能在 Kimi 里搜到?
A:没有官方承诺的时限。检索索引的更新取决于抓取频率与站点权重,能确认的是入口通了(日志里有 200 抓取)。别把它当提交收录的开关。
Q:Kimi-User 要不要放行?
A:它是用户提问触发的实时抓取,不是批量爬。挡掉它并不会让内容「不被引用」,但可能让用户在 Kimi 里求总结时拿不到你的页面。默认建议放行。
Q:我用了 Cloudflare / 宝塔 WAF,会影响吗? A:会。先在日志里确认真实抓取返回 200;如果被边缘拦掉,先去 WAF 里给这些 UA 放行,再回来看 robots.txt。
Q:这 8 个爬虫必须全放行吗? A:标准里 A1 的合格线是全部显式放行。你可以按业务取舍,但每挡掉一个,就等于放弃那一类 AI 产品的答案位——这个选择应该是明知代价的,而不是漏写的。
想先知道自己缺哪一个?GEO 就绪度检测会逐项给出证据与可直接复制的修复片段;担心规则和判定口径,可以先读标准全文。同类问题另见:豆包收录怎么弄、DeepSeek 收录怎么做。