一句话结论:想让网站出现在 Kimi 的搜索结果里,robots.txt 必须显式放行 Kimi-SearchBot。只放行 KimiBot 是不够的——那是训练爬虫,和「能不能被引用」是两件事。Kimi 官方把爬虫按用途拆成了三个,分开配置。

一、Kimi 的三个爬虫,用途完全不同

依据 Kimi 官方爬虫政策页(kimi.ai/policies/kimi-crawlers):

爬虫 用途 不放行的后果
KimiBot 抓取内容,用于训练 Kimi 的基础模型 你的内容不会被用于训练;不影响你在 Kimi 搜索里的可见性
Kimi-User 用户触发的实时抓取(用户让 Kimi 总结某篇文章、回答一个需要联网的问题) 可能降低站点在用户发起检索时的可见性。官方明确说明:因为是用户触发,robots.txt 规则不一定适用
Kimi-SearchBot 分析页面相关性、构建 Kimi 的搜索索引 站点不会出现在 Kimi 搜索结果中

关键点:决定「AI 答案里有没有你」的是 Kimi-SearchBot。它和豆包的 Bytespider、DeepSeek 的 DeepSeekBot 是同一类角色。

二、正确的 robots.txt 写法

精确放行必须写在 User-agent: * 之前——爬虫只匹配第一条命中自己的规则组,写在通配规则之后等于没写:

# AI 搜索引用型:决定 AI 答案里有没有你
User-agent: Bytespider
Allow: /

User-agent: DeepSeekBot
Allow: /

User-agent: QwenBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Kimi:三个爬虫按用途分开
User-agent: Kimi-SearchBot
Allow: /

User-agent: KimiBot
Allow: /

User-agent: Kimi-User
Allow: /

# 通配规则放最后,避免覆盖上面的精确放行
User-agent: *
Disallow: /system
Disallow: /static

想只做训练授权、不要搜索结果?那就反过来,只放行 Kimi-SearchBotDisallowKimiBot。两个方向都能配,关键是你知道自己在授权什么。

三、三步自查

  1. 看文件:浏览器打开 你的域名/robots.txt,搜 Kimi,确认三件事——名字拼写、Allow: / 存在、位置在 User-agent: * 之前。
  2. 看请求:在服务器访问日志里检索 Kimi-SearchBot,长期为 0 说明入口没通(或是还没被抓过)。
  3. 核来源:Kimi 公开了各爬虫的 IP 段(kimibot.jsonkimi-user.jsonkimi-searchbot.json,都在政策页同目录下),命中这些段的请求才是真 Kimi。

四、三个真实踩坑点

坑一:只放行 KimiBot 训练授权和搜索索引是两条独立通道,配了一个不等于开了另一个。这是最常见的误解。

坑二:robots.txt 放行了,但 CDN/WAF 按 UA 拦。 文件是说明,请求能不能进来由边缘决定。有些云 WAF 默认规则会把「非浏览器 UA」当爬虫拦掉,此时 robots.txt 再正确也没用——要在日志里看到 200 的抓取记录才算通。

坑三:屏蔽 Kimi 的 IP 段。 官方明确提示:他们从动态 IP 段运营,屏蔽 IP 可能导致爬虫读不到你最新的 robots.txt。想控制抓取,用 robots.txt,别用防火墙。同理,Kimi-User 是用户发起的行为,robots.txt 对它不一定生效——真要限制,得上访问控制。

五、我们实测到的情况

截至 2026-09-20,GEO 就绪度榜收录 16 个中文站点,A1(robots.txt 正确放行 AI 爬虫)通过率 116。榜单里 8 项爬虫逐一列出,缺哪一个直接看得见——A1 未通过 15 这个数字背后,多数站点是「一个都没写」,少数是「写了但位置在通配规则之后」。

本次我们同步做了一件事:把 KimiBotKimi-SearchBot 加进了《GEO 就绪度标准 v1.0》的 A1 清单(原为 6 个爬虫,现为 8 个),本站 robots.txt 也已按上面的写法放行。此前出具的报告按旧清单判定,会在下次复检时按新清单重判——这也是我们给每份报告做复检机制的原因:标准改了,旧结论不能一直挂着。

六、常见问题

Q:放行了 Kimi-SearchBot,多久能在 Kimi 里搜到? A:没有官方承诺的时限。检索索引的更新取决于抓取频率与站点权重,能确认的是入口通了(日志里有 200 抓取)。别把它当提交收录的开关。

Q:Kimi-User 要不要放行? A:它是用户提问触发的实时抓取,不是批量爬。挡掉它并不会让内容「不被引用」,但可能让用户在 Kimi 里求总结时拿不到你的页面。默认建议放行。

Q:我用了 Cloudflare / 宝塔 WAF,会影响吗? A:会。先在日志里确认真实抓取返回 200;如果被边缘拦掉,先去 WAF 里给这些 UA 放行,再回来看 robots.txt。

Q:这 8 个爬虫必须全放行吗? A:标准里 A1 的合格线是全部显式放行。你可以按业务取舍,但每挡掉一个,就等于放弃那一类 AI 产品的答案位——这个选择应该是明知代价的,而不是漏写的。


想先知道自己缺哪一个?GEO 就绪度检测会逐项给出证据与可直接复制的修复片段;担心规则和判定口径,可以先读标准全文。同类问题另见:豆包收录怎么弄DeepSeek 收录怎么做