核心结论:在《GEO 就绪度标准 v1.0》的 15 项里,A1(robots.txt 正确放行 AI 爬虫)是失败率最高的一项——我们的实测通过率只有 5%。好消息是:它也是最容易修的,改对只需在 robots.txt 里加 6 段声明,10 分钟能做完。

一、为什么这一项最致命

被 robots.txt 屏蔽的爬虫,不会产生任何服务器请求

这句话的含义比它听起来严重得多:

  • 你的内容从未进入 AI 的索引
  • 后面所有优化——结构化数据、llms.txt、结论前置、独家数据——全部归零
  • 而且它不报错、不提示:你看到的是网站一切正常,只是 AI 从不引用你

在我们实测的 19 个中文站点里,只有 1 个做对了这一项。绝大多数站点的 robots.txt 只有一条 User-agent: *,没有任何针对 AI 爬虫的声明。

二、可直接复制的配置

把下面这段放在 robots.txt 的最前面

# --- AI 搜索引用型爬虫(决定 AI 答案里有没有你)---
User-agent: Bytespider
Allow: /

User-agent: DeepSeekBot
Allow: /

User-agent: QwenBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# --- 传统搜索引擎 ---
User-agent: Baiduspider
Allow: /

User-agent: Sogou web spider
Allow: /

User-agent: 360Spider
Allow: /

User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

# --- 通配规则放最后,避免覆盖上面的精确放行 ---
User-agent: *
Disallow: /system
Disallow: /static
Disallow: /api

Sitemap: https://你的域名.com/sitemap.xml

爬虫名单对照

User-Agent 归属
Bytespider 字节 / 豆包
DeepSeekBot 深度求索
QwenBot 阿里 / 通义
GPTBot OpenAI
OAI-SearchBot OpenAI 搜索引用
ClaudeBot Anthropic
PerplexityBot Perplexity

三、一个必须记住的规则:顺序决定成败

robots.txt 的判定遵循最长匹配优先,长度相同时 Allow 优先

但更常见的问题是顺序:如果你的 User-agent: * 写在了 AI 爬虫之前,那么通配规则会先命中,后面的精确放行可能被覆盖

实践结论:把所有 AI 爬虫的精确放行写在 User-agent: * 之前,不要依赖匹配算法去救你。

四、一个我们亲自踩到的坑:注释里的 User-agent: *

我们在自己的 robots.txt 顶部写了一段说明,其中有一句:

# 否则会被 User-agent: * 覆盖(最长匹配优先)。

结果这段注释里的 User-agent: * 被判定程序当成了真实规则,位置比真正的爬虫声明还靠前,于是判定「所有爬虫都在通配符之后」→ 全线不通过。

这是判定工具的通病(我们已修复:解析前先剥离 # 注释行)。但对你有个实用提醒:

不要在 robots.txt 的注释里写 User-agent: * 这几个字,很多工具和脚本会误判。

五、怎么验证真的生效了

改完不要靠感觉,看日志:

grep -iE "GPTBot|Bytespider|DeepSeekBot|QwenBot|ClaudeBot|PerplexityBot" /path/to/access.log \
  | awk '{print $1, $12}' | sort | uniq -c | sort -rn | head -20
  • 有记录 → 爬虫进来了,A1 生效
  • 长期为 0 → 检查 robots.txt 放行状态,或者站点防火墙是否拦了非常规请求

六、三个常见误区

误区 事实
「我允许了 User-agent: * 就等于允许所有爬虫」 通配允许不等于放行声明。AI 爬虫的判定越来越依赖显式声明
「屏蔽 AI 爬虫能保护内容」 屏蔽引用型爬虫 = 主动退出 AI 答案池;而且 robots.txt 是君子协定,拦不住不守规的抓取方
「配完就不用管了」 爬虫 UA 名单变化很快,建议每季度核对一次

七、立刻检查你的站

用「GEO 就绪度检测」输入网址,A1 会直接告诉你 6 个爬虫里哪几个没放行、以及是否被通配符覆盖。

依据《GEO 就绪度标准 v1.0》A1 条:robots.txt 中 6 个 AI 爬虫须显式放行,且精确 Allow 规则须位于 User-agent: * 之前;任一项不通过,总分即判定为「不可见」。