睿见 GEO
GUIDE · 动手清单

怎么让 AI 爬虫读得到你的网站

从 robots.txt 开始,一份可以直接抄的配置

先确认你有没有被挡

AI 要引用你,第一步得能读到你。这一步卡住的企业比想象中多,而且往往当事人完全不知道——网站是几年前外包做的,防火墙和安全插件按默认设置拦掉了一批「非常规爬虫」,AI 爬虫正好在里面。

自查只要一分钟:在浏览器地址栏输入你的域名加 `/robots.txt`(比如 `example.com/robots.txt`)。看到的内容里如果有 `Disallow: /`,或者出现了 `GPTBot`、`Bytespider` 这类名字后面跟着 `Disallow`,那就是被挡了。什么都没有(404)也不算好事,但至少不是主动拦截。

一份可以直接抄的配置

把下面这段存成 `robots.txt`,放在网站根目录(也就是能通过 `你的域名/robots.txt` 访问到的位置)。最后一行的域名换成你自己的。

# --- AI 爬虫:显式放行 ---
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Google-Extended
User-agent: Bytespider
User-agent: DeepSeekBot
User-agent: Qwen-SearchBot
User-agent: MoonshotBot
User-agent: PetalBot
Allow: /

# --- 传统搜索引擎 ---
User-agent: Baiduspider
Allow: /

User-agent: Googlebot
Content-Signal: ai-train=yes, search=yes, ai-input=yes
Allow: /

# --- 其余爬虫 ---
User-agent: *
Allow: /

Sitemap: https://你的域名/sitemap.xml

几个容易写错的地方

  • ·文件必须在根目录,放在子目录里不生效。`example.com/robots.txt` 能打开才算数。
  • ·`User-agent` 可以连写多行再跟一条 `Allow`,上面那段就是这么写的——不用每个爬虫重复一遍规则。
  • ·别用 `Disallow:`(后面留空)来表示放行,虽然它确实等价,但可读性差,接手的人容易误改成 `Disallow: /`。用 `Allow: /` 更清楚。
  • ·改完等几分钟再访问验证,有些 CDN 会缓存这个文件。

Content-Signal 是什么

上面配置里 Googlebot 那段多了一行 `Content-Signal`。这是一个较新的声明方式,用来分开表达三件不同的事:允许拿去训练模型(`ai-train`)、允许用于搜索索引(`search`)、允许在 AI 回答时引用(`ai-input`)。

对绝大多数希望被 AI 推荐的企业来说,三项都设成 `yes` 是合理的——你要的就是被引用。如果你有不希望被拿去训练的内容(比如原创研究报告),可以把 `ai-train` 设成 `no` 而保留 `ai-input=yes`。

这行不是必须的,不写也不影响放行。它更像一个明确的态度声明,支持它的爬虫会照做。

放行了,不等于一定会被抓

这一点要说在前面,免得你改完等了两周没变化以为白做了。

robots.txt 是一道门,把门打开是必要条件,但爬虫来不来、多久来一次,是对方决定的,你没法控制。网站更新频率、有没有外部链接指向你、内容对不对得上用户在问的问题,都会影响它的抓取优先级。

所以正确的期待是:打开门是第一步,不是最后一步。门开了之后,还得让里面的内容值得抄——那是另一件事,见下面的延伸阅读。

延伸阅读

不确定自己的网站现在什么状况?

免费的技术诊断会实际抓取你的网站,检查 robots.txt、llms.txt、结构化数据等 12 项,两分钟出结果。