GUIDE · 动手清单
llms.txt 是什么,要不要写
一个还没成为标准的东西,为什么仍然值得花二十分钟
先把话说在前面:它不是标准
llms.txt 是一份放在网站根目录的纯文本文件(`你的域名/llms.txt`),用简洁的语言把「这家企业是做什么的、有哪些核心信息」写给 AI 看。想法来自 robots.txt 的类比:既然有一份文件告诉爬虫哪些能抓,那也可以有一份文件告诉 AI 该怎么理解这个站。
但必须说清楚:它到今天仍然只是一个社区提案,不是行业标准,各家 AI 平台并没有承诺会读它。网上有些文章把它说得像「写了就能被 AI 优先推荐」,那是不实的。
那为什么还建议写?因为成本极低(一个纯文本文件,二十分钟的事),而潜在收益是不对称的:不被读到,你损失的只是那二十分钟;一旦被读到,你就多了一份由自己撰写、事实密度极高的自我介绍——而不是让 AI 从满是营销辞藻的官网首页里自己猜。
它和 robots.txt 不是一回事
两者经常被搞混,作用完全不同:
| robots.txt | llms.txt | |
|---|---|---|
| 作用 | 控制能不能抓 | 帮助读懂 |
| 地位 | 事实上的行业惯例,各家爬虫都遵守 | 社区提案,支持程度有限 |
| 不写的后果 | 可能被默认规则挡住 | 没有直接损失 |
| 优先级 | 必做,先做这个 | 锦上添花,做完 robots 再说 |
一份可以照抄的结构
格式是 Markdown,没有强制规范。实践下来这几段最有用——本站自己的 `llms.txt` 就是这个结构:
# 你的企业名
> 一段话说清楚:你是做什么的、服务哪类客户、
> 在哪个地区、有什么区别于同行的地方。
> 这一段最重要,AI 最可能直接引用它。
## 核心业务
- 业务一:一句话说明,带上具体的服务范围或规格
- 业务二:同上
- 业务三:同上
## 基本事实
- 成立时间:20XX 年
- 所在地:XX 省 XX 市
- 服务区域:XXX
- 资质/认证:XXX
## 常见问题
**客户最常问的那个问题?**
用两三句话正面回答,不要绕。
## 联系方式
- 电话:XXX
- 邮箱:XXX
- 官网:https://你的域名写的时候注意四件事
- ·写事实,别写形容词。「专业可靠、精益求精」这类词对 AI 毫无信息量,删掉。换成「2015 年成立,服务珠三角地区,主营 XX 设备的安装与维保」这种能被复述的句子。
- ·和官网说的保持一致。llms.txt 里写「成立于 2015 年」而官网「关于我们」写 2016 年,只会让 AI 拿不准该信哪个——不一致比不写更糟。
- ·别塞关键词。堆砌一长串行业词不会提高被引用的概率,反而让整份文件的可读性下降。
- ·记得更新。搬了地址、加了业务线,这份文件要跟着改。放着不管的旧信息,就是将来 AI 说错你的源头。
怎么确认写对了
存到网站根目录后,在浏览器里打开 `你的域名/llms.txt`,能看到纯文本内容就算部署成功(注意不要被 CDN 缓存住旧版本)。
至于「AI 有没有读到」,坦白说没有办法直接验证——各家平台都不公开这件事。可行的做法是隔一段时间扫一次,看 AI 能说出的关于你的具体事实点有没有变多。那是「内容深度」这一维在衡量的东西。
延伸阅读
- 怎么让 AI 爬虫读得到你的网站
AI 爬虫被挡在门外是最常见也最容易修的问题,附一份可直接抄走的配置。
- 结构化数据怎么加
用 JSON-LD 把企业信息标注给机器看,附三种最该加的类型和可抄代码。
- 官网内容怎么写,AI 才「抄得动」
AI 只转述能确认的具体事实。哪些句子它抄得动,哪些它会直接跳过。
