AI 的答案,到底是从哪来的
两个来源,只有一个是你现在能动的
两个来源,别混为一谈
你问 AI「XX 这家公司怎么样」,它给出的那段话里,信息其实来自两个完全不同的地方。
第一个是训练时记下的。模型在训练阶段读过海量网页,关于你的信息如果当时被读到了,就以某种方式留在了模型里。这部分的关键性质是:它已经冻住了。模型训练完成的那一刻,这部分内容就定格了,你今天在官网上改什么都不会影响它,要等下一次训练。
第二个是回答时当场搜到的。现在主流的 AI 助手在遇到具体的品牌、地点、价格这类问题时,会先去搜一遍,把搜到的网页读进来,再据此组织回答。这部分每次都在重新发生——你昨天新发的一篇内容,今天就可能被读到。
性质差在哪
同一个「AI 知道我」,来自哪一层,能做的事完全不同:
| 训练时记下的 | 回答时搜到的 | |
|---|---|---|
| 什么时候定的 | 模型训练完成时 | 每次提问时 |
| 你能不能影响 | 改不了,只能等下次训练 | 能——它读的是现在网上的内容 |
| 看得见吗 | 看不见,只能从回答里猜 | 看得见,接口会返回引用的网页 |
| 出错时 | 很难纠正,可能反复出现 | 改掉源头,下次就跟着变 |
所以 GEO 使劲的地方是第二层
这就是整件事的关键:几乎所有能在几个月内见效的动作,作用的都是第二层。
让 AI 爬虫进得来、把事实写成能被摘走的句子、在官网之外的地方留下一致的说法——这些都是在改变「AI 当场能搜到什么」。它们不需要等下一次模型训练,因为它们本来就不作用在那一层。
反过来,任何声称能「让 AI 记住你」的说法都值得警惕。模型记住什么不是你能安排的事,而且那部分即使真的变了,也要等好几个月才随新版本出来。
怎么看出这次是搜过的
有个很直接的判断方法:看它答没答出只有最近才能知道的事。问一个你上个月刚上线的服务、刚开的新店,如果它答得出来,那一定是搜到的——训练数据里不可能有。
我们的扫描报告里也有一块专门给这个:每家平台返回的引用来源会跨平台汇总成一份域名排行,告诉你 AI 这次到底读了哪些网页。看到自己的官网一次都没出现,说明 AI 说起你的时候用的全是别人写的内容。
要注意的是,各家平台的检索能力不一样,而且接口和 App 不是一回事。比如 DeepSeek 官方接口根本不提供联网检索,我们测的是火山方舟托管的那一版;腾讯元宝 App 接了微信生态里的内容,而公开的混元接口没有。这些差别在平台机制那篇里逐家讲了。
一个常见的误解
很多人以为「被 AI 搜到」和「被百度搜到」是一回事,做好 SEO 就自动做好了 GEO。方向上确实有重叠——两者都要求内容可被抓取、结构清楚——但目标不同。
搜索引擎给你一个排名,用户自己点进去看。AI 是把内容读完之后替用户转述,用户很可能不会点开任何一个链接。所以对 SEO 来说重要的是「排得够前」,对 GEO 来说重要的是「说得够具体,让 AI 有东西可转述」。一个满是形容词的首页可能排名不错,但 AI 从里面抄不出任何一句能用的话。
延伸阅读
- 5 个 AI 平台,各自怎么找信息
逐家说明五个平台的检索机制差别,以及为什么接口测出来的结果和 App 里不完全一样。
- 同一个问题问两次,答案为什么不一样
四个来源导致同一个问题两次答案不同。怎么把真实变化和噪声区分开。
- 官网之外,还有哪些地方在影响 AI 对你的判断
百科、问答、内容平台、行业站、地图——它们各自怎么影响 AI 对你的判断。
