GEO 优化

你不知道的 GEO:AI 可见性的原理、实践与取舍

Created: 05/02/2026

很多人以为,AI时代的搜索,本质还是SEO的延续。

只不过换了一个入口。

但当我真正拆解AI引用逻辑后,结论完全相反。

排名不再是核心变量。

结构,才是。

我最初的触发点很简单。

有朋友告诉我,他们在问AI问题时,我的开源工具被主动推荐了。

而我什么都没做。

没有投流,没有刷排名,甚至没有刻意做SEO。

这件事本身就不正常。

于是我花了一点时间,把内容结构重新整理了一遍。

结果很明显。

AI对内容的理解和引用,都变得更准确了。

问题开始清晰。

不是AI变聪明了。

而是内容终于“被看懂了”。 image


一、为什么传统SEO逻辑在AI里失效

多数人的做法,是沿用旧逻辑。

写更多内容。 堆更多关键词。 试图进入搜索前10。

但AI根本不按这个规则来。

我查到一个关键数据。

AI Overview中,83%的引用来自搜索结果前10之外的页面。

这意味着一件事。

你不需要排名靠前。

你只需要被理解。

同时,AI搜索增长非常快。

2025年上半年同比增长527%。 到2026年2月,ChatGPT周活达到9亿。 AI引荐流量的转化率,大约是传统搜索的5倍。

但另一个现实也很关键。

AI流量占比仍不到1%。

这不是一个流量渠道。

更像是可见性渠道。

GEO不是流量策略,而是认知入口。


二、AI如何“看到”你:爬虫不是一个整体

很多人把robots.txt当开关。

要么全开,要么全关。

但问题在于。

AI爬虫不是一个东西。

而是多个角色。

如果你不区分,就会误伤。

我在实践中,把它拆成四类。

# Search & retrieval: allow
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# User-triggered: allow
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

# Training: block
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# Opt-out tokens
User-agent: Google-Extended
Disallow: /

# Undeclared: block
User-agent: Bytespider
Disallow: /

训练爬虫,用于模型训练。 搜索爬虫,用于实时回答。 用户触发爬虫,用于即时抓取。 未声明爬虫,不可控来源。

关键区别在于影响范围。

屏蔽训练爬虫,不影响当前AI搜索结果。 但屏蔽搜索爬虫,你会直接消失。

我最终的策略是:

允许搜索与用户触发爬虫。 屏蔽训练与未知来源。

这不是技术细节。

而是取舍。

你要决定,是被训练,还是被引用。


三、llms.txt:让AI先理解你是谁

传统网站是写给人看的。

但AI需要一个更直接的入口。

这就是llms.txt。

它类似robots.txt,但作用完全不同。

不是限制,而是解释。

我在根目录放了一个Markdown文件。

# Your Project Name

> One-line description of what this is.

## Links

- [Documentation](https://yoursite.com/docs)
- [GitHub](https://github.com/you/project)
- [Blog](https://yoursite.com/blog)

## About

Short paragraph explaining the project, its purpose, 
key features, and what makes it different.

image

里面只做三件事。

一句话说明你是谁。 列出关键页面。 补充背景与差异。

这看起来很简单。

但效果很直接。

AI在抓取内容时,会优先读取这个文件。

目前已有超过84万个网站部署了llms.txt,但整体采用率只有10%。

这意味着。

这是一个早期红利。

我还做了一个额外动作。

多个站点之间互相引用llms.txt。

形成一个网络结构。

无论AI从哪个入口进入,都能顺着链接找到更多内容。

这一步的本质,不是链接。

而是路径引导。


四、前提条件:AI能找到你

很多人忽略了一个前提。

你再结构化。

AI也得先找到你。

而AI的入口,依然依赖传统搜索。

ChatGPT走Bing。 Google AI Overview走Google。 Perplexity依赖搜索API。

如果没有被收录。

后面的优化全部无效。

我做的第一步,是补全搜索引擎配置。

提交sitemap。 验证站点。 检查索引状态。

同时接入IndexNow。

当内容更新时,主动通知Bing抓取。

从被动等待,变成主动触发。

这一步没有技巧。

但必须完成。 image


五、给AI一个“入口页面”,而不是碎片信息

AI不擅长拼碎片。

它更擅长理解结构。

所以我做了一件事情。

建立一个专门给AI看的知识页面。

这个页面有三层结构。 image

概览层,对应llms.txt。 完整版,对应50KB左右的完整说明。 项目层,每个项目独立页面。

再加一层。

结构化API。

例如:

/api/projects /api/blog /api/profile image

数据来自GitHub API,定期缓存刷新。

这样AI不仅能读文本。

还能直接获取结构化数据。

还有一个关键点。

叙事。

不是列项目。

而是讲关系。

这些项目之间有什么联系。 你的整体方向是什么。

当AI回答“你是谁”时。

叙事比列表更有效。


六、案例复盘:Yobi的结构设计

我在一个项目中完整实践了这套方法。

初始状态是:

多个站点分散。 信息结构不统一。 AI引用不稳定。

我做了四个调整。

第一,建立统一的llms.txt入口。 第二,增加llms-full.txt作为完整知识层。 第三,为每个项目建立独立页面。 第四,提供JSON API接口。

数据从GitHub实时拉取。

使用ISR缓存,每小时更新。

同时,将所有结构同步到主域名。

避免子域名被忽略。

整个调整完成后,大约几天时间。

AI引用开始发生变化。

描述更准确。 来源更稳定。

这不是优化内容。

而是优化理解路径。


七、内容结构:AI真正偏好的不是“短”,而是“可拆解”

很多人以为AI喜欢摘要。

但数据并不支持。

被高频引用的页面,平均接近2000词。 而低质量页面只有170词。

差距超过10倍。

关键不在长度。

而在结构。

是否有清晰段落。 是否有可复用片段。 是否有具体数据与对比。

另一个反直觉点。

FAQ结构,反而可能降低效果。

因为它缺乏连续语义。

这也解释了一个现象。

很多“为SEO写的内容”,在AI时代失效。

AI不需要关键词密度,它需要语义完整。


八、被引用的条件:不是被看到,而是被选择

AI不会引用所有检索到的内容。

数据很直接。

只有15%的页面会被最终引用。

剩下85%,被忽略。

决定因素是什么。

语义匹配。

标题是否接近用户问题。 URL是否清晰表达内容。 是否有明确结构。

例如:

/projects/pake 比 /page?id=47 更容易被引用。

因为它在路径中就表达了语义。

还有一个更重要的变量。

第三方引用。

品牌被外部网站提及的概率,是自有域名的6.5倍。

这意味着。

你说自己好,不够。

别人说你,才有效。


九、方法论总结

模块核心动作本质目标
爬虫策略分类放行与屏蔽控制可见范围
llms.txt提供结构入口帮助AI理解
搜索收录提交索引与Sitemap进入检索池
知识页面三层结构设计集中信息
API接口提供结构化数据提升解析效率
内容结构长内容+清晰分段提高引用概率
URL设计语义化路径强化理解信号
外部引用获取第三方提及提升信任度

十、进阶认知:一个容易被忽视的误区

现在市面上有很多GEO工具。

给你打分。 告诉你缺什么。

FAQ不够。 meta标签不全。 内容不够长。

但我在实践中发现。

这些建议,很多是噪音。

判断标准其实很简单。

你增加的内容。

是否提供了新的信息。

如果没有。

就是干扰。

我曾经给一个页面加过FAQ。

只是重复已有内容。

结果没有任何提升。

反而让结构更混乱。

后来我删掉了。

效果更好。

GEO的核心,不是让AI看到你,而是让AI正确理解你。