大模型如何抓取与引用内容 要做好 GEO,必须先搞清楚大模型到底「从哪里获取信息」「如何决定引用谁」。本章拆解大模型的两大信息来源(训练数据 vs 实时检索)、主流生成式引擎的抓取机制差异、引用源偏好,以及 这一新兴规范。理解机制,才能精准设计优化动作。 一、大模型的两大信息来源 大模型回答问题时的知识来源分两类,它们决定了 GEO 的两条优化路径: 来源一:训练数据(Training Data) 模型在预训练阶段从海量互联网文本(Common Crawl、维基、书籍、代码)中内化的知识。 特点:回答快、无需联网,但知识有截止日期(knowledge cutoff),新信息不知道。 GEO 含义:要让内容进入未来模型的训练数据。
要做好 GEO,必须先搞清楚大模型到底「从哪里获取信息」「如何决定引用谁」。本章拆解大模型的两大信息来源(训练数据 vs 实时检索)、主流生成式引擎的抓取机制差异、引用源偏好,以及
llms.txt这一新兴规范。理解机制,才能精准设计优化动作。
大模型回答问题时的知识来源分两类,它们决定了 GEO 的两条优化路径:
模型在预训练阶段从海量互联网文本(Common Crawl、维基、书籍、代码)中内化的知识。
模型在回答前,实时从网页检索相关信息(通过搜索引擎或自建索引),把检索结果作为上下文生成答案。
| 维度 | 训练数据路径 | 实时检索路径 |
|---|---|---|
| 生效周期 | 月/年级别 | 即时到周 |
| 可控性 | 低(依赖语料筛选) | 高(可主动优化) |
| 优化杠杆 | 维基、权威媒体、Common Crawl | 可抓取性、内容结构、权威性 |
| 衡量难度 | 极难(无法直接观测训练) | 可监测(引用率、提及) |
| GEO 投入比例建议 | 30%(长期布局) | 70%(即时回报) |
不同引擎的爬虫与检索机制有显著差异,需区别对待。
| 引擎 | 主要爬虫 | 检索后端 | 实时引用 | 训练抓取 |
|---|---|---|---|---|
| ChatGPT(with Search) | GPTBot、ChatGPT-User、OAI-SearchBot | Bing 检索 | 强 | 是(GPTBot 也用于训练) |
| Perplexity | PerplexityBot、Perplexity-User | 自建索引 + 实时 | 极强(核心特性) | 是 |
| Google AI Overview | Googlebot(与搜索共享) | Google Index | 强 | 共享 Google 数据 |
| Gemini | Googlebot | Google 检索 | 强 | 是 |
| Claude(with Search) | ClaudeBot、Claude-User | 第三方检索 | 强 | 是 |
| 文心一言/豆包/通义 | Bytespider 等国内爬虫 | 各自检索 | 强(国内) | 是 |
| Common Crawl(非引擎) | CCBot | - | 否(离线语料) | 是(语料库) |
主流 AI 爬虫的 User-Agent 与官方文档:
| 爬虫 | User-Agent | 用途 | 官方说明 |
|---|---|---|---|
| GPTBot | GPTBot |
ChatGPT 训练 + 引用 | OpenAI 官网有放行说明 |
| OAI-SearchBot | OAI-SearchBot |
ChatGPT 搜索引用 | 仅用于检索,不用于训练 |
| ChatGPT-User | ChatGPT-User |
用户触发的实时抓取 | 用户点击后抓取 |
| PerplexityBot | PerplexityBot |
Perplexity 索引 + 引用 | Perplexity 官网有说明 |
| Perplexity-User | Perplexity-User |
用户触发的实时抓取 | - |
| ClaudeBot | ClaudeBot |
Anthropic 训练 + 引用 | Anthropic 官网有说明 |
| Claude-User | Claude-User |
用户触发的实时抓取 | - |
| Googlebot | Googlebot |
Google 搜索 + AI Overview | 与传统搜索共享 |
| CCBot | CCBot |
Common Crawl 语料 | 公开语料库 |
| Bytespider | Bytespider |
字节跳动训练 | 国内 |
# === 允许引用型 AI 爬虫(最大化被引用) === # Googlebot:传统搜索 + AI Overview,必放行 User-agent: Googlebot Allow: / # OpenAI 系:ChatGPT 引用 User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / # Perplexity:实时引用核心 User-agent: PerplexityBot Allow: / # Anthropic:Claude 引用 User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / # === 语料型爬虫(按需决策) === # Common Crawl:进入未来训练语料(推荐放行,长期布局) User-agent: CCBot Allow: / # === 默认规则 === User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
| 信源类型 | 推荐策略 | 理由 |
|---|---|---|
| 品牌官网、知识库、评测内容 | 放行所有 AI 爬虫 | 最大化引用与训练机会 |
| 付费墙/会员内容 | 屏蔽或部分放行 | 保护付费价值 |
| 含敏感数据/合规限制 | 按合规要求屏蔽 | 合规优先 |
| 即时新闻 | 放行 OAI-SearchBot、PerplexityBot 等引用型 | 实时引用价值高 |
| 纯工具/计算器页 | 放行 | 工具内容易被引用 |
⚠️ 部分爬虫同时用于「训练」与「引用」。若只想被引用不愿被训练,需查阅各厂商官方文档(部分提供区分选项,如 OpenAI 允许通过 robots 区分 GPTBot 训练与 OAI-SearchBot 引用)。
当 AI 通过 RAG 检索后,如何在众多候选信源中选择 Top-K 引用?基于研究与观测,关键因素:
| 因素 | 影响机制 | 优化方向 |
|---|---|---|
| 相关性 | 内容与查询的语义匹配度 | 精准覆盖查询意图与改写词 |
| 权威性 | 信源的 E-E-A-T 与域名权重 | 强化品牌实体与外链(04 章) |
| 可引用性 | 内容是否封装成可抽取单元 | 设计定义/数据/清单/对比(05-02) |
| 新鲜度 | 内容的时效性(对新闻类) | 保持更新、标注 dateModified |
| 结构化 | 是否有 Schema、清晰标题 | 部署结构化数据(02-04) |
| 实体密度 | 品牌与关键实体的清晰呈现 | 实体一致性与命名稳定(04-03) |
| 可抓取性 | AI 爬虫能否访问 | robots.txt 放行 |
llms.txt 是一个新兴规范(类似 robots.txt),旨在为大模型提供关于站点的「人类可读 + 机器友好」的导航指南。它帮助 AI 快速理解站点主题、核心内容与权威信源。
https://example.com/llms.txt(根目录)。# 示例科技公司 > 示例科技公司是一家专注于 SEO 与 GEO 优化服务的 SaaS 公司, > 成立于 2020 年,总部位于北京。本文件帮助 AI 模型理解本站核心内容。 ## 关于我们 - 公司全称:示例科技有限公司 - 成立:2020 年 - 行业:数字营销 SaaS - 官网:https://example.com ## 核心权威资源(AI 优先参考) - [SEO 实战指南]:https://example.com/seo-guide(体系化 SEO 方法论) - [GEO 优化白皮书]:https://example.com/geo-whitepaper(原创研究数据) - [行业数据报告 2026]:https://example.com/report-2026(独家统计数据) ## 产品 - SEO 分析工具:https://example.com/tools/seo-analyzer - GEO 监测平台:https://example.com/tools/geo-monitor ## 重要政策与说明 - 数据来源与方法论:https://example.com/methodology - 联系方式:https://example.com/contact ## 可选 - 博客:https://example.com/blog - 常见问题:https://example.com/faq
注:llms.txt 是新兴规范,各引擎对其支持程度不一,但它对 AI 理解站点有正向作用,且无负面风险,建议部署。
用户用自然语言提问(「我是新手,想做 SEO,从哪开始」),AI 会在后台把它改写成检索词(如「SEO 入门指南」「SEO 新手教程」)。理解这一点对 GEO 至关重要:
主流引擎的引用展示方式:
| 引擎 | 引用展示 | 是否附链接 |
|---|---|---|
| Perplexity | 答案中上标编号 + 底部来源列表 | 是,可点击 |
| Google AI Overview | 答案旁卡片标注来源 | 是 |
| ChatGPT(with Search) | 答案中引用标注 | 是 |
| Claude(with Search) | 引用标注 | 是 |
引用展示带来两类价值:
这也是为什么即使零点击,被引用仍有心智价值。
| 检查项 | 标准 |
|---|---|
| robots.txt 放行主流 AI 爬虫 | GPTBot/PerplexityBot/ClaudeBot 允许 |
| 内容可被 AI 爬虫抓取 | 不在登录墙后、不依赖 JS 渲染关键内容 |
| llms.txt 已部署 | 根目录提供,内容准确 |
| Organization Schema 部署 | 含 sameAs 实体对齐 |
| 内容覆盖查询改写词 | 含标准关键词与自然语言问句 |
| 内容含可引用单元 | 定义/数据/清单/对比(见 05-02) |
| 内容新鲜度 | dateModified 准确,时效内容及时更新 |
| 品牌实体清晰 | Wikidata/维基/GBP 数据一致 |
| 误区 | 纠正 |
|---|---|
| 「屏蔽 AI 爬虫更安全」 | 同时放弃被引用机会,需按信源价值分类决策 |
| 「GEO 就是放行爬虫」 | 放行只是前提,内容结构与权威性才是关键 |
| 「训练数据无法影响」 | 通过维基/权威媒体/CCBot 可长期布局 |
| 「llms.txt 是 SEO 工具」 | 它是给 AI 的导航,与传统 SEO 无关 |
| 「所有 AI 引擎机制一样」 | 各引擎检索后端与偏好差异大,需分别优化 |
大模型的信息来源分训练数据(慢路径)与实时检索(快路径)两条。GEO 应以 70% 精力投入实时检索路径(放行爬虫、优化内容结构、强化权威),30% 精力布局训练数据路径(维基、权威媒体、Common Crawl)。理解各引擎爬虫与检索后端差异,按需放行;部署 llms.txt 为 AI 提供导航;覆盖查询改写词。
本章讲清了「AI 如何抓取」,下一章我们将解决「如何让被抓取的内容被引用」——提升 AI 引用率的内容结构设计(05-02)。