「Agent」这个词不是 2023 年才冒出来的新发明。从 1950 年代图灵的人工智能构想,到 1980 年代的专家系统、1990 年代的反应式 Agent、2010 年代的强化学习 Agent,再到今天的 LLM Agent——智能体的概念在 AI 长河里已经轮回了好几次。理解这条脉络,才能看清 LLM Agent 到底「新」在哪里,又继承了什么。
整个 Agent 的发展史,可以浓缩为三次范式跃迁:
| 阶段 | 大脑用什么思考 | 代表范式 | 盛行年代 |
|---|---|---|---|
| 符号主义 Agent | 人写的规则与逻辑 | 专家系统、GOFAI | 1970s-1980s |
| 反应式 / 学习式 Agent | 环境Reward + 神经网络 | 强化学习 Agent | 1990s-2020 |
| LLM Agent | 自然语言推理 + 工具 | ReAct、AutoGPT、AutoGen | 2023 至今 |
每一次跃迁,本质都是在回答同一个问题——「智能体的决策从哪里来」:
下面按这三段脉络展开。
最早的 Agent 是专家系统(Expert System)。它的核心思想是:把人类专家的知识写成一条条「若...则...」规则,存进知识库,再用推理引擎按规则推导。
| 系统 | 领域 | 做法 |
|---|---|---|
| MYCIN | 医学诊断 | 几百条规则判断血液感染 |
| DENDRAL | 化学 | 从质谱数据推断分子结构 |
| XCON | 计算机配置 | 为 DEC 客户配置 VAX 机型 |
符号 Agent 的四模块对应关系:
| 现代模块 | 符号 Agent 对应 |
|---|---|
| Profile | 系统的角色定位(如「血液感染诊断专家」) |
| Memory | 知识库(规则 + 事实) |
| Planning | 前向/反向推理引擎 |
| Action | 输出诊断结果(无外部行动力) |
符号 Agent 的贡献与局限:
💡 历史回响:符号 Agent 的「知识库 + 推理」骨架,其实和今天的「RAG + LLM 推理」惊人地相似。区别只在于:符号时代的知识库是人写的规则,今天的知识库是向量化的文档;符号时代的推理是逻辑演绎,今天的推理是语言模型的概率生成。架构在轮回,只是大脑换了材质。
1980 年代末,罗德尼·布鲁克斯(Rodney Brooks)提出包容架构(Subsumption Architecture),掀起「反应式革命」。他主张:智能不需要复杂的内部模型,智能体应该直接「感知-行动」,靠简单的行为模块组合涌现出复杂行为。
这催生了一类新的 Agent 架构——BDI(Belief-Desire-Intention):
| BDI 要素 | 含义 | 现代对应 |
|---|---|---|
| Belief(信念) | 对世界当前状态的认知 | Memory(状态) |
| Desire(愿望) | 想达成的目标 | Profile(目标) |
| Intention(意图) | 当前承诺要执行的计划 | Planning(下一步) |
BDI 与现代 Agent 四模块的对应几乎一一映射,可以说是当代 Agent 架构的「精神先驱」。它的代表实现包括 PRS、JAAM、Soar 等。
| 流派 | 核心主张 | 代表 |
|---|---|---|
| 反应式 | 无内部模型,直接感知-行动 | Brooks 包容架构 |
| 审慎式(Deliberative) | 有内部模型,符号规划 | 经典 BDI |
| 混合式(Hybrid) | 分层:底层反应+高层审慎 | 3T、Atlantis |
这一阶段的贡献与局限:
真正的学习式 Agent 来自强化学习(Reinforcement Learning, RL)。RL Agent 通过试错与奖励,在与环境的交互中自主学习最优策略。
| 里程碑 | 时间 | 意义 |
|---|---|---|
| DQN 玩 Atari | 2013-2015 | 深度网络 + RL 首次通用化 |
| AlphaGo 击败李世石 | 2016 | RL 攻克围棋 |
| AlphaZero 自学成才 | 2017 | 无需人类棋谱,纯自对弈 |
| OpenAI Five 打 Dota 2 | 2018 | 复杂多人游戏 |
| ChatGPT 的 RLHF | 2022 | RL 用于人类偏好对齐 |
RL Agent 的四模块对应:
| 现代模块 | RL Agent 对应 |
|---|---|
| Profile | 奖励函数定义的目标 |
| Memory | 状态观测(含 RNN/Transformer 记忆) |
| Planning | 策略网络 π(a|s)(或基于价值的规划) |
| Action | 在环境中执行离散/连续动作 |
RL Agent 与 LLM Agent 的本质差异:
| 维度 | RL Agent | LLM Agent |
|---|---|---|
| 决策来源 | 训练得到的策略网络 | 语言模型的零/少样本推理 |
| 通用性 | 强依赖训练任务,迁移难 | 同一模型跨任务通用 |
| 训练成本 | 海量环境交互,极昂贵 | 预训练已摊销,推理即用 |
| 行动力 | 直接控制环境动作 | 通过工具调用间接行动 |
| 适用场景 | 封闭环境(游戏/控制) | 开放任务(办公/编程/搜索) |
⚠️ 关键认知:RL Agent 和 LLM Agent 不是替代关系,而是互补关系。RL 适合「环境明确、奖励清晰、需要精细动作控制」的场景(如机器人、游戏);LLM Agent 适合「目标开放、需要语言理解与常识推理」的场景(如办公自动化、编程助手)。《具身智能技术原理》讨论的就是两者融合的具身 Agent——LLM 做高层规划,RL 策略做底层控制。
2022 年底 ChatGPT 横空出世,但真正点燃 Agent 浪潮的是两篇 2022-2023 年的论文与一批开源项目。
| 时间 | 工作 | 贡献 |
|---|---|---|
| 2022.10 | ReAct(Yao et al.) | 提出 Reasoning + Acting 范式,奠定 LLM Agent 主循环 |
| 2023.03 | Reflexion(Shinn et al.) | 引入语言反思记忆,实现经验学习 |
| 2023.03 | HuggingGPT | LLM 作为控制器调度多模态模型 |
| 2023.03 | AutoGPT | 首个现象级自主 Agent 项目,GitHub 星标破十万 |
| 2023.04 | Generative Agents(斯坦福小镇) | 记忆+反思+规划的虚拟小镇,「西部世界」雏形 |
| 2023.05 | Tree of Thoughts | 把 CoT 推广为树搜索 |
| 2023.06 | Function Calling(OpenAI 原生支持) | 工具调用从 Prompt 约定升级为原生能力 |
| 2023.08 | AutoGen(微软) | 多智能体对话框架 |
| 2023.08 | MetaGPT | SOP 式多 Agent 软件开发 |
| 2024 | MCP 协议(Anthropic) | 工具调用标准化 |
| 2024-2025 | Computer Use / GUI Agent | Agent 直接操作图形界面 |
| 2025-2026 | Agent 工程化 / Agent OS | 走向生产级与操作系统化 |
把 LLM Agent 与前三代 Agent 放在一起对比,能看到三处根本性突破:
| 突破点 | 前代 Agent | LLM Agent |
|---|---|---|
| 大脑的通用性 | 任务专用(规则/策略网络) | 一个 LLM 跨所有任务 |
| 知识的获取 | 人工编写或海量训练 | 预训练已蕴含海量常识 |
| 指令的接口 | 结构化状态 + 动作空间 | 自然语言(人机协同零门槛) |
💡 最深刻的变革是「自然语言成了 Agent 的编程接口」。以前要让 Agent 办一件事,得用规则语言或 Python 写策略;现在只需用自然语言描述目标与约束。这让 Agent 的开发门槛从「AI 工程师」降到了「会写需求文档的人」。这是 Agent 在 2023 年后爆发的根本原因。
如果用第 1.2 节的自主性等级衡量,当前(2026 年)的 LLM Agent 整体处于 L2 到 L3 之间:
<svg viewBox="0 0 720 360" xmlns="http://www.w3.org/2000/svg"> <!-- 横轴 --> <line x1="60" y1="280" x2="680" y2="280" stroke="#475569" stroke-width="2"/> <text x="60" y="305" font-size="12" fill="#475569">L0 人工</text> <text x="200" y="305" font-size="12" fill="#475569">L1 辅助</text> <text x="340" y="305" font-size="12" fill="#475569">L2 半自主</text> <text x="490" y="305" font-size="12" fill="#475569">L3 目标导向</text> <text x="620" y="305" font-size="12" fill="#475569">L4 完全自主</text> <!-- 刻度 --> <line x1="100" y1="275" x2="100" y2="285" stroke="#475569"/> <line x1="240" y1="275" x2="240" y2="285" stroke="#475569"/> <line x1="380" y1="275" x2="380" y2="285" stroke="#475569"/> <line x1="520" y1="275" x2="520" y2="285" stroke="#475569"/> <line x1="640" y1="275" x2="640" y2="285" stroke="#475569"/> <!-- 落地区间 --> <rect x="320" y="120" width="80" height="40" fill="#dcfce7" stroke="#16a34a" rx="4"/> <text x="360" y="145" font-size="13" fill="#14532d" text-anchor="middle" font-weight="bold">生产落地</text> <!-- 研究区间 --> <rect x="480" y="80" width="80" height="40" fill="#fef9c3" stroke="#ca8a04" rx="4"/> <text x="520" y="105" font-size="13" fill="#713f12" text-anchor="middle" font-weight="bold">研究前沿</text> <!-- 未来 --> <rect x="600" y="40" width="80" height="40" fill="#fce7f3" stroke="#db2777" rx="4"/> <text x="640" y="65" font-size="13" fill="#831843" text-anchor="middle" font-weight="bold">未来目标</text> <!-- 标题 --> <text x="360" y="30" font-size="14" fill="#475569" text-anchor="middle" font-weight="bold">2026 年 LLM Agent 自主性坐标</text> </svg>
回顾这条脉络,有三点对理解今天的 LLM Agent 至关重要:
「知识库 + 推理」这个 Agent 骨架,从专家系统到 RAG+LLM,反复出现。变的不是架构,而是大脑的材质——从人写的规则,到统计模型,再到大语言模型。理解这一点,就不会被各种「新概念」迷惑:很多所谓创新,本质是老架构套了新大脑。
四代 Agent 里,真正具备「行动力」的从来都是少数。专家系统只输出诊断、RL Agent 只在虚拟环境动作、即便今天的 LLM Agent,能稳定调用真实 API 完成端到端任务的也是少数。让 Agent 真的「动手」一直是工程上最难的部分——这是第 6 章的全部主题,也是第 8.3 节系统性挑战的重灾区。
前三代 Agent 都需要专门的「编程接口」——规则语言、策略网络代码、RL 训练流程。LLM Agent 第一次让自然语言成为 Agent 的接口:用一句话描述目标,Agent 自己翻译成行动。这是 Agent 从「实验室玩具」走向「大众工具」的根本分水岭。
⚠️ 清醒认识:尽管 LLM Agent 火爆,但它依然处在「能演示,未必能稳定生产」的阶段。演示里 Agent 看似无所不能,生产环境却会因为一次工具调用失败、一次幻觉、一次超时而整个崩溃。第 8 章会专门讨论从「能演示」到「能生产」的鸿沟,这是当前 Agent 工程化的核心命题。
本章建立了全书的认知坐标系:从 LLM 的四大局限出发(1.1),定义了 Agent 与核心循环(1.2),拆解了 Profile-Memory-Planning-Action 四模块架构(1.3),并从历史脉络定位了 LLM Agent 的来路与坐标(1.4)。
接下来,第 2 章将把四模块骨架横向展开,逐一讨论每个模块的设计原则与工程要点,为后续章节的纵向深化铺设共同的语言。