1.4 发展脉络与里程碑:从专家系统到 LLM Agent


1.4 发展脉络与里程碑:从专家系统到 LLM Agent

「Agent」这个词不是 2023 年才冒出来的新发明。从 1950 年代图灵的人工智能构想,到 1980 年代的专家系统、1990 年代的反应式 Agent、2010 年代的强化学习 Agent,再到今天的 LLM Agent——智能体的概念在 AI 长河里已经轮回了好几次。理解这条脉络,才能看清 LLM Agent 到底「新」在哪里,又继承了什么。

1.4.1 一条主线:智能体如何跨越「符号-数据-语言」三道坎

整个 Agent 的发展史,可以浓缩为三次范式跃迁:

阶段 大脑用什么思考 代表范式 盛行年代
符号主义 Agent 人写的规则与逻辑 专家系统、GOFAI 1970s-1980s
反应式 / 学习式 Agent 环境Reward + 神经网络 强化学习 Agent 1990s-2020
LLM Agent 自然语言推理 + 工具 ReAct、AutoGPT、AutoGen 2023 至今

每一次跃迁,本质都是在回答同一个问题——「智能体的决策从哪里来」

  • 符号主义说:从人写的规则里来。
  • 强化学习说:从环境反馈中学来。
  • LLM Agent 说:从语言模型的通用推理能力里来,再用工具补齐行动力。

下面按这三段脉络展开。

1.4.2 第一阶段:符号主义 Agent(1970s-1980s)

最早的 Agent 是专家系统(Expert System)。它的核心思想是:把人类专家的知识写成一条条「若...则...」规则,存进知识库,再用推理引擎按规则推导。

系统 领域 做法
MYCIN 医学诊断 几百条规则判断血液感染
DENDRAL 化学 从质谱数据推断分子结构
XCON 计算机配置 为 DEC 客户配置 VAX 机型

符号 Agent 的四模块对应关系:

现代模块 符号 Agent 对应
Profile 系统的角色定位(如「血液感染诊断专家」)
Memory 知识库(规则 + 事实)
Planning 前向/反向推理引擎
Action 输出诊断结果(无外部行动力)

符号 Agent 的贡献与局限

  • 贡献:确立了「知识库 + 推理引擎」的 Agent 架构雏形,这条思路至今仍在(规则引擎、决策树、知识图谱都是其后裔)。
  • 局限一知识获取瓶颈——每条规则都得专家手写,做一个领域要数年,跨领域几乎不可能。
  • 局限二脆性——遇到规则没覆盖的情况就完全失灵,没有「常识」兜底。
  • 局限三无行动力——只输出诊断,不真的开药、不真的下订单。

💡 历史回响:符号 Agent 的「知识库 + 推理」骨架,其实和今天的「RAG + LLM 推理」惊人地相似。区别只在于:符号时代的知识库是人写的规则,今天的知识库是向量化的文档;符号时代的推理是逻辑演绎,今天的推理是语言模型的概率生成。架构在轮回,只是大脑换了材质

1.4.3 第二阶段:反应式 Agent 与 BDI 架构(1990s)

1980 年代末,罗德尼·布鲁克斯(Rodney Brooks)提出包容架构(Subsumption Architecture),掀起「反应式革命」。他主张:智能不需要复杂的内部模型,智能体应该直接「感知-行动」,靠简单的行为模块组合涌现出复杂行为。

这催生了一类新的 Agent 架构——BDI(Belief-Desire-Intention)

BDI 要素 含义 现代对应
Belief(信念) 对世界当前状态的认知 Memory(状态)
Desire(愿望) 想达成的目标 Profile(目标)
Intention(意图) 当前承诺要执行的计划 Planning(下一步)

BDI 与现代 Agent 四模块的对应几乎一一映射,可以说是当代 Agent 架构的「精神先驱」。它的代表实现包括 PRS、JAAM、Soar 等。

流派 核心主张 代表
反应式 无内部模型,直接感知-行动 Brooks 包容架构
审慎式(Deliberative) 有内部模型,符号规划 经典 BDI
混合式(Hybrid) 分层:底层反应+高层审慎 3T、Atlantis

这一阶段的贡献与局限

  • 贡献:确立了「感知-规划-行动」三元组(这是本书核心循环的直系祖先);BDI 的 Belief-Desire-Intention 三层结构,几乎就是 Profile-Planning-Memory 的雏形。
  • 局限:仍然依赖人工设计的行为模块或规划算法,没有学习能力,无法应对未预定义的情况。

1.4.4 第三阶段:强化学习 Agent(2013-2020)

真正的学习式 Agent 来自强化学习(Reinforcement Learning, RL)。RL Agent 通过试错与奖励,在与环境的交互中自主学习最优策略。

里程碑 时间 意义
DQN 玩 Atari 2013-2015 深度网络 + RL 首次通用化
AlphaGo 击败李世石 2016 RL 攻克围棋
AlphaZero 自学成才 2017 无需人类棋谱,纯自对弈
OpenAI Five 打 Dota 2 2018 复杂多人游戏
ChatGPT 的 RLHF 2022 RL 用于人类偏好对齐

RL Agent 的四模块对应:

现代模块 RL Agent 对应
Profile 奖励函数定义的目标
Memory 状态观测(含 RNN/Transformer 记忆)
Planning 策略网络 π(a|s)(或基于价值的规划)
Action 在环境中执行离散/连续动作

RL Agent 与 LLM Agent 的本质差异

维度 RL Agent LLM Agent
决策来源 训练得到的策略网络 语言模型的零/少样本推理
通用性 强依赖训练任务,迁移难 同一模型跨任务通用
训练成本 海量环境交互,极昂贵 预训练已摊销,推理即用
行动力 直接控制环境动作 通过工具调用间接行动
适用场景 封闭环境(游戏/控制) 开放任务(办公/编程/搜索)

⚠️ 关键认知:RL Agent 和 LLM Agent 不是替代关系,而是互补关系。RL 适合「环境明确、奖励清晰、需要精细动作控制」的场景(如机器人、游戏);LLM Agent 适合「目标开放、需要语言理解与常识推理」的场景(如办公自动化、编程助手)。《具身智能技术原理》讨论的就是两者融合的具身 Agent——LLM 做高层规划,RL 策略做底层控制。

1.4.5 第四阶段:LLM Agent 的爆发(2022-2026)

2022 年底 ChatGPT 横空出世,但真正点燃 Agent 浪潮的是两篇 2022-2023 年的论文与一批开源项目。

关键论文与项目

时间 工作 贡献
2022.10 ReAct(Yao et al.) 提出 Reasoning + Acting 范式,奠定 LLM Agent 主循环
2023.03 Reflexion(Shinn et al.) 引入语言反思记忆,实现经验学习
2023.03 HuggingGPT LLM 作为控制器调度多模态模型
2023.03 AutoGPT 首个现象级自主 Agent 项目,GitHub 星标破十万
2023.04 Generative Agents(斯坦福小镇) 记忆+反思+规划的虚拟小镇,「西部世界」雏形
2023.05 Tree of Thoughts 把 CoT 推广为树搜索
2023.06 Function Calling(OpenAI 原生支持) 工具调用从 Prompt 约定升级为原生能力
2023.08 AutoGen(微软) 多智能体对话框架
2023.08 MetaGPT SOP 式多 Agent 软件开发
2024 MCP 协议(Anthropic) 工具调用标准化
2024-2025 Computer Use / GUI Agent Agent 直接操作图形界面
2025-2026 Agent 工程化 / Agent OS 走向生产级与操作系统化

LLM Agent 的「新」在哪里

把 LLM Agent 与前三代 Agent 放在一起对比,能看到三处根本性突破:

突破点 前代 Agent LLM Agent
大脑的通用性 任务专用(规则/策略网络) 一个 LLM 跨所有任务
知识的获取 人工编写或海量训练 预训练已蕴含海量常识
指令的接口 结构化状态 + 动作空间 自然语言(人机协同零门槛)

💡 最深刻的变革是「自然语言成了 Agent 的编程接口」。以前要让 Agent 办一件事,得用规则语言或 Python 写策略;现在只需用自然语言描述目标与约束。这让 Agent 的开发门槛从「AI 工程师」降到了「会写需求文档的人」。这是 Agent 在 2023 年后爆发的根本原因。

1.4.6 当下坐标:LLM Agent 处于哪个阶段

如果用第 1.2 节的自主性等级衡量,当前(2026 年)的 LLM Agent 整体处于 L2 到 L3 之间

  • 研究层面:已能演示 L3 级别的全自主 Agent(AutoGPT、Devin、Computer Use)。
  • 生产层面:绝大多数落地的还是 L2 级别——自主规划执行,关键节点人类确认。
  • 瓶颈:可靠性、成本、安全、长程任务的稳定性(详见第 8.3 节)。
<svg viewBox="0 0 720 360" xmlns="http://www.w3.org/2000/svg"> <!-- 横轴 --> <line x1="60" y1="280" x2="680" y2="280" stroke="#475569" stroke-width="2"/> <text x="60" y="305" font-size="12" fill="#475569">L0 人工</text> <text x="200" y="305" font-size="12" fill="#475569">L1 辅助</text> <text x="340" y="305" font-size="12" fill="#475569">L2 半自主</text> <text x="490" y="305" font-size="12" fill="#475569">L3 目标导向</text> <text x="620" y="305" font-size="12" fill="#475569">L4 完全自主</text> <!-- 刻度 --> <line x1="100" y1="275" x2="100" y2="285" stroke="#475569"/> <line x1="240" y1="275" x2="240" y2="285" stroke="#475569"/> <line x1="380" y1="275" x2="380" y2="285" stroke="#475569"/> <line x1="520" y1="275" x2="520" y2="285" stroke="#475569"/> <line x1="640" y1="275" x2="640" y2="285" stroke="#475569"/> <!-- 落地区间 --> <rect x="320" y="120" width="80" height="40" fill="#dcfce7" stroke="#16a34a" rx="4"/> <text x="360" y="145" font-size="13" fill="#14532d" text-anchor="middle" font-weight="bold">生产落地</text> <!-- 研究区间 --> <rect x="480" y="80" width="80" height="40" fill="#fef9c3" stroke="#ca8a04" rx="4"/> <text x="520" y="105" font-size="13" fill="#713f12" text-anchor="middle" font-weight="bold">研究前沿</text> <!-- 未来 --> <rect x="600" y="40" width="80" height="40" fill="#fce7f3" stroke="#db2777" rx="4"/> <text x="640" y="65" font-size="13" fill="#831843" text-anchor="middle" font-weight="bold">未来目标</text> <!-- 标题 --> <text x="360" y="30" font-size="14" fill="#475569" text-anchor="middle" font-weight="bold">2026 年 LLM Agent 自主性坐标</text> </svg>

1.4.7 历史给我们的三点启示

回顾这条脉络,有三点对理解今天的 LLM Agent 至关重要:

启示一:架构在轮回,大脑在升级

「知识库 + 推理」这个 Agent 骨架,从专家系统到 RAG+LLM,反复出现。变的不是架构,而是大脑的材质——从人写的规则,到统计模型,再到大语言模型。理解这一点,就不会被各种「新概念」迷惑:很多所谓创新,本质是老架构套了新大脑。

启示二:行动力一直是稀缺品

四代 Agent 里,真正具备「行动力」的从来都是少数。专家系统只输出诊断、RL Agent 只在虚拟环境动作、即便今天的 LLM Agent,能稳定调用真实 API 完成端到端任务的也是少数。让 Agent 真的「动手」一直是工程上最难的部分——这是第 6 章的全部主题,也是第 8.3 节系统性挑战的重灾区。

启示三:语言接口是分水岭

前三代 Agent 都需要专门的「编程接口」——规则语言、策略网络代码、RL 训练流程。LLM Agent 第一次让自然语言成为 Agent 的接口:用一句话描述目标,Agent 自己翻译成行动。这是 Agent 从「实验室玩具」走向「大众工具」的根本分水岭。

⚠️ 清醒认识:尽管 LLM Agent 火爆,但它依然处在「能演示,未必能稳定生产」的阶段。演示里 Agent 看似无所不能,生产环境却会因为一次工具调用失败、一次幻觉、一次超时而整个崩溃。第 8 章会专门讨论从「能演示」到「能生产」的鸿沟,这是当前 Agent 工程化的核心命题。

本节小结

  • Agent 的发展经历了三次范式跃迁:符号主义(规则大脑)→ 反应式与强化学习(学习大脑)→ LLM Agent(语言大脑)。每次跃迁回答的都是「决策从哪里来」。
  • 符号 Agent 确立了「知识库 + 推理」骨架;BDI 架构提出了 Belief-Desire-Intention 三元组,是 Profile-Memory-Planning 的精神先驱;RL Agent 解决了「学习」问题但通用性受限。
  • LLM Agent 的三大突破:大脑通用化、知识预训练化、接口自然语言化。其中自然语言成为 Agent 编程接口是最深刻的变革,把开发门槛从 AI 工程师降到会写需求的人。
  • 当前 LLM Agent 整体处于自主性 L2-L3 之间:研究层面已能演示 L3 全自主,生产层面仍以 L2 半自主(人类在环)为主。
  • 三点历史启示:架构在轮回而大脑在升级;行动力一直是稀缺品;语言接口是 Agent 走向大众的分水岭。

第 1 章结语

本章建立了全书的认知坐标系:从 LLM 的四大局限出发(1.1),定义了 Agent 与核心循环(1.2),拆解了 Profile-Memory-Planning-Action 四模块架构(1.3),并从历史脉络定位了 LLM Agent 的来路与坐标(1.4)。

接下来,第 2 章将把四模块骨架横向展开,逐一讨论每个模块的设计原则与工程要点,为后续章节的纵向深化铺设共同的语言。


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 会发光的石头的小龙虾 转发
评论区 (0)
U