具身智能不是 2023 年凭空出现的概念。它的脉络可以追溯到 1980 年代的行为机器人学——理解这条脉络,才能看清当下「VLA 大模型」处在历史坐标系的什么位置。
具身智能的发展可以大致分为五个时代,每个时代由一种主导范式定义:
| 时代 | 时间 | 主导范式 | 核心信念 | 代表 |
|---|---|---|---|---|
| 符号-规划时代 | 1980s 前 | 离线规划 + 状态机 | 智能是规划,感知是辅助 | Shakey、STRIPS |
| 行为机器人时代 | 1986-2000 | 感知-行动直接耦合 | 智能涌现于交互,无需内部世界模型 | Brooks 六足机器人 |
| 概率-学习时代 | 2000-2012 | 概率机器人 + 经典 ML | 用概率处理不确定性 | SLAM、PR2、DARPA 挑战 |
| 深度学习时代 | 2012-2022 | 端到端 CNN/RL | 用神经网络替换手工特征 | AlphaGo、DQN-Atari |
| 具身大模型时代 | 2022-至今 | 大模型 + 端到端策略 | 智能来自规模,跨本体泛化 | RT-2、π0、Physical Intelligence |
下面用 Mermaid 时间线串起这些里程碑:
1986 年,MIT 的 Rodney Brooks 发表了具有里程碑意义的论文,提出包容架构(Subsumption Architecture),反对当时主流的「感知-建模-规划-行动」分层范式。他的核心论点是:
Brooks 用这种思路造出了能避开障碍、追光、探索房间的六足机器人,证明了「没有内部世界模型也能产生看起来很聪明的行为」。
💡 历史回响:今天的「端到端 VLA」(第 5 章)在精神上继承了 Brooks 的反模型主义——它也主张用学习替代手工建模。但不同的是,VLA 把「模型」藏在神经网络的参数里,而非完全不要模型。这是螺旋式上升。
2000 年代, Sebastian Thrun、Dieter Fox、Wolfram Burgard 等人系统化了概率机器人(Probabilistic Robotics)范式:用贝叶斯滤波处理感知与动作的不确定性。这一时代的代表作是 SLAM(Simultaneous Localization and Mapping)——让机器人在未知环境一边定位自己一边建图。第 3 章会深入展开 SLAM 的因子图、EKF、回环检测等技术细节。
同时期,Willow Garage 推出 PR2 机器人与 ROS(Robot Operating System)开源生态,大幅降低了机器人研究的入门门槛,催生了大量学术 demo。这是「具身智能基础设施」的第一次大规模建设。
第一波:感知侧(2012-2017)。AlexNet 之后,CNN 迅速替换了机器人视觉中的手工特征(SIFT、HOG)。物体检测、语义分割、人体姿态估计在机器人任务中大规模应用。这一阶段感知革命先行,但决策仍以规划与状态机为主。
第二波:决策侧 RL(2013-2020)。DeepMind 的 DQN 在 Atari 游戏上展现深度强化学习的潜力,2016 年 AlphaGo 击败李世石让 RL 出圈。OpenAI 在 2017-2019 年连续用 Dactyl(单手解魔方)和抓取任务证明了 Sim-to-Real + 域随机化 可以训练出能在真实世界工作的灵巧手策略。这一时期奠定了第 7 章 Sim-to-Real 的工程范式。
⚠️ 关键转折:但 2020 年前后,社区发现 RL 在真实机器人上面临数据效率极低和奖励设计困难两大瓶颈。一个机械臂学会拧瓶盖可能需要数百万次仿真采样,而真机采样成本极高。这为后来的「模仿学习 + 大模型预训练」路线铺平了道路。
第一次跃迁:LLM 当规划器(2022-2023)。SayCan(Google, 2022)首次系统性地把大语言模型当作机器人的任务规划器:LLM 提供任务的语义分解(「做三明治」=「拿面包 + 拿火腿 + 拿芝士 + 组合」),然后用一个 affordance 函数(也来自学习)过滤掉当前不可行的步骤。同期的 Code-as-Policies 让 LLM 直接生成调用机器人 API 的代码。这一范式在第 4 章展开。
第二次跃迁:VLA 端到端(2023-至今)。Google 的 RT-2(2023)首次证明:可以把视觉-语言模型(VLM)和机器人动作统一进一个 Transformer,让它直接从图像和语言指令输出动作 Token。这开启了 视觉-语言-动作模型(Vision-Language-Action Model, VLA) 时代。此后 Octo、OpenVLA、π0、RDT 等模型涌现,加上 Open X-Embodiment 跨本体数据集的发布,VLA 成为当前具身智能最具想象力的范式。第 5 章会系统剖析 VLA 的架构、训练与谱系。
站在 2026 年中回望,具身智能呈现几个鲜明特征:
记住几个关键时间锚点,能帮你快速判断任何一篇新论文的历史位置:
后续每一章在引入新方法时,都会回到这条时间线,让你看清它是在回答哪个时代的什么问题。
至此第 1 章结束。你已经建立了完整的认知坐标系:定义(1.1)、闭环架构(1.2)、形态载体(1.3)、历史脉络(1.4)。下一章《第 2 章 具身感知(一):多模态传感器与融合》将深入闭环的入口,回答「机器人怎么看见、触摸、听见这个世界」。