1.4 发展脉络与里程碑:从行为机器人到具身大模型


1.4 发展脉络与里程碑:从行为机器人到具身大模型

具身智能不是 2023 年凭空出现的概念。它的脉络可以追溯到 1980 年代的行为机器人学——理解这条脉络,才能看清当下「VLA 大模型」处在历史坐标系的什么位置。

1.4.1 五个时代分期

具身智能的发展可以大致分为五个时代,每个时代由一种主导范式定义:

时代 时间 主导范式 核心信念 代表
符号-规划时代 1980s 前 离线规划 + 状态机 智能是规划,感知是辅助 Shakey、STRIPS
行为机器人时代 1986-2000 感知-行动直接耦合 智能涌现于交互,无需内部世界模型 Brooks 六足机器人
概率-学习时代 2000-2012 概率机器人 + 经典 ML 用概率处理不确定性 SLAM、PR2、DARPA 挑战
深度学习时代 2012-2022 端到端 CNN/RL 用神经网络替换手工特征 AlphaGo、DQN-Atari
具身大模型时代 2022-至今 大模型 + 端到端策略 智能来自规模,跨本体泛化 RT-2、π0、Physical Intelligence

下面用 Mermaid 时间线串起这些里程碑:

1.4.2 行为机器人革命:Brooks 与包容架构

1986 年,MIT 的 Rodney Brooks 发表了具有里程碑意义的论文,提出包容架构(Subsumption Architecture),反对当时主流的「感知-建模-规划-行动」分层范式。他的核心论点是:

  • 世界就是最好的模型:不需要在内部维护复杂的世界表征,机器人直接对环境刺激做反应。
  • 层次叠加而非中心控制:底层是避障、中层是游走、顶层是探索,高层可以「抑制」(subsume)低层输出。
  • 智能涌现:复杂行为不是被设计的,而是从简单的感知-行动层涌现出来的。

Brooks 用这种思路造出了能避开障碍、追光、探索房间的六足机器人,证明了「没有内部世界模型也能产生看起来很聪明的行为」。

💡 历史回响:今天的「端到端 VLA」(第 5 章)在精神上继承了 Brooks 的反模型主义——它也主张用学习替代手工建模。但不同的是,VLA 把「模型」藏在神经网络的参数里,而非完全不要模型。这是螺旋式上升。

1.4.3 概率机器人与 SLAM 的成熟

2000 年代, Sebastian Thrun、Dieter Fox、Wolfram Burgard 等人系统化了概率机器人(Probabilistic Robotics)范式:用贝叶斯滤波处理感知与动作的不确定性。这一时代的代表作是 SLAM(Simultaneous Localization and Mapping)——让机器人在未知环境一边定位自己一边建图。第 3 章会深入展开 SLAM 的因子图、EKF、回环检测等技术细节。

同时期,Willow Garage 推出 PR2 机器人与 ROS(Robot Operating System)开源生态,大幅降低了机器人研究的入门门槛,催生了大量学术 demo。这是「具身智能基础设施」的第一次大规模建设。

1.4.4 深度学习的两次冲击波

第一波:感知侧(2012-2017)。AlexNet 之后,CNN 迅速替换了机器人视觉中的手工特征(SIFT、HOG)。物体检测、语义分割、人体姿态估计在机器人任务中大规模应用。这一阶段感知革命先行,但决策仍以规划与状态机为主。

第二波:决策侧 RL(2013-2020)。DeepMind 的 DQN 在 Atari 游戏上展现深度强化学习的潜力,2016 年 AlphaGo 击败李世石让 RL 出圈。OpenAI 在 2017-2019 年连续用 Dactyl(单手解魔方)和抓取任务证明了 Sim-to-Real + 域随机化 可以训练出能在真实世界工作的灵巧手策略。这一时期奠定了第 7 章 Sim-to-Real 的工程范式。

⚠️ 关键转折:但 2020 年前后,社区发现 RL 在真实机器人上面临数据效率极低奖励设计困难两大瓶颈。一个机械臂学会拧瓶盖可能需要数百万次仿真采样,而真机采样成本极高。这为后来的「模仿学习 + 大模型预训练」路线铺平了道路。

1.4.5 大模型时代的两次范式跃迁

第一次跃迁:LLM 当规划器(2022-2023)。SayCan(Google, 2022)首次系统性地把大语言模型当作机器人的任务规划器:LLM 提供任务的语义分解(「做三明治」=「拿面包 + 拿火腿 + 拿芝士 + 组合」),然后用一个 affordance 函数(也来自学习)过滤掉当前不可行的步骤。同期的 Code-as-Policies 让 LLM 直接生成调用机器人 API 的代码。这一范式在第 4 章展开。

第二次跃迁:VLA 端到端(2023-至今)。Google 的 RT-2(2023)首次证明:可以把视觉-语言模型(VLM)和机器人动作统一进一个 Transformer,让它直接从图像和语言指令输出动作 Token。这开启了 视觉-语言-动作模型(Vision-Language-Action Model, VLA) 时代。此后 Octo、OpenVLA、π0、RDT 等模型涌现,加上 Open X-Embodiment 跨本体数据集的发布,VLA 成为当前具身智能最具想象力的范式。第 5 章会系统剖析 VLA 的架构、训练与谱系。

1.4.6 当下坐标:2026 年的具身智能

站在 2026 年中回望,具身智能呈现几个鲜明特征:

  1. 双路线融合:大模型规划(第 4 章)与端到端 VLA(第 5 章)正在融合——高层语义由 LLM 处理,底层动作由 VLA 生成,分层架构重新成为主流。
  2. 数据成为新瓶颈:算法架构逐渐收敛(Transformer + 扩散/Flow Matching),真正稀缺的是高质量真实操作数据。Open X-Embodiment、DROID 之后,「数据引擎」与「遥操作基础设施」成为核心竞争力(第 7 章)。
  3. 人形商业化前夜:Figure、Tesla Optimus、Physical Intelligence、智元等公司的人形机器人开始进入工厂和仓库做试点任务,但离家庭通用服务仍有距离(第 8 章综合案例)。
  4. 世界模型兴起:单纯的 VLA 缺乏对世界动力学的理解,难以做长程规划。世界模型(World Model)作为「可预测下一步的内部模型」成为新研究热点,被视为通向具身 AGI 的关键拼图(第 8.4 节)。

1.4.7 给读者的历史地图

记住几个关键时间锚点,能帮你快速判断任何一篇新论文的历史位置:

  • 1986 Brooks = 反模型主义起点(行为机器人)
  • 2013 DQN = 深度 RL 起步
  • 2017 Dactyl = Sim-to-Real 里程碑
  • 2022 SayCan = LLM 当规划器元年
  • 2023 RT-2 = VLA 大模型元年
  • 2024 Open X-Embodiment = 跨本体数据规模化
  • 2025-2026 = 人形商业化前夜 + 世界模型兴起

后续每一章在引入新方法时,都会回到这条时间线,让你看清它是在回答哪个时代的什么问题。

本节小结

  • 具身智能经历了符号-规划、行为机器人、概率-学习、深度学习、具身大模型五个时代。
  • Brooks 包容架构奠定了「反内部模型」的精神,今天的端到端 VLA 在螺旋上升意义上继承了它。
  • 概率机器人与 SLAM 成熟于 2000 年代,深度学习在 2012-2020 年完成感知与 RL 决策两次冲击。
  • 2022 SayCan 与 2023 RT-2 是大模型时代的两次范式跃迁,前者把 LLM 当规划器,后者开启 VLA 端到端。
  • 站在 2026 年,分层融合、数据瓶颈、人形商业化、世界模型兴起是四大特征。

至此第 1 章结束。你已经建立了完整的认知坐标系:定义(1.1)、闭环架构(1.2)、形态载体(1.3)、历史脉络(1.4)。下一章《第 2 章 具身感知(一):多模态传感器与融合》将深入闭环的入口,回答「机器人怎么看见、触摸、听见这个世界」。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U