8.1 综合案例剖析:人形/机械臂/具身大模型系统 抽象原理讲了七章,现在把它们装进三个真实系统看:双足人形(Figure/Optimus/Atlas)、机械臂操作(RT-X 体系)、具身大模型(Physical Intelligence)。每个案例都是前 7 章概念的具象整合。 8.1.1 案例一:双足人形机器人 代表:Figure 02(Figure AI)、Tesla Optimus Gen 3、Boston Dynamics Atlas(电驱版)、1X Neo、Apptronik Apollo、宇树 H1/G1、智元、傅利叶 GR-1。 端到端 pipeline Figure 02 的技术栈(基于公开信息) 感知:头部多目 RGB-D + 手腕相机 + IMU + 关节力矩传感。
抽象原理讲了七章,现在把它们装进三个真实系统看:双足人形(Figure/Optimus/Atlas)、机械臂操作(RT-X 体系)、具身大模型(Physical Intelligence)。每个案例都是前 7 章概念的具象整合。
代表:Figure 02(Figure AI)、Tesla Optimus Gen 3、Boston Dynamics Atlas(电驱版)、1X Neo、Apptronik Apollo、宇树 H1/G1、智元、傅利叶 GR-1。
| 维度 | 当前主流选择 |
|---|---|
| 本体 | 电驱、准直驱关节、30+ DoF |
| 感知 | 头部 RGB-D + 手腕相机 + IMU + 关节力矩 |
| 大脑 | 多模态 LLM(外部 API 或自家) |
| 策略 | VLA + RL 混合 |
| 控制 | WBC + MPC |
| 数据 | 遥操作 + 仿真 + 工厂场景 |
| 算力 | 边缘 GPU(Jetson Thor 等) |
代表:Google DeepMind RT-X 系列、Stanford Mobile ALOHA、UCB Bridge/Data。
RT-X 是 Google DeepMind 2023 年发布的跨机器人通用策略体系:
Stanford 2024 年的 Mobile ALOHA:
| 优势 | 劣势 |
|---|---|
| 形态成熟,控制精确 | 工作空间受限(固定基座) |
| 数据采集相对便宜 | 不能移动到不同场景 |
| 商业化最成熟 | 复杂任务(装配)仍难 |
机械臂操作是当前 VLA 最先落地的形态——仓储拣选、工厂上下料、餐饮烹饪已规模化部署。
代表:Physical Intelligence(π0)、Skild AI、思灵机器人、银河通用等。
这些任务都是传统方法难以处理的,π0 展示了具身大模型在复杂长程任务上的潜力。
| 维度 | 人形机器人 | 机械臂操作 | 具身大模型 |
|---|---|---|---|
| 代表 | Figure/Optimus | RT-X/Mobile ALOHA | π0 |
| 本体 | 30+ DoF 双足双臂 | 6-7 DoF 单/双臂 | 跨本体 |
| 核心难点 | 平衡 + 通用任务 | 精细操作 | 数据规模 |
| 数据 | 遥操作 + 工厂 | Open X + 自采 | 私有大规模 |
| 落地 | 工厂试点 | 仓储/工厂已部署 | 研究示范 |
| 算力需求 | 极高 | 中 | 极高 |
以「人形机器人帮人倒杯水」为例,看一遍全栈调用:
1. 用户语音: "我渴了" ↓ [第4章 LLM 语音理解] 2. LLM 规划: 任务 = 找杯子 + 找水壶 + 倒水 + 送到用户面前 ↓ [第4章 LLM 任务规划] 3. VLM 扫描环境,识别杯子和水壶位置 ↓ [第2章 视觉感知 + 第4章 VLM] 4. SLAM 与路径规划,机器人走到厨房 ↓ [第3章 SLAM + 第6章运动规划] 5. 双足平衡控制,机器人稳定站立 ↓ [第6章 WBC + 平衡 RL] 6. 右臂抓取水壶把手 ↓ [第5章 VLA 抓取策略] 7. 左臂拿杯子 ↓ [第5章 VLA 抓取] 8. 倒水(控制倾倒角度、力反馈停止) ↓ [第6章 阻抗控制 + 第2章 触觉] 9. 把杯子送到用户面前 ↓ [整合] 10. 监督执行,出错(水洒了)→ 反思重规划 ↓ [第4章 Reflexion]
每一步都对应前 7 章的某个技术。具身智能的复杂度可见一斑——一个看似简单的「倒水」任务,调用了全书大部分章节。
下一节《8.2 系统性挑战》将直面具身智能落地的难题。