形态不是智能的「外壳」,而是智能的「一部分」。一个轮式底盘上跑的 VLA 模型,与一个双足人形上跑的同一个模型,能解决的任务空间截然不同。
具身智能的一个核心命题是「形态-智能耦合」(Morphological Computation):身体结构本身就在完成一部分计算工作。
因此讨论具身智能时,不能脱离具体形态。下面按 移动方式 × 自由度 × 生物拟态 三个维度梳理主流形态。
下表从工作空间、移动能力、能耗、控制难度、典型任务五个维度对比四大主流形态:
| 形态 | 工作空间 | 移动能力 | 能耗 | 控制难度 | 典型任务 | 代表产品 |
|---|---|---|---|---|---|---|
| 机械臂(固定) | 球形/臂展范围 | 无 | 低(静止工作) | 中(关节空间) | 抓取、装配、焊接 | UR、Franka、Kuka |
| 轮式底盘 + 臂 | 大范围地面 | 中(平地好) | 低 | 中低 | 仓储物流、室内服务 | Tiago、Stretch |
| 四足 | 起伏/楼梯 | 高(不平地) | 中高(持续平衡) | 高(全身动力学) | 巡检、野外、灾害 | Spot、宇树 |
| 双足人形 | 全人类空间 | 高(人类环境) | 高(持续平衡) | 极高 | 家庭服务、工业替代 | Figure、Optimus、Atlas |
| 软体/连续体 | 狭窄弯曲空间 | 低(受场景限) | 低 | 中(模型难建) | 医疗、检修、抓取异形物 | 软体手指、内镜机器人 |
💡 选型箴言:能用轮式解决就不要用足式,能用单臂解决就不要用双臂。形态越复杂,控制与数据复杂度指数级上升。Tesla Optimus 选择双足,本质是因为目标场景(人类设计的家庭/工厂)是为双足人类优化的,轮式底盘上不了楼梯、进不了厨房。
无论形态如何,具身智能体的硬件本体通常包含五类子系统:
| 子系统 | 功能 | 关键硬件 | 与本书章节 |
|---|---|---|---|
| 执行器 | 把电信号转为关节运动 | 谐波减速器、无框力矩电机、行星滚柱丝杠 | 第 6 章控制 |
| 传动机构 | 传递与放大力矩 | 谐波/RV 减速器、连杆、绳驱 | 第 6.3 节逆动力学 |
| 传感器 | 感知外部与内部状态 | 相机、触觉皮肤、IMU、编码器、力矩传感器 | 第 2 章感知 |
| 计算单元 | 运行感知/策略/控制算法 | 边缘 GPU/Jetson、FPGA、实时 MCU | 第 6 章控制频率分层 |
| 能源 | 持续供电 | 锂电池、超级电容、外接电源 | (全书贯穿) |
近年人形机器人的硬件趋势有两个明显方向:
形态不仅决定「能做什么」,还反向决定「智能算法怎么设计」。几个典型例子:
| 形态特征 | 对智能算法的约束 | 典型应对 |
|---|---|---|
| 高自由度(人形 30+ DoF) | 动作空间维度爆炸,策略难学 | 层次化控制(第 6 章)+ 全身控制 WBC |
| 柔顺关节(高反向可驱动性) | 接触丰富任务更安全 | 阻抗/导纳控制(第 6.4 节) |
| 双足不稳定 | 必须持续主动平衡 | MPC + RL 平衡策略 |
| 软体形态 | 难建精确运动学模型 | 模型自由学习型策略(端到端 VLA) |
| 多臂协同 | 动作空间维度耦合 | 集中训练 + decentral 执行 |
⚠️ 重要观察:当前 VLA 模型(第 5 章)大多针对 单臂 7 DoF + 夹爪 训练,迁移到 30+ DoF 双臂人形时数据效率会急剧下降。这也是为什么 Physical Intelligence 等公司强调「跨本体数据」(cross-embodiment)——让一个模型同时学会控制不同形态的本体。
截至 2026 年,具身智能落地的形态选择呈现「双轨并行」格局:
💡 趋势判断:长期看,人形是通用具身智能的终极形态(因为它要进入为人类设计的环境),但短期(3-5 年)内轮式 + 臂形态的商业化确定性更高。这也是为什么第 5 章 VLA 模型多以机械臂为基准评测——它是当前数据最丰富、迁移成本最低的形态。
下一节《1.4 发展脉络与里程碑》将沿时间轴回顾具身智能从行为机器人到具身大模型的关键转折。