如果只用一张图理解具身智能,那就是「感知-决策-执行」闭环回路。后续所有章节都在为这个闭环的某一环节服务。
具身智能体的工作过程,可以抽象为一个永不停止的反馈回路:智能体从物理世界接收信号(感知),基于内部模型产生意图与动作(决策),通过执行器改变世界(执行),改变后的世界又产生新的信号进入下一轮感知。
下面用一张 SVG 描述代码呈现这个回路(你也可以用 ASCII 心智模型替代):
<svg viewBox="0 0 760 320" xmlns="http://www.w3.org/2000/svg"> <defs> <marker id="arrow" markerWidth="10" markerHeight="10" refX="8" refY="3" orient="auto"> <path d="M0,0 L8,3 L0,6 Z" fill="#374151"/> </marker> </defs> <!-- 物理世界 --> <rect x="20" y="120" width="140" height="80" rx="12" fill="#f3f4f6" stroke="#374151" stroke-width="2"/> <text x="90" y="165" text-anchor="middle" font-size="16" font-weight="bold">物理世界</text> <text x="90" y="185" text-anchor="middle" font-size="12" fill="#6b7280">物体/人/光照/接触</text> <!-- 感知 --> <rect x="220" y="40" width="160" height="80" rx="12" fill="#dbeafe" stroke="#2563eb" stroke-width="2"/> <text x="300" y="80" text-anchor="middle" font-size="16" font-weight="bold">感知 Perception</text> <text x="300" y="100" text-anchor="middle" font-size="12" fill="#1e40af">视觉/触觉/听觉/本体感觉</text> <!-- 决策 --> <rect x="420" y="120" width="160" height="80" rx="12" fill="#fce7f3" stroke="#db2777" stroke-width="2"/> <text x="500" y="160" text-anchor="middle" font-size="16" font-weight="bold">决策 Decision</text> <text x="500" y="180" text-anchor="middle" font-size="12" fill="#9d174d">LLM规划 / VLA策略 / RL</text> <!-- 执行 --> <rect x="220" y="200" width="160" height="80" rx="12" fill="#dcfce7" stroke="#16a34a" stroke-width="2"/> <text x="300" y="240" text-anchor="middle" font-size="16" font-weight="bold">执行 Execution</text> <text x="300" y="260" text-anchor="middle" font-size="12" fill="#166534">运动规划/力控/电机力矩</text> <!-- 箭头:世界→感知 --> <line x1="90" y1="120" x2="220" y2="90" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="140" y="95" font-size="11" fill="#374151">多模态信号</text> <!-- 感知→决策 --> <line x1="380" y1="90" x2="440" y2="135" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="395" y="105" font-size="11" fill="#374151">状态/语义</text> <!-- 决策→执行 --> <line x1="440" y1="170" x2="380" y2="230" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="395" y="225" font-size="11" fill="#374151">动作指令</text> <!-- 执行→世界 --> <line x1="220" y1="250" x2="160" y2="200" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="150" y="245" font-size="11" fill="#374151">关节/力矩</text> </svg>
回路三个节点的职责:
| 节点 | 输入 | 输出 | 本书对应章节 |
|---|---|---|---|
| 感知 | 物理世界的光、力、声、关节角 | 状态估计、语义、地图、点云 | 第 2、3 章 |
| 决策 | 状态 + 自然语言指令 | 高层动作序列 / 连续动作 | 第 4、5 章 |
| 执行 | 动作指令 | 关节角、电机力矩 | 第 6 章 |
💡 关键洞察:闭环不是线性的「感知→决策→执行→结束」,而是永不停止的滚动循环。机器人在执行的同时也在感知(否则就是盲动),所以感知与控制常常以 100Hz-1000Hz 的频率耦合在一起。
真实的机器人系统并不是单一频率的闭环,而是多频率分层的嵌套结构:
这三层分别对应本书的不同章节:慢循环(第 4 章大模型规划)、中循环(第 5 章 VLA/RL 策略)、快循环(第 6 章运动控制)。分层的好处是各层关注不同时间尺度的信息:高层处理语义与长程目标,低层处理动力学与稳定性。
具身智能的闭环架构并非凭空设计,它与已有的两大系统既有相似又有本质差异。
| 维度 | 工业机器人 | 自动驾驶 | 具身智能 |
|---|---|---|---|
| 环境 | 完全结构化(夹具、码垛位) | 半结构化(道路、车道线) | 开放非结构化(家庭、野外) |
| 任务 | 单一重复(焊接、喷涂) | 单一目标(沿道路行驶) | 开放任务集(做家务、组装) |
| 感知 | 简单(位姿标记、触发开关) | 多模态(相机/激光雷达/毫米波) | 多模态 + 触觉(触觉是新增维度) |
| 决策 | 状态机 + 离线编程 | 规则 + 端到端驾驶 | 大模型规划 + 学习型策略 |
| 闭环频率 | 100-1000 Hz 控制 | 10-30 Hz 规划 + 100Hz 控制 | 1 Hz 认知 + 10-30 Hz 策略 + 1kHz 控制 |
| 核心难点 | 精度、节拍 | 安全、长尾场景 | 泛化、操作精细度、Sim-to-Real |
三个值得关注的差异点:
闭环系统有两个永恒的敌人:不确定性(uncertainty)和延迟(latency)。
⚠️ 设计箴言:任何闭环机器人系统设计,第一步永远是问「我的感知-控制链路延迟是多少?这个延迟下任务还能稳定吗?」延迟决定了你能做哪些任务。
把闭环回路套到本书章节上,立刻看到清晰的对应关系:
记住这张地图,后续每一章你都能立刻定位它在闭环中的角色。
下一节《1.3 机器人形态谱系》将讨论承载这个闭环的物理载体——机器人本体为什么有这么多长相,形态如何反向约束智能算法。