1.2 感知-决策-执行闭环:具身智能的核心架构


1.2 感知-决策-执行闭环:具身智能的核心架构

如果只用一张图理解具身智能,那就是「感知-决策-执行」闭环回路。后续所有章节都在为这个闭环的某一环节服务。

1.2.1 闭环回路的三段式拆解

具身智能体的工作过程,可以抽象为一个永不停止的反馈回路:智能体从物理世界接收信号(感知),基于内部模型产生意图与动作(决策),通过执行器改变世界(执行),改变后的世界又产生新的信号进入下一轮感知。

下面用一张 SVG 描述代码呈现这个回路(你也可以用 ASCII 心智模型替代):

<svg viewBox="0 0 760 320" xmlns="http://www.w3.org/2000/svg"> <defs> <marker id="arrow" markerWidth="10" markerHeight="10" refX="8" refY="3" orient="auto"> <path d="M0,0 L8,3 L0,6 Z" fill="#374151"/> </marker> </defs> <!-- 物理世界 --> <rect x="20" y="120" width="140" height="80" rx="12" fill="#f3f4f6" stroke="#374151" stroke-width="2"/> <text x="90" y="165" text-anchor="middle" font-size="16" font-weight="bold">物理世界</text> <text x="90" y="185" text-anchor="middle" font-size="12" fill="#6b7280">物体/人/光照/接触</text> <!-- 感知 --> <rect x="220" y="40" width="160" height="80" rx="12" fill="#dbeafe" stroke="#2563eb" stroke-width="2"/> <text x="300" y="80" text-anchor="middle" font-size="16" font-weight="bold">感知 Perception</text> <text x="300" y="100" text-anchor="middle" font-size="12" fill="#1e40af">视觉/触觉/听觉/本体感觉</text> <!-- 决策 --> <rect x="420" y="120" width="160" height="80" rx="12" fill="#fce7f3" stroke="#db2777" stroke-width="2"/> <text x="500" y="160" text-anchor="middle" font-size="16" font-weight="bold">决策 Decision</text> <text x="500" y="180" text-anchor="middle" font-size="12" fill="#9d174d">LLM规划 / VLA策略 / RL</text> <!-- 执行 --> <rect x="220" y="200" width="160" height="80" rx="12" fill="#dcfce7" stroke="#16a34a" stroke-width="2"/> <text x="300" y="240" text-anchor="middle" font-size="16" font-weight="bold">执行 Execution</text> <text x="300" y="260" text-anchor="middle" font-size="12" fill="#166534">运动规划/力控/电机力矩</text> <!-- 箭头:世界→感知 --> <line x1="90" y1="120" x2="220" y2="90" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="140" y="95" font-size="11" fill="#374151">多模态信号</text> <!-- 感知→决策 --> <line x1="380" y1="90" x2="440" y2="135" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="395" y="105" font-size="11" fill="#374151">状态/语义</text> <!-- 决策→执行 --> <line x1="440" y1="170" x2="380" y2="230" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="395" y="225" font-size="11" fill="#374151">动作指令</text> <!-- 执行→世界 --> <line x1="220" y1="250" x2="160" y2="200" stroke="#374151" stroke-width="2" marker-end="url(#arrow)"/> <text x="150" y="245" font-size="11" fill="#374151">关节/力矩</text> </svg>

回路三个节点的职责:

节点 输入 输出 本书对应章节
感知 物理世界的光、力、声、关节角 状态估计、语义、地图、点云 第 2、3 章
决策 状态 + 自然语言指令 高层动作序列 / 连续动作 第 4、5 章
执行 动作指令 关节角、电机力矩 第 6 章

💡 关键洞察:闭环不是线性的「感知→决策→执行→结束」,而是永不停止的滚动循环。机器人在执行的同时也在感知(否则就是盲动),所以感知与控制常常以 100Hz-1000Hz 的频率耦合在一起。

1.2.2 闭环的频率分层

真实的机器人系统并不是单一频率的闭环,而是多频率分层的嵌套结构:

这三层分别对应本书的不同章节:慢循环(第 4 章大模型规划)、中循环(第 5 章 VLA/RL 策略)、快循环(第 6 章运动控制)。分层的好处是各层关注不同时间尺度的信息:高层处理语义与长程目标,低层处理动力学与稳定性。

1.2.3 与工业机器人、自动驾驶的架构对比

具身智能的闭环架构并非凭空设计,它与已有的两大系统既有相似又有本质差异。

维度 工业机器人 自动驾驶 具身智能
环境 完全结构化(夹具、码垛位) 半结构化(道路、车道线) 开放非结构化(家庭、野外)
任务 单一重复(焊接、喷涂) 单一目标(沿道路行驶) 开放任务集(做家务、组装)
感知 简单(位姿标记、触发开关) 多模态(相机/激光雷达/毫米波) 多模态 + 触觉(触觉是新增维度
决策 状态机 + 离线编程 规则 + 端到端驾驶 大模型规划 + 学习型策略
闭环频率 100-1000 Hz 控制 10-30 Hz 规划 + 100Hz 控制 1 Hz 认知 + 10-30 Hz 策略 + 1kHz 控制
核心难点 精度、节拍 安全、长尾场景 泛化、操作精细度、Sim-to-Real

三个值得关注的差异点:

  1. 触觉的回归:工业机器人和自动驾驶主要靠视觉,但具身智能(尤其操作任务)必须依赖触觉与力觉,否则无法处理「插拔、按压、柔顺装配」这类需要接触反馈的任务。第 2.3 节会专门讲触觉与力感知。
  2. 决策的开放性:工业机器人执行固定程序,自动驾驶目标单一,而具身智能面对「帮我整理桌面」「把这杯水端给奶奶」这类开放式自然语言指令,必须由大模型做任务分解(第 4 章)。
  3. 控制精细度:自动驾驶是「宏观导航」,具身智能很多场景是「亚毫米级操作」,对力控要求完全不同(第 6.4 节)。

1.2.4 闭环中的「不确定性」与「延迟」

闭环系统有两个永恒的敌人:不确定性(uncertainty)和延迟(latency)。

  • 感知不确定性:传感器有噪声、遮挡、盲区;状态估计本身是概率推断(第 3 章 SLAM 的因子图优化就是在处理它)。
  • 模型不确定性:世界模型不完美,预测的下一步状态可能与真实不符(这是 Model-based RL 与世界模型的核心难题,第 8 章讨论)。
  • 执行不确定性:电机有摩擦、 backlash、滑动,发出的指令未必精确实现(第 6 章阻抗控制就是为了应对接触不确定性)。
  • 延迟:感知→决策→执行的链路如果有 100ms 延迟,对高速任务(接球、快插拔)就是致命的。这也是为什么策略模型要预测 action chunk(动作序列块)而非单步动作——用前瞻补偿延迟(第 5 章扩散策略与 ACT 的设计动机)。

⚠️ 设计箴言:任何闭环机器人系统设计,第一步永远是问「我的感知-控制链路延迟是多少?这个延迟下任务还能稳定吗?」延迟决定了你能做哪些任务。

1.2.5 闭环视角下的全书地图

把闭环回路套到本书章节上,立刻看到清晰的对应关系:

  • 感知节点 = 第 2 章(多模态传感器与融合)+ 第 3 章(SLAM 与环境理解)
  • 决策节点 = 第 4 章(大模型任务规划)+ 第 5 章(VLA 与端到端策略)
  • 执行节点 = 第 6 章(运动控制)
  • 如何让闭环持续进化 = 第 7 章(数据与仿真)
  • 闭环系统的整体集成与挑战 = 第 8 章(综合案例与展望)

记住这张地图,后续每一章你都能立刻定位它在闭环中的角色。

本节小结

  • 具身智能的核心是「感知-决策-执行」闭环回路,永不停止地滚动循环。
  • 真实系统是多频率分层的:慢循环(认知)→ 中循环(策略)→ 快循环(控制)。
  • 与工业机器人、自动驾驶相比,具身智能独特在开放任务、触觉需求、操作精细度。
  • 不确定性与延迟是闭环系统的两大敌人,策略模型用 action chunk 补偿延迟。
  • 后续每一章都对应闭环的一个节点:感知(2-3)、决策(4-5)、执行(6)、进化(7)、集成(8)。

下一节《1.3 机器人形态谱系》将讨论承载这个闭环的物理载体——机器人本体为什么有这么多长相,形态如何反向约束智能算法。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U