第 4 章 · 具身决策与大脑(一):大模型任务规划 当用户说「帮我做个三明治」,机器人不能直接「输出一个动作」。它得先在大脑里把这句话拆成「拿面包 → 拿火腿 → 拿芝士 → 组合」,再去判断每一步当前能不能做。这一层「任务规划」就是大语言模型在具身智能中的核心位置。 章节摘要 本章进入「感知-决策-执行」闭环的中枢——大脑。聚焦大语言模型(LLM)与视觉-语言模型(VLM)在任务规划层的应用,区别于第 5 章的端到端策略。内容覆盖四个方面:(1) LLM 作为任务规划器的典型范式,包括 Chain-of-Thought 规划、SayCan 的 affordance 评分、Code-as-Policies、ProgPrompt;
当用户说「帮我做个三明治」,机器人不能直接「输出一个动作」。它得先在大脑里把这句话拆成「拿面包 → 拿火腿 → 拿芝士 → 组合」,再去判断每一步当前能不能做。这一层「任务规划」就是大语言模型在具身智能中的核心位置。
本章进入「感知-决策-执行」闭环的中枢——大脑。聚焦大语言模型(LLM)与视觉-语言模型(VLM)在任务规划层的应用,区别于第 5 章的端到端策略。内容覆盖四个方面:(1) LLM 作为任务规划器的典型范式,包括 Chain-of-Thought 规划、SayCan 的 affordance 评分、Code-as-Policies、ProgPrompt;(2) VLM 如何实现场景-指令对齐与指代消解(CLIP、BLIP、GPT-4V 的视觉 grounding);(3) 记忆、反思与重规划的闭环执行(ReAct、Reflexion);(4) 技能库与工具调用如何桥接抽象指令与原子动作(Primitive Skill 设计、HTN)。本章与第 5 章构成「大脑」的两面——本章是高层认知,第 5 章是底层策略。
读完本章,你应当能够:
| 编号 | 子章节 | 核心问题 | 关联后续 |
|---|---|---|---|
| 01 | 大语言模型作为任务规划器:任务分解与技能链 | LLM 怎么把长程任务拆成动作? | 第 5 章 VLA |
| 02 | 视觉-语言模型(VLM)与场景-指令对齐 | 「红色杯子」怎么定位到具体物体? | 第 5 章 VLA |
| 03 | 记忆、反思与重新规划:长程任务的闭环执行 | 出错了怎么纠偏? | 第 7 章数据 |
| 04 | 技能库与工具调用:从抽象指令到原子动作 | LLM 怎么调用底层动作? | 第 6 章控制 |
四节构成「会拆任务 → 看得懂场景 → 出错能改 → 能调动作」的递进,对应 LLM 规划器从「大脑」走到「手」的全过程。
LLM 任务规划、SayCan、Code-as-Policies、ProgPrompt、视觉语言模型、VLM、CLIP、BLIP、GPT-4V、视觉 grounding、指代消解、ReAct、Reflexion、技能库、HTN、长程任务规划、具身决策。