第 4 章 · 具身决策与大脑(一):大模型任务规划


文档摘要

第 4 章 · 具身决策与大脑(一):大模型任务规划 当用户说「帮我做个三明治」,机器人不能直接「输出一个动作」。它得先在大脑里把这句话拆成「拿面包 → 拿火腿 → 拿芝士 → 组合」,再去判断每一步当前能不能做。这一层「任务规划」就是大语言模型在具身智能中的核心位置。 章节摘要 本章进入「感知-决策-执行」闭环的中枢——大脑。聚焦大语言模型(LLM)与视觉-语言模型(VLM)在任务规划层的应用,区别于第 5 章的端到端策略。内容覆盖四个方面:(1) LLM 作为任务规划器的典型范式,包括 Chain-of-Thought 规划、SayCan 的 affordance 评分、Code-as-Policies、ProgPrompt;

第 4 章 · 具身决策与大脑(一):大模型任务规划

当用户说「帮我做个三明治」,机器人不能直接「输出一个动作」。它得先在大脑里把这句话拆成「拿面包 → 拿火腿 → 拿芝士 → 组合」,再去判断每一步当前能不能做。这一层「任务规划」就是大语言模型在具身智能中的核心位置。

章节摘要

本章进入「感知-决策-执行」闭环的中枢——大脑。聚焦大语言模型(LLM)与视觉-语言模型(VLM)在任务规划层的应用,区别于第 5 章的端到端策略。内容覆盖四个方面:(1) LLM 作为任务规划器的典型范式,包括 Chain-of-Thought 规划、SayCan 的 affordance 评分、Code-as-Policies、ProgPrompt;(2) VLM 如何实现场景-指令对齐与指代消解(CLIP、BLIP、GPT-4V 的视觉 grounding);(3) 记忆、反思与重规划的闭环执行(ReAct、Reflexion);(4) 技能库与工具调用如何桥接抽象指令与原子动作(Primitive Skill 设计、HTN)。本章与第 5 章构成「大脑」的两面——本章是高层认知,第 5 章是底层策略。

学习目标

读完本章,你应当能够:

  1. 解释 LLM 为什么能当机器人任务规划器,以及它的能力边界。
  2. 复述 SayCan、Code-as-Policies 两大经典范式的工作原理。
  3. 说清 VLM 如何把自然语言指令「对齐」到场景中的具体物体(视觉 grounding 与指代消解)。
  4. 画出 ReAct/Reflexion 的思考-行动-观察循环,并解释为何需要反思。
  5. 设计一个层次化技能库,让 LLM 能调用原子动作 API。

子章节安排与导引

编号 子章节 核心问题 关联后续
01 大语言模型作为任务规划器:任务分解与技能链 LLM 怎么把长程任务拆成动作? 第 5 章 VLA
02 视觉-语言模型(VLM)与场景-指令对齐 「红色杯子」怎么定位到具体物体? 第 5 章 VLA
03 记忆、反思与重新规划:长程任务的闭环执行 出错了怎么纠偏? 第 7 章数据
04 技能库与工具调用:从抽象指令到原子动作 LLM 怎么调用底层动作? 第 6 章控制

四节构成「会拆任务 → 看得懂场景 → 出错能改 → 能调动作」的递进,对应 LLM 规划器从「大脑」走到「手」的全过程。

配图说明

  • Mermaid「LLM 规划器 - 技能库 - 执行器数据流」:在第 01 节给出,展示 LLM 规划系统的整体架构。
  • ASCII「ReAct 思考-行动-观察循环」:在第 03 节给出,展示闭环执行过程。
  • Mermaid「层次化技能库树」:在第 04 节给出。

SEO 关键词

LLM 任务规划、SayCan、Code-as-Policies、ProgPrompt、视觉语言模型、VLM、CLIP、BLIP、GPT-4V、视觉 grounding、指代消解、ReAct、Reflexion、技能库、HTN、长程任务规划、具身决策。

章节关联

  • 前置:第 2-3 章建立了感知与场景理解基础,本章消费这些表征做高层决策。
  • 后续:第 5 章 VLA 模型把高层规划与底层动作融合为端到端范式,是本章的延伸与替代路线;第 6 章运动控制消费本章技能库输出的原子动作指令。

发布者: 作者: 灏天文库 转发
评论区 (0)
U