3.2 任务规划与记忆系统


3.2 任务规划与记忆系统

本节摘要:VLA 能做单个动作决策,但真实任务(“收拾厨房”)要分解成一系列动作,跨越较长时间,这就要任务规划和记忆。本节讲任务规划的层次(高层任务分解、中层动作序列、低层执行),以及记忆系统(短期工作记忆、长期情景记忆)怎么支持机器人处理长程任务。核心是理解:复杂任务不是一次性决策,而是规划、执行、观察、调整的循环,记忆让这个循环能跨越时间。

本节导航

阅读完本节,你应当能够:

  1. 区分任务规划的高、中、低三个层次
  2. 说清层次化规划的价值
  3. 理解短期工作记忆和长期情景记忆的差别
  4. 解释记忆系统为什么对长程任务必不可少
  5. 理解规划-执行-观察的循环机制

一、问题与直觉

给机器人一个任务“把厨房收拾一下”。这个任务对 VLA(单动作决策)来说太复杂了——它没法一步输出“收拾厨房”对应的动作。收拾厨房要分解成:收杯子(找杯子、拿起来、放橱柜)、收碗、擦桌子、洗碗……每个子任务又分解成一系列动作。这是一个多层嵌套的任务结构。

而且这些动作不是一次性做完,要跨越几分钟到几十分钟。中间机器人得记住“杯子已经收了、碗还没收”,不然会重复收杯子或漏收碗。这就需要记忆——跨越时间的状态保持。

所以真实的具身智能系统,VLA 之上还要有两层:任务规划(把复杂任务分解成动作序列)和记忆系统(在长程任务里保持状态)。这两层让机器人从“会做单个动作”升级到“能完成复杂的长程任务”。

二、核心原理

2.1 层次化任务规划

复杂任务的处理,靠的是层次化规划——把任务从抽象到具体逐层分解。

高层规划(任务分解):把抽象任务分解成子任务序列。“收拾厨房”分解成“收杯子、收碗、擦桌子、洗碗”。这一层关注“做什么”,不关注“怎么做”,常用大语言模型的能力来分解(因为大模型擅长理解任务语义)。

中层规划(动作序列):把每个子任务分解成动作序列。“收杯子”分解成“走到桌边、定位杯子、伸手抓取、移动到橱柜、打开橱柜、放入、关橱柜”。这一层关注“怎么做”,每个动作有明确的起止条件和参数。

低层执行(运动控制):把每个动作交给运动控制器执行。“伸手抓取”变成具体的关节角度序列或末端轨迹。这是第 4 章的内容。

层次化规划的价值是化解复杂度。一个上百步的复杂任务,直接从顶层规划到底层是不现实的;分层后,每层只处理自己粒度的问题,层间通过明确接口(高层给中层子任务目标,中层给低层动作参数)传递。每层相对简单,组合起来能处理复杂任务。

2.2 规划-执行-观察循环

任务执行不是“规划一次然后一口气执行完”,而是“规划-执行-观察-调整”的循环。

机器人规划出动作序列后,执行第一步,观察执行结果(感知),根据结果决定是继续按原计划、还是调整。比如规划“抓杯子”,伸手后发现杯子被碰掉了,原计划失效,要重新规划(“先捡起杯子再放橱柜”)。

这个循环让机器人对环境变化有适应性——它不是死板执行预设计划,而是根据实际进展动态调整。循环的频率和层次相关:低层执行循环快(高频感知调整),高层规划循环慢(低频重新规划)。

2.3 记忆系统

长程任务(跨越几十分钟)必须有记忆系统支持,否则机器人会“失忆”——忘了已经做过的、忘了要做什么。记忆系统主要有两类。

短期工作记忆(Working Memory):维护当前任务的即时状态。“现在在做什么、做到哪一步了、刚才看到了什么”。容量小、更新快、任务结束就清空。比如收杯子的工作记忆里存“正在找杯子、已经找到两个、还差一个”。

长期情景记忆(Episodic Memory):记录过去的经历,供回顾和反思。“昨天收厨房时杯子在左柜、碗在洗碗机”。容量大、持久、可检索。长期记忆让机器人能利用过去的经验——下次收厨房,记得杯子在左柜,直接去找不用满屋子找。

记忆类型 内容 特点 作用
短期工作记忆 当前任务即时状态 小、快、任务后清空 跟踪任务进展
长期情景记忆 过去经历 大、持久、可检索 利用经验、跨任务复用

记忆系统对长程任务的价值,在于让机器人保持连贯性。没有工作记忆,机器人会重复做已经做过的步骤;没有长期记忆,机器人每次做任务都像第一次,无法利用经验。两者的配合,让机器人能在时间长河里保持连贯的行动。

三、工程实践要点

3.1 大模型适合高层规划

任务规划的三层里,高层规划最适合用大语言模型。因为高层规划依赖对任务语义的理解(“收拾厨房”包含哪些子任务),这正是大模型的强项。把任务指令给大模型,让它分解成子任务序列,这种做法在具身智能里越来越流行。

但要注意,大模型分解出的子任务可能不符合物理可行性(“收拾厨房”分解出“把冰箱搬到角落”——搬不动)。所以大模型分解后,要有一个可行性检查环节,过滤或修正不可行的子任务。

3.2 记忆要有取舍机制

记忆不能什么都存,否则信息过载、检索困难。要有取舍机制——工作记忆只存当前任务相关的、任务结束清空;长期记忆只存有价值的经验(成功的策略、失败教训),定期整理压缩。一个塞满垃圾记忆的系统,反而比没记忆的更糟(检索噪音大)。

3.3 规划和感知要紧密结合

规划不能脱离感知闭门造车。好的规划系统,规划阶段就要考虑感知的不确定性——不能假设“杯子一定在桌上”,要规划“先找杯子,找到了再抓,没找到就报告”。执行阶段感知到的意外(东西不在预期位置),要能反馈到规划层重新规划。规划和感知是紧耦合的,不是分开的两个阶段。

⚠️ 常见坑:规划系统和感知系统脱节,规划假设理想情况(物体在预定位置),一执行发现现实和假设不符,规划全盘失效。规划必须考虑感知不确定性,把“观察”作为规划的一部分。

💡 关键直觉:长程任务的本质挑战是“在时间维度上保持连贯”。规划让连贯有了结构(任务分解成序列),记忆让连贯有了载体(状态跨时间保持)。两者让机器人从“只顾眼前一个动作”升级到“能谋划和执行长程任务”。

一节小结

  • 层次化规划:高层(任务分解)、中层(动作序列)、低层(运动执行),逐层化解复杂度。
  • 规划执行观察循环:不是一次规划到底,而是边执行边观察边调整,对环境有适应性。
  • 短期工作记忆:维护当前任务即时状态,小而快,跟踪进展。
  • 长期情景记忆:记录过去经历,大而持久,利用经验跨任务复用。
  • 大模型做高层规划:语义理解是强项,但要过滤不可行的子任务。
  • 记忆取舍:不能全存,要有取舍和整理机制,避免信息过载。
  • 规划感知紧耦合:规划要考虑感知不确定性,把观察纳入规划。

下一章进入闭环的输出端——运动控制,讲决策怎么变成精确的物理运动。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U