本节摘要:VLA 能做单个动作决策,但真实任务(“收拾厨房”)要分解成一系列动作,跨越较长时间,这就要任务规划和记忆。本节讲任务规划的层次(高层任务分解、中层动作序列、低层执行),以及记忆系统(短期工作记忆、长期情景记忆)怎么支持机器人处理长程任务。核心是理解:复杂任务不是一次性决策,而是规划、执行、观察、调整的循环,记忆让这个循环能跨越时间。
阅读完本节,你应当能够:
给机器人一个任务“把厨房收拾一下”。这个任务对 VLA(单动作决策)来说太复杂了——它没法一步输出“收拾厨房”对应的动作。收拾厨房要分解成:收杯子(找杯子、拿起来、放橱柜)、收碗、擦桌子、洗碗……每个子任务又分解成一系列动作。这是一个多层嵌套的任务结构。
而且这些动作不是一次性做完,要跨越几分钟到几十分钟。中间机器人得记住“杯子已经收了、碗还没收”,不然会重复收杯子或漏收碗。这就需要记忆——跨越时间的状态保持。
所以真实的具身智能系统,VLA 之上还要有两层:任务规划(把复杂任务分解成动作序列)和记忆系统(在长程任务里保持状态)。这两层让机器人从“会做单个动作”升级到“能完成复杂的长程任务”。
复杂任务的处理,靠的是层次化规划——把任务从抽象到具体逐层分解。
高层规划(任务分解):把抽象任务分解成子任务序列。“收拾厨房”分解成“收杯子、收碗、擦桌子、洗碗”。这一层关注“做什么”,不关注“怎么做”,常用大语言模型的能力来分解(因为大模型擅长理解任务语义)。
中层规划(动作序列):把每个子任务分解成动作序列。“收杯子”分解成“走到桌边、定位杯子、伸手抓取、移动到橱柜、打开橱柜、放入、关橱柜”。这一层关注“怎么做”,每个动作有明确的起止条件和参数。
低层执行(运动控制):把每个动作交给运动控制器执行。“伸手抓取”变成具体的关节角度序列或末端轨迹。这是第 4 章的内容。
层次化规划的价值是化解复杂度。一个上百步的复杂任务,直接从顶层规划到底层是不现实的;分层后,每层只处理自己粒度的问题,层间通过明确接口(高层给中层子任务目标,中层给低层动作参数)传递。每层相对简单,组合起来能处理复杂任务。
任务执行不是“规划一次然后一口气执行完”,而是“规划-执行-观察-调整”的循环。
机器人规划出动作序列后,执行第一步,观察执行结果(感知),根据结果决定是继续按原计划、还是调整。比如规划“抓杯子”,伸手后发现杯子被碰掉了,原计划失效,要重新规划(“先捡起杯子再放橱柜”)。
这个循环让机器人对环境变化有适应性——它不是死板执行预设计划,而是根据实际进展动态调整。循环的频率和层次相关:低层执行循环快(高频感知调整),高层规划循环慢(低频重新规划)。
长程任务(跨越几十分钟)必须有记忆系统支持,否则机器人会“失忆”——忘了已经做过的、忘了要做什么。记忆系统主要有两类。
短期工作记忆(Working Memory):维护当前任务的即时状态。“现在在做什么、做到哪一步了、刚才看到了什么”。容量小、更新快、任务结束就清空。比如收杯子的工作记忆里存“正在找杯子、已经找到两个、还差一个”。
长期情景记忆(Episodic Memory):记录过去的经历,供回顾和反思。“昨天收厨房时杯子在左柜、碗在洗碗机”。容量大、持久、可检索。长期记忆让机器人能利用过去的经验——下次收厨房,记得杯子在左柜,直接去找不用满屋子找。
| 记忆类型 | 内容 | 特点 | 作用 |
|---|---|---|---|
| 短期工作记忆 | 当前任务即时状态 | 小、快、任务后清空 | 跟踪任务进展 |
| 长期情景记忆 | 过去经历 | 大、持久、可检索 | 利用经验、跨任务复用 |
记忆系统对长程任务的价值,在于让机器人保持连贯性。没有工作记忆,机器人会重复做已经做过的步骤;没有长期记忆,机器人每次做任务都像第一次,无法利用经验。两者的配合,让机器人能在时间长河里保持连贯的行动。
任务规划的三层里,高层规划最适合用大语言模型。因为高层规划依赖对任务语义的理解(“收拾厨房”包含哪些子任务),这正是大模型的强项。把任务指令给大模型,让它分解成子任务序列,这种做法在具身智能里越来越流行。
但要注意,大模型分解出的子任务可能不符合物理可行性(“收拾厨房”分解出“把冰箱搬到角落”——搬不动)。所以大模型分解后,要有一个可行性检查环节,过滤或修正不可行的子任务。
记忆不能什么都存,否则信息过载、检索困难。要有取舍机制——工作记忆只存当前任务相关的、任务结束清空;长期记忆只存有价值的经验(成功的策略、失败教训),定期整理压缩。一个塞满垃圾记忆的系统,反而比没记忆的更糟(检索噪音大)。
规划不能脱离感知闭门造车。好的规划系统,规划阶段就要考虑感知的不确定性——不能假设“杯子一定在桌上”,要规划“先找杯子,找到了再抓,没找到就报告”。执行阶段感知到的意外(东西不在预期位置),要能反馈到规划层重新规划。规划和感知是紧耦合的,不是分开的两个阶段。
⚠️ 常见坑:规划系统和感知系统脱节,规划假设理想情况(物体在预定位置),一执行发现现实和假设不符,规划全盘失效。规划必须考虑感知不确定性,把“观察”作为规划的一部分。
💡 关键直觉:长程任务的本质挑战是“在时间维度上保持连贯”。规划让连贯有了结构(任务分解成序列),记忆让连贯有了载体(状态跨时间保持)。两者让机器人从“只顾眼前一个动作”升级到“能谋划和执行长程任务”。
下一章进入闭环的输出端——运动控制,讲决策怎么变成精确的物理运动。