本节摘要:认知、决策、学习不是三门并列的课,而是同一循环上的三段职责。认知把观测收成状态并维护世界模型;决策在状态上按目标或效用选出行动;学习用奖励或新数据改策略、改模型或改知识。三者互相提供接口:认知给决策状态,决策给环境行动,环境给学习评分,学习再改认知与决策。读完应能指出后文每一章改的是哪一个接口。
阅读完本节,你应当能够:
SOURCE 用树根、树干、年轮作比:认知吸收,决策传递,学习留下年轮。比喻能记,接口更重要。认知的出口是状态(以及可选的世界模型);决策的出口是行动;学习的出口是更新后的知识——规则、参数或回放缓存。进口也要钉死:认知进口是观测与旧记忆;决策进口是状态、目标/效用、可选的规划用模型;学习进口是奖励、新样本、有时还有人类示范。
很多人把认知理解成「视觉做得好」。视觉只是观测管道之一。认知还包括:把像素变成「行人在 8 米处横穿」这种符号或向量;把历史轨迹收成「这人可能要过马路」;在知识库里接上「斑马线附近减速」。没有后两步,检测框再密,决策仍可能把行人当静态障碍。反过来,决策再强,状态若把关键物体漏掉,规划只是在错误棋盘上算最优。
学习有三条典型落点,后文第 4 章会展开,这里先认座位。改策略:同样的状态,以后更常选另一个行动。改世界模型:预测「若我开窗,十分钟后气温」更准,规划跟着变。改表示:同一段像素被收成更稳的状态,决策的输入分布变了。三条可以同时发生,但调试时必须分开看——否则你会在策略网络上死磕,其实崩在感知漏检。
SOURCE 写了三句协同:认知增强决策、决策驱动学习、学习提升认知。按仓库分拣走一圈。
认知增强决策:货位检测从「大概在这片」变成「第三层左侧空位」,路径规划才能从绕大圈改成插一次货。决策驱动学习:一次插货刮到包装,评判给出负奖励,学习元件降低「在该货位用该角度插入」的倾向,或更新「该包装材质易刮」的知识。学习提升认知:多次刮擦之后,感知模块开始把「薄膜包装」当成需要额外边距的类别——状态里多了一个对决策有用的维度。
自动驾驶同构。识别信号灯是认知;决定刹还是行是决策;闯灯或被加塞后的数据用来改识别阈值或改跟车策略是学习。注意时序:决策的一步只消耗当前状态;学习常常要等奖励延迟到达。稀疏奖励任务里,协同会看起来「断了」——其实是评判元件太晚才说话,学习不知道该改认知还是改决策。这是第 4 章要处理的结构问题,不是「再加一层网络」能糊过去的。
| 协同方向 | 传递的东西 | 失败时的症状 |
|---|---|---|
| 认知到决策 | 状态、置信、世界模型 | 规划很漂亮,现实里撞 |
| 决策到环境 | 行动 | 环在执行器处断开 |
| 环境到学习 | 奖励、下一观测 | 策略不更新或更新乱抖 |
| 学习到认知 | 更好的表示或检测 | 老错误特征一直喂给决策 |
| 学习到决策 | 新策略或新启发式 | 感知已经对了,行为仍旧 |
⚠️ 常见坑:把准确率、规划成功率、回报三条曲线当成三个项目组的 KPI。智能体只有一条业务曲线;三条必须能对上同一段轨迹。
第 2 章只谈认知:感知流水线、知识表示、世界模型、推理。读的时候反复问:它输出的状态,决策能不能用?第 3 章只谈决策:目标与效用、规划、行动选择、不确定下的决策。问:它假设状态里已经有什么?缺的是补认知,还是在决策里显式处理缺失?第 4 章谈学习范式与更新,问:更新落在策略、模型还是表示?第 5 章谈架构,其实是在选这三段怎么模块化、允许哪段被跳过。第 6 章谈多智能体与大模型:多智能体让环境里出现别人的循环;大模型常常把认知与决策糊在一次生成里——糊可以,但你仍应能指出状态与行动在生成文本的哪一段被决定。
概念代码把接口写成可检查的断言,比再讲一遍定义有用:
断言 状态由认知产出,决策不得直接读生像素 断言 行动由决策产出,学习不得绕过执行元件改环境 断言 学习只通过更新知识影响下一轮认知或决策 断言 奖励不进入决策的当前步,只进入学习或评判
最后一条常被打破:有人把奖励直接当行动特征喂进当前策略。短任务里也许能跑,概念上它把「评分」和「状态」焊死,后续换奖励函数会牵一发而动全身。坐标系立住的好处就是:你知道自己在违反哪条断言,而不是觉得「都是输入」。
💡 关键直觉:三大能力的「核心作用」不是重要性排名,而是接口不可互换。把奖励当状态、把生成文本当世界模型,系统还能跑,但调试时你会失去分层。
拿一段真实失败:车在路口犹豫。先问状态里有没有灯色与行人轨迹——没有则认知缺口。有且置信很低,决策却当确定,是 2.4 到 3.4 的接口撒谎。灯色对、策略仍选抢黄灯,查效用是否把进度压过避免碰撞。若训练日志里抢黄灯曾拿正奖励,是学习写歪了 3.1。同一段犹豫,四个接口都能被问到,这才叫协同体检。若团队只说「再加点数据」,体检表是空的。
客服失败同构:用户说「不要了」,系统仍推荐。状态里有没有否定意图?没有是认知。有却被生成模型覆盖,是决策没读字段或合法集没禁「在明确拒绝后继续推销」。若点击奖励仍在驱动推荐,是评判元件与用户目标分裂。1.3 的价值就是把这种分裂说成接口错误,而不是「模型不够懂人」。
再看成功轨迹也要拆。一次顺利插货,标出感知给出的货位、规划给出的路径、反射是否沉默、学习有没有在本步更新。若本步更新了防撞阈值,成功也可能是隐患——L0 被悄悄改了。协同不仅解释失败,也审计成功。成功里暗含的写入,往往比失败更难发现,因为没有人开会。
把体检写成固定四问,贴在项目墙也无妨:状态缺不缺、决策有没有把不确定当确定、效用与约束谁赢、本步有没有非法写入。四问比「加强协同」五个字具体。后文每一章都在给其中一问提供更细的工具,但问法从本章就定死,避免后文各章各问各的。
一张失败轨迹能否用四问走完:状态缺不缺、不确定有没有当确定、效用与约束谁赢、本步有没有非法写入?成功轨迹有没有审计暗写入?奖励有没有泄漏进当前反射?决策有没有直接读生像素?学习有没有直接操执行器?客服「不要了仍推荐」能拆到哪一接口?协同体检表是空的还是墙上真有四问?后文三章是否被你预先当成接口展开而不是三门新课?若四问只会问「再加点数据」,1.3 的接口还没变成肌肉。肌肉来自对失败的反复拆,不来自再背一遍树根树干年轮。比喻可忘,接口不可忘。
犹豫当场问:灯色字段在不在、置信当不当确定、效用有没有买通避免、本步有没有改 L0。四问能走完,1.3 的接口才变成肌肉。肌肉不来自再背协同口号。口号不拆犹豫。拆犹豫才协同。协同是诊断链。链短:缺字段回认知,当确定回 2.4/3.4,买通回 3.1,改 L0 回 4.3。四回指向四章。四章预先坐在本节的接口上。坐住了,后面不是新课。新课是旧病。旧病用这一条犹豫当疫苗。疫苗要反复打:客服「不要了仍推荐」同样四问。同样链。链通用。通用是 1.3 的价值。价值不在树的比喻。比喻可忘。链不可忘。链能走,1.3 毕业。毕业标志是失败会上先问四问,而不是先说再加点数据。数据可能需要,但要在问完之后。之后才知道加在感知还是加在奖励。加错科室,数据会把撒谎学稳。学稳更难拆。难拆之前用四问。四问是本节作业。作业很短。短的要真问。真问过关。
真问过关。过关标志是失败会上先问四问,而不是先说再加点数据。数据可能需要,但要问完才知道加在感知还是加在奖励。加错科室,数据会把撒谎学稳。学稳更难拆。难拆之前用四问当疫苗。疫苗反复打,接口才变成肌肉。肌肉能走客服与路口同一条链,1.3 才不是比喻课。比喻可忘。链不可忘。链短到四问。四问先于数据。数据在问完之后才知道加在哪一科室。科室分清,协同体检表才不是空墙。空墙会在失败会上重新发明四问。重新发明太晚。太晚之前把四问贴在项目墙。墙上有问,1.3 才算交卷。交卷后才允许第 2 章展开感知。感知没有四问会变成另一门课。另一门课是散。散用墙挡住。墙过关。
下一章进入认知:原始信号怎样被收成决策用得上的状态。