1.2 智能体的类型与环境


1.2 智能体的类型与环境

本节摘要:智能体类型不是品牌分层,而是对循环内部做了哪些简化。简单反射只用当前观测;基于模型维护世界状态;基于目标在状态上搜索到达条件;基于效用用标量比较不可兼得的结果;学习型则允许策略或模型被经验改写。环境则用可观测性、确定性、动态性、连续性、单多智能体等属性,反过来决定这些简化能不能成立。

本节目标

阅读完本节,你应当能够:

  1. 按「有没有内部模型、目标、效用、学习」区分五类智能体
  2. 说出学习型智能体四个元件:执行、评判、学习、问题产生器
  3. 用可观测、确定、静态、离散等词描述一个具体环境
  4. 解释为什么部分可观测环境会逼你从简单反射升级到带记忆的模型

类型是对循环的简化,不是智商排行

SOURCE 里列出简单反射、基于模型、基于目标、基于效用、学习型。常见误读是把它们当成从低到高的段位。更准确的读法:每一类都在循环上拿掉或加上一块。简单反射拿掉记忆与模型,直接把当前观测接到行动;它在「温度低于阈值就加热」这种完全可观测、静态、规则稳定的环境里足够,换到十字路口就会把被卡车挡住的行人当成真空。

基于模型的智能体补回内部状态:用观测更新「我以为世界现在怎样」,再在这个估计上选行动。自动驾驶里那张局部地图、其他车的速度估计,就是模型。模型错了,决策会很自信地错。基于目标的智能体再补一个到达条件,用搜索或规划找行动序列。基于效用的智能体承认目标往往不可兼得——既要快又要省电又要舒适——于是用效用函数把结果打成分数再比。学习型不规定知识从哪来,只规定有一条用反馈改知识的通道。

温室例子可以走完这一谱。简单反射:气温高于 28 开窗。基于模型:加上「开窗后十分钟气温怎么走」的粗模型,避免频繁开关。基于目标:白天把气温赶到 25 附近。基于效用:在气温、湿度、能耗上加权。学习型:根据过去一周的超温次数改阈值或改模型。同一套传感器,类型选择取决于你愿意在循环里维护多少结构。

💡 关键直觉:升级类型是因为环境属性让旧简化失效,不是因为「高级」听起来更好。能用恒温器解决的,不要上规划器。

学习型的四个元件

SOURCE 把学习型拆成执行元件、评判元件、学习元件、问题产生器。这四个名字值得单独钉一次,因为后文所有「学习」都会落到其中一块。

执行元件就是 1.1 节的运行时循环:状态进、行动出。评判元件拿外部奖励或任务规范,打出「这一步好不好」——它是奖励进入循环的海关。学习元件根据评判结果改策略或改模型。问题产生器故意制造探索:不是为了当前这一步最优,而是为了让学习看到没见过的状态。少了问题产生器,智能体很容易在已知好路上打转,把坐标系缩成一条细缝。

元件 在循环中的位置 不做它会怎样
执行元件 状态到行动 没有行为
评判元件 奖励或规范到评分 学习没有对错
学习元件 评分到参数或规则更新 永远重复同一策略
问题产生器 插入探索行动 只利用、不探索

探索与利用的定量算法(epsilon-greedy、UCB)属于强化学习文集的深度;这里只需记住:问题产生器是类型定义的一部分,不是调参附录。

环境属性如何卡死类型选择

环境不是「背景图」,是循环的另一半。常用维度如下,名称来自经典教材,含义按工程口吻说。

完全可观测:当前观测已含决策所需全部信息,棋盘游戏接近这种。部分可观测:必须靠历史或主动探测,扑克、多数机器人视觉都是。确定性:行动后果可精确预言;随机性:同样行动会得到不同下一状态。片段式:每一步的评分不依赖更早的选择,像一张张独立考卷;序列式:今天的行动改写明天的状态。静态:决策期间环境不自己走;动态:你还在算,车已经开过来了。离散/连续:棋步对速度指令。单智能体/多智能体:对面是物理还是也在优化自己目标的对手。

可观测性 完全 ──────── 部分 确定性 确定 ──────── 随机 时间结构 片段 ──────── 序列 变化节奏 静态 ──────── 动态 取值 离散 ──────── 连续 对手 无 ──────── 有

这些轴会组合。仓库分拣:部分可观测(货架背后看不见)、混合确定与随机(轮子打滑)、序列式、动态(有人走动)、连续控制加离散货位、有时还有其他车。这种组合几乎立刻排除纯简单反射,并逼你至少维护内部状态;要不要上效用,看是否在时效、能耗、破损率之间权衡。

⚠️ 常见坑:用完全可观测、确定性仿真里调好的策略,直接丢进部分可观测的真机。失败看起来像「模型不行」,根因是环境属性假设没写进设计。

图:类型与环境匹配

图:类型与环境匹配

PEAS 描述任务时很有用:性能指标、环境、执行器、传感器。写清楚这四项,类型选择就不再靠感觉。性能指标对应目标和效用;环境对应上面那组轴;执行器与传感器对应 1.1 的硬件层。缺 PEAS 就开会,最后往往变成「我们做一个智能的」。

多智能体环境还多一个麻烦:你的最优取决于别人的策略。这时「环境」里藏着别的循环。第 6 章再展开;此刻只需知道:单智能体里有效的简单反射,在对手会针对你时会变成可被剥削的固定套路。

虚拟环境与物理环境不是两种智能体

同一套类型谱,换到纯软件环境(棋、模拟器、网页)仍然适用。差别在传感器与执行器的形态,以及失败代价。棋是完全可观测、确定性、离散、回合制,简单反射几乎不够,因为必须看全局棋谱当状态——这其实是基于模型加搜索。网页客服是部分可观测、序列式、动态(用户随时离开)、离散行动(回复或调工具)。别因为没有轮子就跳过环境轴:用户是否在线、会话是否被打断,就是动态性。

物理环境多了安全与标定。轮速与相机不同步,内部模型会自己打架,类型上你以为自己是基于模型,实际上模型从未一致过。这会表现为「上了模型反而更抖」。先修时间对齐,再谈要不要升到基于目标。虚拟环境里时间对齐几乎免费,因此在仿真里显得很聪明的类型,到真机可能必须降一级,把规划视野缩短,把反射层加厚。类型可以随部署降级,这不是认输,是环境轴变了。

再补一条常被漏的轴:情节长度。片段式任务每步几乎独立,学习信号密;序列式任务奖励稀疏,基于目标的规划或强化才有理由进场。把序列式任务硬切成片段,看起来好标数据,会丢掉「今天插货的角度影响明天货架稳定性」这种跨步结构。切不切,应写进环境描述,而不是偷偷在数据管道里切。

本节检查清单

环境六轴是否都填了,哪怕填「近似完全可观测」?类型选择是否写了「因为哪一轴让旧简化失效」,而不是「因为高级」?学习型四元件有没有缺问题产生器?上线后探索是否另有开关?PEAS 的性能指标能否检验?虚拟任务有没有漏写动态性,例如用户随时离开?物理任务的时间对齐有没有当成类型问题来修?序列式任务有没有被数据管道偷偷切成片段?仿真里升上去的类型,真机是否允许降级并加厚反射?降级合同有没有写进部署说明?答不出「哪一轴」这一问,类型节等于没读,只记住了五个名字的顺序。顺序不是谱系智商,是内部结构的加减。

仿真升类型、真机允许降级

仿真完全可观测,基于目标的规划很美。真机部分可观测且动态,应降级:规划缩短视野,反射加厚。降级写进部署合同。合同是 1.2 的完成态:类型随环境轴变,不随演示变。演示在仿真。仿真轴更强。更强轴上的类型搬到真机是陷阱。陷阱用这一条拆:同一策略,仿真成功、真机抖。抖先查可观测与时间对齐,再查要不要降类型。降不是认输。认输是环境轴变了还不改简化。不改会超时或振荡。振荡像控制差。差可能是类型不匹配。不匹配回环境六轴。六轴填完,类型才有理由。理由写「因为哪一轴」。哪一轴写不出,1.2 不及格。不及格不要用「高级」遮。高级不是轴。轴是可观测、确定、动态那些。那些填完,恒温器可以仍是简单反射。仍是,正确。正确匹配过关。过关允许真机比仿真更简单。更简单是智慧。智慧在降级合同。合同在作业。作业做了,1.2 毕业。毕业发的是会降级的习惯。习惯比五个类型名字抗忘。名字可忘。轴不可忘。轴决定简化。简化决定能不能活。活着先于高级。高级在真机上可能死于超时。超时回 5.1。5.1 会问周期。周期来自环境动态。动态是本节的轴。轴填了,全书后面的选型才有根据。根据在 1.2。1.2 过关。

一节小结

  • 类型是简化:反射、模型、目标、效用、学习,对应循环上少了或多了哪一块
  • 学习型四元件:执行、评判、学习、问题产生器;探索是类型定义不是附录
  • 环境属性:可观测、确定、片段/序列、静态/动态、离散/连续、单/多
  • 匹配原则:属性让旧简化失效才升级,不因为名词高级
  • PEAS:性能、环境、执行器、传感器写清,类型选择才可讨论
  • 仿真陷阱:在过强可观测与确定性里调好的策略,换真环境会先崩在假设上

下一节把认知、决策、学习预先嵌进这张循环,作为后三章的接口说明。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U