3.1 目标与效用


3.1 目标与效用

本节摘要:目标是智能体希望达成、维持或避免的状态条件;效用是把不同结果打成可比较分数的标尺。状态目标、成就目标、维持目标、避免目标决定规划器看的是到达、计数、区间还是禁区。目标可以层层分解;冲突时必须显式加权,否则循环会在暗处优化错误的东西。奖励是效用在时间上的一种实现,不是另一套哲学。

本节导航

阅读完本节,你应当能够:

  1. 给一个任务写出目标类型,而不是只写「做得更好」
  2. 把总目标分解成可检验的子目标,并指出分解错误会怎样
  3. 用效用解释快、安全、能耗不可兼得时如何取舍
  4. 说明奖励函数与效用、终止条件之间的分工

目标先写成可检验的条件

自动驾驶「安全到达」听起来完整,规划器却没法当布尔用。SOURCE 把目标分成状态、成就、维持、避免四类,就是逼你写成条件。状态目标:房间干净、货已入位。成就目标:完成一百笔交易、组装完一个部件——关心事件发生过。维持目标:室温落在区间、车道保持——成功是一直成立。避免目标:未授权访问不发生、碰撞不发生——成功是反例计数为零。

四类可以叠。温室既要维持气温区间,又要避免长时间过湿,还可能有「本周产量」这种成就。写成一张表,比写成一句愿景有用。表达手段也要选:逻辑表达式适合离散约束;状态变量阈值适合控制;目标函数适合连续权衡。同一系统里三者共存很常见:碰撞是逻辑禁区,速度是变量,舒适度进目标函数。

💡 关键直觉:目标层次不是文档结构,是规划器的搜索范围。上层失败时,下层再优化也是在错误任务上刷分。

效用把冲突变成可比较的数

只靠布尔目标,一旦两个目标不能同时真,智能体就会卡住或暗中挑一个。效用函数给每个结果一个分数,决策选期望效用高的。投资机器人在回报与回撤之间加权,跟车在时限、能耗、破损之间加权,都是这件事。效用不是「更高级的目标」,是目标冲突时的公度。没有冲突时,布尔到达就够,不必硬造分数。

设计效用时有三处易歪。一是漏掉真正会被优化的维度:只写时效,包装破损会上升,因为破损没进分数。二是量纲混乱:把「秒」和「元」直接加。三是把稀疏的终局效用误当成逐步奖励,导致中间过程不可学。第 4 章会谈塑形;本章只需声明:效用描述结果有多好,奖励是把这种好坏按时间发给学习的信号。两者应当能对上,但不必逐步相同。

写法 适合 冲突怎么处理 风险
单一布尔目标 到达、解谜 不处理 多目标时卡住
层次分解 大任务拆步 下层服务上层 分解错则局部最优
加权效用 持续权衡 显式权重 权重变成暗目标
约束加效用 安全禁区加舒适 禁区不可买 约束过紧无解
词典序 先安全后速度 优先级 低优先级永远没份额

SOURCE 提到强化学习、规划算法、效用函数都可作为目标设定手段。放回坐标系:规划用目标条件搜序列;强化学习把目标沉进奖励;效用型智能体在一步或策略层面最大化分数。三种可以嵌:外层效用定权重,中层规划守硬约束,内层学习微调。不要开会时三选一站队。

谁有权改目标

运行时改目标是合法的——用户说「改为冷链优先」——但必须走显式通道,不能让学习偷偷改成功标准。否则评判元件与执行元件用的不是同一盏灯塔。维护目标尤其危险:阈值被学习慢慢挪了,业务还以为在守旧规范。我更倾向:学习可以改策略与模型,改目标要人确认,或至少留下可审计的版本。

⚠️ 常见坑:用代理指标当目标。点击率替代「用户真正办完事」,智能体会学会弹窗。循环很闭合,坐标系从一开始就偏了。

仓库例子可以写全。总目标:当日订单出库率。子目标:拣货路径短、错误率为零、易碎破损为零。效用:出库率为主,路径为辅,错误与破损为硬约束(词典序或约束)。奖励若只给「拣得快」,学习会抄近路挤坏包装。这不是算法失败,是 3.1 没写进约束。PEAS 里的 P,在这一节必须变成可计算的数或逻辑式,不能停留在形容词。

概念上检查目标是否写清,可用下面的清单:每个目标能否用当前状态判定真假或打分?冲突是否有权重或优先级?避免类目标是否真的不可被效用买通?谁可以在运行时修改?四问过不了,先别做规划器。

图:目标层次与效用权衡

图:目标层次与效用权衡

把目标写成可判定的谓词或区间

工程落地时,每个目标应能用当前状态或一段窗口判定。到达:货位占用变为已插入。维持:过去五分钟气温在区间内的比例。避免:碰撞计数保持零,窗口可以是任务全程。成就:当日完成单数达到阈值。写不出判定,规划器会用代理——例如「尽量往前开」——代理会慢慢取代你以为还在的目标。判定函数应版本化,和 4.3 一样,业务改成功标准时要能指出哪一天换了谓词。

多目标权重不要藏在魔法系数里。把权重表给非算法同事看:时效 0.3、能耗 0.1、破损无穷。他们会立刻改无穷为很大的数,这时要挡住:很大的数仍可被买通,无穷才是约束。词典序是另一种公开:先满足避免,再谈效用。公开比精妙更重要。隐藏权重等于隐藏真正的灯塔,学习会优化你没说出口的那盏。

目标层次分解错误的典型:把「用户满意」拆成「多说话」。客服轮次变长,满意未必升。分解要用可观测的中间结果,并且定期用上层指标校准下层。下层 KPI 独立发奖,层次就断了。自动驾驶把「安全到达」拆成「别压线、别超速、别碰」,还要用到达时间校准,否则会学会永远停在路边——避免类全满足,成就类为零。层次需要向上负责,不是只向下拆。

效用与奖励的对账表应存在:终局效用项、逐步奖励项、塑形项,三列。塑形只为好学,必须能证明它不改变最优策略的到达集,或至少用约束包住。对不上账,第 4 章会学得很欢,第 3 章的灯塔已经歪了。

本节检查清单

四类目标是否都写成了判定函数并版本化?避免类是否真的不可被加权买通,而不是「很大的数」?层次是否向上负责,会不会学会永远停在路边以刷安全?权重表有没有给非算法同事看过?代理指标(点击、轮次、速度)有没有取代灯塔?奖励、终局效用、塑形三列对账了吗?学习默认不能改目标,通道显式吗?「用户满意」有没有被拆成「多说话」这种错误层次?合同课不及格就不要打开 3.2。打开了也只是在未定义问题上跑搜索,跑得越快错得越坚定。坚定的错看起来像智能,其实是优化器在执行一份没写完的合同。写完合同是决策的第一步,也是最不像算法的一步。

永远停在路边算不算成功

若安全子目标独立发奖,智能体学会不开车。避免类全真,成就类为零。层次向上负责的检验就是这一条:到达时间为零则上层失败,即使从未碰撞。失败要写进判定,不能只在下层 KPI 上开香槟。香槟会让第 4 章把停车学稳。学稳的停车是错误合同。合同要改:避免是约束,到达是必须成立的成就或维持。约束与成就的词典序里,约束先,但成就不能永远为零。为零则整体假。假用这一条实验拆穿。拆穿后权重表才能给同事看。同事若把无穷改成很大的数,挡住。挡住是 3.1 的职业。职业对着灯塔。灯塔不能被下层刷分替换。替换是代理。代理是点击、轮次、速度。速度代理会挤坏包装。包装进约束。约束不可买。不可买写进判定函数版本。版本化后,业务改成功标准能指出哪一天换了谓词。指出是问责。问责从目标写清开始。写清才能规划。规划在下一节。下一节没有写清的目标,只是散步。散步不叫决策。决策从判定开始。判定能判停车为失败,3.1 过关。过关很土。土的灯塔才能进循环。循环不需要漂亮的愿景句。愿景句不能当布尔。布尔或区间才能当。当了,抢黄灯才有四句可答。四句在支柱页。支柱页的题在本节落地。落地是判定函数。函数有版本。版本有人签。签了,学习默认不能改。不能改写进 4.3 的 L0 或 L1。L1 人审才能改灯塔。改灯塔是大事。大事不是调参。调参改策略。策略在灯塔下。灯塔下才能学。学之前灯塔要亮。亮是可检验。可检验是本节唯一的诗意。诗意很短:能判真假。能判,合同成立。合同成立,优化器才被允许进场。进场前这一条停车实验必须红过一次,证明你会抓假成功。抓到了再 Greening。Greening 是到达也成立。两成立,层次才没断。没断,3.1 毕业。毕业不发效用公式证书。发的是不会给路边停车发奖的习惯。习惯比公式抗忘。抗忘才能进 3.2。3.2 会要 G。G 来自判定。判定来自本节。本节不交 G,搜索器会发明代理 G。代理 G 是永远停车或永远加速。两极都来自合同空。合同空用这一条填。填完,效用表才有资格出现。资格很严。严是因为灯塔歪了,后面五章都会很勤奋地歪。勤奋的歪最难拆。难拆之前在路边停车这一条拆掉。拆掉很便宜。便宜的先做。做了,再谈加权。加权是冲突时的公度。公度之前先有不可买的约束与不可为零的到达。两先,3.1 才不是愿景课。愿景课不决策。决策要判定。判定要能判停车失败。失败能判,成功才有意义。意义在到达。到达在合同。合同在本节。本节钉合同。钉子钉在可检验。可检验过关。

一节小结

  • 四类目标:到达、成就、维持、避免,必须写成可检验条件
  • 层次:上层定义任务,下层是手段;下层刷分不等于上层成功
  • 效用:只在冲突时需要,用来公度,不是装饰
  • 约束优先:安全类避免目标不要被加权买通
  • 奖励对齐:奖励是效用的时间信号,代理指标会扭曲循环
  • 改目标要显式:学习默认只改策略与模型

下一节在目标已写清的前提下,讨论如何搜索行动序列。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U