3.4 不确定性下的决策


3.4 不确定性下的决策

本节摘要:真实循环里,观测会缺、动态会随机、模型会错。偶然不确定来自世界本身的随机,加数据消不掉;认知不确定来自不知道,加数据、主动探测、更好的模型可以降。决策要把两类分开处理:对偶然,优化期望或风险;对认知,先减不确定或保守行动。贝叶斯更新、期望效用、带风险的规划、备份方案,都是在同一坐标系上的不同插件。

本节目标

阅读完本节,你应当能够:

  1. 用具体例子区分偶然不确定与认知不确定
  2. 说明为何只最大化期望可能让尾部风险不可接受
  3. 指出部分可观测时决策应作用在信念状态上
  4. 设计「先看一眼再走」这种用行动减认知不确定的策略

不确定不是调参能抹掉的雾

岔路一条看起来好走、一条可能近。这不是文学,是决策在缺信息时的常态。SOURCE 把来源写成环境随机、信息缺失、模型局限,并把不确定分成偶然与认知。抛硬币、轮胎打滑、市场微观波动,接近偶然:你再测也还是分布。没看过的路口后面有没有施工、新包装的摩擦系数,接近认知:派人看一眼、做一次试验,分布会变窄。

两类混在一个方差数字里,对策就会错。把认知当偶然,你会「认命」不探测,永远保守或永远赌。把偶然当认知,你会无意义地加传感器,以为多看一眼能让骰子变确定。状态里应分开存:这一维是物理噪声,那一维是「我还没看」。

💡 关键直觉:决策的对象在部分可观测时不是真实状态,而是信念——对可能状态的分布。硬挑一个最可能状态再规划,等于把溯当事实。

期望、风险、信念

期望效用:按分布加权平均再选。长期重复、损失可补时合理。一次性不可逆(碰撞、资金爆仓)时,平均值会掩盖尾部。于是有风险度量:看分位数、看最坏若干分之一、给灾难结果无穷代价。3.1 的避免目标在这里变成「期望里也买不走」。我更倾向安全相关用约束或无穷代价,舒适类才进期望。

部分可观测把状态换成信念。滤波用新观测更新分布,规划在信念上搜——计算更贵,但概念正确。工程上常用粒子或若干假设跟踪,而不是完整信念。假设集要能被感知证伪:一直留着不可能的假设,决策会永远分叉。

处理 针对 输出 代价
期望效用 偶然、可重复 平均最好 忽视尾部
风险约束 灾难性偶然 合法集缩小 可能过于保守
信念规划 部分可观测 在分布上的计划 算力
主动感知 认知不确定 先看后动 多花一步
鲁棒最坏情况 模型不确定 对一簇 T 都还行 更保守

SOURCE 会提到贝叶斯网络、决策树、MCTS 等作为评估手段。放回本节:贝叶斯网络更新信念;决策树在离散偶然分支上算期望;MCTS 用采样逼近期望。它们不是互斥产品,是信念与期望的计算工具。工具选错的标志是:偶然分支被当成需要「再训练就能消失」的误差。

用行动去买信息

认知不确定可以被行动降低。路口减速、探头伸出货架缝、对话里追问一句,都是用行动买观测。这要求决策承认「看」也是行动,有代价,也有价值。信息价值高而行动代价低时,先看;反之,按当前信念保守走。简单反射没有这块,因为它没有「我不知道」这个内部状态。

⚠️ 常见坑:用点估计规划,再用最大检测分数当确定。分数 0.51 的行人会被当成「在」,分数 0.49 的当成「不在」,决策在阈值两侧跳。应把分数送进信念或至少送进代价。

模型局限是第三种味道,常被归进认知:T 的参数不准、结构缺项。对策是鲁棒规划(对一簇模型都可接受)、在线用预测误差改 T、以及缩短规划视野。视野缩短是承认远步的 T 不可信,不是认输。第 2.3 节的误差回流,在这里变成决策侧的视野管理。

温室:天气噪声是偶然,传感器是否漂移是认知。对策不同——前者用区间维持而不是盯一个点温;后者用校准行动或冗余传感器。仓库:轮滑是偶然,货架后是否有人是认知。探头看一眼的代价远小于按「没人」规划后的碰撞。把这两种写成同一条「加一点随机性」,系统会该看时不看、该认命时乱看。

图:两类不确定两条对策

图:两类不确定两条对策

信念如何表示才喂得动决策

完整分布喂不进大多数规划器。常用若干假设跟踪:每个假设一个粒子或一个模式(行人过街/沿路走),带权重。决策可对期望规划,或对最坏若干假设做鲁棒。假设要能被新观测杀死:一直留着权重近零却不删的假设,树会膨胀。删除规则属于认知卫生,却决定 3.4 算不算得完。

风险度量选错的症状是:平均成绩很好,一年一次灾难。若业务不能接受那一次,期望效用从一开始就不是正确目标。用约束把灾难行动剔除,比在期望里加巨大负分更干净——巨大负分仍是可买的,只是贵。贵在采样噪声下可能被估错,约束不会。这与 3.1 词典序同构,只是对象从目标变成不确定下的行动集。

主动感知的信息价值可以很粗:不确定高且该维能影响合法集,就看。不必上完整的价值函数。走廊缝后可能有人,合法集会从「直行」变成「必须让路或停」,信息价值高。货架印刷文字几乎不影响合法集,信息价值低,不必为了好看去读。3.4 的「看也是行动」要配这把粗尺子,否则会变成到处看的观光智能体。

模型不确定用缩短视野,是承认远步的 T 不可信。缩短后空出来的「以后的事」交给重规划。视野长度应随预测误差自适应:误差大则短。自适应规则本身是决策知识,走 4.3 的慢更新,不要每帧拧。每帧拧视野会抖,抖会被人看成控制失败,其实是 3.4 的超参在打架。

本节检查清单

偶然与认知有没有分开存,对策有没有分开写?决策对象是点估计还是信念?检测分数 0.51/0.49 会不会让行为跳?主动感知的粗尺子(能否改变合法集)用了没有?观光式到处看有没有出现?模型不准时视野是否随误差缩短,缩短规则是不是每帧拧?不可逆灾难用约束还是用巨大负分?假设跟踪能否被新观测杀死?同源证据有没有虚高置信从而骗规划代价?「看也是行动」有没有占用执行器时间预算?预算没有,看会挤掉真正的避障。挤掉避障的好奇不是智能,是 3.4 没写完时间账。时间账是不确定决策的隐藏约束,与 5.1 的周期表是同一张表的两面。

0.51 与 0.49 不该分成两个世界

行人检测分数在阈值两侧跳,点估计规划会一帧刹车一帧加油。正确做法:分数进信念或进代价,阈值两侧连续,必要时减速买信息。买信息的条件是该维能改变合法集——行人在与不在会改变能不能穿。能改变,看一眼划算。划算不需要完整信息价值函数,粗尺子够。够了就不要观光。观光耗时,耗时挤避障。挤避障是 3.4 的时间账没写。时间账与 5.1 周期表是同一张表:看也占执行器。占了要记账。记账后,偶然打滑仍用区间维持,不派人看——看消不掉打滑。消不掉的当偶然。能降低的当认知。两类写在状态的不同字段。不同字段才能对不同药。药开错,会加传感器幻想消除骰子,或该探头时认命。认命在缝后有人时是撞。撞是认知不确定被当成偶然。当成偶然就不会买信息。不买信息的节约是假节约。假节约用一次碰撞付清。付清太贵。贵之前用粗尺子决定看不看。看不看是行动。行动进合法集与时间账。两账都清,3.4 过关。过关不要求会写 POMDP 全解。全解在邻书。本书要求不把 argmax 当世界。世界是分布。分布可以很糙,几个假设即可。假设能被新观测杀死。杀死是卫生。卫生比完整贝叶斯更先。更先的做了,完整可以以后再上。以后再上不妨碍今天把 0.51 和 0.49 收成连续不确定。连续了,横跳会停。停了,才谈风险分位数。分位数对付尾部。尾部对付不可逆。不可逆用约束。约束不可买。买不通的约束是 3.1 在雾里的延续。延续要显式。显式在合法集。合法集在选择器。选择器在上一节。上一节与本节用信念握手。握手失败,表现为阈值跳。阈值跳是症状。症状的根是点估计。点估计是撒谎。撒谎从 2.4 就开始。本节是决策侧拒绝被骗。拒绝写进代价与信念。写进了,规划会绕开看不清的格子。绕开是诚实。诚实比勇敢穿过去安全。安全是避免目标。避免目标在雾里更要硬。硬的办法不是假装看见。假装看见是 0.51 当「在」。当「在」会急刹;当「不在」会穿。两侧都可能错。错的结构是同一的:把不确定压成点。压成点是本节禁止的压缩。压缩可以发生在感知,不可以发生在交给决策之前还要再压一次。再压一次是 argmax。argmax 禁止作为唯一输入。唯一输入应是分布或至少是分数加来源。来源同源不加倍。不加倍是 2.4 的卫生在决策侧的回声。回声要听见。听见了,3.4 才不是一段关于雾的散文。散文不决策。决策要字段。字段要连续的不确定。连续了,0.51 与 0.49 回到同一个世界。同一个世界才能规划。规划在雾里走短步。短步是视野管理。视野随误差缩短。缩短规则慢变。慢变走 4.3。4.3 与本节再次接头。接头很多。很多是因为不确定贯穿认知到决策。贯穿不是点缀。点缀是最后一节才提一句噪声。噪声不够。不够的要两类、信念、买信息、短视野。四样齐,本节毕业。毕业不发贝叶斯证书。发的是不再用 argmax 当世界的习惯。习惯比公式抗忘。抗忘才能进学习章:学习若吃 argmax 当状态,会把撒谎学稳。学稳的撒谎更难拆。难拆之前在本节拆掉。拆掉很简单:把分数留下。留下分数,世界就还是雾。雾是真的。真的雾才能做真的决策。假的晴天会让规划勇敢。勇敢在 0.49 那边。那边可能没人,也可能有人。有人时勇敢是事故。事故预防是连续不确定。连续不确定是本节作业。作业是改输入,不是改勇气。勇气不进合法集。合法集进约束。约束进雾里仍硬。仍硬才叫 3.4,而不是把 3.2 的确定规划换个标题。标题可以有不确定。输入必须真的不确定。真的从分数开始。分数留下。留下就不跳。不跳就可以短步走。短步走完本节。

重点提炼

  • 两类不确定:偶然消不掉,认知可降低,对策不可混
  • 信念状态:部分可观测时决策的对象是分布
  • 期望不够:不可逆灾难用约束或风险,不买进平均值
  • 主动感知:看也是行动,信息有价
  • 点估计会跳:检测分数应进信念或代价
  • 模型不准就缩短视野:远步的精确计划是幻觉

下一章进入学习:经验如何改策略、模型或表示,而不改写循环本身。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U