本节摘要:行动选择是在当前状态的候选行动中挑出要执行的那一个。规则把状态匹配到动作;概率按分布采样;价值估计选分高的;基于模型则先用 T 预演再选。探索与利用决定何时偏离当前最优去长见识。规划是把选择拉成序列;本节讨论序列长度为 1、或规划只给出候选时,最后那一票怎么投。
阅读完本节,你应当能够:
迷宫里「右手扶墙」是规则策略:状态简化成「右手有没有墙」,行动是沿墙走。它能走出简单迷宫,不是因为聪明,是因为环境拓扑配合。SOURCE 把策略分成规则、概率、价值、模型、探索-利用。前四类是「如何打分或匹配」,最后一类是「要不要故意不选当前最高分」。混在一起讲会乱。先看前四类。
规则:温控「高于 25 开空调」。快、可审计、怕例外。部分可观测时,同一观测对应多种真实状态,规则会振荡——灯闪一下就急刹。概率:按策略分布采样,适合需要多样性或要探索的场合,也适合对手会针对确定性套路的博弈。价值:给每个行动一个分数,贪心取最大。分数可以来自手写启发式、从模拟回传、或从学习得到的 Q。模型:用 T 看一步或几步后的效用,再选。它和 3.2 的差别主要是视野:规划视野长,这里常常只看浅层。
💡 关键直觉:行动选择策略是「当前步的决策程序」。它可以被规划器调用(每步用价值选扩展),也可以独立存在(反应式)。
学习型智能体若永远选当前最高分,状态空间里没走过的走廊会永远黑着。问题产生器的工作就是在某些步插入探索。探索可以是 epsilon 概率随机、可以是对少访行动加奖励、可以是对模型不确定高的区域优先。利用则是按当前估计走。两者不是两种算法站队,是同一策略里的配额。配额随训练进度收,不随上线后的业务 KPI 收——上线后还大幅探索,用户会变成小白鼠。
| 选择机制 | 需要什么 | 上线是否还探索 | 典型失败 |
|---|---|---|---|
| 规则匹配 | 覆盖全面的规则 | 否 | 例外与振荡 |
| 随机策略 | 分布参数 | 可选 | 方差大 |
| 贪心价值 | 较准的价值 | 通常否 | 估计偏了就错得很坚定 |
| 浅层模型预演 | 局部准的 T | 否 | 短视 |
| 带探索的价值 | 价值加计数或不确定 | 训练是、上线慎 | 上线探索伤业务 |
价值从哪来,决定这类策略的真实身份。启发式价值是编译进去的知识;模拟价值是在线规划;学习价值是第 4 章的产物。口头上都叫「选 Q 最大的行动」,来源差很远。调试时先问分数的出生证明。
规划可以把序列交给执行器,也可以只把根节点的行动交给 3.3。很多树搜索就是「在模型里规划,在根上选择」。规则策略可以当规划的底层技能:高层搜「去货位」,低层用规则沿通道走。学习则改价值或改规则权重,不改选择器的形式——贪心还是贪心,只是分数变了。
⚠️ 常见坑:用均匀随机当探索,在危险行动集合上同样掷骰子。探索应限制在安全集,或先在模型里探索再上真机。
仓库窄道会车:规则「谁先进入谁优先」可审计;价值「谁让路后全局延误更小」更优但要估计;模型预演能看到卡死;探索在真机窄道里乱试会撞。正确组合往往是:硬规则划定合法行动集,价值或规划在合法集里选,探索只在仿真。这把 3.1 的约束、3.2 的预演、3.3 的选择焊在一起。
概率策略还有一层用途:表达不可分辨。两个行动效用接近时,硬贪心会对估计噪声极度敏感,表现为左右横跳。对接近的分数做软选择,行为更稳。这不是「更随机更智能」,是承认价值估计有误差。误差来自 2.4 的置信时,选择器应把置信吃进去,而不是只吃点估计。
概念伪代码:
合法集 = 规则过滤器(状态) 若 合法集为空: 触发安全默认行动 分数 = 价值或浅层预演(合法集) 若 处于训练且未上线: 按探索配额偏离 argmax 否则: 在分数接近的子集里软选择,避免横跳 执行 选出的行动
过滤器先于分数,保证避免类目标不被高分买通。这是 3.1 在选择器上的落点。
软选择常用温度参数:温度高,接近的分数更多被抽到,抗噪声;温度低,接近贪心, exploitative。训练可从高到低退火;上线应低,且探索配额单独用开关关掉。不要用同一个随机源既当探索又当软选择——关掉探索时行为仍应稳定。问题产生器是训练设施,不是生产默认。
规则策略的维护成本随例外上升。例外超过一页,应把高频例外升成状态字段加价值选择,而不是继续叠 if。叠 if 会在部分可观测下振荡:灯闪一下匹配到另一条。价值选择也振荡,若分数接近且硬贪心;这时回到软选择或加滞回。滞回是控制里的老办法:阈值分开开关,避免边界抖。选择器可以很土,土往往稳。
模型预演的浅层深度是超参。深一层更像规划,算得起就深,算不起就浅,并承认短视。短视不是耻辱,是与 5.1 反应式的连续谱。把深度写成契约:技能层最多预演 k 步,超时返回当前最好根行动。超时返回随机才是失败。
合法集过滤器应可测:构造「高分但非法」的行动,断言选不中。测不过,3.1 的避免目标只写在纸上。过滤器测试比回报曲线更接近决策正确性。回报可以靠在合法边缘擦出来,过滤器测试专门抓擦边。
合法集过滤器有没有「高分非法」测试?探索与软选择是否共用一个随机源,关掉探索后还抖吗?温度与配额上线开关分开了吗?规则例外是否超过一页还在叠 if?滞回有没有用在边界振荡上?浅层预演深度与超时返回写进契约了吗?分数出生证明是启发式、模拟还是学习?上线探索是否限制在安全集或只在仿真?接近分数硬贪心横跳有没有改成软选择?过滤器先于分数——这一句能否在代码职责上指出来,而不是只在课上点头?指不出来,避免目标仍可能被买通。买通发生在选择器,不发生在愿望清单。愿望清单再完整,最后一厘米松了,循环仍会走出禁区。禁区测试必须打在选择器上。
构造状态:前方距离低于阈值,价值网络给加速打最高分。选择器应输出限速或停。测不过,过滤器不存在或存在于愿望里。愿望不执行。执行的是选择器顺序:先合法集,再分数,再软选择,上线关掉探索。顺序写进四行伪代码,与 5.1 的急停合同同构。同构不是巧合。决策的最后一厘米就是架构的最快层在算法侧的名字。名字可以叫过滤器。过滤器测试每月与冲突测试一起跑。跑不过禁止宣称 3.1 的避免目标已落地。落地必须打在选择器。选择器松,目标再完整也是纸。纸挡不住高分。高分会买通纸,买不通测试。测试是铁。铁放在合法集。合法集由规则与物理限幅构成。限幅属 L0。L0 不可学习。不可学习的过滤器才配挡高分。挡得住,3.3 过关。挡不住,回头加滞回与分开关阈值,避免边界抖被当成「再加点探索」。探索不是抖的药。抖的药是滞回与软选择分离。分离后关掉探索,行为应静。静是上线资格。资格比平均回报先。先测静,再看分。分在合法集内才有意义。集外的分是攻击样本。攻击样本要进回归。回归不过不发版。发版纪律与 4.3 同一精神:先闸后快。快的选择器没有闸,只是贪心。贪心在非法高分上很坚定。坚定的非法是事故。事故预防是这一条构造测试。测试很短。短的每月跑。跑比讨论「要不要上更强价值网络」便宜。更强网络可能把非法分打得更高。更高更要挡。挡在前。前是过滤器。过滤器在本节作业里。作业不做,3.3 只是策略名词展览。展览不挡车。挡车的是限幅。限幅要测。测要用高分非法。高分非法造出来,才知道自己有没有选择器。有没有,比叫什么策略重要。叫什么可以后补。有没有必须当场知道。当场知道靠这一条。这一条过,才配谈温度退火。退火是训练设施。设施关不上,上线会把用户当问题产生器。问题产生器是 1.2 的元件,不是客服。客服不该被探索。不被探索写在开关。开关测过,3.3 才算把探索轴从选择机制里拆开。拆开是本节的坐标系。坐标系立住,名称可以乱飞。乱飞不影响闸。闸在前。前在合法集。合法集测试在这一节的作业里,请当真。当真的标志是回归里真有这一条,而不是只在课上点头。点头不挡高分。回归挡。挡了,再谈软选择抗噪声。抗噪声是锦上。锦上之前先有合法集这层土。土在,选择才是决策。决策在循环里。循环不接受集外的最优。最优若在集外,那不是最优,是漏洞。漏洞用构造测。测到了就修过滤器。修的是 3.3,不是 4.2。4.2 会把漏洞学得更稳。更稳的漏洞更糟。糟之前用这一条拦住。拦住是选择器的职业操守。操守很土。土的留下。
下一节把不确定性从「噪声」提升为决策必须显式处理的对象。