4.2 学习机制与算法


4.2 学习机制与算法

本节摘要:机制是「经验如何变成一次合法更新」。步骤可概括为感知经验、积累、更新内部知识、用新知识改下一轮行为。算法是这条管道上的具体阀门:梯度下降改参数、Q 学习改价值表、策略梯度直接改行动分布。选算法先认它改的是表示、价值还是策略,以及它假设数据是否来自当前策略。深度只是函数近似的一种材料,不是新范式。

先说结论

阅读完本节,你应当能够:

  1. 把一次学习循环画成积累、更新、评估三步
  2. 给 Q 学习、策略梯度、行动者-评论者在「改价值还是改策略」上定位
  3. 说明函数近似解决的是状态装不下表,会引入新的不稳定
  4. 判断一个算法名字属于监督管道还是强化管道

机制是管道,算法是阀门

SOURCE 把学习过程写成感知、经验积累、模型构建、知识提炼、行为改进。换成 1.3 的接口:积累的是轨迹或带标签样本;构建/提炼是更新知识;行为改进是下一轮决策读到新知识。管道两端必须闭合到循环,否则只是离线训练一个函数,与智能体无关。

监督管道:样本进,损失出,参数更新。强化管道:与环境交互产轨迹,用回报估计价值或策略梯度,再更新。无监督管道:无标签批次进,重构或对比损失出。三种管道可以共享同一套参数存储器,但优化目标不能偷偷加在一起不声明——那会变成 4.3 的冲突写入。

重复: 采集一批经验 D 计算更新 Δ 知识 若校验通过: 知识 ← 知识 + Δ 用新知识跑执行元件 用评判元件看是否真改进

💡 关键直觉:没有「校验通过」这一闸,学习元件会把任何噪声写进知识。闸可以是保持集、仿真回归、安全约束,但不能是「损失下降了」。

强化算法的座位,点到为止

表格方法的 Q 学习:对每个状态-行动对存一个分数,用贝尔曼残差更新。它改的是价值,行动选择再贪心或带探索。深度 Q 网络只是用网络近似这张表,因此能处理图像状态,也因此失去表格的收敛舒服。策略梯度不存 Q 表,直接让好轨迹里的行动更常被抽到。行动者-评论者两边都要:评论者估价值减方差,行动者改策略。细节与稳定技巧留给专集。本文集只需能回答:这个名字改的是价值、策略,还是两者。

名字 管道 主要改什么 数据是否要来自当前策略
分类/回归/SVM 监督 映射参数 否,离线即可
聚类/自编码器 无监督 表示
Q 学习 强化 价值 可用离策略数据,但要小心
深度 Q 网络 强化 价值近似 常用回放,离策略味道
策略梯度 强化 策略 基本要当前策略数据
行动者-评论者 强化 策略加价值 看具体变体

函数近似是因为状态清单一旦含图像或连续量,表就爆。近似让学习泛化到邻近状态,也让更新彼此干扰:改好了 A 状态,B 状态的价值可能被带偏。这是 4.4 要面对的结构,不是调学习率能从根上取消的。世界模型类算法(学 T 再规划)改的是 2.3,不是直接改策略;若规划器固定,学好 T 也会改行为——行为改变是间接的,调试时要看预测误差,不要只看回报。

深度与「端到端」的边界

神经网络在 SOURCE 里出现在监督与深度强化两边。它是可微的函数近似器,可以把感知与策略焊在一次前向里。焊得住不等于边界消失:你仍应能设计实验,看失败来自识别还是来自选择。端到端在标注齐、模拟准、安全能兜住时很香;在约束要审计、模块要独立回滚时很贵。概念筑基的立场是允许焊,但保留探针。

⚠️ 常见坑:把算法名当架构。系统图上只写「DQN」却看不出观测怎么进、奖励怎么算、合法行动谁过滤。名字解决不了接口。

迁移学习在机制上是「用源任务参数初始化再在目标任务上走同一管道」。主动学习是监督管道里的问题产生器:挑最不确定的样本去问人。模仿学习是监督管道改策略。逆强化是从示范反推奖励,再走强化管道——奖励仍要接受 3.1 的审计,因为反推出来的奖励可能不可解释。机制层把这些名字收回管道,比背清单更抗忘。

温室:气温预测用监督回归改模型;控制策略可用规则,也可用强化在仿真里微调;异常温升用无监督。三种更新应分时、分库:不要让一次强化梯度改掉已经校准的温度映射。这就是管道隔离。算法再新,隔离原则不变。

校验闸的最小实现

更新提交前至少跑三套:保持集或影子回报不下降超过阈值;约束违反计数不升;关键场景回归(急停、超时、合法集)。三套都过才改线上版本号。损失下降不在三套里——损失是优化目标,不是业务目标。强化里训练回报尤其爱骗人,因为探索与评估纠缠。评估必须冻结探索。

回放缓存是强化管道的记忆。它能提高样本效率,也会让过时动态长期占着更新。环境一变,应提高新样本比例或缩短缓存寿命,这与 4.3 过时病同一药。策略梯度类对数据是否来自当前策略敏感,乱塞旧缓存会学歪;价值类相对宽容,也不是无限宽容。管道说明书里应写清「能不能吃旧日志」。写不清就默认不能。

函数近似的干扰可用简单探针看见:固定若干关键状态,每次更新后记录它们的价值或行动分布。若不相干状态一起跳,容量或学习率有问题。探针是 4.2 的示波器,比只看平均回报细。端到端网络更要探针:感知侧准确率与策略侧合法率分开记。分开记不是反对端到端,是反对瞎。

SOURCE 把神经网络、支持向量机、聚类、自编码器、Q 学习、深度 Q 网络、策略梯度、行动者-评论者列在一起。认座位口诀:有标签映射 → 监督工具箱;无标签结构 → 无监督工具箱;有奖励序列 → 强化工具箱。深度只是前两个箱子里的材料,也可以当强化里的近似器。口诀能把一次技术分享从品牌巡展拉回管道。

本节检查清单

更新提交前三套闸(保持/影子、约束计数、关键回归)在不在?训练回报有没有冒充评估、探索有没有冻结再评?管道说明书写清能不能吃旧日志了吗?关键状态探针在更新后会不会不相干地一起跳?感知准确率与策略合法率是否分开记?名字坐的是价值、策略、模型还是表示?深度只是近似材料这句话,能否用来阻止「我们上了某网络所以换了范式」的会议结论?校验通过之前损失下降有没有被当成放行理由?回放寿命在环境变化时有没有缩短?隔离更新:强化梯度会不会改到已校准的温度映射上?改到了就是管道抢笔。抢笔比选错算法更常见,也更少被写进事故报告,因为报告爱写算法名。本节逼你先写管道名。

损失下降不是放行

一次强化更新后损失降了,急停回归却红了。闸应拒绝提交。拒绝是 4.2 的职业操守。操守对着业务,不对着优化器。优化器永远能找到降损失的方向,方向可能是把 L0 擦边。擦边用约束计数捕获。捕获了就回滚。回滚比「再降一点」更像机制。机制是管道加闸。闸的三套缺一不可。缺保持集,会过拟合训练噪声。缺约束计数,会学穿红线。缺急停回归,会在演示场景外冻住。三套都在,损失曲线可以看,但不当裁判。裁判是闸。闸过了,版本号才动。版本号不动,线上仍吃旧知识。旧知识可能笨,但笨得可预期。可预期比新而红更好。更好是因为 5.3 的协同监控认得旧版本的否决分布。新版本分布一变,监控会报警。报警后对比三套。三套仍是裁判。裁判不换成算法名。算法名坐座位:这一次更新改的是价值还是策略,要写在提交说明里。说明里写「又训练了」等于没写。没写不准合入。合入纪律看起来像流程,其实是机制的外壳。外壳没有,阀门会自己转。自己转就是抢笔。抢笔在 4.3 会碰到红线。红线要人。人要看说明。说明要座位。座位在 4.2。4.2 过关的标志是提交单上能看到座位与三套闸的结果。结果是绿才能动版本。动版本是学习真正发生的时刻。时刻不在损失打印行。打印行只是优化器的心情。心情不放行。放行是闸。闸是本节作业。作业是把三套写进提交模板。模板比新网络重要。新网络也要走模板。走了,深度只是材料。材料可换。模板不换。不换是管道。管道立住,4.2 毕业。毕业不要求手推梯度。要求提交单。提交单能拦住红的急停。拦住了,学习才配进架构的技能层。配不进,箭头要画成禁止。禁止比聪明安全。安全是闸的审美。审美对准红线。红线不看损失。损失看完可以关看板。关看板开会。开会只看三套。三套过了散会。散会后才允许谈要不要换行动者-评论者。换名字仍走同一张提交单。同一张是机制还在的证据。证据比品牌抗忘。抗忘才能避免 4.2 变成算法展览。展览不提交。提交才改变知识。改变知识必须过闸。过闸这一句,比任何公式更接近本节的完成态。

过闸这一句,比任何公式更接近本节的完成态。完成态是提交单上能看到座位与三套闸的结果。结果是绿才能动版本。动版本才是学习发生。发生不在损失打印行。打印行是优化器心情。心情不放行。放行是闸。闸在模板。模板不换。不换是管道还在。

温故知新

  • 管道先于算法:积累、更新、校验、再执行
  • 名字要坐接口:价值、策略、模型、表示,四选一或显式组合
  • 深度是近似材料:带来泛化也带来更新干扰
  • 端到端可焊:探针和回滚边界仍要留
  • 离策略与否:决定能不能用旧日志,用错会学别人的偏差
  • 隔离更新:不同管道不要抢同一块参数却不声明

下一节专门谈知识写入时的冲突、版本与遗忘。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U