本节摘要:机制是「经验如何变成一次合法更新」。步骤可概括为感知经验、积累、更新内部知识、用新知识改下一轮行为。算法是这条管道上的具体阀门:梯度下降改参数、Q 学习改价值表、策略梯度直接改行动分布。选算法先认它改的是表示、价值还是策略,以及它假设数据是否来自当前策略。深度只是函数近似的一种材料,不是新范式。
阅读完本节,你应当能够:
SOURCE 把学习过程写成感知、经验积累、模型构建、知识提炼、行为改进。换成 1.3 的接口:积累的是轨迹或带标签样本;构建/提炼是更新知识;行为改进是下一轮决策读到新知识。管道两端必须闭合到循环,否则只是离线训练一个函数,与智能体无关。
监督管道:样本进,损失出,参数更新。强化管道:与环境交互产轨迹,用回报估计价值或策略梯度,再更新。无监督管道:无标签批次进,重构或对比损失出。三种管道可以共享同一套参数存储器,但优化目标不能偷偷加在一起不声明——那会变成 4.3 的冲突写入。
重复: 采集一批经验 D 计算更新 Δ 知识 若校验通过: 知识 ← 知识 + Δ 用新知识跑执行元件 用评判元件看是否真改进
💡 关键直觉:没有「校验通过」这一闸,学习元件会把任何噪声写进知识。闸可以是保持集、仿真回归、安全约束,但不能是「损失下降了」。
表格方法的 Q 学习:对每个状态-行动对存一个分数,用贝尔曼残差更新。它改的是价值,行动选择再贪心或带探索。深度 Q 网络只是用网络近似这张表,因此能处理图像状态,也因此失去表格的收敛舒服。策略梯度不存 Q 表,直接让好轨迹里的行动更常被抽到。行动者-评论者两边都要:评论者估价值减方差,行动者改策略。细节与稳定技巧留给专集。本文集只需能回答:这个名字改的是价值、策略,还是两者。
| 名字 | 管道 | 主要改什么 | 数据是否要来自当前策略 |
|---|---|---|---|
| 分类/回归/SVM | 监督 | 映射参数 | 否,离线即可 |
| 聚类/自编码器 | 无监督 | 表示 | 否 |
| Q 学习 | 强化 | 价值 | 可用离策略数据,但要小心 |
| 深度 Q 网络 | 强化 | 价值近似 | 常用回放,离策略味道 |
| 策略梯度 | 强化 | 策略 | 基本要当前策略数据 |
| 行动者-评论者 | 强化 | 策略加价值 | 看具体变体 |
函数近似是因为状态清单一旦含图像或连续量,表就爆。近似让学习泛化到邻近状态,也让更新彼此干扰:改好了 A 状态,B 状态的价值可能被带偏。这是 4.4 要面对的结构,不是调学习率能从根上取消的。世界模型类算法(学 T 再规划)改的是 2.3,不是直接改策略;若规划器固定,学好 T 也会改行为——行为改变是间接的,调试时要看预测误差,不要只看回报。
神经网络在 SOURCE 里出现在监督与深度强化两边。它是可微的函数近似器,可以把感知与策略焊在一次前向里。焊得住不等于边界消失:你仍应能设计实验,看失败来自识别还是来自选择。端到端在标注齐、模拟准、安全能兜住时很香;在约束要审计、模块要独立回滚时很贵。概念筑基的立场是允许焊,但保留探针。
⚠️ 常见坑:把算法名当架构。系统图上只写「DQN」却看不出观测怎么进、奖励怎么算、合法行动谁过滤。名字解决不了接口。
迁移学习在机制上是「用源任务参数初始化再在目标任务上走同一管道」。主动学习是监督管道里的问题产生器:挑最不确定的样本去问人。模仿学习是监督管道改策略。逆强化是从示范反推奖励,再走强化管道——奖励仍要接受 3.1 的审计,因为反推出来的奖励可能不可解释。机制层把这些名字收回管道,比背清单更抗忘。
温室:气温预测用监督回归改模型;控制策略可用规则,也可用强化在仿真里微调;异常温升用无监督。三种更新应分时、分库:不要让一次强化梯度改掉已经校准的温度映射。这就是管道隔离。算法再新,隔离原则不变。
更新提交前至少跑三套:保持集或影子回报不下降超过阈值;约束违反计数不升;关键场景回归(急停、超时、合法集)。三套都过才改线上版本号。损失下降不在三套里——损失是优化目标,不是业务目标。强化里训练回报尤其爱骗人,因为探索与评估纠缠。评估必须冻结探索。
回放缓存是强化管道的记忆。它能提高样本效率,也会让过时动态长期占着更新。环境一变,应提高新样本比例或缩短缓存寿命,这与 4.3 过时病同一药。策略梯度类对数据是否来自当前策略敏感,乱塞旧缓存会学歪;价值类相对宽容,也不是无限宽容。管道说明书里应写清「能不能吃旧日志」。写不清就默认不能。
函数近似的干扰可用简单探针看见:固定若干关键状态,每次更新后记录它们的价值或行动分布。若不相干状态一起跳,容量或学习率有问题。探针是 4.2 的示波器,比只看平均回报细。端到端网络更要探针:感知侧准确率与策略侧合法率分开记。分开记不是反对端到端,是反对瞎。
SOURCE 把神经网络、支持向量机、聚类、自编码器、Q 学习、深度 Q 网络、策略梯度、行动者-评论者列在一起。认座位口诀:有标签映射 → 监督工具箱;无标签结构 → 无监督工具箱;有奖励序列 → 强化工具箱。深度只是前两个箱子里的材料,也可以当强化里的近似器。口诀能把一次技术分享从品牌巡展拉回管道。
更新提交前三套闸(保持/影子、约束计数、关键回归)在不在?训练回报有没有冒充评估、探索有没有冻结再评?管道说明书写清能不能吃旧日志了吗?关键状态探针在更新后会不会不相干地一起跳?感知准确率与策略合法率是否分开记?名字坐的是价值、策略、模型还是表示?深度只是近似材料这句话,能否用来阻止「我们上了某网络所以换了范式」的会议结论?校验通过之前损失下降有没有被当成放行理由?回放寿命在环境变化时有没有缩短?隔离更新:强化梯度会不会改到已校准的温度映射上?改到了就是管道抢笔。抢笔比选错算法更常见,也更少被写进事故报告,因为报告爱写算法名。本节逼你先写管道名。
一次强化更新后损失降了,急停回归却红了。闸应拒绝提交。拒绝是 4.2 的职业操守。操守对着业务,不对着优化器。优化器永远能找到降损失的方向,方向可能是把 L0 擦边。擦边用约束计数捕获。捕获了就回滚。回滚比「再降一点」更像机制。机制是管道加闸。闸的三套缺一不可。缺保持集,会过拟合训练噪声。缺约束计数,会学穿红线。缺急停回归,会在演示场景外冻住。三套都在,损失曲线可以看,但不当裁判。裁判是闸。闸过了,版本号才动。版本号不动,线上仍吃旧知识。旧知识可能笨,但笨得可预期。可预期比新而红更好。更好是因为 5.3 的协同监控认得旧版本的否决分布。新版本分布一变,监控会报警。报警后对比三套。三套仍是裁判。裁判不换成算法名。算法名坐座位:这一次更新改的是价值还是策略,要写在提交说明里。说明里写「又训练了」等于没写。没写不准合入。合入纪律看起来像流程,其实是机制的外壳。外壳没有,阀门会自己转。自己转就是抢笔。抢笔在 4.3 会碰到红线。红线要人。人要看说明。说明要座位。座位在 4.2。4.2 过关的标志是提交单上能看到座位与三套闸的结果。结果是绿才能动版本。动版本是学习真正发生的时刻。时刻不在损失打印行。打印行只是优化器的心情。心情不放行。放行是闸。闸是本节作业。作业是把三套写进提交模板。模板比新网络重要。新网络也要走模板。走了,深度只是材料。材料可换。模板不换。不换是管道。管道立住,4.2 毕业。毕业不要求手推梯度。要求提交单。提交单能拦住红的急停。拦住了,学习才配进架构的技能层。配不进,箭头要画成禁止。禁止比聪明安全。安全是闸的审美。审美对准红线。红线不看损失。损失看完可以关看板。关看板开会。开会只看三套。三套过了散会。散会后才允许谈要不要换行动者-评论者。换名字仍走同一张提交单。同一张是机制还在的证据。证据比品牌抗忘。抗忘才能避免 4.2 变成算法展览。展览不提交。提交才改变知识。改变知识必须过闸。过闸这一句,比任何公式更接近本节的完成态。
过闸这一句,比任何公式更接近本节的完成态。完成态是提交单上能看到座位与三套闸的结果。结果是绿才能动版本。动版本才是学习发生。发生不在损失打印行。打印行是优化器心情。心情不放行。放行是闸。闸在模板。模板不换。不换是管道还在。
下一节专门谈知识写入时的冲突、版本与遗忘。