本节摘要:泛化是在训练时没见过、但与训练同分布的新样本上仍能用;适应是分布已经变了,循环还要靠更新或冻结策略活下去。过拟合是死记训练轨迹。领域偏移、时间漂移、对手策略变化,是适应要对付的不同敌人。检测靠保持集、在线误差、回放对照;处理靠正则、数据多样、模块冻结、再加 4.3 的合法更新。泛化不是「模型更大」,是状态清单与数据覆盖是否对齐。
阅读完本节,你应当能够:
SOURCE 用白天猫照片训练、夜晚认不出,讲泛化差。更细的分:若夜晚仍是「猫」这一任务、只是光照变了,这是协变量偏移下的泛化失败,数据增强或表征可能救。若任务改成认狗,那是新任务,需要适应或迁移。智能体还多一档:环境动态变了——地面换了摩擦系数——世界模型过期,策略在旧 T 上的最优不再成立。这不是分类精度问题,是 2.3 的知识过时。
过拟合在监督里是记样本。在强化里是记训练时见过的状态-行动对,换一张地图就不会走。探索不足会加重:问题产生器没打开,坐标系缩成一条走廊。函数近似本来想靠邻近状态分享知识,若网络太灵活又数据窄,仍会记。正则、早停、多样场景、域随机化,都是在扩训练分布,让「没见过」仍落在分布里。
💡 关键直觉:先诊断是泛化失败还是世界换了。前者加数据与正则,后者走 4.3 更新或缩短规划视野。两者都当「再训练」会把旧能力冲掉。
时间漂移:季节、磨损、用户习惯。对策是持续监控预测误差与回报,触发小步更新,混旧回放防遗忘。领域偏移:仿真到真机、仓 A 到仓 B。对策是对齐状态清单、域自适应、或干脆重做标定。对手适应:别人也在学,你的最优被针对。对策是多样策略、显式对手模型,这已碰到第 6 章。灾难性变化:货架布局一夜翻新。对策是世界模型版本切换,而不是幻想策略自己泛化过去。
| 现象 | 诊断 | 优先动作 |
|---|---|---|
| 保持集掉、在线还行 | 过拟合训练技巧 | 减容量、增数据 |
| 保持集好、在线慢慢掉 | 时间漂移 | 监控加增量更新 |
| 换仓立刻崩 | 领域偏移 | 标定、对齐状态、少量微调 |
| 只冻策略仍崩 | 感知或地图过期 | 更新认知知识 |
| 全网微调后旧仓也崩 | 遗忘 | 回放、分模块、降学习率 |
冻哪一层是适应的核心工艺。感知在多仓之间往往可共享(托盘长得像),地图与局部动态要重学。策略若依赖地图坐标,必须重学;若依赖相对关系(沿通道、避障),可能能迁。状态清单若用相对量而不是绝对货位号,泛化会好一截——又回到 2.1:状态怎么写,决定 4.4 有多难。
只在训练迷宫测,是自己给自己发奖状。应保留从未用于更新的场景、光照、布局。在线还应有影子模式:新版本只打分不控车,对比旧版本。适应上线走 4.3 的版本闸,不走「今晚全量替换」。安全相关策略的适应阈值应高于感知:认错一个包装是质量问题,认错一个行人是另一类问题——避免目标再次出现。
⚠️ 常见坑:用训练回报当泛化指标。强化回报在训练分布上涨,可能是过拟合探索噪声。要看冻结探索后的评估,以及没见过的布局。
适应与 1.2 的环境属性闭环:静态环境少适应;动态、非平稳必须把学习通道打开,但打开不等于无闸。学习型智能体的定义包含问题产生器,上线后问题产生器应降功率,变成受控的小探索或纯监控。否则「适应」会变成对用户做实验。概念上,泛化是评价知识的宽度,适应是评价更新管道在分布变化时还守不守约束。两者都合格,循环才配离开实验室。
白天猫、夜晚猫仍是好例子,但智能体版要加动作:夜晚不仅要认出猫,还要决定是否减速。泛化失败可能发生在识别,也可能发生在「夜晚该用另一套速度效用」。拆开测:只换光照、不换动态,看感知;只换摩擦、不换外观,看模型与策略。拆不开,就不要声称「我们提高了泛化」。
训练时故意打乱光照、摩擦、布局,是把「没见过」拉进训练分布,提高泛化,不是提高适应。适应是部署后分布又变。两者工具不同:前者在仿真预算里买多样性;后者在线上买监控与小步更新。用域随机化冒充已经适应真机,会在未随机到的维度上崩——例如真实人流密度。随机清单应公开,未覆盖维在上线清单里标红。
影子模式:新版本与旧版本并行打分,不控执行器。对比约束违反、超时、否决计数、业务指标。新版本全面更好才切。切的是版本号,不是偷偷改参数。强化若在线更新,影子仍要有,否则用户就是验证集。4.4 的刻薄包含对用户的刻薄拒绝:不要用生产流量当第一个测试集。
状态用相对量:相对货位、相对前车、相对目标航向,而不是仓库绝对坐标。相对化是泛化的廉价杠杆。绝对坐标把每一仓变成新任务。地图作为独立知识对象,策略吃相对关系,换仓只换地图版本。这是 2.1 状态清单对 4.4 的馈赠。馈赠没拿到,适应会变成每仓重训策略。
对手非平稳:评估要用会适应的对手,而不是固定回放。固定回放会高估。多样策略池、定期换对手,是多智能体版的刻薄测试。单智能体评估过关,不代表 6.1 过关。本章只要求你知道测试必须匹配敌人类型;敌人怎么建模,下一章说。
失败诊断是同分布泛化、时间漂移、换域、换任务还是对手非平稳?动作是否匹配诊断,而不是一律再训练?冻感知只适配备策略试过没有?状态是相对量还是绝对货位号?域随机化未覆盖维在上线清单标红了吗?影子模式对比的是约束与否决,还是只看平均回报?评估冻结探索了吗?用户有没有被当成第一个测试集?对手评估用固定回放还是会适应的对手?训练地图上的高回报有没有当泛化证书?证书应来自未见布局。未见布局没有,4.4 就还是实验室天气。实验室天气出不了仓。出仓要承认世界会换,并给换的那一层单独的合法更新路径。路径就是 4.3。两节是一对,拆开读会以为泛化是模型品德。品德不更新地图。
仓 B 上线,外观类似、通道宽度不同。正确适应:换地图版本,冻共享感知,重学或重标定局部动态与窄道技能,影子对比否决与卡死。错误适应:全网微调三天,仓 A 回放崩了。崩是遗忘。遗忘说明 4.4 诊断错成「再训练」。诊断应是领域偏移加地图过期。过期走 4.3 换版本,偏移走相对状态加少量技能数据。数据应从仓 B 影子来,不应从仓 A 用户来。用户不是验证集。验证集是未见布局与影子。影子不过不切。切的是版本号。版本号让仓 A 仍能回滚。回滚是适应的道德。道德不是不适应,是适应可撤销。可撤销才敢在仓 B 小步走。小步走比豪赌全网更像工程。工程承认状态写法决定难度:绝对坐标会把每一仓变成新任务,相对通道关系才能迁。迁不了的那一层单独更新。单独更新是冻层工艺。工艺在本节,不在更大的网络。更大的网络更会忘。忘了仓 A,业务不会因为仓 B 好看而原谅。原谅不来。来的是回滚。回滚演练过,适应才允许开始。开始前把未随机到的人流密度标红。标红的维用保守速度顶着,直到有数据。有数据再解禁。解禁也走闸。闸还是 4.3。4.4 只负责诊断该解哪一层。解错层,就是本章最贵的误诊。误诊看起来像勤奋训练。勤奋训练冲掉仓 A。冲掉是事故。事故预防是冻对的层。冻对的前提是状态清单分得清哪些是共享外观、哪些是本地几何。分得清来自 2.1。2.1 的遗产在换仓那天兑现。兑现不了,4.4 只能全网赌。赌输了用遗忘解释。解释太晚。太晚之前用冻层表。表在换仓清单第一页。第一页不是算法。算法在第三页。第三页可以空。第一页不能空。空了不要换仓。
第一页不能空。空了不要换仓。换仓清单把共享外观与本地几何分开,冻对的层,才叫适应而不是豪赌全网。豪赌会忘仓 A。忘是事故。事故预防是冻层表。表在第一页。算法在第三页。第三页可以空。空了仍能换仓,说明适应走的是地图版本与冻层,不是豪赌。豪赌会忘。忘了仓 A 不要用泛化失败来解释。解释应是误诊。误诊很贵。贵之前看第一页。第一页满了再换仓。满的标志是共享外观与本地几何分开、影子指标写清、回滚演练过。三样缺一,仓 B 只许影子,不许控车。不许控车是适应的道德。道德比速度重要。速度会忘仓 A。忘了不要用泛化证书遮。证书应来自未见布局与影子。影子不过不控车。不控车过关。
下一章把循环装进反应式、慎思式与混合架构,看模块如何落地。