6.1 探索与利用进阶:UCB、Boltzmann 与好奇心


文档摘要

6.1 探索与利用进阶:UCB、Boltzmann 与好奇心 本节摘要:ε-greedy 的探索是"瞎均匀":不管哪个动作没被试过、试过多少次,一律等概率乱选。本章把探索升级成可计算的策略:UCB 给"不确定性高的选项"加置信加分,Boltzmann 按"温度"把价值转成采样概率,好奇心驱动则完全跳出外部奖励、用预测误差发内在工资。这三条线各有数学根基与失败模式,本节逐一过堂并给出选型建议。 会员。《6.1 探索与利用进阶:UCB、Boltzmann 与好奇心》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U