6.2 基于模型的强化学习与 MCTS:AlphaGo 路线


文档摘要

6.2 基于模型的强化学习与 MCTS:AlphaGo 路线 本节摘要:前文的算法都是无模型的——环境怎么变只能靠真试。基于模型的强化学习把转移规律学进网络(世界模型),然后在"想象中"规划;蒙特卡洛树搜索(MCTS)是想象力的执行引擎,AlphaGo 用"两个网络剪枝 + MCTS 推演"击败了围棋。本节讲清模型学习的动机与误差代价、MCTS 四阶段循环的每一步,以及 AlphaGo 组合拳里每个部件解决什么问题。 会员。《6.2 基于模型的强化学习与 MCTS:AlphaGo 路线》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U