5.1 REINFORCE:策略梯度定理


文档摘要

5.1 REINFORCE:策略梯度定理 本节摘要:REINFORCE 是策略路线的最小实现:跑完整条轨迹拿到回报 G,然后对每个 (st, at) 沿 ∇log π(at|st)·Gt 方向调参数——高回报轨迹上的动作概率被推高,低回报的被压低。策略梯度定理保证这个朴素规则的期望恰好等于期望回报的梯度。本节从直觉推出定理,给出完整算法与一个最小可跑实现,并说明它为何在连续动作上得心应手、为何方差大到必须等第 5.2 节来救。 会员。《5.1 REINFORCE:策略梯度定理》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U