5.6 DDPG 与确定性策略梯度


文档摘要

5.6 DDPG 与确定性策略梯度 本节摘要:动作连续时,随机策略可以简化成确定性映射 μ(s;θ):每个状态直接输出一个动作值,不再输出分布。确定性策略梯度定理(DPG)保证对它的期望回报梯度形如 E[∇a Q(s,a;w)|μ(s) ∇θ μ]——critic 对动作求导,actor 顺着导数方向挪。DDPG 把 DPG 装上 DQN 的两台稳定器(经验回放与目标网络),成为深度强化学习的连续控制开山之作。 会员。《5.6 DDPG 与确定性策略梯度》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U