5.6 DDPG 与确定性策略梯度 本节摘要:动作连续时,随机策略可以简化成确定性映射 μ(s;θ):每个状态直接输出一个动作值,不再输出分布。确定性策略梯度定理(DPG)保证对它的期望回报梯度形如 E[∇a Q(s,a;w)|μ(s) ∇θ μ]——critic 对动作求导,actor 顺着导数方向挪。DDPG 把 DPG 装上 DQN 的两台稳定器(经验回放与目标网络),成为深度强化学习的连续控制开山之作。 会员。《5.6 DDPG 与确定性策略梯度》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。