5.2 基线与优势函数:给策略梯度降方差 本节摘要:REINFORCE 的梯度估计无偏但方差巨大——回报 G 的绝对值在样本间抖得离谱。解法出人意料地简单:从 G 里减掉一个"基线" b(s),只要它不依赖动作,梯度的期望一点不变,方差却大幅下降。把基线选成状态价值 V(s),差值 Q−V 有了专有名字——优势函数 A,含义是"这个动作比该状态的平均水准好多少"。 会员。《5.2 基线与优势函数:给策略梯度降方差》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。