2.3 策略与价值函数 本节摘要:策略 π(a|s) 确定性或随机。V^π(s) 状态价值;Q^π(s,a) 动作价值。最优 V, Q 满足 Bellman 最优方程。 本节地图 写 V^π 与 Q^π 的定义 区分确定性策略与随机策略 写出 Bellman 期望方程(概念) 策略 确定性:a = π(s) 随机性:π(a|s) = P(At=a | St=s) 随机策略用于探索与纳什均衡;策略梯度直接优化 πθ(a|s)。 会员。《2.3 策略与价值函数》收录于灏天文库文集《强化学习入门:探索智能体的决策之路》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。