第 2 章 · MDP 与贝尔曼方程:给决策建数学骨架 章节摘要:第 1 章的闭环还是自然语言,本章把它升级为严格对象——马尔可夫决策过程(MDP)。马尔可夫性质一句话:未来只依赖当前状态,与更早的历史无关;五元组(状态集、动作集、转移概率、奖励函数、折扣因子)则是把任何决策问题装进数学容器的清单。有了 MDP,就能推出全书最重要的一个方程——贝尔曼方程:价值等于即时奖励加上折扣后的后续价值。 会员。《第 2 章 · MDP 与贝尔曼方程:给决策建数学骨架》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。