8.3 从马尔可夫决策过程到强化学习 本节摘要:马尔可夫决策过程(MDP)用状态、动作、转移、奖励四件套刻画序贯决策,贝尔曼最优方程给出最优值函数。本节在网格世界手写值迭代与 Q-learning,前者吃已知模型、后者只靠试错样本,对照两者揭示强化学习的本质——用采样数据逼近贝尔曼方程的解,并以探索与利用的权衡收尾。 罬最后一块地基 第 1 章埋的会师伏笔在此兑现。 会员。《8.3 从马尔可夫决策过程到强化学习》收录于灏天文库文集《运筹学与控制论》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。