7.1 老手艺:单智能体强化学习 摘要:强化学习让镇民不靠程序员手写规则、靠试错与奖励自己学会策略。本节讲 MDP 五元组、贝尔曼方程的直觉、Q 学习的时间差分更新、epsilon 贪婪的探索利用平衡,并用纯 Python 实现表格型 Q 学习,让镇民在网格小镇里自学出绕泥潭的最短路。 学骑车的人没有一个人是看着说明书学会的——摔几次、找手感、慢慢就会了。这种"从后果里学"的功夫就是强化学习,也是学堂的启蒙课。 会员。《7.1 老手艺:单智能体强化学习》收录于灏天文库文集《多智能体系统理论与实践:协作、竞争与博弈》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。