第4章 · 无模型学习 章节摘要:不知 P(s'|s,a) 时,从 episode 样本学 V 或 Q。MC 用完整回报;TD 单步 bootstrap;Q-learning off-policy 学 Q。 先说结论 对比 MC 与 TD 更新时机 写 TD(0) 与 Q-learning 更新式 说明 on-policy SARSA vs off-policy Q-learning 子章节 4.1 蒙特卡洛方法 4. 会员。《第4章 · 无模型学习》收录于灏天文库文集《强化学习入门:探索智能体的决策之路》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。