1.1 核心概念:智能体、环境、状态、动作与奖励 本节摘要:智能体是通过试错学习的决策者,环境是它无法完全控制但可以观察的外部世界,状态是对世界某一时刻的描述,动作是智能体可做的选择,奖励是环境给出的单步数值反馈。这五个概念构成强化学习的最小闭环,其余一切(价值函数、策略梯度、经验回放)都是在这个闭环上加装的部件。本节的任务是把每个零件的边界划清楚,尤其是奖励——它不是"分数",而是你写给智能体的目标函数。 会员。《1.1 核心概念:智能体、环境、状态、动作与奖励》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。