1.1 核心概念:智能体、环境、状态、动作与奖励


文档摘要

1.1 核心概念:智能体、环境、状态、动作与奖励 本节摘要:智能体是通过试错学习的决策者,环境是它无法完全控制但可以观察的外部世界,状态是对世界某一时刻的描述,动作是智能体可做的选择,奖励是环境给出的单步数值反馈。这五个概念构成强化学习的最小闭环,其余一切(价值函数、策略梯度、经验回放)都是在这个闭环上加装的部件。本节的任务是把每个零件的边界划清楚,尤其是奖励——它不是"分数",而是你写给智能体的目标函数。 会员。《1.1 核心概念:智能体、环境、状态、动作与奖励》收录于灏天文库文集《强化学习与智能体训练:从 Q-Learning 到深度强化学习》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U