强化学习


文档摘要

强化学习 强化学习训练智能体通过试错、最大化累积奖励来做序列决策。本文件涵盖 MDP、价值函数、贝尔曼方程、Q-learning、策略梯度、actor-critic 方法、PPO 和 RLHF——它是下棋打游戏智能体以及语言模型对齐背后的框架。 监督学习需要带标签的数据。无监督学习从无标签数据里找模式。强化学习(reinforcement learning, RL)与两者都不同:智能体通过与环境的交互来学习——采取行动、获得奖励。没有所谓的正确标签;智能体必须通过试错自己发现好行为。 想象教一只狗新把戏。你不会给它看一份"正确行为"的数据集。相反,它去尝试各种动作,做得好你就给零食,久而久之它就摸索出你想要什么。RL 把这个过程形式化了。 RL 的设定有五个核心要素。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U