- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
教程导读:强化学习入门
一句话定位:强化学习(RL)让智能体通过与环境交互、最大化累积奖励来学习策略。本教程采用问题驱动主调:从奖励稀疏、训练不稳定、探索浪费三类故障倒推 MDP、TD 与 DQN。
这门课解决什么问题
很多人背过「Agent-Environment-奖励」三角,却在 CartPole 能跑、连续控制就发散——根源是没把 MDP 五元组 → Bellman → TD/Q-learning → 函数近似/DQN 串成排查链。本教程按五章把 RL 从定义讲到深度 Q 网络。
适合谁读
- 有机器学习基础、想系统入门 RL 的学生
- 会监督学习、要补 MDP 与 Q-learning 的工程师
- 准备读 DQN/PPO 论文前的自学者
学习路线
| 阶段 | 核心能力 | 典型产出 |
|---|---|---|
| 第1章 | RL vs 监督/无监督 | 画交互循环图 |
| 第2章 | MDP、策略、V/Q | 写 Bellman 期望方程 |
| 第3章 | 策略迭代、ε-greedy | 手算小型 GridWorld |
| 第4章 | MC、TD、Q-learning | 实现 tabular Q-learning |
| 第5章 | 函数近似、DQN | 理解 experience replay |

⚠️ 常见误区:把 RL 当成「带 reward 的监督学习」——没有固定标签,只有延迟、稀疏的回报信号。
💡 关键直觉:先问「奖励从哪来、延迟几步、状态是否可观测」,再选算法。
章节概览
- 概述 — RL 定义、特点、与 SL/UL 区别
- MDP 框架 — 马尔可夫性、策略、价值函数
- 预测与控制 — 策略评估/优化、探索利用
- 无模型学习 — MC、TD、Q-learning
- 深度 RL — 函数近似、DQN、策略梯度入门
阅读前提
本教程面向有机器学习基础、想系统入门强化学习的读者。建议先具备三点基础,读起来会更顺:
- 熟悉监督学习的基本术语:懂"损失函数、梯度下降、训练/验证/测试集、过拟合",因为深度 RL 里大量复用这些概念(DQN 的 MSE loss、经验回放抽样本质和训练集采样是同一回事)。
- 有一点线性代数与概率直觉:知道矩阵/向量的含义、条件概率的表达(P(s'|s,a) 读作"在状态 s 执行动作 a 后转移到 s' 的概率")。看不懂公式没关系,本教程所有公式都配有文字解释与代码示意。
- 最好跑过一段 Python:第 3、4 章的 ε-greedy、Q-learning 都给了 Python 示意代码,能读懂函数与循环即可,不要求独立实现。
完全零基础但想入门?可以按"概念筑基"的方式读:先只读每节的"要点速记/核心回顾",把 MDP、V/Q、Bellman 这些名词混个脸熟,再回头读正文。RL 的概念彼此咬合,第一遍"似懂非懂"是正常的。
常见疑问
疑问一:学 RL 要不要先精通数学?
不需要。MDP、Bellman 方程这些看着吓人,但本教程把它们拆成"状态→动作→奖励→下一状态"的循环理解。进阶到 DQN/PPO 论文时再补数学,起步阶段动手写代码、跑小实验比啃公式更有效。
疑问二:CartPole 能跑通了,接下来学什么?
CartPole 是入门玩具,它掩盖了三个真实难点:奖励稀疏、状态部分可观测、训练不稳定。读完第 4 章 Q-learning 后,建议挑战 CliffWalking(悬崖行走)感受 SARSA 与 Q-learning 的差异,再上第 5 章 DQN 玩 Atari 或连续控制。本教程第 5 章末尾给出了 DQN 到 PPO 的衔接方向,正好接住这个进阶需求。
疑问三:RL 和深度学习是什么关系?
RL 是决策框架(学策略),深度学习是函数近似工具(表达策略/价值)。两者可独立使用:小状态空间用表格法做 RL(第 4 章),大状态空间用神经网络近似(第 5 章 DQN)。本教程从表格法讲起,就是为了让你先理解 RL 算法本身的机制,再叠加深度学习的工程技巧。
怎么用这本教程:建议不要跳读,第 2 章的 MDP、第 3 章的预测控制、第 4 章的 Q-learning 是一条因果链,跳过任何一环,后面的"为什么"都会接不上。每节末尾的"要点速记/核心回顾"是自测清单,合上书能复述才算过。带代码的节(如 3.3 的 ε-greedy、4.3 的 Q-learning)建议动手敲一遍;实在没环境,逐行读注释也能建立实现直觉。五章读完,你就有能力读懂 DQN 和 PPO 的原论文开头部分,并动手在格子环境里跑通一个自己的强化学习智能体。
目录大纲
最新文档
知识宇宙
正在加载知识图谱...