2.1 马尔可夫决策过程


2.1 马尔可夫决策过程

本节摘要:MDP 五元组 (S, A, P, R, γ)。马尔可夫性:未来只依赖当前 s,a。有限/无限 horizon;折扣 γ∈[0,1] 保证收敛。

先说结论

  1. 写出 MDP 五元组
  2. 解释马尔可夫性质
  3. 说明 γ 对「远见」的影响

MDP 定义

马尔可夫决策过程(MDP):

  • S:状态空间
  • A:动作空间(可依赖 s)
  • P(s'|s,a):转移概率
  • R(s,a,s')R(s,a):奖励
  • γ:折扣因子

马尔可夫性:P(s_{t+1}|s_t,a_t,s_{t-1},...)=P(s_{t+1}|s_t,a_t)

γ 取值 含义
γ→0 短视,只看即时 r
γ→1 长远,累积回报权重大
γ=0.99 经典控制常用

回报与目标

累积回报 G_t = r_t + γ r_{t+1} + γ² r_{t+2} + ...

目标:找策略 π 最大化 E[G_t | s_t=s]

回报与目标

⚠️ 常见坑:γ 太大 + 无终止 → 回报可能发散(需 episodic 或 γ<1)。

💡 关键直觉:MDP 把「环境规则」数学化——学 RL 就是在这个框架里找最优 π。

重点提炼

  • 五元组 S,A,P,R,γ
  • 马尔可夫:无历史依赖
  • G_t 折扣求和
  • episodic vs continuing
  • 目标是 max E[G]

深度扩展:折扣因子的手感与回报计算

MDP 五元组里最难建立直觉的是折扣因子 γ,这里用一个具体数值例子把它"算"出感觉来。

γ 对回报的影响:假设一个两幕场景,从当前时刻起未来三步的奖励分别是 +1、+1、+1。

γ = 0.5 时:G = 1 + 0.5×1 + 0.25×1 = 1.75 γ = 0.9 时:G = 1 + 0.9×1 + 0.81×1 = 2.71 γ = 0.99 时:G = 1 + 0.99 + 0.9801 = 2.97 γ = 1.0 时:G = 3(不衰减)

可以看出,γ 越小,"远处的奖励"被压得越厉害,智能体越短视;γ 越接近 1,远期奖励权重越大,智能体越有"远见"。工程直觉:围棋、长程策略类游戏常用很大的 γ(0.99+);而"每步都要有反馈"的即时任务可以用较小的 γ。γ 取 1 只有在任务保证有终止(episodic)时才安全——如果任务永远不结束,无限长的累积回报会发散,这就是本节"常见坑"说的"γ 太大 + 无终止 → 发散"。

episodic vs continuing 的差异:下棋、游戏通关这类"有明确终点"的任务是 episodic,每局是一个 episode,回报在终局后完整计算;库存管理、恒温控制这类"永远进行"的任务是 continuing,没有自然终点,必须靠 γ<1 让累积回报有限。这个区分直接决定算法选择——蒙特卡洛方法只能用于 episodic 任务(要等整条轨迹结束),而时序差分方法两类都能用(只依赖单步转移)。

回报的递推视角:累积回报 G_t = r_t + γ G_{t+1},这一步递推是全书最重要的公式之一——它就是 Bellman 方程的雏形。把"长期回报"拆成"眼前的一步奖励 + 折价的未来回报",价值函数的学习就有了递归结构。第 2.3 节会把它正式写成价值函数的形式,理解了这个递推,后面策略评估、Q-learning 的更新式都只是这个递推的采样版本。建议现在就用上面 γ 的例子,在纸上把 G_0、G_1、G_2 按递推各算一遍,建立手感。

动手练习:把一个实际问题建模成 MDP

把抽象的五元组装进一个具体任务,才能检验你是否真正理解。选"自动贩卖机补货"这个简单问题,试着完成五元组:状态 S 可以是什么?(当前各货道的余量、距离上次补货的天数)动作 A 是什么?(给某个货道补货、什么都不做)转移概率 P 怎么理解?(补货后余量确定,顾客购买则余量随机减少)奖励 R 怎么给?(售出商品收入为正、补货操作有成本为负、缺货则失去销售机会为负)折扣 γ 该取大还是小?——这个任务奖励跨多天才兑现(补货决定影响未来几天的销售),所以 γ 应该接近 1 而不是 0.5。

写完后对照检查两点:一是"顾客购买"这个随机环节正是 P 的来源——现实问题里转移概率几乎都是未知的,这正是第 4 章"无模型方法"要解决的问题;二是状态设计是否足够做决策——如果状态只有"库存总量"而没有"各货道分布",补货决策就无从下手。这个练习让你看到,MDP 建模的难点不在公式,而在"怎么把现实世界的要素准确映射到五个框里",映射对了,算法才有用武之地。

常见误区辨析

MDP 章节有三个容易踩的坑。一是把马尔可夫性当成"世界的默认性质"——它是一条假设,真实问题几乎都不是严格马尔可夫的,需要你自己设计状态(加入历史摘要、合并多帧观测)来"凑出"马尔可夫性,状态设计不好,算法会学得很差。二是 γ 凭感觉取——γ 是"远见"的旋钮,取值要和任务的时间尺度匹配:奖励要跨很多步才兑现的任务(围棋、长期投资)取 0.99+,奖励每步即时的任务取小些;记住"γ 太大加无终止会发散",是工程红线。三是忽略 episodic 与 continuing 的算法含义——不是"都行",MC 只能用于 episodic(要等回合结束),TD 两类通用,选错方法会直接跑不起来。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U