4.3 强化学习:在试错中学会决策


4.3 强化学习:在试错中学会决策

本节摘要:强化学习(RL)研究智能体如何靠与环境交互、凭奖励反馈学出最优策略,核心要素是状态、动作、奖励、策略与价值函数。它与监督学习、无监督学习并列第三种范式:没有标注好的标准答案,只有延迟到来的回报。技术主线从需要完整环境模型的动态规划,走到无需模型的蒙特卡洛与时序差分(Q 学习、SARSA),再由深度强化学习(DQN、PPO 等)推到大状态空间。游戏对弈、机器人控制、调度优化是主场,样本效率低是它最大的软肋。

上手前先明确

  • 画出智能体与环境的核心交互循环,解释五个要素的分工;
  • 说清强化学习与监督学习在反馈方式上的本质差别;
  • 复述动态规划、Q 学习、深度强化学习三级解冻的因果链;
  • 理解探索与利用、奖励设计两大难点的来龙去脉;
  • 能判断哪些业务适合上强化学习、哪些别硬上。

一、只有一个信号可用:奖励

设想你被关进一间黑屋子,桌上有一排按钮。没人告诉你哪个该按,只有偶尔掉下来的糖果与偶尔炸响的电流。你会怎么学?多半是乱按一通,被电几次,记住甜的按钮,再逐步摸出门道。婴儿学步、新手下棋、企业定价,全是这种处境:反馈稀疏、延迟、还夹着噪声。强化学习研究的正是这种处境下的学习问题——它不是给机器看带答案的题库(那是监督学习),而是让机器自己在行动与后果之间建立因果。

它的世界只有两个角色。智能体是学习者与决策者;环境是它改动不了规则的外部世界。循环分六步:智能体观察当前状态,依照策略选择一个动作;环境随之转移到新状态,并吐回一个奖励;智能体拿这四样素材更新策略或价值函数,进入下一轮。目标是最大化长期累积奖励,而不是眼前的糖——折扣因子给未来的奖励打折,越远的回报权重越低,像地质勘探把十年后的可能矿藏折算成今天的估值。

要素再补两个。策略是从状态到动作的映射,是智能体的"性格";价值函数负责打分:状态价值函数衡量"站在这个局面值多少",动作价值函数衡量"在这个局面走这步棋值多少",后者直接指导选动作,是多数算法的心脏。按是否学习环境模型,又分基于模型与无模型两派:前者先学地图再规划,后者不看地图直接摸。

💡 关键直觉:奖励是唯一的教材。教材写得含糊,学生学出来的东西一定走样——这句话先记住,本节后半的算法与应用,处处是它的注脚。

拿勘探打个比方:监督学习是拿着勘探完毕的矿区图纸进场施工,强化学习是边钻边绘活地图,钻错一孔的学费也要自己认。

二、三次解冻:从知道地图,到不看地图也能走

这条矿脉的第一口井是动态规划,前提苛刻——环境模型必须完全已知。它把问题拆成策略评估(算清当前策略下每个局面的价值)与策略改进(按价值换更好的动作),两者交替迭代到收敛,就是策略迭代;嫌绕的可以价值迭代一步到位。方法严密,但两处硬伤:真实世界的模型你往往根本没有;状态一多,计算量爆炸,棋类之外几乎无处落脚。

第二次解冻甩掉了地图。蒙特卡洛方法不要模型,完整跑完一个回合再回头算总回报,用无数次采样的平均值逼近期望——粗,但管用,棋类这种回合制任务正合适。代价是方差大,且必须等回合结束才能更新,中途学不了。时序差分学习(TD)把两边的好处合了流:每走一步就更新,用"对下一步的估值"修正"当前的估值",这套自举逻辑配上学习率与折扣因子,成了现代强化学习的发动机。最简单的 TD 更新可以写成:当前价值,加上学习率乘以"奖励加折扣后的下一步价值,减去当前价值"——一步一修,边走边学。

TD 家族里长出两株标志性的苗。SARSA 是在线学法:用自己实际选的下一个动作来更新,学出来的是"当前策略下稳妥"的走法,躲着悬崖走。Q 学习是离线学法:不管实际走了哪步,一律用下一局面里最优动作的价值来更新,因此能从带探索性的行为里学出最优策略。两者一个保守一个激进,工程里按任务的风险偏好选。

第三次解冻由深度学习完成。当状态是原始像素、维度爆炸时,表格存不下 Q 值,改用神经网络近似 Q 函数——这就是 DQN。它带来两件稳定器:经验回放把交互样本存进缓冲区再随机抽样训练,打破样本间的相关性;目标网络单独维护一份、周期性更新,防止自举目标追着自己跑导致震荡。靠这套组合,DQN 在 Atari 游戏上达到甚至超越人类水平。策略梯度是另一条路:不绕道价值函数,直接学策略,天然支持连续动作,但 REINFORCE 这类基础款方差大、收敛慢。Actor-Critic 把两派缝合:Actor 负责选动作,Critic 负责打分,用评价压低梯度的方差。A2C 与 A3C 引入优势函数与异步并行环境;DDPG 把整套装置搬到连续控制;SAC 用熵项鼓励探索;PPO 则限制每次策略更新的幅度,稳定、好用、好调,成了工业界的默认起步选项。

算法 派系 需要环境模型吗 更新时机 代表作与标签
动态规划 基于模型 需要 逐状态扫描 策略迭代、价值迭代
蒙特卡洛 无模型 不需要 回合结束后 棋类估值的老师伙
SARSA 无模型·价值 不需要 每步,在线 用实际动作更新,稳妥
Q 学习 无模型·价值 不需要 每步,离线 用最优动作更新,激进
DQN 深度·价值 不需要 每步,经验回放 Atari 超人水平
PPO 深度·策略 不需要 截断更新幅度 工业界默认起步选项

⚠️ 常见坑:奖励设计。你奖励"到达终点",它可能学会原地转圈刷分;你奖励"内容点击",它可能学会生产标题党。智能体会钻透奖励函数的每一道缝,业内称之为钻奖励空子。奖励没设计好之前,别怪算法不努力。

探索与利用的平衡同样贯穿始终:只利用已知最优动作,容易锁死在平庸解;只探索新动作,永远收不了割。常见做法是按小概率随机选动作的贪心策略,用一点可控的浪费换信息。

三、高光与骨感:应用版图与真实约束

先看高光。游戏与对弈是这条矿脉最富的矿区:AlphaGo 击败围棋世界冠军,成为强化学习的全球级广告;DQN 横扫 Atari;OpenAI Five 在 Dota 2、AlphaStar 在星际争霸这类即时战略游戏里战胜职业选手。为什么偏偏是游戏?规则封闭、奖励可量化、试错零成本、仿真可以无限加速——勘探成本为零的富矿,当然先挖。

游戏之外,机器人控制是最需要它的地方:机械臂的抓取、放置、组装,复杂地形里的导航避障,四足与双足机器人的步态平衡学习,都靠仿真里成千上万次摔倒换真机上的稳。资源调度有工业界最著名的案例:DeepMind 用深度强化学习优化谷歌数据中心的冷却系统,显著降低了能耗——奖励是电费,环境是机房,试错在历史数据与仿真里完成。自动驾驶用它做车道保持、并线超车这类序贯决策,交通信号配时也试过让智能体学着调。金融交易里,量化策略的买卖时机与仓位管理、风险规避都有人试水,但市场非平稳,回测漂亮实盘翻车的故事也不少。推荐系统把它当序贯决策问题求解,目标是长期用户满意度而非单次点击(4.5 节会接上这条线);对话系统与机器翻译的质量优化也借过它的力;医疗领域的个性化治疗方案调整与药物分子设计,则还在谨慎试探。

再看骨感的一面。样本效率低是头号软肋:复杂任务动辄需要亿万次交互,游戏里一秒千百帧无所谓,真实世界里机器人摔一次都是钱,医疗场景更是摔不起。泛化能力差紧随其后:换个环境、改个参数,学到的策略常常作废,得重练。再加上黑箱决策难以解释、安全性无法担保,强化学习在真实世界的落地,远比它在棋盘上慢。

解法在收敛。离线强化学习只从历史数据学策略,不再与活环境交互;模仿学习先抄专家作业再超越;多智能体研究协作与竞争;安全强化学习给探索划红线;还有人机协作路线,把低风险决策交机器、高风险决策留给人。这些方向合起来,正在把这条矿脉从"游戏专用"推向"工业可用"。

问题:强化学习这么厉害,为什么身边的产品很少用它?

回答:因为它的两个前提在现实里很难满足——海量试错机会与低试错成本。目前大面积落地的是两类:一是可以无限仿真的场景,游戏、调度优化;二是试错可回滚、可离线的场景,用历史数据训练的策略辅助人工决策。凡是一次试错就造成真实损失的场合,它还在门外等着安全与样本效率的突破。

问题:AlphaGo 到底证明了什么?

回答:不是机器穷举了围棋,而是延迟、稀疏的奖励下,纯试错加自我对弈能把序贯决策问题学到超人水平。它用价值网络评估局面、策略网络选点,再靠自我对弈生成训练数据。这给所有"规则明确但答案难算"的问题开了条新路——决策可以被学习出来,而不必被枚举出来。

核心回顾

  • 范式定位:强化学习是监督、无监督之外的第三范式,反馈只有延迟的奖励信号,核心是智能体、环境、状态、动作、奖励、策略、价值函数这套循环。
  • 三次解冻:动态规划依赖完整模型,维数爆炸;蒙特卡洛与时序差分甩掉地图,Q 学习用最优动作更新、SARSA 用实际动作更新;DQN 用神经网络近似 Q 函数,靠经验回放与目标网络稳住训练。
  • 两派合流:价值派与策略派由 Actor-Critic 缝合,A2C、A3C、DDPG、SAC、PPO 是这条线的果实,PPO 以稳取胜成为工业默认。
  • 高光时刻:AlphaGo、Atari、OpenAI Five、AlphaStar,以及谷歌数据中心冷却系统节能。
  • 落地清单:游戏对弈、机器人控制、调度优化、自动驾驶决策、金融交易、推荐系统的长期优化。
  • 两大难题:奖励设计(防钻空子)与探索利用平衡(防锁死在平庸解)。
  • 最大软肋:样本效率低、泛化差、安全难担保,离线强化学习与模仿学习是补课方向。

决策讲完,人机之间还剩一条最古老的通道没打通——说话。下一节从机器的耳朵和喉咙讲起,看语音识别如何把声波变成文字,语音合成又如何让机器开口。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U