3.2 多智能体强化学习


3.2 多智能体强化学习

本节摘要:多智能体强化学习(MARL)让一群智能体在交互中边做边学,从经验里演化出协同策略。它和单智能体强化学习的本质区别在于环境内生非平稳性——每个智能体的"环境"恰恰是其他正在学习变化智能体,导致经典 RL 的收敛性证明失效。本节讲清这个本质区别、以随机博弈为形式化基础、三大训练范式(中心化训练去中心化执行 CTDE、完全去中心化、分层角色化),以及信用分配、策略空间爆炸、学习者困境三大技术挑战。

学习目标

阅读完本节,你应当能够:

  1. 解释 MARL 区别于单智能体 RL 的本质——环境内生非平稳性
  2. 说清随机博弈这个形式化框架
  3. 复述三大训练范式 CTDE、完全去中心化、分层角色化的机理和适用场景
  4. 指出信用分配、策略空间爆炸、学习者困境三大挑战的应对思路

一、问题与直觉

设想一百台无人配送车在密集城区跑订单。如果你给每台车单独训练一个强化学习策略——把它自己的状态(位置、电量、载货)映射成动作(加速、转向、停靠),上线后很快会出问题:十字路口集体僵持、仓库门前无序堆叠、同一订单被多车争抢又放弃。

这不是算法有缺陷,是建模方式错了。单智能体强化学习有个隐含假设:环境是马尔可夫且静止的,所有非智能体部分都是"环境噪声"。可在这座城市里,"环境"恰恰是其余九十九个同样在学习、决策、甚至博弈的智能体。把同伴当环境,等于把活生生的对手当死物来预测;把交互当噪声,等于否认协作本身才是最关键的信号。

MARL 的第一重自觉,就是承认环境的内生性:每个智能体面对的环境,是其他智能体行为的叠加,而这个环境每一步都在变。这就是 MARL 区别于单智能体 RL 的根本所在,也是它所有技术挑战的源头。

二、核心原理

2.1 环境内生非平稳性

当智能体 i 固定策略训练时,其余智能体的策略却在同步更新。对 i 而言,它的"环境"(状态转移和奖励函数)每一步都在漂移。这让经典 RL 的收敛性证明土崩瓦解——经典证明假设环境不变,所以重复试验能让价值估计收敛;但环境本身在变时,价值估计追着一个移动目标,导致训练震荡、策略坍塌。

更深层的张力在理性层次:纳什均衡要求每个智能体在给定别人策略下无法单方面获益,但如果所有智能体都试图逼近纳什,谁来保证过程稳定?如果追求帕累托最优,又怎么避免搭便车或公地悲剧?这些问题超越了工程实现,直指分布式理性的根基。

2.2 随机博弈这个形式化框架

MARL 的数学基石不再是单一马尔可夫决策过程,而是随机博弈(Stochastic Game)。它由智能体集合、状态空间、每个智能体的动作集、联合动作下的状态转移概率、每个智能体的奖励函数、折扣因子构成。关键在于:状态转移和奖励都依赖于所有智能体的联合动作,而不是单个智能体的动作。

这个框架立刻揭示出几个核心概念:纳什均衡(每个人给定他人策略无法单方面改善)、相关均衡(靠公共信号协调出比纳什更优的结果)、团队最优(群体总收益最大)。不同的解概念对应不同的协同目标,选择哪个取决于场景是纯协作、纯竞争还是混合。

2.3 三大训练范式

面对非平稳性这头巨兽,工程实践里发展出三条脉络:

中心化训练去中心化执行(CTDE) 是当前工业界事实标准。它的智慧在于:训练时奢侈地使用全局信息(所有智能体的状态和动作),构建一个能理解群体因果的策略网络;但部署时每个智能体只依赖本地观测和私有策略决策,保证实时性和鲁棒性。代表算法 MADDPG 给每个智能体训练独立的策略网络,但评价网络输入全局状态和全部动作,从而教会每个策略理解自身动作对群体收益的边际贡献。后续的 COMA 进一步用反事实基线精确剥离单个智能体动作的独立价值,直击信用分配痛点。

完全去中心化学习 走向另一极端:训练时也拒绝任何全局信息共享。每个智能体只观测本地、接收本地奖励,通过局部交互缓慢对齐策略。这在军事集群、卫星网络等高对抗、低带宽场景里不可替代。它的理论根基常诉诸分布式优化:把联合策略优化近似为可分解的目标,再用共识算法让各智能体的策略参数在通信图上渐进一致。图的连通性直接决定收敛速度。

分层角色化学习 向 MAS 的宏观结构回归。它不假设所有智能体平等,而是预设或自动发现角色分工(领导者追随者、攻击者防御者、探索者利用者),不同角色用差异化的策略网络和学习目标。代表算法 QMIX 不直接学联合价值,而是学一组个体价值再通过一个单调性约束的混合网络组合。这个约束保证个体改进必带来集体提升,巧妙绕开了联合动作空间爆炸,也天然支持角色专业化。

范式 核心思路 适用场景 代价
CTDE 训练用全局,执行用局部 可控环境、性能优先 需训练时全局信息
完全去中心化 训练也只用本地 高对抗、低带宽 收敛慢
分层角色化 角色分工差异化 复杂任务、需专业化 角色设计复杂

三、工程实践要点

3.1 三大技术挑战

信用分配的幽灵:一群机器人攻入一球,功劳归传球者、跑位者还是射门者?单智能体强化学习里,价值误差可清晰回溯到单个动作;但 MARL 里联合奖励是全体动作的混响。COMA 的反事实基线虽然有启发,但要为每个智能体构造多个虚拟动作评估影响,计算开销巨大。更新的思路转向因果推理——把智能体交互建模为结构因果模型,通过因果效应识别而不是相关性来分配信用。

策略空间的诅咒:联合动作空间规模呈指数爆炸。即使每个智能体只有五个离散动作,十个智能体的联合空间已达近百亿。QMIX 通过单调混合缓解,但表达能力受限。更根本的出路是动作抽象——学习高层技能(如"协同搬运""编队转向")作为可复用模块,把底层动作序列封装,让策略在"做什么"和"怎么做"两个层面同时进化。

学习者困境:所有智能体同步学习时,A 的更新使 B 的旧策略失效,B 为适应 A 而更新又反过来摧毁 A 的收益,形成恶性循环。最新进展把 MARL 嵌入元博弈框架——把每个智能体的策略视为元博弈中的纯策略,通过在线学习算法在策略空间寻找近似纳什均衡。训练不再是单次优化,而是一场持续的多轮策略军备竞赛。

3.2 应用场景与价值

MARL 的价值体现在传统方法束手无策的领域:

智能交通:把路口视为智能体,以通行延误为个体奖励,通过车路通信交换意图,动态生成绿波带。实测早高峰主干道平均车速能显著提升,背后是数百个信号控制器在非平稳车流中达成的分布式共识。

电力需求响应:协调数百家制造企业和储能电站,每家企业作为独立智能体在满足生产约束下最小化用电成本,电网发布实时电价信号。MARL 让各企业基于本地负荷预测自主学习削峰填谷策略,园区整体负荷曲线方差明显降低,验证了去中心化机制在隐私敏感场景的优势。

多机器人协同搜救:在通信中断风险下,漫游车采用分层角色化 MARL——一台领航者负责全局地图和路径规划,其余为勘探者执行局部采样,角色可动态切换,领航者失联时勘探者通过共识选举新领袖。这种弹性远超预编程脚本。

💡 关键直觉:MARL 的应用逻辑正从"替代人类决策"转向"增强人类治理"。它不追求取代交通警察或电网调度员,而是为他们提供一个可解释、可干预、可演化的协同决策底座——当系统异常时能追溯是哪个智能体的策略偏离导致连锁反应,当政策调整时只需改对应智能体的奖励函数,整个群体会自主重新校准。

3.3 选范式的实用建议

⚠️ 常见坑:盲目套用单智能体强化学习算法到多智能体场景。直接给每个智能体跑个 DQN 或 PPO,不处理非平稳性,结果训练震荡、策略坍塌。多智能体场景必须用专门处理非平稳性的范式(CTDE 或去中心化),不能图省事套单智能体算法。

选范式的简单准则:如果训练时有条件用全局信息(仿真环境、可观测全部状态),优先 CTDE,性能最好;如果是真实部署、带宽受限、对抗性强,用完全去中心化,虽慢但稳;如果任务天然有角色分工(比如异构机器人团队),用分层角色化,能利用结构优势。

训练实践的三条经验

给准备动手训练 MARL 的读者三条来自实战的经验。第一,先在两到三个智能体的小规模上把整个训练闭环跑通再扩规模——非平稳性问题在小规模下同样暴露,但调试成本低一个数量级,扩规模后出的新问题才不会被老问题污染判断。第二,奖励信号的粒度比算法选择更影响结果:过于稀疏的群体奖励让信用分配无从谈起,适当引入密集的局部 shaping(哪怕引入一点偏差)往往比换算法提升更明显。第三,保留一部分 selfish baseline(每个智能体独立训练、不感知同伴的版本)作为对照组——很多"协同提升"其实是环境本身变简单了,对照组是识别自欺的照妖镜。

本节要点回顾

  • MARL 区别于单智能体 RL 的本质是环境内生非平稳性:环境是其他正在学习的智能体,经典收敛证明失效。
  • 随机博弈是形式化基础:状态转移和奖励依赖联合动作,引出纳什均衡、相关均衡等解概念。
  • 三大训练范式:CTDE(工业标准,训练全局执行局部)、完全去中心化(高对抗低带宽)、分层角色化(角色分工)。
  • 三大技术挑战:信用分配(用反事实或因果推理)、策略空间爆炸(用动作抽象)、学习者困境(用元博弈框架)。
  • 别套单智能体算法:多智能体场景必须处理非平稳性,CTDE 是首选。

下一章进入大模型时代——LLM 怎么改变 MAS 的落地方式,以及工程实践和工具生态。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U