MARL——MADDPG、QMIX、MAPPO 本节摘要:多智能体协调的强化学习遗产,到 2026 仍在塑造 LLM-Agent 系统。MADDPG(Lowe 等, NeurIPS 2017, arXiv:1706.02275)引入「中心训练、分布执行」(Centralized Training, Decentralized Execution, CTDE):每个 critic 在训练时看到所有 Agent 的状态与动作,测试时只跑局部 actor;适用于合作、竞争、混合。QMIX(Rashid 等, ICML 2018, arXiv:1803.11485)是带单调混合网络的值分解,使 干净地分布到各 Agent——在 StarCraft 多智能体挑战(SMAC)上占主导。