6.1 多智能体系统


6.1 多智能体系统

本节摘要:多智能体系统是多个循环共享一个环境。每个智能体仍有自己的观测、状态、策略、行动;差别是别人的行动改写了你眼中的动态,于是世界模型里必须出现「对手或伙伴的策略」。SOURCE 用自主、反应、社会、前摄四性描述个体;系统层还要问通信、协议、是协作还是博弈。没有通信的多车避让也是多智能体——通过环境间接耦合。

本节目标

阅读完本节,你应当能够:

  1. 把四性翻译成循环上的能力,而不是形容词
  2. 区分通过环境耦合与通过消息耦合
  3. 说明协作与博弈对奖励接口的不同要求
  4. 指出为何单智能体最优在对手会学时会失效

环境里出现了别的循环

城市里车、人、灯都在动。灯可以当环境装置,也可以当智能体,取决于它有没有自己的目标与策略。多智能体的定义不靠数量,靠「至少还有一个也在优化」。你的 T 不再是物理加噪声,还含别人的 π。1.2 的多智能体轴在此展开。四性:自主是本循环不等人遥控每一步;反应是观测能进反射层;社会是能发消息或能读懂别人行动;前摄是有目标驱动而不是纯触发。四性是个体规格,不是系统已经协调好的保证。

我: o → s → a 你: o' → s' → a' 环境: 下一世界 = 物理(世界, a, a') 我看到的 o_next 含你的 a' 的后果

💡 关键直觉:别人不必发消息才算多智能体。仓库两车抢窄道,耦合发生在占用上。消息只是让耦合更显式、更好协议化。

通信、协议、共同奖励

通信把别人的意图放进你的观测,减少认知不确定。协议规定谁先过窄道,等于在合法集上加社会规则——3.3 的过滤器多了一层。共同奖励把多个循环接到同一评判:团队出库率。个体奖励则可能内卷:每车最大化自己的完成数会堵死主干。设计时要承认:系统目标不会自动分解成个体奖励。分解错误是多智能体版的 3.1 代理指标问题。

耦合 观测里有什么 失败形态
仅环境 别人行动的物理后果 振荡、死锁、抢道
消息 意图、请求、报价 协议不完备、撒谎
共享状态 黑板或共同地图 单点写冲突
共同奖励 团队评分 个体钻团队空子
零和 对手回报 被针对、非平稳

博弈里环境非平稳:你一改策略,对手的最优跟着变,4.4 的适应变成互相追。探索会暴露可剥削套路。这不是调学习率能结束的,需要多样策略或显式对手模型。协作里非平稳来自伙伴也在学:昨天能配合的手势今天变了。协议版本化,与 4.3 的知识版本是同一纪律。

架构上多出来的模块

社会性往往落成通信层与协议层,不要塞进反射。反射仍管别撞;让路协商在技能或任务层。前摄落成目标栈,可能含「帮伙伴」这种社会目标,效用里要加权,否则永远自利。自主不表示拒绝中央调度:调度可以是另一个智能体,发来的是任务层参考,不是遥控电机。中央调度存在时,系统仍是多智能体,只要车上循环没消失。若车只是执行器,那是单智能体加设备,别滥用 MAS 这个词。

⚠️ 常见坑:给每个模块都叫智能体,统计「我们有 40 个智能体」。没有独立目标与策略的线程不是智能体,是函数。坐标系被名词稀释之后,仲裁会没人认领。

交通灯若只按固定相位,是环境装置。若按排队优化相位,它是智能体,车也是,系统目标要写清:总延误还是公交优先。写不清,灯与车的学习会互相拆台。多智能体难在目标分解与非平稳,不难在把单车算法跑 N 份。N 份拷贝没有社会性,只是并行单循环。

Wooldridge 四性检查可以当验收:缺社会性却声称协同,其实在赌环境耦合自己变顺;缺前摄只靠反应,群体会在局部避障里迷路;缺自主则是遥控。把四性挂回循环,比背英文单词抗忘。

协议是社会性的合法集

窄道会车协议「先到先过、超时则协商」是加在个体合法集上的社会规则。没有协议,个体最优会堵死。协议版本必须与 4.3 一样可回滚:新协议在影子交通里测死锁率,再切。通信不可靠时,协议要有缺省:没收到确认则当环境耦合处理,减速而不是假设对方已让。缺省属于反射层,协商属于技能层,不要把握手放进急停路径。

共同奖励的分解可用整形:个体奖励 = 团队项 + 局部项 - 冲突项。冲突项惩罚抢道。分解错会内卷或偷懒(都等别人干)。检验方法是关掉一个体看团队是否仍能完成——不能则过度依赖英雄,分解失败。中央调度可以存在,它是另一个智能体,发任务参考。车上循环仍在。若调度直达电机,MAS 名不副实,应按单智能体加执行器来设计,反而更简单、更可追。

四性验收表:缺自主则每步等人,系统不是智能体集群;缺反应则协商成功也会在物理上撞;缺社会却声称协同,是在赌;缺前摄则群体在局部避障里迷路,完不成出库。把表贴到架构评审,比讨论「我们要不要上多智能体强化学习」更先。算法可以后上;没有协议与分解,算法会学到更精致的互坑。

谎言与对抗:消息可能假。社会性不是信任。合法集仍以自身传感器为准,消息只降认知不确定,不覆盖 L0。对手发「我已停下」而雷达显示逼近,信雷达。这是 6.1 与 6.3 的接头:社会观测不可买通约束。

本节检查清单

环境里是否真有另一个优化循环,还是把线程都叫了智能体?四性缺哪条,缺了还声称什么?耦合是环境、消息还是共享状态?协议缺省在反射还是把握手放进了急停路径?共同奖励分解关掉一个体还能不能完成任务?中央调度是发参考还是直达电机?消息与雷达冲突时信谁?协议版本有没有影子测死锁再切?非平稳评估用不用会适应的对手?N 份拷贝没有社会性——这句话能否用来删掉夸大的智能体计数?删掉之后剩下的才是要设计协议的对象。对象少了,问题变清楚:目标怎么分解、合法集怎么叠加社会规则、缺省怎么保守。清楚了再谈要不要多智能体强化学习。强化学习填不了没写的协议。没写的协议会变成互坑的精致策略。精致互坑在回放里好看,在窄道里堵死。堵死是 6.1 的业务指标,比平均回报诚实。

两车窄道的最小协议实验

仿真里放两车相向,无消息,只靠占用。记录死锁次数。再加「先到先过、超时则双方减速」的协议,死锁应下降。再让一方撒谎声称已到,雷达仍显示运动,合法集应信雷达。三步实验把环境耦合、协议、L0 优先级走完,不需要先上多智能体强化。强化在协议空时会学到更会抢的个体策略,死锁可能更精致。精致死锁在曲线上像高个体回报。个体回报不是系统目标。系统目标是通过率。通过率才是 6.1 的分数。分数升了,再考虑要不要让协议参数被学习。学习协议参数必须走版本与影子,与 4.3 同一闸。闸没套上,社会性会变成可被剥削的口头约定。口头约定在真机窄道里等于没有。没有协议的多车不是团队,是共享路面的若干单循环。若干单循环可以并行,但不要叫协同。协同从协议实验的死锁下降开始。下降可测。可测才配进架构评审。评审若只展示多智能体动画,退回本节做三步实验。动画不是四性。四性要能缺省、能信雷达、能分解奖励。三能写在实验记录里。记录比动画抗辩。抗辩得住,6.1 过关。过关后才允许把「对手也会学」放进 4.4 的评估集。评估集没有会适应的对手,过关是假的。假过关会在上线第一周被别的车的策略打脸。打脸很贵。实验很便宜。便宜的先做。

死锁下降可测,协同才配进评审。评审若只展示动画,退回三步实验:无消息、有协议、撒谎信雷达。三步不过,不要上多智能体强化。强化在协议空时会学到更精致的互坑。互坑在窄道里堵死。堵死是分数。分数是通过率。通过率升了再谈学协议参数。参数仍走版本闸。闸没套上,口头约定等于没有。没有协议的多车只是共享路面的若干单循环。若干单循环可以并行,但不要叫协同。协同从死锁次数下降开始。下降写进实验记录。记录比动画抗辩。抗辩得住,才允许把「对手也会学」放进评估集。评估集没有会适应的对手,过关是假的。假过关会在上线第一周被别的车的策略打脸。打脸很贵。三步实验很便宜。便宜的先做。做完,6.1 过关。过关不要求会纳什均衡。要求死锁可测、撒谎信雷达、奖励分解能关一个体仍完成。三要求写进实验记录。记录在架构评审第一页。第一页没有动画。动画在附录。附录不决策。决策看死锁次数。次数下降,社会性才不是形容词。形容词不降死锁。死锁次数才降。次数写进第一页。第一页过关,6.1 才允许把通信层画进架构。画之前没有协议,通信只是新的撒谎通道。撒谎通道信雷达挡住。挡住过关。过关后通信层只降认知不确定,不覆盖 L0。覆盖 L0 的消息是攻击。攻击信雷达。雷达过关。过关标志是撒谎实验里合法集仍信自身传感器。自身传感器先于消息。先于消息,社会性才安全。安全过关。

温故知新

  • 定义:环境里还有别的优化循环,T 含别人的策略
  • 四性:自主、反应、社会、前摄,是个体规格
  • 耦合:环境、消息、共享状态,间接也算
  • 奖励分解:系统目标不会自动变成个体奖励
  • 非平稳:对手或伙伴在学,适应变成互相追
  • 别滥用名称:无独立目标的线程不是智能体

下一节看大模型如何把认知与决策糊进一次生成,以及如何拆回来。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U