投票与辩论拓扑


文档摘要

投票与辩论拓扑 本节摘要:最便宜的聚合:采样 N 个独立 Agent,多数票。Wang 等 2022 的自洽性(Self-Consistency)用一个模型采样 N 次做到这一点;多智能体把它扩展为异构 Agent——不同模型、不同提示、不同温度、不同上下文,以逃离单作(monoculture)。多数票之外,辩论拓扑(topology)更要紧:MultiAgentBench(arXiv:2503.01935, ACL 2025)评测了星型/链式/树型/图型四种协调,发现图型最适合研究任务,且超过约 4 个 Agent 就出现「协调税」。

投票与辩论拓扑

本节摘要:最便宜的聚合:采样 N 个独立 Agent,多数票。Wang 等 2022 的自洽性(Self-Consistency)用一个模型采样 N 次做到这一点;多智能体把它扩展为异构 Agent——不同模型、不同提示、不同温度、不同上下文,以逃离单作(monoculture)。多数票之外,辩论拓扑(topology)更要紧:MultiAgentBench(arXiv:2503.01935, ACL 2025)评测了星型/链式/树型/图型四种协调,发现图型最适合研究任务,且超过约 4 个 Agent 就出现「协调税」。AgentVerse(ICLR 2024)记录了两种涌现模式——志愿行为(volunteer)与从众行为(conformity)——而从众既是特性(找到共识),也是风险(群体思维,见第 23 节)。本节测绘拓扑空间,逐个搭出变体,并量化协调税。

学习目标

阅读完本节,你应当能够:

  1. 说明自洽性(单模型采样 N 次)与异构多 Agent 投票的关系与差异,指出后者为何能打破单作。
  2. 辨识星型、链式、树型、图型四种拓扑各自的信息流特征与适用任务。
  3. 复述 MultiAgentBench 关于「图型适合研究、星型适合快答、链式适合流水线、~4 个 Agent 后出现协调税」的实测结论。
  4. 识别 AgentVerse 记录的志愿行为与从众行为,并说明为何无界辩论会奖励「霸凌者」。
  5. 应用「异质性强于数量」的经验法则,为一个集成选择拓扑、N、异构画像与轮数上限。

一、问题与直觉

辩论能提升准确率(Du 等, arXiv:2305.14325),也能降低它。辩论是否有益,取决于四个结构选择:

  1. 谁和谁说话(拓扑)。
  2. 多少轮(Du 2023:轮数与 Agent 数各自独立地影响结果)。
  3. Agent 是否异构(不同基座打破单作)。
  4. 是否存在对抗性声音(钢铁人论证 vs 稻草人攻击)。

那些把「跑 5 个 Agent 再投票」硬塞进任务的团队,常常比单 Agent 还退步。失败不是随机的,它们沿着拓扑与异质性走。本节就是这张拓扑地图。

自洽性:单模型基线

Wang 等 2022(《Self-Consistency Improves Chain of Thought Reasoning》)在温度 > 0 下对同一模型采样 N 次,对推理路径上的答案做多数票。GSM8K 上的结果:N=40 采样比单次贪心解码有大幅提升。自洽性是多 Agent 投票的单 Agent 前身。

局限:自洽性只用一个基座,误差构造性地相关。若模型有系统性偏置,所有 N 个样本共享它。

多 Agent 投票:异构扩展

把 N 个样本换成 N 个不同的 Agent——不同基座(Claude、GPT、Llama)、不同提示、不同工具访问。收益:误差不相关。代价:不同 Agent 成本不同,协调它们增加开销。

2026 异构辩论的通用名称是 A-HMAD(对抗式异构多 Agent 辩论)。虽未普遍采纳,但论文用它指「不同模型辩论,以减少单作崩溃带来的相关误差」。

四种拓扑

星型 star 链式 chain 树型 tree 图型 graph ┌─A─┐ A─B─C─D ┌──A──┐ A───B │ │ │ │ │ × │ B C B C D───C │ │ / \ / \ D E D E F G (全连接)
  • 星型:一个中心,其他人只与中心说话。等价于无后向信道的监督者-工人。
  • 链式:线性,每个 Agent 看到前一个的输出。类流水线。
  • 树型:层级,用于层级 Agent 系统(第 06 节)。
  • 图型:任意到任意,含全连接团与任意 DAG。

协调税(MultiAgentBench)

MultiAgentBench(MARBLE, ACL 2025, arXiv:2503.01935)在含研究、编码、规划的任务套上基准测试了星、链、树、图。关键实测:

  • 图型在研究类任务上胜出。信息任意到任意流动,Agent 能彼此批评。
  • 星型在快答类事实任务上胜出。中心过滤并整合。
  • 链式在分步流水线(分阶段精炼)上胜出。
  • 协调税在图型拓扑上、超过约 4 个 Agent 时出现:墙钟时间与 token 成本增长快于质量。

4 个 Agent 的天花板是经验的,非根本的。它反映 2026 LLM 的上下文容量:每个 Agent 的上下文被同侪输出塞满,一旦人人可见人人,加第 N+1 个的边际价值就骤降。

多 Agent 辩论策略(「我们该 MAD 吗?」)

arXiv:2311.17371 是 2023 年 MAD(多 Agent 辩论)策略综述。被他人复现的关键发现:结构上与自洽性相似(独立采样 + 聚合)的 MAD 变体,在同等预算下往往输给自洽性。MAD 最有用的时候,是 Agent 真正异构、且辩论带对抗结构(一个 Agent 专门唱反调)。

AgentVerse 的涌现模式

AgentVerse(ICLR 2024)记录了两种行为,它们在多 Agent 辩论中无需显式设计就会涌现:

  • 志愿(volunteer):一个 Agent 未经提示就主动揽活(「我可以做下一步」)。有用:它把工作分给最适合子任务的 Agent。
  • 从众(conformity):一个 Agent 调整立场去匹配批评者,即便批评者错了。这是辩论版的谄媚(第 14 节)。

从众正是为何「辩论到一致」会奖励霸凌者。有界轮数加独立裁判能缓解。

⚠️ 「辩论到收敛」是危险默认值——它系统性地奖励声音最大、立场最硬的 Agent。把轮数限死在 2~3 轮,再用一个不参与辩论的独立裁判收尾,是从众风险的两道闸。

异质性:真正拨动准确率的旋钮

2024~2026 实践文献的一个模式:把 N 个 Agent 中的一个换成不同基座,带来的准确率提升,比把 N 加 1 还大。直觉就是单作——每一个新的独立误差源,都比一个额外的相关样本更值钱。

极限情形下,异质性强于数量。在大多数有干净真值的任务上,三个不同模型胜过五个同一模型的副本。

陪审团方法

Sibyl 框架(被 Minsky-LLM 文献引用)形式化了一个「陪审团」——一小群专业化 Agent,在每个阶段靠投票精炼答案。与朴素多数票不同,陪审团有角色:一个交叉质询、一个补充上下文、一个打分可信度。陪审团方法是朴素投票(便宜、易单作)与完整 MAD(昂贵、易从众)之间的中点。

投票加辩论何时占优

  • 问题有真值(事实、数学、代码行为),票收敛有意义。
  • Agent 能访问不同来源或工具(异构可用)。
  • 轮数有界(典型 2~3),且有独立裁判或验证者。
  • 预算允许 35 个 Agent;图型拓扑超过 57 个,协调税就主导。

投票加辩论何时有害

  • 问题像意见。Agent 收敛到看起来最自信、而非最正确的答案。
  • 所有 Agent 共享基座。单作让共识毫无意义。
  • 轮数无界。从众每次都赢。
  • 任务简单。带 N=5 自洽性的单 Agent 更便宜且同样准。

二、从零实现

code/main.py 实现:

  • run_star(agents, hub, question)——中心轮询每个工人并聚合。
  • run_chain(agents, question)——顺序精炼。
  • run_tree(root, children, question)——层级,深度 2 聚合。
  • run_graph(agents, question, rounds)——全对全辩论,有界轮数。
  • 一个脚本化的异构度旋钮:每个 Agent 有一个 error_bias 表示其系统性偏差。
  • 一个测量框架,在 N=3、5、7 跑每种拓扑,报告 (准确率, 总 token, 模拟墙钟)

图型辩论骨架(有界轮 + 裁判)

def run_graph(agents, question, rounds=3): answers = {a.id: a.initial_answer(question) for a in agents} for r in range(rounds): for a in agents: peers = {pid: ans for pid, ans in answers.items() if pid != a.id} answers[a.id] = a.revise(answers[a.id], peers) # 看同侪再修订 return judge.final_vote(answers) # 独立裁判,不参与辩论

设计要点:rounds 是承重的护栏——无界时从众必然胜出,因为每轮都让 Agent 更靠近最响的声音。裁判 judge 不投票,只打分,把「辩论」与「裁决」两个角色物理分离。

运行 python3 code/main.py,期望输出一张 拓扑 × N -> (准确率, token, 延迟) 的表:**N=3~5 时图型在研究类任务胜出;星型在快事实任务胜出;N=7 时图型显现协调税(延迟膨胀快于准确率)。**

三、框架对比

拓扑 信息流 最适任务 协调税拐点
星型 经中心辐合 快答事实、过滤整合 高(中心是瓶颈)
链式 线性传递 分步流水线、逐级精炼 低(无 fan-out)
树型 层级聚合 层级系统(第 06 节)
图型 任意到任意 研究、多步、需互相批评 ~4 个 Agent 后陡升

💡 心法:**先自洽性(N=5,单强模型)打底,再上异构投票(N=3),最后才考虑辩论拓扑。** 跳过前两级直接上图型辩论,是「为复杂而复杂」的典型陷阱——Anthropic 的研究帖反复强调 simple over complex。

四、可复用产物

outputs/skill-topology-picker.md:一个 skill,读入任务描述,推荐拓扑(星/链/树/图)、N(Agent 数)、异构画像(该用哪些基座)、以及轮数上限。

五、练习

  1. 画协调税曲线:运行 code/main.py,画出图型拓扑的协调税曲线——准确率 vs N、token vs N。曲线在哪个 N 反弯?
  2. 实现 A-HMAD:三个 Agent 带刻意不同的偏差。全同偏差基线在第 14 节单作攻击下,与 A-HMAD 比如何?
  3. 加裁判角色:给图型拓扑加一个不投票、只给最终共识打分的裁判。这会改变涌现的从众行为吗?
  4. 读 AgentVerse:读 AgentVerse(ICLR 2024),识别你的实现里哪种涌现行为最强。能靠改提示诱发相反行为吗?
  5. 复现「图型胜研究」:读 MultiAgentBench(arXiv:2503.01935)第 4 节(拓扑实验),在你的框架上对论文里的一个任务复现「图型胜研究」结果。

本节要点回顾

  1. 自洽性是单模型基线:Wang 2022,温度 > 0 采样 N 次再多数票;多 Agent 投票是其异构扩展。
  2. 异构打破单作:不同基座带来不相关误差,这是真正拨动准确率的旋钮。
  3. 四种拓扑:星型(辐合)、链式(线性)、树型(层级)、图型(任意到任意)。
  4. MultiAgentBench 实测:图型适合研究、星型适合快答、链式适合流水线。
  5. 协调税约在 4 个 Agent 后出现:图型拓扑上成本增速压过质量,反映 2026 上下文容量。
  6. 两种涌现模式:志愿(主动揽活,有用)与从众(向批评者对齐,是辩论版谄媚)。
  7. 无界辩论奖励霸凌者:轮数限死 2~3 轮,配独立裁判,是从众风险的两道闸。
  8. 异质性强于数量:三个不同模型常胜过五个同模型副本。
  9. 三档递进:先自洽性 N=5,再异构投票 N=3,最后才辩论拓扑——别为复杂而复杂。

下一节,我们转向 Agent 之间最古老的协调形式——协商与讨价:看 OG-Narrator 如何把「算报价」与「写话术」拆开,把成交率从约 27% 拉到约 89%,以及为何思维链隐瞒是大规模协商赛的制胜策略。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U