投票与辩论拓扑 本节摘要:最便宜的聚合:采样 N 个独立 Agent,多数票。Wang 等 2022 的自洽性(Self-Consistency)用一个模型采样 N 次做到这一点;多智能体把它扩展为异构 Agent——不同模型、不同提示、不同温度、不同上下文,以逃离单作(monoculture)。多数票之外,辩论拓扑(topology)更要紧:MultiAgentBench(arXiv:2503.01935, ACL 2025)评测了星型/链式/树型/图型四种协调,发现图型最适合研究任务,且超过约 4 个 Agent 就出现「协调税」。
本节摘要:最便宜的聚合:采样 N 个独立 Agent,多数票。Wang 等 2022 的自洽性(Self-Consistency)用一个模型采样 N 次做到这一点;多智能体把它扩展为异构 Agent——不同模型、不同提示、不同温度、不同上下文,以逃离单作(monoculture)。多数票之外,辩论拓扑(topology)更要紧:MultiAgentBench(arXiv:2503.01935, ACL 2025)评测了星型/链式/树型/图型四种协调,发现图型最适合研究任务,且超过约 4 个 Agent 就出现「协调税」。AgentVerse(ICLR 2024)记录了两种涌现模式——志愿行为(volunteer)与从众行为(conformity)——而从众既是特性(找到共识),也是风险(群体思维,见第 23 节)。本节测绘拓扑空间,逐个搭出变体,并量化协调税。
阅读完本节,你应当能够:
辩论能提升准确率(Du 等, arXiv:2305.14325),也能降低它。辩论是否有益,取决于四个结构选择:
那些把「跑 5 个 Agent 再投票」硬塞进任务的团队,常常比单 Agent 还退步。失败不是随机的,它们沿着拓扑与异质性走。本节就是这张拓扑地图。
Wang 等 2022(《Self-Consistency Improves Chain of Thought Reasoning》)在温度 > 0 下对同一模型采样 N 次,对推理路径上的答案做多数票。GSM8K 上的结果:N=40 采样比单次贪心解码有大幅提升。自洽性是多 Agent 投票的单 Agent 前身。
局限:自洽性只用一个基座,误差构造性地相关。若模型有系统性偏置,所有 N 个样本共享它。
把 N 个样本换成 N 个不同的 Agent——不同基座(Claude、GPT、Llama)、不同提示、不同工具访问。收益:误差不相关。代价:不同 Agent 成本不同,协调它们增加开销。
2026 异构辩论的通用名称是 A-HMAD(对抗式异构多 Agent 辩论)。虽未普遍采纳,但论文用它指「不同模型辩论,以减少单作崩溃带来的相关误差」。
星型 star 链式 chain 树型 tree 图型 graph ┌─A─┐ A─B─C─D ┌──A──┐ A───B │ │ │ │ │ × │ B C B C D───C │ │ / \ / \ D E D E F G (全连接)
MultiAgentBench(MARBLE, ACL 2025, arXiv:2503.01935)在含研究、编码、规划的任务套上基准测试了星、链、树、图。关键实测:
4 个 Agent 的天花板是经验的,非根本的。它反映 2026 LLM 的上下文容量:每个 Agent 的上下文被同侪输出塞满,一旦人人可见人人,加第 N+1 个的边际价值就骤降。
arXiv:2311.17371 是 2023 年 MAD(多 Agent 辩论)策略综述。被他人复现的关键发现:结构上与自洽性相似(独立采样 + 聚合)的 MAD 变体,在同等预算下往往输给自洽性。MAD 最有用的时候,是 Agent 真正异构、且辩论带对抗结构(一个 Agent 专门唱反调)。
AgentVerse(ICLR 2024)记录了两种行为,它们在多 Agent 辩论中无需显式设计就会涌现:
从众正是为何「辩论到一致」会奖励霸凌者。有界轮数加独立裁判能缓解。
⚠️ 「辩论到收敛」是危险默认值——它系统性地奖励声音最大、立场最硬的 Agent。把轮数限死在 2~3 轮,再用一个不参与辩论的独立裁判收尾,是从众风险的两道闸。
2024~2026 实践文献的一个模式:把 N 个 Agent 中的一个换成不同基座,带来的准确率提升,比把 N 加 1 还大。直觉就是单作——每一个新的独立误差源,都比一个额外的相关样本更值钱。
极限情形下,异质性强于数量。在大多数有干净真值的任务上,三个不同模型胜过五个同一模型的副本。
Sibyl 框架(被 Minsky-LLM 文献引用)形式化了一个「陪审团」——一小群专业化 Agent,在每个阶段靠投票精炼答案。与朴素多数票不同,陪审团有角色:一个交叉质询、一个补充上下文、一个打分可信度。陪审团方法是朴素投票(便宜、易单作)与完整 MAD(昂贵、易从众)之间的中点。
code/main.py 实现:
run_star(agents, hub, question)——中心轮询每个工人并聚合。run_chain(agents, question)——顺序精炼。run_tree(root, children, question)——层级,深度 2 聚合。run_graph(agents, question, rounds)——全对全辩论,有界轮数。error_bias 表示其系统性偏差。(准确率, 总 token, 模拟墙钟)。def run_graph(agents, question, rounds=3): answers = {a.id: a.initial_answer(question) for a in agents} for r in range(rounds): for a in agents: peers = {pid: ans for pid, ans in answers.items() if pid != a.id} answers[a.id] = a.revise(answers[a.id], peers) # 看同侪再修订 return judge.final_vote(answers) # 独立裁判,不参与辩论
设计要点:
rounds是承重的护栏——无界时从众必然胜出,因为每轮都让 Agent 更靠近最响的声音。裁判judge不投票,只打分,把「辩论」与「裁决」两个角色物理分离。
运行 python3 code/main.py,期望输出一张 拓扑 × N -> (准确率, token, 延迟) 的表:**N=3~5 时图型在研究类任务胜出;星型在快事实任务胜出;N=7 时图型显现协调税(延迟膨胀快于准确率)。**
| 拓扑 | 信息流 | 最适任务 | 协调税拐点 |
|---|---|---|---|
| 星型 | 经中心辐合 | 快答事实、过滤整合 | 高(中心是瓶颈) |
| 链式 | 线性传递 | 分步流水线、逐级精炼 | 低(无 fan-out) |
| 树型 | 层级聚合 | 层级系统(第 06 节) | 中 |
| 图型 | 任意到任意 | 研究、多步、需互相批评 | ~4 个 Agent 后陡升 |
💡 心法:**先自洽性(N=5,单强模型)打底,再上异构投票(N=3),最后才考虑辩论拓扑。** 跳过前两级直接上图型辩论,是「为复杂而复杂」的典型陷阱——Anthropic 的研究帖反复强调 simple over complex。
outputs/skill-topology-picker.md:一个 skill,读入任务描述,推荐拓扑(星/链/树/图)、N(Agent 数)、异构画像(该用哪些基座)、以及轮数上限。
code/main.py,画出图型拓扑的协调税曲线——准确率 vs N、token vs N。曲线在哪个 N 反弯?下一节,我们转向 Agent 之间最古老的协调形式——协商与讨价:看 OG-Narrator 如何把「算报价」与「写话术」拆开,把成交率从约 27% 拉到约 89%,以及为何思维链隐瞒是大规模协商赛的制胜策略。