协调评估与基准


文档摘要

协调评估与基准 本节摘要:20252026 年五个基准覆盖了多智能体评估空间。MultiAgentBench / MARBLE(ACL 2025, arXiv:2503.01935)评估星/链/树/图拓扑配里程碑 KPI;图型最适合研究,认知规划额外加约 3% 里程碑达成。COMMA 评估多模态非对称信息协调;含 GPT-4o 在内的前沿模型挣扎着打败随机基线。MedAgentBoard(arXiv:2505.12371)覆盖四类医疗任务,常发现多智能体并不压制单 LLM。AgentArch(arXiv:2509.10769)基准企业级 Agent 架构,组合工具使用 + 记忆 + 编排。SWE-bench Pro(arXiv:2509.

协调评估与基准

本节摘要:2025~2026 年五个基准覆盖了多智能体评估空间。MultiAgentBench / MARBLE(ACL 2025, arXiv:2503.01935)评估星/链/树/图拓扑配里程碑 KPI;图型最适合研究,认知规划额外加约 3% 里程碑达成。COMMA 评估多模态非对称信息协调;含 GPT-4o 在内的前沿模型挣扎着打败随机基线。MedAgentBoard(arXiv:2505.12371)覆盖四类医疗任务,常发现多智能体并不压制单 LLM。AgentArch(arXiv:2509.10769)基准企业级 Agent 架构,组合工具使用 + 记忆 + 编排。SWE-bench Pro(arXiv:2509.16941)有 41 个仓库的 1865 题,跨商业应用、B2B 服务、开发者工具;前沿模型在 Pro 上约 23%、在 Verified 上 70%+——一个对污染的现实检验。Claude Opus 4.7(2026 年 4 月)在 Pro 上据报 64.3%(用显式 Agent 团队协调,尚无 Anthropic 主源,视作初步);Verdent(Agent 框架)在 Verified 上 76.1% pass@1AAAI 2026 Bridge Program WMAC 是 2026 社区焦点。本节基于 MARBLE 的指标,跑一个拓扑-指标扫描,并钉死「光过 SWE-bench Verified 不是泛化的证据」这条规则。

学习目标

阅读完本节,你应当能够:

  1. 复述五大 2026 基准(MARBLE、COMMA、MedAgentBoard、AgentArch、SWE-bench Pro)各自测量什么、适用何时。
  2. 说明 SWE-bench Pro 为何是「抗污染的现实检验」——前沿在 Pro 约 23% vs Verified 70%+ 的差距就是污染信号。
  3. 解释 MedAgentBoard「多智能体在多数类别上不压制单 LLM」的发现,及其对「多数提议的多智能体系统过度工程」的暗示。
  4. 应用「带着怀疑读基准宣称」的六条检查清单(哪个基准哪个 split、污染检查、基线对比、统计显著性、任务多样性、成本披露)。
  5. 识别四个「没有基准测得好」的轴(长程协调、对抗韧性、部署下漂移、成本归一化性能),并据此判断何时该建内部基准。

一、问题与直觉

当一篇论文宣称「我们的多智能体系统更好」,问题是:比什么、在什么上、怎么测的?20232024 的多智能体评估是混乱期——人人挑自己的指标、基线、任务集。20252026 的基准 impose 了结构。

没有共享基准,你无法有意义地比较两个多智能体系统。更糟的是,没有留出基准,前沿模型可能被污染:SWE-bench Verified 到 2025 年中已部分泄露进训练语料,前沿分数虚高;Pro 就是作为未污染现实检验设计的。本节枚举五个 2026 标准基准,命名各测什么,并教你怀疑地读基准宣称。

MultiAgentBench(MARBLE)——ACL 2025

arXiv:2503.01935。在研究、编码、规划任务上评估四种协调拓扑(星、链、树、图)。基于里程碑的 KPI 跟踪部分进展,而非只看最终成功。

实测结果:图型拓扑在研究场景最佳(支持任意到任意批评);链型在分步精炼编码最佳;星型在快事实整合最佳;协调税在图型上超过约 4 个 Agent 后出现;认知规划在各拓扑上额外加约 3% 里程碑达成。适用于:你想苹果对苹果地比较协调拓扑时。MARBLE 仓库提供评估器。

COMMA——多模态非对称信息

覆盖 Agent 有不同观察模态、且须在不完全信息共享下协调的任务。报告的结果令人不安:含 GPT-4o 在内的前沿模型,在 COMMA 的 Agent-Agent 协作上挣扎着打败随机基线。信号是多智能体模态欠训练、欠评估——LLM 处理单模态合作还行,多模态协调就崩。

适用于:你的系统有多模态或非对称信息协调时。COMMA 的零结果是「宣称前先测量」的警告。

MedAgentBoard——领域压力测试

arXiv:2505.12371。四类医疗任务:诊断、治疗规划、报告生成、患者沟通。比较多智能体 vs 单 LLM vs 传统规则系统。

发现:多智能体在多数类别上并不压制单 LLM。多智能体优势很窄——任务分解在子任务可清晰分离时(诊断 + 治疗)有用,在协调开销超过专门化收益时(报告生成)有害。

适用于:你的领域有清晰的单 LLM 基线时。若 MedAgentBoard 的教训能泛化,许多提议的多智能体系统是过度工程的。

⚠️ MedAgentBoard 的发现戳破了「多智能体天然更好」的幻觉——在多数领域,单 LLM 加好的提示就能匹敌甚至击败多智能体,且成本低得多。多智能体的优势是窄的:只在子任务可清晰分离、且协调开销小于专门化收益时才显现。这是把「协调难点在协调而非多」落到评估层面的最直接证据。

AgentArch——企业架构

arXiv:2509.10769。企业设定,工具使用、记忆、编排叠加。基准隔离每层的贡献:加工具有多少帮助?加记忆?加多智能体编排?

适用于:你在设计企业 Agent 栈、需为每层找理由时。AgentArch 帮你避免买你测不出价值的功能。

SWE-bench Pro——现实检验

arXiv:2509.16941。41 个仓库的 1865 题,跨商业应用、B2B 服务、开发者工具。设计为未污染(有更晚的训练截止)。前沿模型在 Pro 上约 23%、在 Verified 上 70%+——差距就是污染信号。

2026 年 4 月分数:Claude Opus 4.7 在 Pro 上 64.3%(报告用显式 Agent 团队协调,无 Anthropic 主源,视作初步);Verdent 在 Verified 上 76.1% pass@1;前沿无 Agent 框架的原始 Pro 分数约 23~35%。

结论:「我们打败了 SWE-bench Verified」已不再是能力的证据。Pro 是当前的把关测试。 Agent 团队框架在 Pro 上产可观增益(约 30~40 个百分点差),是 2026 多智能体协调最强的实证论据之一。

AAAI 2026 WMAC

AAAI 2026 Bridge Program——多智能体协调工作坊。2026 多智能体 AI 研究的社区焦点。录用论文与工作坊论文集是评估新方法的标准场所;生产决策上,WMAC 录用的宣称优先于 arXiv 预印本。

带着怀疑读基准宣称——2026 检查清单

当有人宣称一个多智能体结果时:

  1. 哪个基准、哪个 split? SWE-bench Verified vs Pro 差很多。报错 split 的数字一文不值。
  2. 污染检查。 基准是否在模型训练截止后发布?若否,谨慎对待。
  3. 基线对比。 对比单 LLM 基线、随机、先前多智能体工作——不是「对比同一系统的未调版本」。
  4. 统计显著性。 N 次试验、p 值、置信区间。前沿模型高方差,单次运行会误导。
  5. 任务多样性。 一种还是多种?泛化对生产要紧。
  6. 成本披露。 每任务 token、墙钟。90% 的解在 20 倍成本下是商业决策,不是能力宣称。

没有基准测得好的

  • 长程协调。 数天的墙钟交互,现有基准都跑得短。
  • 对抗韧性。 一个 Agent 恶意或被攻陷时会发生什么?
  • 部署下漂移。 基准静态,生产分布漂移。
  • 成本归一化性能。 多数基准报原始准确率,非每美元准确率。

为你在乎的轴建内部基准,常常是对的动作。

二、从零实现

code/main.py 是一个非交互式走查:

  • 在一个玩具任务上模拟 3 个多智能体系统。
  • 为每个算 MARBLE 式里程碑指标。
  • 通过从「训练集」扣留任务跑污染检查。
  • 显式对比随机基线。
  • 打印一份基准宣称评分卡。

里程碑指标与污染检查

def marble_score(system, task): milestones = task.milestones # 部分进展点 achieved = [m for m in milestones if system.reached(m)] return { "milestone_rate": len(achieved) / len(milestones), "final_success": system.reached(task.final), "tokens": system.tokens_used, "wallclock": system.elapsed, } def contamination_check(model, held_out): # held_out 是模型截止后发布的任务 on_held = model.score(held_out) on_train = model.score(published_before_cutoff) return {"gap": on_train - on_held, # 大 gap = 污染信号 "verdict": "contaminated" if (on_train - on_held) > 0.3 else "plausibly-clean"}

设计要点:milestone_rate 是 MARBLE 的承重创新——只看 final_success 会把「差一步就完成」与「完全没开始」都判为零分,丢失部分进展信号。contamination_checkgap 是 SWE-bench Pro 的核心洞见:同一模型在「截止前已发布」与「截止后发布」任务上的准确率差,就是污染的可测量指纹。

运行 python3 code/main.py,期望输出:系统评分卡含原始准确率、里程碑达成、每任务成本、相对随机基线的差值,以及一条污染检查注记。

三、框架对比

基准 测什么 关键发现 警示
MARBLE 星/链/树/图拓扑 + 里程碑 图型适合研究、链型适合编码 ~4 Agent 协调税
COMMA 多模态非对称信息协调 前沿挣扎着打败随机 多模态协调欠训练
MedAgentBoard 四类医疗任务 多智能体多不压制单 LLM 多数系统过度工程
AgentArch 工具 + 记忆 + 编排 隔离每层贡献 别买测不出价值的功能
SWE-bench Pro 41 仓库 1865 题,未污染 前沿约 23% vs Verified 70%+ Verified 已污染,Pro 是把关测试

💡 心法:Verified 已污染,Pro 是把关测试;MedAgentBoard 证明多智能体常不压制单 LLM;COMMA 证明多模态协调还远未解决。 这三条加起来是 2026 评估层面的「清醒剂」——任何宣称多智能体优势的论文,都得先回答「比单 LLM 强吗、在未污染 split 上吗、算上成本吗」。

四、可复用产物

outputs/skill-benchmark-reader.md:读任何多智能体基准宣称并应用审查清单,输出一个评级与注意事项。

五、练习

  1. 找性价比:运行 code/main.py,识别三个模拟系统里哪个每里程碑成本最佳。它与原始准确率最高的是同一个吗?
  2. 读 MARBLE:读 arXiv:2503.01935,为自己的任务领域决定 MARBLE 会推荐四种拓扑里的哪个,从论文结果给出理由。
  3. 读 SWE-bench Pro:读该论文,具体什么使它抗污染?同一技术能用于你在乎的其他基准吗?
  4. 读 COMMA:读其多模态协调发现,设计一个你能加进内部基准的简单多模态协调任务。什么算有用信号?
  5. 套检查清单:把基准宣称检查清单套到一篇近期多智能体论文的头条结果上,你会给这个宣称什么评级?

本节要点回顾

  1. 五大基准:MARBLE(拓扑)、COMMA(多模态)、MedAgentBoard(医疗领域)、AgentArch(企业栈)、SWE-bench Pro(未污染把关)。
  2. MARBLE:图型适合研究、链型适合编码、星型适合快答,~4 Agent 协调税,认知规划 +3%。
  3. COMMA 警示:含 GPT-4o 在内,前沿挣扎着打败随机——多模态协调欠训练。
  4. MedAgentBoard 警示:多智能体在多数类别不压制单 LLM,优势窄,许多系统过度工程。
  5. SWE-bench Pro 是把关测试:未污染,前沿约 23% vs Verified 70%+,差距即污染信号;Agent 团队在 Pro 上加 30~40 个百分点。
  6. 怀疑读宣称六条:哪个 split、污染检查、基线对比、统计显著性、任务多样性、成本披露。
  7. 四个没测好的轴:长程协调、对抗韧性、部署漂移、成本归一化——为你在乎的轴建内部基准。
  8. WMAC 2026 是焦点:生产决策上,WMAC 录用宣称优先于 arXiv 预印本。

下一节,也是本章收官——案例与 2026 前沿:精读三大生产级参考(Anthropic 研究系统、MetaGPT/ChatDev、OpenClaw/Moltbook),测绘 2026 框架版图,把贯穿全章的协调机制浓缩为可带走的工程心法。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U