协调评估与基准 本节摘要:20252026 年五个基准覆盖了多智能体评估空间。MultiAgentBench / MARBLE(ACL 2025, arXiv:2503.01935)评估星/链/树/图拓扑配里程碑 KPI;图型最适合研究,认知规划额外加约 3% 里程碑达成。COMMA 评估多模态非对称信息协调;含 GPT-4o 在内的前沿模型挣扎着打败随机基线。MedAgentBoard(arXiv:2505.12371)覆盖四类医疗任务,常发现多智能体并不压制单 LLM。AgentArch(arXiv:2509.10769)基准企业级 Agent 架构,组合工具使用 + 记忆 + 编排。SWE-bench Pro(arXiv:2509.
本节摘要:2025~2026 年五个基准覆盖了多智能体评估空间。MultiAgentBench / MARBLE(ACL 2025, arXiv:2503.01935)评估星/链/树/图拓扑配里程碑 KPI;图型最适合研究,认知规划额外加约 3% 里程碑达成。COMMA 评估多模态非对称信息协调;含 GPT-4o 在内的前沿模型挣扎着打败随机基线。MedAgentBoard(arXiv:2505.12371)覆盖四类医疗任务,常发现多智能体并不压制单 LLM。AgentArch(arXiv:2509.10769)基准企业级 Agent 架构,组合工具使用 + 记忆 + 编排。SWE-bench Pro(arXiv:2509.16941)有 41 个仓库的 1865 题,跨商业应用、B2B 服务、开发者工具;前沿模型在 Pro 上约 23%、在 Verified 上 70%+——一个对污染的现实检验。Claude Opus 4.7(2026 年 4 月)在 Pro 上据报 64.3%(用显式 Agent 团队协调,尚无 Anthropic 主源,视作初步);Verdent(Agent 框架)在 Verified 上 76.1% pass@1。AAAI 2026 Bridge Program WMAC 是 2026 社区焦点。本节基于 MARBLE 的指标,跑一个拓扑-指标扫描,并钉死「光过 SWE-bench Verified 不是泛化的证据」这条规则。
阅读完本节,你应当能够:
当一篇论文宣称「我们的多智能体系统更好」,问题是:比什么、在什么上、怎么测的?20232024 的多智能体评估是混乱期——人人挑自己的指标、基线、任务集。20252026 的基准 impose 了结构。
没有共享基准,你无法有意义地比较两个多智能体系统。更糟的是,没有留出基准,前沿模型可能被污染:SWE-bench Verified 到 2025 年中已部分泄露进训练语料,前沿分数虚高;Pro 就是作为未污染现实检验设计的。本节枚举五个 2026 标准基准,命名各测什么,并教你怀疑地读基准宣称。
arXiv:2503.01935。在研究、编码、规划任务上评估四种协调拓扑(星、链、树、图)。基于里程碑的 KPI 跟踪部分进展,而非只看最终成功。
实测结果:图型拓扑在研究场景最佳(支持任意到任意批评);链型在分步精炼编码最佳;星型在快事实整合最佳;协调税在图型上超过约 4 个 Agent 后出现;认知规划在各拓扑上额外加约 3% 里程碑达成。适用于:你想苹果对苹果地比较协调拓扑时。MARBLE 仓库提供评估器。
覆盖 Agent 有不同观察模态、且须在不完全信息共享下协调的任务。报告的结果令人不安:含 GPT-4o 在内的前沿模型,在 COMMA 的 Agent-Agent 协作上挣扎着打败随机基线。信号是多智能体模态欠训练、欠评估——LLM 处理单模态合作还行,多模态协调就崩。
适用于:你的系统有多模态或非对称信息协调时。COMMA 的零结果是「宣称前先测量」的警告。
arXiv:2505.12371。四类医疗任务:诊断、治疗规划、报告生成、患者沟通。比较多智能体 vs 单 LLM vs 传统规则系统。
发现:多智能体在多数类别上并不压制单 LLM。多智能体优势很窄——任务分解在子任务可清晰分离时(诊断 + 治疗)有用,在协调开销超过专门化收益时(报告生成)有害。
适用于:你的领域有清晰的单 LLM 基线时。若 MedAgentBoard 的教训能泛化,许多提议的多智能体系统是过度工程的。
⚠️ MedAgentBoard 的发现戳破了「多智能体天然更好」的幻觉——在多数领域,单 LLM 加好的提示就能匹敌甚至击败多智能体,且成本低得多。多智能体的优势是窄的:只在子任务可清晰分离、且协调开销小于专门化收益时才显现。这是把「协调难点在协调而非多」落到评估层面的最直接证据。
arXiv:2509.10769。企业设定,工具使用、记忆、编排叠加。基准隔离每层的贡献:加工具有多少帮助?加记忆?加多智能体编排?
适用于:你在设计企业 Agent 栈、需为每层找理由时。AgentArch 帮你避免买你测不出价值的功能。
arXiv:2509.16941。41 个仓库的 1865 题,跨商业应用、B2B 服务、开发者工具。设计为未污染(有更晚的训练截止)。前沿模型在 Pro 上约 23%、在 Verified 上 70%+——差距就是污染信号。
2026 年 4 月分数:Claude Opus 4.7 在 Pro 上 64.3%(报告用显式 Agent 团队协调,无 Anthropic 主源,视作初步);Verdent 在 Verified 上 76.1% pass@1;前沿无 Agent 框架的原始 Pro 分数约 23~35%。
结论:「我们打败了 SWE-bench Verified」已不再是能力的证据。Pro 是当前的把关测试。 Agent 团队框架在 Pro 上产可观增益(约 30~40 个百分点差),是 2026 多智能体协调最强的实证论据之一。
AAAI 2026 Bridge Program——多智能体协调工作坊。2026 多智能体 AI 研究的社区焦点。录用论文与工作坊论文集是评估新方法的标准场所;生产决策上,WMAC 录用的宣称优先于 arXiv 预印本。
当有人宣称一个多智能体结果时:
为你在乎的轴建内部基准,常常是对的动作。
code/main.py 是一个非交互式走查:
def marble_score(system, task): milestones = task.milestones # 部分进展点 achieved = [m for m in milestones if system.reached(m)] return { "milestone_rate": len(achieved) / len(milestones), "final_success": system.reached(task.final), "tokens": system.tokens_used, "wallclock": system.elapsed, } def contamination_check(model, held_out): # held_out 是模型截止后发布的任务 on_held = model.score(held_out) on_train = model.score(published_before_cutoff) return {"gap": on_train - on_held, # 大 gap = 污染信号 "verdict": "contaminated" if (on_train - on_held) > 0.3 else "plausibly-clean"}
设计要点:
milestone_rate是 MARBLE 的承重创新——只看final_success会把「差一步就完成」与「完全没开始」都判为零分,丢失部分进展信号。contamination_check的gap是 SWE-bench Pro 的核心洞见:同一模型在「截止前已发布」与「截止后发布」任务上的准确率差,就是污染的可测量指纹。
运行 python3 code/main.py,期望输出:系统评分卡含原始准确率、里程碑达成、每任务成本、相对随机基线的差值,以及一条污染检查注记。
| 基准 | 测什么 | 关键发现 | 警示 |
|---|---|---|---|
| MARBLE | 星/链/树/图拓扑 + 里程碑 | 图型适合研究、链型适合编码 | ~4 Agent 协调税 |
| COMMA | 多模态非对称信息协调 | 前沿挣扎着打败随机 | 多模态协调欠训练 |
| MedAgentBoard | 四类医疗任务 | 多智能体多不压制单 LLM | 多数系统过度工程 |
| AgentArch | 工具 + 记忆 + 编排 | 隔离每层贡献 | 别买测不出价值的功能 |
| SWE-bench Pro | 41 仓库 1865 题,未污染 | 前沿约 23% vs Verified 70%+ | Verified 已污染,Pro 是把关测试 |
💡 心法:Verified 已污染,Pro 是把关测试;MedAgentBoard 证明多智能体常不压制单 LLM;COMMA 证明多模态协调还远未解决。 这三条加起来是 2026 评估层面的「清醒剂」——任何宣称多智能体优势的论文,都得先回答「比单 LLM 强吗、在未污染 split 上吗、算上成本吗」。
outputs/skill-benchmark-reader.md:读任何多智能体基准宣称并应用审查清单,输出一个评级与注意事项。
code/main.py,识别三个模拟系统里哪个每里程碑成本最佳。它与原始准确率最高的是同一个吗?下一节,也是本章收官——案例与 2026 前沿:精读三大生产级参考(Anthropic 研究系统、MetaGPT/ChatDev、OpenClaw/Moltbook),测绘 2026 框架版图,把贯穿全章的协调机制浓缩为可带走的工程心法。