协商与讨价 本节摘要:Agent 之间协商资源、价格、任务分配与条款。2026 的基准集很清楚:NegotiationArena(arXiv:2402.05863)显示 LLM 能靠人格操纵(「 desperation」)把收益提升约 20%;「Measuring Bargaining Abilities」(arXiv:2402.15813)显示买方比卖方更难、且规模化帮不上忙——其 OG-Narrator(确定性报价生成器 + LLM 旁白)把成交率从 26.67% 拉到 88.88%;大规模自主协商赛(arXiv:2503.
本节摘要:Agent 之间协商资源、价格、任务分配与条款。2026 的基准集很清楚:NegotiationArena(arXiv:2402.05863)显示 LLM 能靠人格操纵(「 desperation」)把收益提升约 20%;「Measuring Bargaining Abilities」(arXiv:2402.15813)显示买方比卖方更难、且规模化帮不上忙——其 OG-Narrator(确定性报价生成器 + LLM 旁白)把成交率从 26.67% 拉到 88.88%;大规模自主协商赛(arXiv:2503.06416)跑了约 18 万次协商,发现隐瞒思维链的 Agent 靠向对手隐藏推理取胜;Bhattacharya 等 2025 在哈佛协商项目指标上排名:Llama-3 最有效、Claude-3 最激进、GPT-4 最公平。本节实现合同网协议(第 02 节的 FIPA 先祖),接一个 LLM 式买卖双方,跑一个 OG-Narrator 式分解,并测量成交率随每个结构选择如何变化。
阅读完本节,你应当能够:
两个 Agent 要就一个价格达成一致。让它们只靠纯语言提示自由发挥,2024~2026 的 LLM 成交率低得惊人(arXiv:2402.15813 在紧参数化的讨价中约 27%)。规模化修不了:GPT-4 在结构上并不比 GPT-3.5 更会讨价,它只是更会说讨价的话。
根子在 LLM 把两件事搅在一起——决定报价与叙述报价。OG-Narrator 把两者拆开:一个确定性的报价生成器算数值移动,LLM 只负责旁白。成交率跳到约 89%。
这呼应了一个经典多智能体发现:把机制与通信层解耦就能赢。 合同网协议(FIPA, 1996; Smith, 1980)就是参考的任务市场机制。把 LLM 插进旁白槽,就得到一个现代的、LLM 驱动的任务市场。
Smith 1980 的合同网协议:一个管理者(manager)广播征询提案(cfp);**投标者(bidders)**用含报价的 propose 消息回应;管理者挑出赢家,给赢家发 accept-proposal,给输家发 reject-proposal。赢家执行工作。可选消息:refuse(投标者拒绝提案)。FIPA 把它编纂为 fipa-contract-net 交互协议。
「Measuring Bargaining Abilities of Language Models」(arXiv:2402.15813)观察到:
OG-Narrator 的分解:
┌──────────────────┐ ┌──────────────────┐ 状态 → │ 报价生成器 │ 价格 → │ LLM 旁白 │ → 消息 │ (确定性) │ │ (写人话风格的 │ │ │ │ 伴随辞令) │ └──────────────────┘ └──────────────────┘
报价生成器是一个经典协商策略:Rubinstein 讨价模型、Zeuthen 策略,或简单的以牙还牙。LLM 负责旁白。消息里同时含确定性价格与自然语言包装。
成交率跳升,因为:价格留在协议区内;锚定是战略性的而非情绪化的;LLM 做它擅长的事——写。
arXiv:2402.05863 给出通用基准。头条发现:
这不是「LLM 不会协商」,而是「LLM 协商得太像人,包括可被剥削的部分」。
大规模自主协商赛(arXiv:2503.06416)跨多种 LLM 策略跑了约 18 万次协商。胜者向对手隐瞒自己的推理:
这是 2026 对经典博弈论(Aumann 1976 论理性与信息)的回响:暴露你的私人估值要付出代价。LLM 不会直觉到这一点,乐于在推理痕迹里打出自己的保留价,而这些痕迹对对手可见。
工程结论:把私有草稿区上下文与公开消息上下文分开。这不是可选项。
⚠️ 这是「协调难点在信息」的集中爆发——谁掌握了对方的保留价,谁就拿走剩余。LLM 天然倾向于在思维链里「自言自语」,而这段自言自语一旦流入公开通道,就把谈判筹码拱手送人。
在哈佛协商项目指标(原则性协商、BATNA 尊重、利益互惠)上:
这是 2025 的快照。要点不是 2026 年 4 月哪个模型赢,而是不同基座有持久的协商风格。异构集成(第 15 节)把这当作一种多样性来源。
合同网在 LLM 多智能体里的现代复用:
cfp。(price, eta, confidence),price 可以是 token、算力单元或美元。这能扩展过 100 个工人,因为协调是「广播-响应」而非同步聊天。生产中在用:Microsoft Agent Framework 的编排模式、部分 LangGraph 实现。
横贯所有 2024~2026 协商基准,一致的工程规则是:
让 LLM 旁白。别让 LLM 算报价。
若报价得是个数字(价格、ETA、数量),从协商状态确定性生成,让 LLM 产出包装。若报价得是个提案结构(任务分解、角色分配),让 LLM 起草,但发送前先按 schema 校验、做约束检查。
code/main.py 实现:
ContractNetManager、ContractNetTask、Bid——管理者 + 投标者,广播 cfp,收集提案,授标。og_narrator_bargain(state, rng)——OG-Narrator 买方:确定性的 Zeuthen 式让步,向中点逼近。seller_response(state, rng)——确定性的卖方还价策略(两种风格的共同结构真值)。naive_llm_bargain(state, rng)——模拟一个全 LLM 议价者:高方差地挑价格,常落到 ZOPA 外。def og_narrator_bargain(state, rng): # 确定性报价:向中点让步,不越 ZOPA midpoint = (state.buyer_max + state.seller_min) / 2 offer = state.last_offer + 0.5 * (midpoint - state.last_offer) offer = clamp(offer, state.buyer_min, state.buyer_max) narration = llm.narrate(offer, persona="professional buyer") # LLM 只写话 return {"price": offer, "message": narration}
设计要点:
offer完全由确定性策略决定,LLM 只触碰narration。这一道隔离是成交率从 ~65% 跳到 ~89% 的承重墙——把它拆掉、让 LLM 直接出价,你立刻回到「无意义价格 + 糟糕锚定」的困境。
运行 python3 code/main.py,期望输出:朴素 LLM 成交率约 6575%;OG-Narrator 约 8595%;这 15~25 个百分点的差距,就是把报价生成与旁白分解开的结构性优势。外加一个三投标者、一任务的合同网任务市场分配示例。
| 机制 | 报价由谁算 | 旁白由谁写 | 私有草稿区 | 成交率量级 |
|---|---|---|---|---|
| 朴素 LLM 议价 | LLM | LLM | 无(常泄露) | 6575% |
| OG-Narrator | 确定性生成器 | LLM | 显式分离 | 8595% |
| 合同网 + LLM 旁白 | 投标者确定性算 | LLM | 投标者各自私有 | 高(广播-响应) |
| 全 LLM 自由协商 | LLM | LLM | 无 | ~27%(紧参数) |
💡 心法:机制(数值)归确定性代码,话术(语言)归 LLM。 这条分工是所有现代 LLM 协商系统的公分母——违反它,你就回到「规模化也救不了」的低成交率。
outputs/skill-bargainer-designer.md:设计一个讨价协议——谁来生成报价(确定性还是 LLM)、谁来旁白、私有草稿区如何与公开消息分离、成交率如何被监控。
code/main.py,确认 OG-Narrator 在成交率上胜过朴素 LLM。胜多少?下一节,我们从结构化的任务团队转向开放世界里的涌现行为——Park 等 2023 的生成式 Agent 与 Smallville 沙盒,看记忆流、反思、计划三件套如何让一场情人节派对从无到有地涌现。