协商与讨价


文档摘要

协商与讨价 本节摘要:Agent 之间协商资源、价格、任务分配与条款。2026 的基准集很清楚:NegotiationArena(arXiv:2402.05863)显示 LLM 能靠人格操纵(「 desperation」)把收益提升约 20%;「Measuring Bargaining Abilities」(arXiv:2402.15813)显示买方比卖方更难、且规模化帮不上忙——其 OG-Narrator(确定性报价生成器 + LLM 旁白)把成交率从 26.67% 拉到 88.88%;大规模自主协商赛(arXiv:2503.

协商与讨价

本节摘要:Agent 之间协商资源、价格、任务分配与条款。2026 的基准集很清楚:NegotiationArena(arXiv:2402.05863)显示 LLM 能靠人格操纵(「 desperation」)把收益提升约 20%;「Measuring Bargaining Abilities」(arXiv:2402.15813)显示买方比卖方更难、且规模化帮不上忙——其 OG-Narrator(确定性报价生成器 + LLM 旁白)把成交率从 26.67% 拉到 88.88%;大规模自主协商赛(arXiv:2503.06416)跑了约 18 万次协商,发现隐瞒思维链的 Agent 靠向对手隐藏推理取胜;Bhattacharya 等 2025 在哈佛协商项目指标上排名:Llama-3 最有效、Claude-3 最激进、GPT-4 最公平。本节实现合同网协议(第 02 节的 FIPA 先祖),接一个 LLM 式买卖双方,跑一个 OG-Narrator 式分解,并测量成交率随每个结构选择如何变化。

学习目标

阅读完本节,你应当能够:

  1. 说明为何「让 LLM 既算报价又写话术」是成交率低下的根因,以及 OG-Narrator 分解为何把成交率从约 27% 拉到约 89%。
  2. 复述合同网协议(Contract Net Protocol)的 cfp/propose/accept/reject 消息流,及其在现代 LLM 任务市场中的复用方式。
  3. 应用「让 LLM 旁白,别让 LLM 算报价」这条横贯所有 2024~2026 协商基准的工程铁律。
  4. 实现私有草稿区(scratchpad)与公开消息通道的隔离,说明思维链隐瞒为何是制胜策略。
  5. 识别不同基座模型持久的协商风格(激进/公平/有效),并把其作为异构集成(第 15 节)的多样性来源。

一、问题与直觉

两个 Agent 要就一个价格达成一致。让它们只靠纯语言提示自由发挥,2024~2026 的 LLM 成交率低得惊人(arXiv:2402.15813 在紧参数化的讨价中约 27%)。规模化修不了:GPT-4 在结构上并不比 GPT-3.5 更会讨价,它只是更会讨价的话。

根子在 LLM 把两件事搅在一起——决定报价叙述报价。OG-Narrator 把两者拆开:一个确定性的报价生成器算数值移动,LLM 只负责旁白。成交率跳到约 89%。

这呼应了一个经典多智能体发现:把机制与通信层解耦就能赢。 合同网协议(FIPA, 1996; Smith, 1980)就是参考的任务市场机制。把 LLM 插进旁白槽,就得到一个现代的、LLM 驱动的任务市场。

合同网,一段话讲清

Smith 1980 的合同网协议:一个管理者(manager)广播征询提案(cfp);**投标者(bidders)**用含报价的 propose 消息回应;管理者挑出赢家,给赢家发 accept-proposal,给输家发 reject-proposal。赢家执行工作。可选消息:refuse(投标者拒绝提案)。FIPA 把它编纂为 fipa-contract-net 交互协议。

为何 OG-Narrator 赢

「Measuring Bargaining Abilities of Language Models」(arXiv:2402.15813)观察到:

  • LLM 常违反讨价规则(报出无意义的价格、无视对方的协议可能区 ZOPA)。
  • 锚定很差(接受糟糕的首报价;以象征性而非战略性金额还价)。
  • 单靠规模化修不了——更大的模型用相似的战略错误产出更像样的语言。

OG-Narrator 的分解:

┌──────────────────┐ ┌──────────────────┐ 状态 → │ 报价生成器 │ 价格 → │ LLM 旁白 │ → 消息 │ (确定性) │ │ (写人话风格的 │ │ │ │ 伴随辞令) │ └──────────────────┘ └──────────────────┘

报价生成器是一个经典协商策略:Rubinstein 讨价模型、Zeuthen 策略,或简单的以牙还牙。LLM 负责旁白。消息里同时含确定性价格与自然语言包装。

成交率跳升,因为:价格留在协议区内;锚定是战略性的而非情绪化的;LLM 做它擅长的事——写。

NegotiationArena 的发现

arXiv:2402.05863 给出通用基准。头条发现:

  • LLM 能靠采用人格(「我急着在周五前卖掉这个」)把收益提升约 20%——人格操纵是真实战术。
  • 公平/合作的 Agent 被对抗性 Agent 剥削;防御需要显式的反向姿态。
  • 对称配对在约 40% 的基准场景上收敛到不平等结果。

这不是「LLM 不会协商」,而是「LLM 协商得太像人,包括可被剥削的部分」。

思维链隐瞒

大规模自主协商赛(arXiv:2503.06416)跨多种 LLM 策略跑了约 18 万次协商。胜者向对手隐瞒自己的推理:

  • 若一个 Agent 在公开可见的草稿区里打出「我只会出到 75 美元;我的保留价是 70 美元」,对手就读到了。
  • 胜者私下算策略;输出通道只含报价与最少的必要旁白。

这是 2026 对经典博弈论(Aumann 1976 论理性与信息)的回响:暴露你的私人估值要付出代价。LLM 不会直觉到这一点,乐于在推理痕迹里打出自己的保留价,而这些痕迹对对手可见。

工程结论:把私有草稿区上下文与公开消息上下文分开。这不是可选项。

⚠️ 这是「协调难点在信息」的集中爆发——谁掌握了对方的保留价,谁就拿走剩余。LLM 天然倾向于在思维链里「自言自语」,而这段自言自语一旦流入公开通道,就把谈判筹码拱手送人。

Bhattacharya 等 2025——模型排名

在哈佛协商项目指标(原则性协商、BATNA 尊重、利益互惠)上:

  • Llama-3 最会成交(成交率 + 收益)。
  • Claude-3 最激进(高锚、晚让步)。
  • GPT-4 最公平(配对间收益方差最小)。

这是 2025 的快照。要点不是 2026 年 4 月哪个模型赢,而是不同基座有持久的协商风格。异构集成(第 15 节)把这当作一种多样性来源。

经合同网 + LLM 做任务分配

合同网在 LLM 多智能体里的现代复用:

  1. 管理 Agent 把任务拆成单元。
  2. 向工人 Agent 广播带任务描述的 cfp
  3. 每个工人返回一个报价:(price, eta, confidence),price 可以是 token、算力单元或美元。
  4. 管理者挑赢家(单个或多个,视任务而定)并授标。
  5. 落选工人可自由竞标其他任务。

这能扩展过 100 个工人,因为协调是「广播-响应」而非同步聊天。生产中在用:Microsoft Agent Framework 的编排模式、部分 LangGraph 实现。

「旁白 vs 机制」铁律

横贯所有 2024~2026 协商基准,一致的工程规则是:

让 LLM 旁白。别让 LLM 算报价。

若报价得是个数字(价格、ETA、数量),从协商状态确定性生成,让 LLM 产出包装。若报价得是个提案结构(任务分解、角色分配),让 LLM 起草,但发送前先按 schema 校验、做约束检查。

二、从零实现

code/main.py 实现:

  • ContractNetManagerContractNetTaskBid——管理者 + 投标者,广播 cfp,收集提案,授标。
  • og_narrator_bargain(state, rng)——OG-Narrator 买方:确定性的 Zeuthen 式让步,向中点逼近。
  • seller_response(state, rng)——确定性的卖方还价策略(两种风格的共同结构真值)。
  • naive_llm_bargain(state, rng)——模拟一个全 LLM 议价者:高方差地挑价格,常落到 ZOPA 外。
  • 测量:1000 次试验的成交率,每次试验重新采样保留价。

OG-Narrator 的确定性核心

def og_narrator_bargain(state, rng): # 确定性报价:向中点让步,不越 ZOPA midpoint = (state.buyer_max + state.seller_min) / 2 offer = state.last_offer + 0.5 * (midpoint - state.last_offer) offer = clamp(offer, state.buyer_min, state.buyer_max) narration = llm.narrate(offer, persona="professional buyer") # LLM 只写话 return {"price": offer, "message": narration}

设计要点:offer 完全由确定性策略决定,LLM 只触碰 narration。这一道隔离是成交率从 ~65% 跳到 ~89% 的承重墙——把它拆掉、让 LLM 直接出价,你立刻回到「无意义价格 + 糟糕锚定」的困境。

运行 python3 code/main.py,期望输出:朴素 LLM 成交率约 6575%;OG-Narrator 约 8595%;这 15~25 个百分点的差距,就是把报价生成与旁白分解开的结构性优势。外加一个三投标者、一任务的合同网任务市场分配示例。

三、框架对比

机制 报价由谁算 旁白由谁写 私有草稿区 成交率量级
朴素 LLM 议价 LLM LLM 无(常泄露) 6575%
OG-Narrator 确定性生成器 LLM 显式分离 8595%
合同网 + LLM 旁白 投标者确定性算 LLM 投标者各自私有 高(广播-响应)
全 LLM 自由协商 LLM LLM ~27%(紧参数)

💡 心法:机制(数值)归确定性代码,话术(语言)归 LLM。 这条分工是所有现代 LLM 协商系统的公分母——违反它,你就回到「规模化也救不了」的低成交率。

四、可复用产物

outputs/skill-bargainer-designer.md:设计一个讨价协议——谁来生成报价(确定性还是 LLM)、谁来旁白、私有草稿区如何与公开消息分离、成交率如何被监控。

五、练习

  1. 跑基准:运行 code/main.py,确认 OG-Narrator 在成交率上胜过朴素 LLM。胜多少?
  2. 人格操纵:实现 arXiv:2402.05863 的人格式收益提升——买方只在旁白里采用「这周必须买到」的人格,报价生成器不变。成交率或收益变化了吗?
  3. 思维链隐瞒:维护一个不传给对手的私有草稿区字符串。若你意外泄露(模拟方式:互换两个通道),会发生什么?
  4. N 投标者拍卖:把合同网扩展成带保留价的 N 投标者拍卖。当所有报价都超保留价时,管理者如何在最低价与最高质量间抉择?你选哪种授标规则,为什么?
  5. 读 Bhattacharya 2025:读哈佛协商项目指标那篇,实现两个不同风格(激进 vs 公平)的议价者。测量对称与不对称配对下的收益方差。

本节要点回顾

  1. 根子在搅混两件事:LLM 既算报价又写话术,是成交率低下的根因;规模化只改善语言,不改善战略错误。
  2. OG-Narrator 分解:确定性报价生成器 + LLM 旁白,把成交率从约 27% 拉到约 89%。
  3. 合同网是参考机制:cfp/propose/accept/reject,广播-响应,可扩展过 100 工人。
  4. 思维链隐瞒制胜:大规模赛胜者把私有草稿区与公开通道分离,不暴露保留价。
  5. 私有草稿区非可选:LLM 天然在推理里「自言自语」,流入公开通道就送出筹码。
  6. 铁律——让 LLM 旁白,别让它算报价:数字归确定性代码,话术归 LLM。
  7. 不同基座有持久协商风格:Llama-3 最有效、Claude-3 最激进、GPT-4 最公平,是异构集成的多样性来源。
  8. 工程护栏:分离草稿区、确定性报价、schema 校验、有界轮数(3~5 轮)、持续测成交率与收益方差。

下一节,我们从结构化的任务团队转向开放世界里的涌现行为——Park 等 2023 的生成式 Agent 与 Smallville 沙盒,看记忆流、反思、计划三件套如何让一场情人节派对从无到有地涌现。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U