本节摘要:长程自主 Agent(METR 从 1 小时到 8 小时的工作曲线)需要经济能动性。新兴的五层栈是:DePIN(物理算力)→ 身份(W3C DID + 声誉资本)→ 认知(RAG + MCP)→ 结算(账户抽象)→ 治理(Agentic DAO)。生产级 Agent 激励网络包括 Bittensor(TAO 子网奖励任务专属模型)、Fetch.ai / ASI Alliance(ASI-1 Mini LLM + FET token)、Gonka(把算力重新分配给生产性 AI 任务的 transformer PoW)。学术上:AAMAS 2025 的去中心化 LaMAS 用 Shapley 值功劳归属公平奖励贡献 Agent;Google Research 的「面向大模型的机制设计」提出在单调聚合下的 token 二价拍卖。本节搭一个最小的 Agent 市场,对一个多智能体流水线应用 Shapley 值功劳归属,并跑一场二价 token 拍卖,让博弈论机器具体落地。
阅读完本节,你应当能够:
当 Agent 联合产出价值却需被单独奖励时,多智能体系统就变复杂了。经典机制——均分、最后贡献者通吃——不公平或可被博弈。基于联盟的 Shapley 值奖励构造性公平,但计算昂贵。2025~2026 文献推进了实用近似:Shapley 采样、单调聚合拍卖、从确认贡献累积的链上声誉。
功劳归属之外,这一领域转向了真实的经济型 Agent:Bittensor 的 TAO 奖励挖矿算力去微调子网专属模型;Fetch.ai/ASI 用 FET token 奖励 ASI-1 Mini LLM 的使用;Gonka 把 transformer 工作量证明重新导向生产性 AI 任务。自主交易的 Agent 今天已存在;问题是如何对齐激励。
本节把 Agent 经济当作一个具体问题族——功劳归属、机制设计、声誉——用最少的数学搭出每一个,让想法生根。
并非每个生产系统都用全五层:Bittensor 用 1、2、部分 3、部分 4、无 5;OpenAI Agent 除 3 外都不用。栈是参考地图,不是要求。
三者截至 2026 年 4 月都是生产级。收益分配不同:Bittensor 按子网验证者奖励质量;Fetch 按付费用户衡量的效用;Gonka 按可验证推理工作。
三个 Agent 协作一个任务,输出打 0.8 分。谁贡献了什么?
Shapley 值:满足四公理(效率、对称、线性、空玩家)的唯一功劳分配。对 Agent i:
shapley(i) = (1/N!) * Σ_{所有排列 O} (v(S_i_O ∪ {i}) - v(S_i_O))
其中 S_i_O 是排列 O 中 i 之前的 Agent 集合。实践:枚举所有排列,记录每个 Agent 在每个排列里的边际贡献,取平均。N=3 有 6 个排列,N=10 有 360 万——所以实践中采样排列而非枚举。
Google Research(「面向大模型的机制设计」)提出用二价 token 拍卖聚合 LLM 输出。设定:N 个 Agent 各提一个补全,各有一个被选中的私人估值;拍卖者选最高估值提案,付第二高估值。在单调聚合下(价值取决于选哪个提案,不取决于投了多少),这是真实的——Agent 报真实估值无激励偏离。
这对 LLM 系统的意义:你可把补全任务外包给多个不同定价的 Agent,拍卖选最优 + 公平付费,Agent 无激励误报。
绑定到 DID 的声誉分从确认贡献累积。一个简单更新规则:
rep(i, t+1) = alpha * rep(i, t) + (1 - alpha) * contribution_quality(i, t)
衰减因子 alpha 接近 1。声誉:对路由决策读取便宜(「把难任务发给高声誉 Agent」);伪造昂贵(随时间累积,绑 DID);可罚没(未通过验证的贡献扣分)。
LaMAS 提案(AAMAS 2025)结合:DID 身份、Shapley 值功劳归属、简单拍卖机制。关键论断:把功劳归属步骤去中心化,使系统可审计、免疫单点操纵。
⚠️ 这是「协调难点在激励」的集中体现——机制设计的全部难处在于「让说真话成为占优策略」。任何功劳函数一旦可被博弈,就会被博弈;上线前必须做对抗测试,否则女巫与操纵会把系统吃空。
开放网络且运营者异质(无单团队控制全部 Agent);输出可验证(无验证则功劳归属是猜);长程工作流(一次性任务不受益于声誉累积);代币化支付在你司法辖区合法可行。封闭的企业系统里,经济让位给更简单的分配(管理者派活、指标是内部的)。
code/main.py 实现:
shapley(value_fn, agents)——小 N 下靠枚举的精确 Shapley。second_price_auction(bids)——真实机制,赢家付第二高价。Reputation——DID 绑定、带指数衰减与罚没的声誉。def shapley(value_fn, agents): n = len(agents); credits = {a: 0 for a in agents} for perm in permutations(agents): prefix = [] for a in perm: without = value_fn(prefix) with_a = value_fn(prefix + [a]) credits[a] += (with_a - without) # 边际贡献 prefix.append(a) return {a: v / math.factorial(n) for a, v in credits.items()} def second_price_auction(bids): # bids: {agent: value} ranked = sorted(bids.items(), key=lambda x: -x[1]) winner, highest = ranked[0] second = ranked[1][1] if len(ranked) > 1 else 0 return winner, second # 赢家付第二高价,真实报价无激励偏离
设计要点:二价拍卖的承重性质是「真实性」——赢家付第二高价而非自己的报价,使每个 Agent 的占优策略都是报真实估值。把付款改成「付自己的报价」(一价),立刻退化为「该低报以少付」的博弈泥潭。Shapley 同理:边际贡献的全排列平均,是同时满足四公理的唯一分配。
运行 python3 code/main.py,期望输出:各 Agent 的 Shapley 值;拍卖结果展示真实报价均衡;声誉加权路由在预热后比随机高 10~20% 质量。
| 机制 | 承重性质 | 适用 | 代价 |
|---|---|---|---|
| 均分/最后贡献者 | 简单 | 一切 | 不公平/可博弈 |
| Shapley 值 | 满足四公理的唯一分配 | 小 N 精确、大 N 采样 | 计算昂贵(N! 或采样) |
| 二价拍卖 | 单调聚合下真实 | 外包补全、任务槽 | 需单调聚合假设 |
| 声誉资本 | DID 绑定 + 衰减 + 罚没 | 长程、路由 | 预热期、调衰减 |
| TAO/FET/Gonka | 子网/效用/可验证工作 | 开放网络 | 监管悬顶 |
💡 心法:先声誉,后 token。 声誉便宜、单独就有价值、且不引入法律与经济复杂度;token 在你已验证声誉机制有效、且司法辖区允许后才加。颠倒顺序是常见的过度工程。
outputs/skill-economy-designer.md:设计一个最小的 Agent 经济——身份层选择、功劳归属机制、付款机制、声誉规则。
code/main.py,确认 Shapley 值之和等于总价值(效率公理)。改价值函数,Shapley 分配是否按预期方向变?下一节,我们从理论机制转向生产硬仗——生产扩展:队列、检查点、持久执行,看 LangGraph 运行时如何让任何工作器在任何崩溃后恢复任何运行,以及为何「FastAPI + Postgres、别的不要」常常就够了。