6.1 有限与无限重复博弈


文档摘要

6.1 有限与无限重复博弈 本节摘要:本节把第 2 章的一次性矩阵原样复制多份连起来玩,结论却天翻地覆。有限次重复逃不出终点效应:最后一期人人背叛,倒推到第一期照样背叛。无限次(或没有人知道哪天结束)重复里,触发策略用未来的报复给今天的合作上保险,折现因子条件可代数求解;无名氏定理则揭示这套机制的威力与后遗症——几乎所有收益上说得通的结局都能成为均衡。巷口两家的价格战案例把全部计算走通。 一、终点效应:已知的最后一张牌必然砸锅 先把囚徒困境重复一百期,每期收益独立累加。用第 3 章的回推法看最后一期:没有明天,只有本期矩阵,背叛是占优选择。第一百期的背叛是共同知识,于是第九十九期的"合作换未来"无从谈起——本期背叛,往后的报复从已经注定背叛的部分里挤不出损失。回推逐期传染,第一期就背叛。

6.1 有限与无限重复博弈

本节摘要:本节把第 2 章的一次性矩阵原样复制多份连起来玩,结论却天翻地覆。有限次重复逃不出终点效应:最后一期人人背叛,倒推到第一期照样背叛。无限次(或没有人知道哪天结束)重复里,触发策略用未来的报复给今天的合作上保险,折现因子条件可代数求解;无名氏定理则揭示这套机制的威力与后遗症——几乎所有收益上说得通的结局都能成为均衡。巷口两家的价格战案例把全部计算走通。

一、终点效应:已知的最后一张牌必然砸锅

先把囚徒困境重复一百期,每期收益独立累加。用第 3 章的回推法看最后一期:没有明天,只有本期矩阵,背叛是占优选择。第一百期的背叛是共同知识,于是第九十九期的"合作换未来"无从谈起——本期背叛,往后的报复从已经注定背叛的部分里挤不出损失。回推逐期传染,第一期就背叛。这就是终点效应:确定的有限重复不能改变一次性博弈的均衡。

现实里合作却大量存在于"迟早会结束"的关系中。解释有两条。一是关系的终点不确定:只要每期以概率 p 延续,等效折现因子就是 p 乘时间偏好,博弈在数学上等价于无限重复——"不知道哪天散伙"与"永远不散伙"在激励上难以区分,这是本节全部结论的前提。二是参与者的行为偏离回推(3.3 节蜈蚣实验的老朋友):实验里有限重复囚徒困境的前期合作率相当可观,终点临近才塌方,理性假设与真实行为的边界再一次显形。

二、触发策略与折现条件:合作的保费怎么算

无限重复的标准支撑机制是触发策略:从合作开始;只要无人背叛就继续合作;一旦有人背叛,从此永远回到一次性均衡(互相背叛)。合作值与背叛值可以精确算出来。设每期合作各得 R = 3,互相背叛各得 P = 1,单方背叛者当期得 T = 5、被背叛者得 S = 0。合作的终身现值 = 3 ÷ (1 − δ);背叛的终身现值 = 5 + δ × 1 ÷ (1 − δ)(痛快一期,之后永堕均衡)。合作划算当且仅当 3 ÷ (1 − δ) 不小于 5 + δ ÷ (1 − δ),整理得 δ 不小于 (T − R) ÷ (T − P) = (5 − 3) ÷ (5 − 1) = 0.5。一句话:只要未来至少值未来的一半,没人舍得砸锅。

以牙还牙(第一步合作,之后照抄对方上一期的动作)比触发温和:报复可以终止,错误可以原谅。它在计算机锦标赛里的夺冠故事(9.2 节 Axelrod 锦标赛)说明"善良、可激怒、宽容、清晰"四性质的成功组合,但它在噪音环境里有致命伤:一次误判引发循环互咬,两支以牙还牙的队伍在 1% 的误动作率下会把大量回合浪费在互相惩罚上——噪声越大,越需要宽容变体(如"以牙还牙加宽恕")或触发式的确定性。

三、无名氏定理:合作可能,但挑选成了难题

触发逻辑的威力远超囚徒困境。无名氏定理说:在无限重复博弈里,只要折现因子足够接近一,任何"每期收益不低于一次性均衡水平"的可行收益向量都能成为均衡——不只合作,五花八门的分配、轮换、罚金安排统统可以。这是祝福:理论解释了行会规矩、商业信用、互惠网络的存在。也是灾难:均衡太多了,理论说不清实际落在哪一个。收尾这份解释责任的是三件历史性的东西——惯例(先例当聚焦点)、声誉(对手对你类型的怀疑,见 3.3)、以及制度(把某个均衡写进规则)。理解重复博弈的人不会问"合作为什么可能",会问"这么多均衡里,为什么是这一个"。

图 6-1:合作可行域——折现因子划出的边界

图 6-1:合作可行域——折现因子划出的边界

四、案例推演:巷口双店的定价默契

背景。两家杂货店在同一条街对门经营,每期(一个月)各自定价:默契高价各赚 8000,价格战互咬各赚 5000,单方偷偷降价抢客者当期赚 12000、对方剩 3000。这是一次性的囚徒困境数字(R 等于 8000,P 等于 5000,T 等于 12000,S 等于 3000)。两家都在本街长住,社区关系稳定。

操作。套触发条件:δ 不小于 (T − R) ÷ (T − P) = (12000 − 8000) ÷ (12000 − 5000) = 4000 ÷ 7000 ≈ 0.571。若店主的时间偏好对应月折现 0.9(月息视角下下月利润很值钱),合作成立;换算成"预期共存期"——若每月有 95% 概率继续经营(搬迁、转行概率 5%),等效 δ ≈ 0.9 × 0.95 = 0.855,仍高于 0.571,默契价稳。

结果。现实中这类街市默契价确实常见,直到拆迁公告贴出:存续概率从 95% 跌到 50%,等效 δ 掉到 0.45,低于临界值——公告贴出当月,街市价格默契崩盘、互相砸价清库存。模型精确预言了崩盘的时点:不在物理关门日,而在"预期存续时长跌破临界"的那个月。

解读。三点迁移价值。其一,临界条件的分子是背叛诱惑、分母是未来分量——管理合作,要么降 T(让偷降价的价差变小,比如透明的价格公示),要么升 δ(加长合约期、提高转换成本、深耕社区)。其二,触发策略的"永世不得超生"过于狠辣,商人们实际用的是有期抵制(惩罚若干月后恢复),理论上有期惩罚在噪音环境下更稳健,且同样满足支撑条件。其三,无名氏定理的多重均衡病在此现形:高价默契与低价比拼都是均衡,落在哪一个由街区历史与先例决定——这也是为什么"新进入者"往往是价格默契的破坏者:他不在旧均衡的声誉网络里。

变式。若降价行为可以被立即发现(线上比价时代),惩罚当期生效,合作区扩大;若价格保密(大客户私下折扣),诱惑 T 变大而发现概率变小,临界 δ 上升,默契更难维持。信息流速是重复博弈里最值钱的参数——商业史上的信用中介(商会、评级、平台评分)本质上都是 T 与 δ 的改造器。

本节要点回顾

  • 要点一:已知的有限重复因终点效应无法支撑合作,合作的舞台是"没有已知终点的重复"。
  • 要点二:触发策略的支撑条件 δ 不小于 (T − R) ÷ (T − P),分子是背叛诱惑,分母是未来的分量。
  • 要点三:无名氏定理展示了重复机制的强大与含糊:一切可行且理性的收益向量皆可为均衡,挑选靠惯例、声誉与制度。
  • 要点四:巷口双店案例演示了把存续概率折进 δ 的算法,并预言了"拆迁公告日即价格默契崩盘日"。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U