3.1 序贯博弈与逆向归纳 本节摘要:本节把时间装进博弈树,正式建立回推分析法:从终局收益出发逐层倒推每个决策点的最优选择,由此得到子博弈精炼均衡。它会自动筛掉空头威胁,也会给出斯坦克伯格先行者优势的精确数值。蜈蚣博弈将展示这套方法最刺眼的一处裂缝——理论上正确与现实中发生可以背道而驰,这个裂缝是 3.3 节的引线。 一、从终点开始读剧本 序贯博弈的记法是第一章学过的博弈树,本节补上分析方向:时间顺流,推理逆流。逆向归纳的操作分三步:找到距离终点最近、且轮到某参与者的决策节点;假设博弈真走到了这里,让他选收益最高的分支;把这个选择的价值回填到上一层节点,当作上一层选择该分支的确定收益。逐层往根走,树根处留下的组合就是逆向归纳解。 这个解在概念上比纳什均衡更严。
本节摘要:本节把时间装进博弈树,正式建立回推分析法:从终局收益出发逐层倒推每个决策点的最优选择,由此得到子博弈精炼均衡。它会自动筛掉空头威胁,也会给出斯坦克伯格先行者优势的精确数值。蜈蚣博弈将展示这套方法最刺眼的一处裂缝——理论上正确与现实中发生可以背道而驰,这个裂缝是 3.3 节的引线。
序贯博弈的记法是第一章学过的博弈树,本节补上分析方向:时间顺流,推理逆流。逆向归纳的操作分三步:找到距离终点最近、且轮到某参与者的决策节点;假设博弈真走到了这里,让他选收益最高的分支;把这个选择的价值回填到上一层节点,当作上一层选择该分支的确定收益。逐层往根走,树根处留下的组合就是逆向归纳解。
这个解在概念上比纳什均衡更严。第二章的纳什均衡只要求"没有谁想单方面偏离整个策略计划",可动态博弈里的策略计划覆盖着永远不会到达的分支,计划上写着威胁,执行威胁的节点若真的到达,按威胁行事可能已经不理性——纳什均衡管不到那里。泽尔腾 1965 年提出的子博弈精炼均衡堵住这个漏洞:要求策略组合在每一个子博弈(从树上任何节点切下来的完整后续博弈)里都构成纳什均衡。在完美信息的有限树上,子博弈精炼与逆向归纳解重合,且必然是纳什均衡的子集——它是从纳什均衡集合里筛掉"空头威胁支撑的解"之后剩下的硬核。
背景。两家同质厂商,市场需求 p = 100 − Q,边际成本都是 20。区别只在先后:厂商 1 是在位龙头,公开宣布产量并先投产;厂商 2 观察到实际产量后再决定自己的产量。这不再是同时决策的古诺博弈,而是先后手博弈。
操作。先算后手的反应:给定先手产量 q₁,厂商 2 的利润 (80 − q₁ − q₂)·q₂ 对 q₂ 求导,得反应函数 q₂ = (80 − q₁) ÷ 2。再算先手:厂商 1 完全预见这个反应,把 q₂ 表达式代进自己的利润函数,得 π₁ = q₁·(80 − q₁ − (80 − q₁) ÷ 2) = q₁·(40 − q₁ ÷ 2)。对 q₁ 求导为零,解得 q₁ = 40,回代 q₂ = 20,市场价 40。利润:先手 40 × 20 = 800,后手 20 × 20 = 400。
结果。作为对照,同时行动的古诺均衡是两家各产 80 ÷ 3 ≈ 26.7,价约 46.7,各得约 711。先行者多产多占,利润 800 对 711;后手反而比古诺更惨,400 对 711。
解读。先行者优势的来源不是"动作快",而是承诺:先投产把产量变成既成事实,后手的反应函数被迫绕着事实转。数量竞争下大承诺可信(产能摆在那里收不回来),价格竞争下同样的逻辑会翻转成后手优势——先降价者把整个市场让给了跟随者,这是伯特兰序贯版的著名反差。承诺要有分量才有用,口头宣布产量而产能跟不上,回推时后手不会买账,均衡滑回古诺。这条"承诺改变收益矩阵,而非改变话语"的原则,是本章的总纲。
变式。把先后对调,厂商 2 成先手,800 与 400 对调——位置比身份重要。给先手加上产能成本,每单位承诺产能花 2 元,先手优势缩水到临界点以下,龙头会放弃公开承诺、伪装成同时行动;参数一动,结论跟着动,这正是要动手算而不是背结论的理由。

蜈蚣博弈的结构:一笔小钱放在桌上,轮到的人可以选择拿走大头结束游戏,或者传给对方让总额翻倍。六步之后总额 256。回推从终点开始:最后一步甲拿走 32 优于传出的 16,于是倒数第二步乙预判甲必拿,自己先拿 16 对 8……一路推回起点:甲第一步就拿走 2 结束游戏,两人总共只得 3。可行为实验(麦凯尔维与帕尔弗雷 1992 年的经典实验及其后的多轮复现)里,绝大多数对局合作到最后一步附近才有人动手,双方实际所得远高于回推解。
解读。裂缝不在数学而在前提:回推要求"理性是共同知识"在每一个节点都成立。可当对方真的传了一次,你面对的信息恰恰是"回推的前提可能不成立"——对手或是利他,或是算错,无论哪种,继续合作都比按原剧本背叛更赚。逆向归纳在前提被博弈自身推翻时没有自动纠错机制。工程上的态度是:回推适合作为基准线与威胁验伪器,而不是对真实人类行为的逐点预测;当对手可能偏离理性假设时,把"对手是非理性的概率"显式写进模型,就走到了 3.2 节的信念框架门口。
变式。把蜈蚣从六步砍到两步,实验与回推逐渐吻合——链短则共同知识假设勉强站得住;把收益换成对等分(最后一步传出可得 64 对 64),提前背叛的理由消失,合作率趋满。蜈蚣的教训因此有边界:它暴露的是"长链加非对等收益"下回推的脆弱,不是回推方法本身的失效。
斯坦克伯格与威慑的逻辑可以装进日常工具箱,四件装置各有清晰的博弈学身份。定金与违约金:事前押一笔钱在"违约就损失"的位置,把背叛的收益矩阵当场改写——它买断的是自己未来背叛的自由。公开截止期限:把"无限拖延"修剪成有限树,回推从此生效,拖延方的"再等等"失去藏身处,谈判学里"优惠到今晚"的走量术正是终点效应的营销化。分期投入:把一次性合作拆成连续小步,每步的背叛诱惑被下一步的预期合作对冲,重复结构替单次结构背书——工程里的里程碑付款干的就是这件事。自断退路:把退路的收益砍到低于前路(公开宣布、独家绑定、专有产线),先行者优势从可能变成必然,谢林说"束缚敌人的是自由,束缚自己的也是自由"。
使用这些装置前做一次可信性自检:装置的成本必须沉没在改变主意之前——可无条件撤销的"承诺"不是承诺,只是口气的升级。以及一句来自 3.3 的冷水:装置改变的是你自己的收益矩阵,对手若对你的成本结构没有信息,装置还须被观察到才有威慑力——公开性是承诺技术的隐藏部件。