本节摘要:重复博弈假设每一局一模一样,现实里规则会随历史漂移:鱼群越捞越少,产能越扩越过剩,信任存量随背叛流失。随机博弈把这种漂移写进状态变量,马尔可夫完美均衡把"理性"压缩为只看当前状态的最优反应。本节给出框架、均衡概念与渔业共管的完整数值案例,它是第 8 章环境与资源应用的数学底座。
随机博弈(stochastic game)由沙普利 1953 年提出,零件有五个:参与者、状态集、每个状态下各人的行动集、状态相关的收益函数、状态转移规则(当期大家的行动决定下期状态的概率分布)。每一期大家在当前状态下打一个阶段博弈,收益照发,状态按转移规则滚动。普通重复博弈是它的特例:只有一个状态。随机博弈的价值在于"压缩历史":博弈论并不需要记住完整的历史长链,状态变量把影响未来的历史全部打包——鱼存量、剩余产能、信任刻度、账户余额,都是把过去浓缩成一个数字的压缩器。
均衡概念也随之压缩。子博弈精炼要求策略在所有可能历史上最优,历史树在随机博弈里指数爆炸;马尔可夫完美均衡(MPE)只要求策略是当前状态的函数、且在每个状态下构成均衡——它把"以牙还牙式的记仇"排除在外(记仇依赖具体历史,不是状态的函数),换来两样东西:均衡存在性的证明容易得多(折现因子小于一时,沙普利证明零和随机博弈有值,后来的工作推广到一般博弈),以及计算的可行性——状态空间有限时,MPE 的求解是一个不动点问题,规模与状态数线性相关而非指数相关。
把策略限制在状态上,等于假设"过去只有通过状态才影响未来"。合理的场合很多:鱼群不在乎谁捞过它,产能不记得谁投的资。冒险的场合同样真实:人际关系恰恰记得"谁欠过谁"——声誉、信任、恩怨都是不在状态压缩器里的历史变量。使用 MPE 前必须回答一个问题:我要研究的现象,是否已经全部装进了状态?若是,MPE 是利器;若否,被压掉的历史正巧是现象本身,MPE 会系统性漏看。工程上的补救是把要紧的历史升格为状态——把"信誉分"设成状态变量,记仇就重新合法了,代价是状态空间膨胀。
MPE 与无名氏定理的关系也值得一句:压缩是有代价的。重复博弈里靠完整历史支撑的合作惩罚(触发策略)不是 MPE——它记住了"谁在什么时候背叛过"。因此 MPE 世界里的合作必须由状态内生的激励支撑:合作存量本身是状态,背叛让存量下降、未来共同收益缩水,理性的自我约束由此重生。这个"合作资本"的思想是理解自然资源与公地治理的钥匙。
背景。一片渔场由两条船共用,状态是鱼存量 k,可取高(H,存 100 吨)或低(L,存 40 吨)。每期各船选捕捞量:节制(捕 10)或狂捞(捕 25)。阶段收益是捕捞量乘鱼价(每吨 1),减去狂捞的额外燃油成本 3。状态转移:高存量下双方都节制,仍为高;任何一方狂捞,下期降为低。低存量下谁都狂捞则枯竭(收益永为零);低存量下双方节制,鱼群以半数概率恢复为高。
操作。把状态与行动的衔接写成转移表,随机博弈的骨架一目了然:
| 当前状态 | 双方行动 | 本期每船收益 | 下期状态 |
|---|---|---|---|
| 高存量 | 都节制 | 10 | 高存量 |
| 高存量 | 一方狂捞 | 狂捞 22,节制 10 | 低存量 |
| 低存量 | 都节制 | 10 | 各半概率升为高或维持低 |
| 低存量 | 有狂捞 | 狂捞 22,节制 10 | 走向枯竭 |
先看一次性诱惑:高存量下,给定对方节制,自己狂捞得 22 对节制的 10,当期诱惑 12。再看长期账:设 V(H)、V(L) 分别为高、低存量下的终身现值。双方都节制时 V(H) = 10 ÷ (1 − δ);动了狂捞念头的一方当期得 22,下期状态跌到低存量。低存量下双方节制的终身值满足 V(L) = 10 + δ × (0.5 × V(H) + 0.5 × V(L))。代入 δ = 0.8 解联立:V(H) = 10 ÷ 0.2 = 50;V(L) = 10 + 0.8 × (0.5 × 50 + 0.5 × V(L)),整理得 0.6 × V(L) = 30,解出 V(L) = 50。狂捞偏离的诱惑值 = 22 + 0.8 × V(L) = 22 + 40 = 62,大于守约值 10 + 0.8 × 50 = 50——节制在高存量下撑不住!除非给狂捞加价:若低存量状态的收益本身随合作改变,或引入外部执法罚金 F,需 F 至少填平 62 减 50 的 12 缺口。
结果。解出门槛:当且仅当罚金或合作资本损失不低于 12 时,"高存量节制"是 MPE 的一部分;否则均衡是"有鱼赶紧捞",资源加速枯竭。这个 12,就是制度的价值标尺。
解读。模型精确复刻了渔场的真实悲剧与转机:开放进入的渔场系统性过度捕捞;而当配额、休渔期或社区监督把狂捞的收益砍掉 12 以上,节制成为自我实施的均衡。列维坦式执法不是唯一解——本地社区的非正式监督(奥斯特罗姆的田野发现)等效于提高发现概率与罚金,同样能把均衡从枯竭推向共管。MPE 的另一个预言同样锋利:均衡对 δ 敏感,市场利率上升(未来更不值钱)会自动放松捕捞纪律——宏观金融环境与生态保护之间存在一条模型可算的传导线。
变式。把两条船换成 n 条,监督与制裁的组织成本进入罚金项,共管的门槛抬高;把状态连续化(存量任意实数),数值方法从解联立换成值函数迭代——9.2 节的模拟工具正是干这个的。随机博弈还统治着动态寡头(产能是状态)、搜索引擎竞价(质量分是状态)与气候谈判(累积排放是状态),换皮不换骨。
手算随机博弈可以流程化。第一步,冻结状态清单:列出所有会改变未来收益与规则的历史压缩量(存量、产能、信任刻度),检查每项是否真的"只在状态里影响未来"。第二步,猜值函数:对每个状态写出终身现值的自洽方程——本期阶段收益加折现后的下期状态值;低维离散状态用手算联立,连续状态猜线性或二次形态后代入验证。第三步,解不动点并核偏离:把每个状态下的最优选择代回去,求出各状态的值,再逐状态检查"单方面偏离是否更差"——渔业案例的三行联立就是这套流程的最小版本。工程上状态一旦超过几十个,手算让位于值函数迭代(9.2 的模拟工具),但流程骨架不变。养成先写状态清单再写方程的习惯,能拦住随机博弈建模里最常见的错——把影响未来的历史留在了状态之外。