2.1 纯策略与混合策略


2.1 纯策略与混合策略

本节摘要:本节是第二章的起点,解决"均衡长什么样"的问题。先学会用占优与劣策略剔除快速锁定确定结局,再面对确定策略无处可逃的情境——猜硬币式的博弈里,可预测本身就是损失,于是策略必须带上骰子。无差异条件是配平混合概率的万能钥匙,罚点球案例会把它完整走一遍。

第一章建好了记谱法,本节开始真正在矩阵上做分析:有些矩阵一眼见底,因为某格对一方是无论如何都不亏的选择;有些矩阵却让任何确定性选择都被人反制,唯一的出路是随机化。识别这两种局面,是全部静态分析的第一步。

一、占优与劣策略:先剔除再谈均衡

占优策略是这样一种选择:无论对手怎么做,它都比你的其他任何选择带来更高收益。囚徒困境里的认罪就是典型——对方抵赖,认罪更好;对方认罪,认罪还是更好。当所有参与者都有占优策略,博弈的结局毫无悬念,矩阵自解释。

更常用的工具是严格劣策略:对某参与者而言,无论对手怎么做,某策略都比另一策略收益更低——它就是该扔的废牌。反复剔除所有参与者的严格劣策略(简称反复剔除,英文缩写 IEDS),矩阵不断收缩;若最后只剩一格,这格就是唯一理性预测。要注意剔除的顺序不影响严格劣策略的结论,但会影响弱劣策略的结论——所以工程上只信赖严格剔除。

一个干净的小例子。甲有上、中、下三策,乙有左、右两策。给定乙出左,甲收益为上 4、中 2、下 1;给定乙出右,甲为上 0、中 2、下 1。甲的"下"在两种情形都不优于"中"(1 小于 2),被剔除;再看乙:给定甲出上,左 -3 右 -2;甲出中,左 2 右 0——乙的"右"两轮全输,被剔除;乙只剩左,甲在上与中之间选上(4 大于 2)。唯一解:甲上、乙左。没有用到任何均衡概念,纯粹的减法。

二、确定策略的陷阱:猜硬币的世界

可很多矩阵剔不动,也找不到互为最优反应的策略组合。最典型的是猜硬币:两人同时亮硬币,同面乙赢一文、异面甲赢一文。甲若总出正面,乙盯死正面;甲改总出反面,乙跟着换——任何确定性选择都会被针对。罚点球是同样的结构:射门方向完全被门将预判就是灾难," 出其不意"不是花哨,而是数学上的必需。

出路是混合策略:按概率在多个纯策略间随机化。直觉上要"不可预测",但均衡概率不是掷骰子随便定,而由一条精巧的条件锁死——无差异条件:在均衡中,让对手在你各纯策略之间的期望收益完全相同。道理在于,对手愿意随机化,恰恰说明他换哪个纯策略都一样好;若某个纯策略更赚,他就该全力押注那个,随机化即刻瓦解。你的混合概率不是为了让随机方自己满意,而是为了让对方"懒得动",从而被冻在原地。

三、罚点球:把配平完整算一遍

背景。射手与门门将同时决策:射手选左路或右路,门将扑同侧或异侧。射手角度刁钻时进球率高:门将扑错必进,扑对侧时若射手打右路进球率八成、打左路仅五成——假设打右路是惯用脚更顺的射门。

操作。写成矩阵,格中数字是射手的进球期望(零和视角下门将收益取负):

射手 \ 门将 扑左 扑右
射左 0.5 1
射右 1 0.8

设门将扑左的概率为 q。射手射左的期望进球 = 0.5q + 1(1 − q) = 1 − 0.5q;射右 = 1q + 0.8(1 − q) = 0.8 + 0.2q。无差异条件要求两者相等:1 − 0.5q = 0.8 + 0.2q,解得 q = 2/7 ≈ 0.286。对称地,设射手射左概率为 p,门将扑左的期望失球 = 0.5p + 1(1 − p) = 1 − 0.5p,扑右 = p + 0.8(1 − p) = 0.8 + 0.2p,相等解得 p = 2/7。

结果。均衡是:射手以约 28.6% 的概率打左路,门将也以约 28.6% 的概率扑左路,射手均衡期望进球约 0.857。惯用脚的优势没有让右路占比变成九成,只把概率从一半拉到八分之二点八六——优势策略会被适度多用,而非用尽。

解读。三点值得咀嚼。其一,你的最优混合概率只取决于对手的收益,不取决于你自己的收益——这是无差异条件的推论,初学者最容易反过来。其二,1990 年代以来对五大联赛数千次点球的统计研究发现,职业球员的实际射门与扑救频率同理论配平相当接近,且历史数据检验不出可利用的规律性——顶尖选手用职业生涯实现了均衡。其三,若规则允许射手第三种选择(中路),配平方程组扩成三元,均衡概率整体重排——策略集每扩一维,全部概率都要重算,混合均衡是全局解而非局部微调。

变式。把门将扑对右侧时射左路的进球率改低到 0.9,重解得 q = 1/7:对手某个策略变得更强,你在对侧的使用率就该上调。把进球率换成钱、把门将换成竞争对手,同样的算式直接适用于促销时点选择与产品发布日避撞。

图 2-1:无差异条件的几何表达

图 2-1:无差异条件的几何表达

四、程序验证与要点回顾

十行代码足以复演上面的配平,也方便你换参数做实验:

# 二乘二混合均衡:无差异条件数值解 # 射手收益矩阵 payoff[射手][门将] payoff = {"射左": {"扑左": 0.5, "扑右": 1.0}, "射右": {"扑左": 1.0, "扑右": 0.8}} def mix_2x2(a, b, c, d): """求射手策略使门将无差异:p 射左 a c 为门将扑左时射手两策略收益,b d 为扑右时""" # 射左期望 = 0.5... 这里直接解 1-0.5q = 0.8+0.2q 型方程 # 通用式:门将在 p 下的期望相等 => p*a + (1-p)*c = p*b + (1-p)*d return (d - c) / (a - b - c + d) p = mix_2x2(0.5, 1.0, 1.0, 0.8) # 返回射手射左概率 0.2857 print(f"均衡射左概率 = {p:.4f}")

顺带一提随机化的现实装置:均衡要求的是"对手无法预测",不必真掷骰子——职业选手靠节奏变化与身体假动作制造不可预测性,程序用伪随机数,采购部门用轮换表。真正的失败案例是伪随机可被推断的场景:对手一旦掌握你的历史序列,均衡概率再标准也会被针对,这解释了为什么高水平选手会刻意保留"无逻辑的手感"。

  • 要点一:占优策略一步定局,严格劣策略反复剔除是首选减法,两者都失灵才谈均衡。
  • 要点二:猜硬币类博弈里确定性选择必被反制,随机化是均衡的内在要求而非心理花招。
  • 要点三:无差异条件是配平钥匙——你的均衡概率由对手的收益决定,直觉相反时以公式为准。
  • 要点四:点球数据与理论配平的吻合,是博弈论预测力最著名的实证背书之一。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U