1.3 收益矩阵与博弈树


文档摘要

1.3 收益矩阵与博弈树 本节摘要:定义齐备之后,本节解决"怎么写下来"的问题。收益矩阵记录同时行动,博弈树记录先后行动;两种记谱法之间存在明确的互换规则与失效边界,信息集概念是那把钥匙。掌握本节,你就掌握了全书静态部分与动态部分各自的语言。 一、收益矩阵:同时行动的快照 正常形式(也叫策略型)用一个三元组描述博弈:参与者名单、每人策略集、收益函数。当参与者只有两人且策略有限时,收益函数可以画成一张二维表——行是参与者甲的策略,列是乙的策略,每个格子里填一对收益。这张表是一张"快照":它假装所有人的决策在同一瞬间完成,谁也看不见谁的手势。 囚徒困境是标准示例。

1.3 收益矩阵与博弈树

本节摘要:定义齐备之后,本节解决"怎么写下来"的问题。收益矩阵记录同时行动,博弈树记录先后行动;两种记谱法之间存在明确的互换规则与失效边界,信息集概念是那把钥匙。掌握本节,你就掌握了全书静态部分与动态部分各自的语言。

一、收益矩阵:同时行动的快照

正常形式(也叫策略型)用一个三元组描述博弈:参与者名单、每人策略集、收益函数。当参与者只有两人且策略有限时,收益函数可以画成一张二维表——行是参与者甲的策略,列是乙的策略,每个格子里填一对收益。这张表是一张"快照":它假装所有人的决策在同一瞬间完成,谁也看不见谁的手势。

囚徒困境是标准示例。甲乙两名嫌疑人分开审讯,各自可选抵赖或认罪:

甲 \ 乙 乙抵赖 乙认罪
甲抵赖 各判 1 年 甲判 9 年,乙释放
甲认罪 甲释放,乙判 9 年 各判 6 年

读表的方式要形成肌肉记忆:甲比较同一列里的上下两行,乙比较同一行里的左右两格。给定乙抵赖,甲认罪(释放)优于抵赖(1 年);给定乙认罪,甲认罪(6 年)仍优于抵赖(9 年)。矩阵的用途正是支持这种"固定对方、扫描自己"的比较。

二、博弈树:先后行动的剧本

扩展形式把时间放回来。树由三类零件组成:决策节点(轮到谁了)、从节点伸出的分支(该参与者的可选行动)、终止节点(游戏结束,标注每个人的收益)。市场进入博弈是最小示例:潜在进入者先决定是否进入市场,在位者后决定是默许共存还是打价格战。画成树之后,分析方向与时间方向相反——从终局往根回推:在位者在"进入已发生"的节点上比较默许得 300 与价格战得 100,会选默许;进入者预判这一点,比较进入得 200 与不进入得 0,选择进入。这个回推操作就是逆向归纳,第三章的主题,这里只需要认出:矩阵做不了这件事,因为矩阵里没有"先后的承诺"。

图 1-2:同一情境的两种记谱对照

图 1-2:同一情境的两种记谱对照

三、互换规则与信息集

两个方向的不对称必须分清。从树到矩阵总是可行的:把每个参与者在各信息集的行动组合打包成"策略",矩阵立刻得到。从矩阵回到树却常常不行:同时行动博弈里的"策略"没有时间位置,硬画成树会凭空制造先后手,改变博弈本身。判断标准是信息集——树中若干被虚线圈起的决策节点,表示当事人分不清自己身处其中哪个节点。囚徒困境画成树时,乙的决策节点构成一个信息集(他听不见审讯室隔壁的声音);市场进入博弈里,在位者的节点自己就是一个信息集(他看得见进没进来)。信息集是第三章"不完美信息"的种子,此处先认脸。

两种记法的选型口诀可以压成一行:问"谁出手时知道什么"。若所有人出手时都不知道他人当下的选择,用矩阵;若存在明确的先后且后手能观察先手,用树;两者混合(先签合同再同时定价)就分层画,先树后矩阵。

四、案例推演:把进入威慑写成两种记法

背景。一家连锁便利店考虑进入一条只有一家老店的小街。进入需前期投入 100;进入后若老店维持原价,两家平分利润各得 200;若老店发动价格战,进入者只剩 50,老店从 400 跌到 100。老店对外放话:敢来就打价格战。

操作。先写矩阵版本:老店的"价格战承诺"若只是放话,则进入者的矩阵只有"进入、不进入"两行、老店"默许、价格战"两列。再写树版本:进入者先动,老店后动且观察进入与否。回推树:在"已进入"节点,老店价格战得 100、默许得 200,选默许;进入者预判默许,进入得 200、不进入得 0,选进入。

结果。树版本的预测是"进入发生、价格战不发生";矩阵版本若把老店的放话当真,可能得出"不进入"。两个记法给出不同结论。

解读。差异的根源是可信性:矩阵里"价格战"是一格承诺,树里它必须执行于"进入已成事实"的节点上,而在那个节点它已经无利可图。口头威胁撑不住回推检验——这就是 3.1 节将正式建立的子博弈精炼直觉,此处你已提前用肉眼看到了一次。

变式。若老店在进入前抢先投资一条自动补货线,价格战的成本从 300 降到 80,回推结论翻转,进入者留下;若进入者与老店在多个市场相遇,老店打一次价格战能在所有市场立威,重复互动再次改写结论。同一条小街,配上不同的时间与重复结构,就是第 3 章与第 6 章的导览片。

五、记法自查清单

写完矩阵或树之后,过一遍这份清单能拦住绝大多数记法事故。其一,策略与行动分清了吗:序贯博弈里"策略"必须覆盖所有信息集,写"如果进入则价格战"时,没进入分支的行动也要写全。其二,信息集画对了吗:同一信息集里的节点必须属于同一参与者,且他当时的观察完全一致。其三,格子读对方向了吗:甲总在列内比行,乙总在行内比列,混着读会把最优反应认反。其四,收益向量次序统一了吗:约定先甲后乙就全程不改,很多"悖论"只是两处次序不一致。其五,随机项写清归属了吗:自然行动的分支要标概率且概率和为一。

做一个两分钟的小练习把清单落地:把本节第四节的进入威慑改写成"老店先宣布价目表、进入者后决定"的版本。画树时你会发现信息集变了——进入者观察到价目表后再选,老店在"已进入"节点上不再需要信息集,而"承诺"的含义从口头变为可观察的结构。同一故事,两种树,预测不同:这就是记法不是排版,而是分析本身。

再做一步加固:给本节的第二种记法配上"行动树"的读法练习。取猜硬币博弈画一棵树——自然先给两枚硬币定面值,甲亮面,乙在不看甲动作的信息集里选面。树画完后问自己两个问题:乙的信息集里有几个节点(答案:两个,他分不清甲亮了哪面);这棵树压缩回矩阵后与第 2 章的猜硬币矩阵是否一致(答案:一致,且信息集对应了"同时出手"的假设)。做完这个练习你会发现,矩阵与树不再是两种需要背的记号,而是同一情境的两种取景——一个掐掉时间,一个保留时间但把看不见的地方圈起来。

本节要点回顾

  • 要点一:矩阵是同时行动的快照,支持"固定对方、扫描自己"的比较;树是先后行动的剧本,支持从终局回推。
  • 要点二:树可以压缩成矩阵,矩阵通常还原不成树;判断钥匙是信息集——当事人分不清自己身在哪些节点。
  • 要点三:选型口诀是问"谁出手时知道什么",混合情境分层画。
  • 要点四:进入威慑案例显示,同一情境在两种记法下预测可以不同,可信性问题藏在时间结构里。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U