4.3 鞅与停时:公平博弈的数学


4.3 鞅与停时:公平博弈的数学

本节摘要:鞅是"条件期望等于当前值"的过程——下一刻的最优猜测就是此刻的值,公平博弈的精确数学化身。本节给出鞅、上鞅、下鞅的定义与判别法,证明可选停时定理的实用版本,用它一行解出赌徒破产的公平情形,并说明"停时"这个概念为什么是整个定义里最精巧的零件。

赌场里流传一句行话:"桌上的每一局都是公平的,输掉的是你停不下来的那只手。"这句话的数学版本就叫鞅论:单步看期望不变,但你可以选择什么时候离场——离场时机算不算一种优势?鞅论最漂亮的结果恰是回答:在合理规则下,不能靠挑选离场时机把公平博弈变成有利可图。本节把这句话论证到可以引用的程度。

鞅的定义与三种形态

设 {Xₙ} 是信息流 Fₙ 上的适应过程(Xₙ 的值在第 n 时刻可知)。称 Xₙ 为,若 E|Xₙ| 有限且对一切 n:

E[Xₙ₊₁ | Fₙ] = Xₙ

直观读法:拿到截至现在的全部信息后,下一刻的条件期望就等于当前值——现在就是最优预测,历史给不出任何改进。把等号换向就得到另外两种形态:大于等于号是下鞅(平均而言上涨,如支付保费前的赌徒优势局面),小于等于号是上鞅(平均而言下跌,如缴纳费用的市场)。

三个标准例子值得过一遍。其一,公平随机游走:每步加一或减一、概率各半,位置过程是鞅(第 3 章赌徒破产在 p = 0.5 时的资金过程就是它)。其二,指数鞅:exp(λW(t) − λ²t/2) 关于布朗运动是鞅——它是金融定价公式里"贴现因子"的雏形。其三,布朗运动本身是鞅,且是连续时间鞅的原型。

判别法常用三条:独立零均值增量之和是鞅(最常用);鞅的凸函数若 integrable 则凸函数过程是下鞅(詹森不等式的过程版);连续鞅的平方减其"二次变差"仍是鞅(W(t)² − t 是鞅——请记住这一条,4.5 节它就是修正项的出生证明)。

停时:把"离场时机"合法化

定义:随机变量 T(取值于时间集加无穷)称为停时,若对每个 n,事件 {T ≤ n} 只依赖截至 n 的信息。直观:决定"现在停不停"不能偷看未来

合法与非法的分界线要划清楚。合法:资金首次达到 100 元的时刻(看一眼账户就知道是否达标)、首次破产的时刻、首次涨跌满三格的时刻。非法:"预测下一次掷出六点的那个时刻""本局结束前最后一枚正面的时刻"——判定这些时刻是否到来需要未来的信息,它们不是停时。这条分界线在第 5 章算法交易与最优停止问题里会反复出现:任何策略只要能写成停时,就活在"合理规则"内。

可选停时定理:公平不会被时机打破

定理(实用版):设 Xₙ 是鞅,T 是有界停时(或满足适当可积性条件),则 E[X_T] = E[X₀]。

证明思路展示一下这个领域的手感:对有界停时 T ≤ N,把恒等式 X_T = X₀ + Σₖ (增量贡献,仅在 T ≥ k 时计入) 逐项取期望——每个条件期望项在鞅性下为零,只剩 X₀。关键技巧是"停时的指示变量在决策时刻已知"这一适应性的直接应用。

它值多少?第 3 章赌徒破产在公平情形(p = 0.5)下了大力气:首步分析、差分方程、特征根,最后得到达成概率 i/N 与期望时长 i(N − i)。现在用鞅语言重解一遍。资金过程 Mₙ 是鞅,T 为破产或达标的停时,则 E[M_T] = i。而 M_T 只取两个值:0(破产)或 N(达标),设达标概率为 u,则 i = N·u,一行得出 u = i/N。再对鞅 Mₙ² − n(也是鞅)用停时定理,一步得到期望时长 i(N − i)。第 3 章"半页纸的工程"在正确的视角下是"一行的体操"——工具等级决定推导长度,这是本教程反复想让你体感的事。

边界在哪里:定理不是万能支票。著名的"加倍策略"(输了就加倍下注,赢了收手)看似必赢,实际上要么资金有上限(等价于有限 N,回到赌徒破产模型,期望仍是零),要么允许无限负债——此时赌徒的财富过程不再是鞅可停时适用的情形,定理的前提被抽掉了。定理失效的地方,正是骗术生长的地方:凡是"稳赚策略",先检查它偷改了哪条前提,十有八九答案在可积性或有限性里。

数值实验:停时的期望确实是起点

import numpy as np rng = np.random.default_rng(31415) trials, N = 100_000, 100 # 实验:公平游走从 50 出发,T 为触 0 或触 100 的停时 finals = np.empty(trials) for k in range(trials): x = 50 while 0 < x < N: x += 1 if rng.random() < 0.5 else -1 finals[k] = x print(f"E[M_T] 模拟值 {finals.mean():.3f}(定理断言等于起点 50)") print(f"达标占比 {np.mean(finals == N):.4f}(定理推论 i/N = 0.50)") # 典型输出:均值 50.0x,占比约 0.500——公平博弈下任何合法停时都翻不了盘 # 对照:改用带手续费的"看似必赢"策略(每步固定扣 0.02),资金过程变上鞅 fee_finals = np.empty(trials) for k in range(trials): x = 50 while 0 < x < N: x += (1 if rng.random() < 0.5 else -1) - 0.02 fee_finals[k] = x print(f"含费用 E[M_T] 模拟值 {fee_finals.mean():.3f}(上鞅:期望低于起点)") # 典型输出:约 30 上下——费用把鞅打成上鞅,"离场时机"无力回天

第二组实验值得记住:手续费那么小(每步两分钱),长期期望却被拖低四成。金融里"成本忽略不计"的假设经不起鞅论的复利式拷问——上鞅的优势衰减不随时间摊薄,它按步数线性累积

鞅的现代岗位

停一停看看这套理论今天的岗位:金融定价的等价鞅测度(无套利 = 存在使折现价格为鞅的概率测度,期权定价公式的现代证明骨架);滤波理论的鞅刻画(噪声过程的最优估计残差是鞅——第 5 章卡尔曼滤波的信息论注脚);统计检验的鞅差分条件(回归诊断里"误差无自相关"的现代表述);以及算法博弈论中的"乘法权重是鞅"技巧。学鞅不是为了怀旧十七世纪的赌桌,而是因为"信息到达时如何公平记账"是无处不在的结构。

本节要点回顾

  • 鞅 = 条件期望恒等于现值:现在即最优预测;上鞅下鞅是它的倾斜版。
  • 停时 = 不偷看未来的决策时刻:合法性由信息流判定,不由意图判定。
  • 可选停时定理:有界(或条件合适的)停时下 E[M_T] = E[M₀],公平博弈无时机红利。
  • 赌徒破产的一行解:鞅 + 停时把第 3 章的半页推导压缩成一行。
  • 加倍策略的破产点:改前提才能改结论——检查可积性与有限性是排骗术的探雷器。
  • W(t)² − t 是鞅:下一节频域巡礼结束后,它将变成伊藤引理的修正项。

期望的账本理清了。下一节换到频率的账本:平稳过程与谱分析,看路径如何在频域里摊开。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U