1.2 随机变量与数字特征:期望方差的实操手册


1.2 随机变量与数字特征:期望方差的实操手册

本节摘要:随机变量是把样本点映射成实数的可测函数;期望、方差、协方差则是描述它的三件随身仪器。本节以计算为主线:分布律或密度函数如何求期望、线性性质何时可用、方差为何不能线性叠加、协方差矩阵怎么读。目标只有一个——让后面章节遇到的所有矩运算都不再卡手。

把随机变量想成一台"读数机":摇进去一个样本点,吐出来一个实数。骰子实验里它吐 1 到 6;一天的客流量实验里它吐非负整数;布朗粒子实验里它吐某个时刻的位置坐标。数字特征则是对这台机器读数行为的总结报告——期望报告平均读数,方差报告读数的散布幅度,协方差报告两台机器读数的联动关系。

先把期望算利索

离散情形按分布律加权求和:E[X] = Σ xᵢ·pᵢ,前提是级数绝对收敛。绝对收敛这个前提不是装饰:若级数条件收敛,求和顺序会影响结果,"平均"就失去了唯一性。重估某风控模型时曾见过反例——对重尾赔付分布直接套求和公式,正负项交错求和得到了一个"期望",换一种遍历顺序数值整整挪了一倍,原因是该分布的绝对值级数发散,期望根本不存在。算期望前先问存在性,是随机过程研究者的基本功——柯西分布、 Levy 分布的期望都不存在,套公式会得出荒谬结论。

连续情形换成积分:E[X] = ∫ x f(x) dx。初学者最容易犯的错是拿"最可能取的值"当期望。看一个反例:某系统寿命服从参数 λ = 1(单位:千小时)的指数分布,密度在零点最高,最容易"早夭",但期望是 1/λ = 1000 小时。两个数字描述的是不同侧面:众数说"单次抽签最可能的结果",期望说"大量抽签的平均水平"。可靠性工程里真正决定备件策略的是期望(长期总消耗),决定单次预警的是众数附近的行为——混淆两者会导致库存策略整体跑偏。

期望的线性性质是全册用得最频繁的定理:E[aX + bY] = a·E[X] + b·E[Y],无需独立。这一点值反复强调:第 5 章蒙特卡洛方法估计复杂期望,靠的就是把复杂随机变量拆成一堆指示变量的和,再用线性性质逐项求期望。指示变量技巧值得专门练一次——"至少一人中奖"的概率类问题里,设指示变量再求和,往往比直接排列组合快得多。

方差:散布的度量与它的非线性脾气

方差的定义 Var(X) = E[(X − E[X])²],等价计算式为 E[X²] − (E[X])²。第二条式子在手工计算里更常用,但要小心数值稳定性:当均值远大于标准差时,两个大数相减会吞掉有效数字,编程时优先用单遍算法或库函数。

方差的关键脾气是对和不线性:Var(X + Y) = Var(X) + Var(Y) + 2·Cov(X,Y)。只有当协方差为零时才能拆成两项。金融里"分散化降低风险"的整个逻辑就藏在这个加号后面:两只股票波动率各自很大,只要收益协方差是负的,组合方差可以远小于两者之和。反过来说,牛市场景里股票联动增强、协方差抬头,"按各自方差估的组合风险"会系统性偏低——2008 年金融危机中不少组合模型失效,这一项是主犯之一。

标准差 SD(X) = 方差开算术平方根,好处是与 X 同量纲。切比雪夫不等式把标准差变成概率的承诺:P(|X − μ| ≥ kσ) ≤ 1/k²。这个界很松,但它的价值在于不依赖分布形状——第 3 章证明收敛、第 5 章论证模拟精度时,都会用到这种"只看矩不看分布"的粗界。

协方差与协方差矩阵

Cov(X,Y) = E[(X − E[X])(Y − E[Y])],度量线性联动的方向与强度。相关系数 ρ = Cov(X,Y) 除以两个标准差之积,把量纲归一。三个常用事实要刻在脑子里:

事实 准确表述 常见误读
不相关 协方差为零 被误读为独立;不相关只排除线性联动
独立 联合分布可分解 独立确实蕴含不相关,反之不成立
相关系数范围 介于 -1 与 1 之间 只捕捉线性关系,对非线性联动可能视而不见

经典反例:设 X 服从区间 -1 到 1 上的均匀分布,Y = X²。X 与 Y 完全互相决定(一点都不独立),但 Cov(X, Y) = E[X³] − E[X]·E[X²] = 0。任何只盯相关系数的风控指标对这种"对称的曲线关系"都是瞎的。实践中处理办法是检查散点图,或对变量做变换后再看相关。

多元场景把协方差摆成矩阵:对角线放各分量的方差,非对角线放协方差。多元正态分布被均值向量与协方差矩阵完全决定——第 4 章的高斯过程本质就是"无穷维的多元正态",届时协方差矩阵升级成协方差函数,但读法不变:对角线是每个点的波动幅度,非对角线是不同点之间的联动。

条件分布:换一种信息状态再算一遍

有了事件 B 的信息,随机变量的分布要更新:离散情形 P(X = x | B) = P(X = x 且 B) / P(B);连续情形把分母换成密度、分子换成联合密度。条件期望 E[X | B] 就是按新分布重新加权的平均。全概率公式与贝叶斯公式是这个机制在"事件"层面的表现,第 1.3 节会把"条件化"升级成对整个 σ-代数的版本——那才是随机过程真正使用的形态。

⚠️ 一个高频错误:把 P(A | B) 与 P(B | A) 混写。疾病检测的标准题目里,"检出阳性时确实患病"的概率取决于患病率(基础比率),检测准确率再高也不能绕开基础比率直接谈。基础比率谬误不是智力问题,是条件概率方向感没练出来的问题——每写一个条件概率,先自问"给定了什么,求什么的分布"。

数值实验:用模拟核对方差公式

import numpy as np rng = np.random.default_rng(7) n = 500_000 X = rng.normal(loc=2.0, scale=1.5, size=n) # 均值2 标准差1.5 Y = 0.5 * X + rng.normal(loc=0.0, scale=2.0, size=n) cov = np.cov(X, Y) # 2x2 协方差矩阵 var_sum_direct = X.var() + Y.var() + 2*cov[0,1] # 按定义逐项加 var_sum_actual = (X + Y).var() # 直接算 X+Y 的方差 print(f"逐项拼装 Var(X+Y) = {var_sum_direct:.4f}") print(f"直接计算 Var(X+Y) = {var_sum_actual:.4f}") print(f"相关系数 corr = {cov[0,1]/(X.std()*Y.std()):.4f}") # 典型输出:两者在 6.7 附近几乎一致;相关系数约 0.35 # 把 Y 的系数 0.5 改成 -0.5 再跑,协方差翻负,组合方差显著小于 X 与 Y 方差之和

跑完第二组参数你会直观看到:负相关的两个波动源叠加,总波动反而被部分抵消。这就是"对冲"两个字的全部数学内容。

本节要点回顾

  • 期望存在性先行:级数或积分须绝对收敛;柯西分布、Lévy 分布没有期望。
  • 线性性质无条件成立:E[aX+bY] 无需独立,这是指示变量技巧与蒙特卡洛的支柱。
  • 方差对和不是线性的:中间那项 2 倍协方差,是分散化与对冲的数学本体。
  • 不相关不等于独立:Y = X² 的例子是照妖镜。
  • 协方差矩阵的读法:对角线看波动,非对角线看联动;高斯过程会把它推广成函数。
  • 条件概率先分清方向:给定了什么、求什么的分布,每写一次核对一次。

期望的下一个进阶形态——对"部分信息"取期望——正是下一节的主题,它是整本教程使用密度最高的单一工具。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U