3.2 方差、矩、偏度与峰度


3.2 方差、矩、偏度与峰度

本节摘要:方差 Var(X)=E[(X−EX)²] 度量围绕期望的散布,标准差回到原量纲;k 阶矩 E(Xᵏ) 是数字特征的总纲,标准化三阶矩(偏度)刻画不对称、标准化四阶矩(峰度)刻画厚尾。本节用"两策略对决"案例说明为何期望相同还要比方差,并给出用模拟估计四大画像数字的完整流程。

同样的期望,不同的命运

策略 A:每局稳赢 10 元。策略 B:各以一半概率赢 1010 元或输 990 元。两策略期望同为 10 元/局,但 B 的实际轨迹惨烈得多——连输几局就可能爆仓。区分它们的数字是方差:Var(X) = E[(X−EX)²],开方得标准差 σ 回到原单位。策略 A 方差为 0;策略 B 的方差 = 0.5×1000² + 0.5×1000² = 10⁶,标准差 1000 元。期望定价,方差定险——凯利公式、风险价值、夏普比率全都建立在这对搭档上。

方差的两个实用形式与性质:Var(X) = E(X²) − (EX)²(计算常用);Var(aX+b) = a²Var(X)(平移不变尺度平方)。标准化的随机变量 Z = (X−μ)/σ 期望 0 方差 1,是所有"标准化/ z 分数"操作的出处——之后假设检验里反复出现的"统计量标准化"全是这一步。

import numpy as np rng = np.random.default_rng(66) n = 200_000 A = np.full(n, 10.0) # 策略A 稳赢 B = np.where(rng.random(n) < 0.5, 1010.0, -990.0) # 策略B 大开大合 for name, s in [("A", A), ("B", B)]: print(f"策略{name}: 期望 {s.mean():8.1f} 方差 {s.var():10.0f}" f" 标准差 {s.std():7.1f}") # 100 局为一局的"局均"轨迹对比:方差在平均中被除以局数 for name, s in [("A", A), ("B", B)]: blocks = s[:n//100*100].reshape(-1, 100).mean(axis=1) print(f"策略{name} 每100局平均收益: 均值 {blocks.mean():6.2f}" f" 标准差 {blocks.std():6.2f}")

关键输出:单局标准差 A 是 0、B 是 1000;但按 100 局平均后 B 的标准差降到约 100(1000/√100)——独立求平均,波动按 1/√n 缩小,这是第 5 章大数定律与中心极限定理的定量预告。

矩与画像三件套

k 阶原点矩 E(Xᵏ)、中心矩 E((X−μ)ᵏ) 是数字特征的总纲:一阶矩是期望、二阶中心矩是方差。三阶与四阶标准化中心矩补齐分布画像:

  • 偏度 γ₁ = E((X−μ)³)/σ³:对称分布为 0;正偏(右尾长)如收入分布为正,负偏(左尾长)如考试成绩压缩分布为负
  • 峰度 γ₂ = E((X−μ)⁴)/σ⁴ − 3:以正态为基准 0;投资收益的尖峰厚尾(超额峰度为正)意味着极端日比正态预言的更常见——1987 年单日 −22% 的美股在正态假设下几乎不可能,正态假设该背锅
import numpy as np from scipy import stats rng = np.random.default_rng(4) # 三个分布同台:对称(正态)、右偏(指数)、厚尾(t分布 自由度3) data = { "正态": rng.normal(0, 1, 500_000), "指数": rng.exponential(1, 500_000), "t3": rng.standard_t(3, 500_000), } for name, x in data.items(): print(f"{name}: 期望 {x.mean():+.3f} 方差 {x.var():.3f} " f"偏度 {stats.skew(x):+.3f} 峰度 {stats.kurtosis(x):+.3f}") # 厚尾后果展示:|x|>4σ 的实际频率对比 for name, x in data.items(): z = (x - x.mean()) / x.std() print(f"{name}: |z|>4 实际频率 {abs(z).mean()*0+ (abs(z)>4).mean():.5f}" f" 正态理论 {2*stats.norm.sf(4):.2e}")

典型结果:正态偏度峰度都近 0;指数偏度约 +2;t(3) 峰度显著为正(理论上无穷),|z|>4 的实际频率比正态理论值高出两三个数量级。峰度不是"尖不尖"而是"尾厚不厚"——这是金融风控最常被误解的一个数字。

图 3-1 分布画像四数字:位置、散布、偏斜、尾部

图 3-1 分布画像四数字:位置、散布、偏斜、尾部

切比雪夫式的保守预告

在第 5 章严格化之前,先记住方差的一个普适约束(切比雪夫不等式预告):任何分布,落在期望 k 个标准差之外的概率不超过 1/k²。k=2 时不超过 25%、k=3 时不超过 11%。对正态实际只有 5% 与 0.3%,可见这个界很保守——但它的价值在"对任何分布都成立",不依赖形状假设。

import numpy as np rng = np.random.default_rng(77) x = rng.exponential(1, 1_000_000) # 换成任何分布试 mu, sd = x.mean(), x.std() for k in [2, 3]: actual = (abs(x - mu) > k*sd).mean() print(f"k={k}: 切比雪夫上界 {1/k**2:.3f} 实际 {actual:.3f}")

本节要点回顾

  • 方差度量围绕期望的散布,计算常用 Var = E(X²) − (EX)²,平移不变、尺度平方
  • 期望相同方差不同的赌局命运迥异:定价之外必须量险
  • 独立平均使波动按 1/√n 缩小:大数定律与标准误的定量伏笔
  • 偏度看不对称方向,峰度看尾部厚度而非峰尖:厚尾=极端值更常见
  • 切比雪夫界 1/k² 对任何分布普适:保守但无需形状假设
  • 标准化 (X−μ)/σ 贯穿全书:z 分数、检验统计量都是它

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U