1.4 随机过程的定义:有限维分布与样本路径


1.4 随机过程的定义:有限维分布与样本路径

本节摘要:随机过程是一族带时间索引的随机变量,但这个定义有两张等价的面孔——有限维分布族与样本路径。本节给出正式定义,比较两种视角各自擅长回答的问题,用一段仿真代码画出多条样本路径,并解释为什么 Kolmogorov 延拓定理是整个学科的存在性保票。

一个反例可以立刻暴露初等概率论的边界:抛一枚硬币一次,正面记 1、反面记 0,初等概率论应付自如。现在改成抛无数次,把每次结果记成序列,问"序列中 1 的占比是否收敛到二分之一"。这个问题里没有单独的"某个随机变量"是主角,主角是整条无穷序列——一个随机函数。任何只处理有限个随机变量的工具箱在这里都不够用,必须给"一族随机变量"建立语法。这套语法就叫随机过程。

正式定义与两个坐标系

定义:设 T 是参数集(通常取非负实数或非负整数),对每个 t 属于 T,X_t 是同一概率空间上的随机变量,则族 {X_t, t 属于 T} 称为随机过程。

这个定义本身平淡无奇,力量全在两种读法里:

读法一:固定时刻,横切。取定 t₀,X_t₀ 是一个普通随机变量,有分布、有期望、有方差。把所有时刻的分布叠起来,得到"一维分布族";任取有限个时刻 t₁ 到 tₖ,(X_t₁, …, X_tₖ) 有联合分布,这构成有限维分布族。问题:哪些有限维分布族能拼成一个合法的过程?Kolmogorov 延拓定理回答:只要这族分布满足相容性(边缘分布对得上),就存在一个概率空间把它们全部实现。这张保票让研究者可以放心地"先写分布、后造过程"——高斯过程、第 4 章的布朗运动,都是先给出相容的有限维分布再被构造出来的。

读法二:固定样本点,纵切。取定一次实验结果 ω,映射 t 到 X_t(ω) 是 T 上的普通函数——这便是样本路径。股价某一天的分时线、某次地震仪记录的波形,都是某条样本路径的片段。路径视角关心的问题是:路径连续吗?有界吗?极限存在吗?第 4 章会看到布朗运动的路径处处连续却处处不可微——这个惊人的性质只能从路径视角提出来。

图:一族样本路径与一个时刻的横切面

图:一族样本路径与一个时刻的横切面

两种视角的分工表

关心的问题 该用的视角 全册对应的章节
t 时刻的取值大致多大 横切:一维分布 各章的期望与方差计算
两个时刻取值的联动 横切:二维分布、自协方差 第 4 章平稳过程与谱分析
路径是否连续、能否微分 纵切:路径正则性 第 4 章布朗运动
长期比例是否稳定 两者结合:极限定理 第 3 章遍历性
触碰某水平的时刻 纵切:停时与首中时 第 3、4 章

两个视角在"过程是什么"这个层面上完全等价(有限维分布族决定过程的一切分布性质),但计算的顺手程度天差地别。证明定理时常常在两个视角之间换座:先在分布视角写出等式,再到路径视角解释含义。这种换座能力是读懂随机过程文献的门槛,值得从本节开始刻意练习。

按什么标准给过程分类

后续章节的排兵布阵,依据的是四条正交的分类轴:

时间轴:离散时间(链、序列)与连续时间(过程)。第 2 章的计数过程与第 4 章的布朗运动分居两侧。

状态轴:状态空间离散(可数个状态)与连续(区间或流形)。排队人数是离散状态,粒子位置是连续状态。

依赖结构:独立增量(各段互不影响)、马尔可夫性(只依赖当前)、鞅性(条件期望恒等于现值)、平稳性(分布随平移不变)。这是最重要的一条轴,第 2 到第 4 章各占一种。

矩结构:高斯性(有限维分布全是正态)与非高斯。高斯性让分布族由二阶矩完全决定,第 4 章高斯过程一节专门展开。

这四条轴的组合生成全册的"角色表":泊松过程 = 连续时间 + 离散状态 + 独立增量;马尔可夫链 = 任意时间 + 离散状态 + 马尔可夫性;布朗运动 = 连续时间 + 连续状态 + 独立增量 + 高斯。拿到一个实际问题时,第一件事就是沿这四条轴给现象定位——第 6 章的建模方法论会把它变成一套固定流程。

动手:画出你第一条样本路径族

import numpy as np import matplotlib.pyplot as plt rng = np.random.default_rng(3) t = np.linspace(0, 1, 500) # 一个最简单的连续时间过程:带漂移的随机相位正弦叠加噪声 # 用它练手"路径族"的观察姿势,第 4 章会换成真布朗运动 fig, ax = plt.subplots(figsize=(8, 4.5)) for i in range(8): phase = rng.uniform(0, 2*np.pi) noise = rng.normal(0, 0.15, size=t.shape) path = np.sin(2*np.pi*2*t + phase) + np.cumsum(noise)*0.05 ax.plot(t, path, linewidth=1.0, alpha=0.8) ax.axvline(0.6, color="darkorange", linestyle="--", linewidth=1.5) # 横切时刻 ax.set_xlabel("时间 t") ax.set_ylabel("X(t)") ax.set_title("八条样本路径:每条是一次完整抽签,虚线处横切得到随机变量") plt.tight_layout() plt.show() # 观察点:任取一条竖线,路径在该处的取值散布成一个分布; # 任取一条横线沿时间走,看到的是一次具体实现的演化。两张"照片"属于同一个过程。

跑完把 8 条改成 80 条再跑一次:横切处的散布会逐渐显形为一条密度曲线——横切视角就是在这群点上看分布。这个练习五分钟,但对建立"分布与路径同时在场"的双重视觉直觉,效率远高于读十页定义。

📌 顺手记住一个术语:轨迹的实现(realization)与样本路径同义;统计文献里也说"一条轨道"。看到不同叫法不必慌,都是同一件事。

辨析:三个容易含混的术语

"过程"与"序列"的边界:离散时间、连续时间只是参数集不同,没有本质鸿沟。把连续时间的均匀网格抽样,得到的就是时间序列;把时间序列的采样间隔推到零的极限,常常回到连续过程。实践中"数据是离散的、模型是连续的"是常态——拟合时利用连续模型的理论(谱、标度),预测时输出离散网格值。

"实现"与"样本"的层级:一条样本路径是一次完整实验的实现,路径上某个时刻的取值是一个样本点。统计里"样本量"通常指独立实现的条数,而不是一条路径上采了多少个点——后者受相关拖累,有效信息要按自相关折算(第 3、5 章都吃这个亏的坑)。

"状态"与"取值":马尔可夫语境里"状态"是系统所有可能处境的标签集合中的元素;"取值"是某时刻的具体读数。布朗运动的状态空间是实数轴(连续状态),泊松计数的状态空间是非负整数(离散状态)——同一个"过程"词汇下,状态空间的形状决定用什么工具:离散状态走矩阵与链论,连续状态走密度与微分方程。第 2、3、4 章的分章依据正是这条线。

本节要点回顾

  • 随机过程 = 同一概率空间上带时间索引的随机变量族,定义简单,两种读法才是筋骨。
  • 横切得分布,纵切得路径;Kolmogorov 延拓定理保票"分布族可以拼成过程"。
  • 路径视角才能提出正则性问题(连续性、可微性),第 4 章的惊喜都在这里。
  • 四条分类轴:时间、状态、依赖结构、矩结构;给现象定位是建模第一步。
  • 双重视角的换座能力,是读文献与做推导的日常动作。

地基到此打完。下一章进入第一个具体过程:用泊松过程为"偶然到达"计数,你会立刻看到本章全部工具的实战运转。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U