本节摘要:MA(q) 说当前值是均值加上当前冲击与过去 q 个冲击的线性组合:y_t = μ + ε_t + θ1 ε_{t-1} + … + θq ε_{t-q}。冲击只活 q 步,故 ACF 在 q 后截尾;间接关系让 PACF 拖尾。可逆性要求 MA 多项式根在圆外,否则同一相关结构有两套 θ,估计会晃。
阅读完本节,你应当能够:
台风过境当天发货骤降,这是冲击 ε_t。接下来两天即使「惯性水平」没变,值班员仍会处理积压、改派车,这是冲击的余波,用 θ 乘过去的 ε 来表达更干净。若硬用 AR,你是在说「因为昨天件数低所以今天低」——昨天低本身是台风造成的,水平可能很快回去,AR 会把一次意外写成持久惯性。
MA(1):y_t = μ + ε_t + θ ε_{t-1}。θ=-0.4 表示上期正向意外会把本期往回拉一点,常见于「过冲再修正」。θ=0 就是白噪声加均值。示意:μ=0,θ=0.5,上期冲击 +4,本期即使新冲击为 0,也会被抬 +2,再下一期 θ 用尽,记忆消失。这就是 ACF 截尾:k>q 时,y_t 与 y_{t-k} 不再共享任何 ε,总体相关为零。
「移动平均」这个词容易让人想到平滑窗口。这里的平均对象是不可见的冲击,不是把最近 q 个 y 做算术平均。业务上的移动平均线是另一套工具,第 4 章对比时再谈。
MA(q) 写成 y_t - μ = θ(B) ε_t,θ(B)=1+θ1 B+…+θq B^q。可逆指能把 ε 写成过去 y 的无穷 AR。要求 θ(z)=0 的根在单位圆外。MA(1) 即 |θ|<1。不可逆时,存在另一组可逆系数给出同一 ACF,似然在两套参数间分不清。软件把搜索限制在可逆域,你会看到 θ 顶在边界。
过差分与 MA 单位根是亲戚:对白噪声再差分,得到 MA(1) 且 θ=-1,正好在可逆边界上。第 1 章「过差分后滞后 1 的 ACF 大幅为负」就是这条代数。估计里 MA 系数贴近 -1,优先减 d,而不是再加 q。

因为 ACF 截尾,MA 阶是第 1 章最「好看」的一种:刀口清晰。样本 ACF 在 q 后仍有擦边柱,不必立刻写成更大的 q。MA 与 AR 混合成 ARMA 后,两张图都拖尾,刀口消失,必须靠短名单。纯 MA 过程的 PACF 拖尾,有人误把 PACF 的「很多柱」读成高阶 AR——在已确认 ACF 截尾时,应坚持 MA 解释。
| 过程 | 记得什么 | ACF | PACF |
|---|---|---|---|
| AR(p) | 过去的 y | 拖尾 | 截尾 |
| MA(q) | 过去的 ε | 截尾 | 拖尾 |
| 白噪声 | 什么都不记得 | 进带 | 进带 |
| 过差分白噪声 | 差分制造的 MA 单位根 | 滞后 1 大负相关 | 往往也乱 |
⚠️ 常见坑:把 Excel 里对 y 做的滑动平均当成已经做了 MA(q)。那是平滑,不是用冲击建模;平滑后的序列相关结构被你人为改写,再套 ARIMA 会重复处理。
💡 关键直觉:若业务故事是「意外会修正、水平不该永久改写」,先试 MA;若故事是「状态会带着走」,先试 AR。都可以进短名单,让似然和残差裁决。
估计 MA 必须迭代,因为 ε 不可见。初值差时可能停在坏点。看到似然警告或 θ 乱跳,简化阶、检查 d、换精确似然,比加大 q 更有效。预测时,q 步之后纯 MA 的预报回到均值(或差分还原后的相应水平),不会像高 φ 的 AR 那样拖很远——这也是识别「这个现象该不该有长记忆」的对照实验。
MA(1) 的滞后 1 自相关等于 θ/(1+θ²),更高滞后总体为零。|θ|<1 时这个值的绝对值不超过 0.5。所以若你在平稳序列上看到滞后 1 的 ACF 高达 0.8,它不太像可逆 MA(1),更像 AR 或欠差分。反过来,过差分白噪声的滞后 1 相关是 -0.5,正好落在 MA(1) 相关的边界上,这就是「θ 贴 -1」的数字指纹。把公式和图形对照,比只背口诀更难被野峰骗。
可逆性让冲击能写成过去 y 的无穷 AR。不可逆的 MA(1) 与它的倒数系数给出同一相关结构,估计会在两个点间晃。软件限制在可逆域,你会看到 θ 顶在 0.99。这时不要再加 q,要减 d 或减阶。可逆也保证预报可以用可观测的过去 y 递归更新冲击,而不是依赖不可观测的双边序列。
业务里的移动平均线是对 y 做窗口平均,目的是平滑着看趋势。ARIMA 的 MA 是对不可见冲击加权。对已经平滑过的 y 再套 MA(q),等于把相关结构改写后再建模,残差会假白,持出时真实余波还在。探索图可以用平滑,估计输入用原始(或只做对数、差分这些可逆变换)。这条纪律和第 3.1 节「不要把分解当数据」是同一句。
纯 MA 的多步预报在 q 步之后回到均值(或差分还原后的相应水平)。若业务故事是「冲击会改写以后很久的水平」,纯 MA 讲不通,应是 AR 或单位根。用「q 步后是否还该记得」当对照实验,能帮你在短名单里删掉讲不通的候选,而不必等 AIC。
MA(q) 的冲击只活 q 步,ACF 截尾。MA(1) 滞后 1 相关是 θ/(1+θ²),绝对值不超过 0.5,所以 0.8 的滞后 1 不太像可逆 MA(1)。θ 贴 -1 先想过差分。移动平均线是平滑 y,不是 MA 模型,平滑后再套 ARIMA 会假白。
故事更像 AR 或单位根。纯 MA 在 q 步后回到均值,讲不通长记忆。
不可逆与另一套系数给出同一 ACF。软件限制在可逆域。简化阶或减 d,不要加大 q。
台风当天骤降是冲击,随后两天改派车是余波,用 θ 乘过去的 ε 比用 AR 把一次意外写成持久惯性更干净。冲击只活 q 步,ACF 截尾。MA(1) 滞后 1 相关 θ/(1+θ²) 不超过 0.5,看到 0.8 不太像可逆 MA(1)。过差分白噪声滞后 1 相关 -0.5,对应 θ 贴 -1。可逆才能把冲击写成过去 y 的无穷 AR,估计才稳。Excel 滑动平均是平滑 y,不是本模型,平滑后再套会假白。纯 MA 多步后回均值,长记忆故事应换 AR 或单位根。初值差时 θ 乱跳,减阶或减 d 比加大 q 有效。
口令:MA 记得冲击余波,寿命 q 步,ACF 截尾。MA(1) 相关 θ/(1+θ²)≤0.5。θ 贴 -1 想过差分。可逆才能用过去 y 反推冲击。滑动平均线≠MA 模型。纯 MA 多步后回均值,长记忆换 AR 或单位根。估计顶边界时减阶或减 d。不可逆与倒数系数同一 ACF,软件限在可逆域。把「意外会修正、水平不该永久改写」当选 MA 的业务故事,和 AR 的惯性故事对照进短名单,让似然裁决。
原文 MA(q):y_t=μ+ε_t+θ1 ε_{t-1}+…+θq ε_{t-q}。当前值与过去 q 个误差项有关,不是与过去 y 做窗口平均。ACF 在 q 后理论上为零,PACF 拖尾。可逆要求 MA 多项式根在圆外,MA(1) 即 |θ|<1,否则同一相关有两套 θ。过差分接近 θ=-1。MA(1) 的滞后 1 自相关为 θ/(1+θ²),绝对值不超过 1/2,故很高的滞后 1 相关不像可逆 MA(1)。把「移动平均」这个容易混淆的词拆开:业务滑动平均平滑 y,本模型加权不可见冲击。纯 MA 在 q 步后预报回到均值,长记忆故事应换 AR 或单位根。估计必须迭代,因为 ε 不可直接当自变量。
| 概念 | 正确理解 | 混淆 |
|---|---|---|
| MA(q) | 加权过去冲击 | 对 y 做窗口平均 |
| ACF 截尾 | 冲击只活 q 步 | 和 AR 的 PACF 截尾搞反 |
| θ/(1+θ²) | MA(1) 滞后 1 相关 | 该值不超过二分之一 |
| 可逆 | 根在圆外 | 顶边界还加 q |
| θ 贴 -1 | 过差分指纹 | 当成 MA 很强 |
| 业务移动平均线 | 平滑 y | 以为已经做了 MA 模型 |
| q 步后预报 | 回到均值 | 硬讲长记忆 |
| ε 不可见 | 必须迭代估计 | 当普通回归自变量 |
| 与 AR 对照进短名单 | 让似然裁决 | 只凭故事定死 |
| 不可逆另一套 θ | 同一 ACF | 换初值死磕 |
把 MA(1)、θ 取 0.5 的相关算一遍:滞后 1 的理论自相关是 0.5 除以 1 加 0.25,得 0.4。若你在已平稳的发货变化上看到滞后 1 的柱高达 0.8,它不像可逆 MA(1),更该怀疑 AR 或欠差分。再把 θ 换成 -0.9:相关约 -0.497,已经贴着负二分之一,和过差分白噪声的 -0.5 几乎分不清,估计表上就会看到系数顶边界。用示意冲击 2,-1,3 和 θ=0.5 手推三期:第一期观测等于均值加 2;第二期等于均值加 -1 再加 0.5×2;第三期等于均值加 3 再加 0.5×(-1)。冲击在第三期之后不再进入第四期,这就是 ACF 截尾的算术。业务滑动平均若对 y 取窗口 3,得到的是另一条更光滑的序列,相关结构已被改写,不能再拿去套 MA(q) 当「已经做了移动平均模型」。把这两套算术分开写在草稿纸上,现场最常见的词义混淆会少一半。
滑动平均模型记得的是意外的余波,不是水位本身。冲击活几步,相关图就在几步后进带。若业务把「移动平均线」和这个模型当成同一件事,会拿已经被平滑过的序列再套模型,相关结构已被改写。可逆条件破了会出现另一套系数讲同一个相关,换初值死磕没有意义。贴负一的系数先想是不是多差了一次。
下一节把差分算子写进同一行,得到 ARIMA(p,d,q) 的表达式,并看过差分在代数上做了什么。