2.3 动态与时间序列因果模型


2.3 动态与时间序列因果模型

本节摘要:当处理分多期进行、结果随时间反复测量,静态 DAG 需要沿时间轴展开为时间切片图。本节讲时间切片的画法、时变混杂与时变处理的纠缠(控制先前结果会打开对撞路径的经典难题)、g 方法的存在意义,以及 Granger 因果与结构因果在时间序列上的差别。

为什么静态图不够用

慢性病治疗是典型场景:医生根据病人上个月的血压调整本月药量,血压又受上月药量影响。把"用药"和"血压"各画成一个节点,图根本画不出来——它们既互为先后原因,又各自自我延续。解决办法是把每个时变变量按时间点拆开:用药_t、血压_t 各成一个节点,时间轴横向展开,同一变量相邻时点之间连自回归边。这样得到的有向无环图称为时间切片因果图,DAG 性质保持成立(因为时间不可逆,环不会出现)。

图:时变处理与时变混杂的时间切片展开

图:时变处理与时变混杂的时间切片展开

时变混杂的死结

图里暴露的结构困境值得用文字再压一遍。第二期的用药由第一期后的血压决定,而这个血压又是第一期用药的结果。于是血压_2 同时扮演两个角色:对用药_2 与结局 Y 而言它是混杂因子(影响两者),对用药_1 的效应而言它是中介(在因果路径上)。任何"按协变量分层"的标准调整在这里都自相矛盾:控血压_2 会阻断用药_1 的部分效应并打开对撞路径,不控则用药_2 的估计留着混杂。

这不是画图失误,而是时变处理的固有结构。破局的是 g 方法族(g-formula、IPW 边缘结构模型、g-estimation 的结构嵌套模型),共同思路是:不再"一锤子分层",而是沿时间轴把处理策略整体作为估计对象——要么模拟(g-formula 按顺序迭代条件期望),要么加权(IPW 把每个人按其历史接受的处理重新赋权,造出一个"处理不依赖历史"的伪总体)。细节在第 4.2 节与第 5.3 节展开,这里只需记住结论:时间展开后暴露出的角色冲突,决定了动态场景必须换估计范式

Granger 因果与结构因果的分界

时间序列文献里有自己的"因果"词汇,需要与结构因果划清边界。Granger 因果的定义是预测性的:若用 X 的历史能改善对 Y 未来的预测(在已含 Y 自身历史的条件下),则称 X Granger-导致 Y。它有三条硬伤:第一,它度量预测增益而非干预效应——第 1 层的知识;第二,它对未测的共同驱动敏感,两个序列被第三个不可观测过程同步推动时会互相 Granger 因果;第三,它在瞬时(同期)因果上无话可说,因为按定义只看滞后项。

结构时间序列因果(如结构向量自回归 SVAR、时序 DAG)则把同期与滞后关系都放进图里,允许谈干预。实用判断:若问题是"预测谁带动谁",Granger 够用且便宜;若问题是"政策改变 X 序列会怎样改变 Y",必须回到结构框架并声明识别假设(通常靠工具变量或同期因果的次序假设)。

画时间切片图的三条纪律

一、粒度对齐决策频率。 切片间隔应等于处理可被改变的频率(临床按月调药就按月切片),过粗会把动态混杂压回静态图、重蹈死结;过细则放大图规模且引入大量无意义的自回归边。

二、基线协变量单列。 不随时间变化的协变量(性别、基因)画一次,向各期处理与结局引边即可;不要逐期复制。

三、结局只进不出。 最终结局 Y 只作为箭头终点;把中间结局当协变量控制前,先按第 2.2 节的四问流程检查它是不是对撞或中介。

FAQ 与自检

问题:把滞后项放进回归就等于处理了时变混杂吗?

不等于。把血压_1、血压_2 都塞进标准回归等于逐期条件化,正是本节说的死结操作——对用药_2 之外的效应估计全部带着条件化中介的偏倚。正确路线是 g 方法族(第 4.2、5.3 节),它们在"整条处理策略"层面做估计,不逐期分层。

问题:时间切片图需要画多长?

覆盖"处理—结局"因果时滞的最大跨度即可,再往前加基线协变量。图太长(几十期)时,若每期结构相同,可声明"平稳性/时不变结构"假设后用模板化画法(画两个相邻切片加省略号),分析时按参数共享处理。

问题:SUTVA 在时间序列上的形态是什么?

个体间不干扰对应"序列间不交叉影响";面板数据里地区间溢出(邻省政策影响本省)是时间维度的干扰,处理方式与第 5.2 节相同——把实验/识别单元升格到互相独立的群组。三题自检:本期的因是谁?跨期边有没有漏?序列间有没有串门?答全才动手估。

一个两期决策的完整算例

把死结落到数字上。设基线健康素质 U(未测)影响血压与依从性;第一期后血压高者进入强化治疗。简化数字:强化治疗本身降压 8 mmHg;血压每高 10 mmHg,结局风险升 5 个点。朴素做法"按第二期血压分层"估计强化治疗效应:高血压层内,进入强化的人多是"U 差到必须强化"的,其风险天然偏高——分层非但没洗掉 U,反而通过血压这个对撞点把 U 的信息放了进来,效应被低估甚至翻号。g-formula 的做法:按时间顺序估计每期条件期望,再对 U 的分布积分,模拟"全部强化"与"全部常规"两种策略下的结局差。两者的数值差就是"逐期条件化偏倚"的标价,动态场景下这个标价经常大到改变临床结论。

时间切片图的常见提问再答两则

一问:基线协变量与生俱来(性别、基因)也要向每一期引边吗?是的,凡影响该期变量者皆需引边,但画法上可以用一条贯穿带标注的边简化,读图时按"每一期都受影响"理解。二问:两期之间的测量误差怎么进图?为该期变量加一个观测子节点(真实值→观测值←测量误差),对撞结构提示"按观测值分层"会引入与真实值的关联——这也是为什么时变场景对测量质量更敏感:误差会被逐期条件化放大,而不是平均掉。

本节要点回顾

  • 时间展开:时变变量按时间点拆节点、自回归边相连,保持 DAG 性质。
  • 角色冲突:时变混杂同时是先前处理的中介,常规分层调整必然偏倚,须换 g 方法范式。
  • Granger 分界:预测增益属于第 1 层,干预问题需结构时间序列框架。
  • 画图纪律:切片对齐决策频率、基线协变量单列、结局只进不出。
  • 下一节:静态图语言齐备,进入识别理论——后门准则。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U