2.2 DAG三型结构:混杂、对撞与中介


2.2 DAG 三型结构:混杂、对撞与中介

本节摘要:任何 DAG 都由三种局部结构组合而成——链(A→B→C)、分叉(A←B→C)、对撞(A→B←C)。三者决定关联沿路径流动还是被阻断:链与分叉传导关联、条件化中间点即阻断;对撞恰好相反,默认阻断、条件化反而打开。掌握这张"通断表",就掌握了读图能力,后门准则只是它的应用题。

三型结构一览

因果图再复杂,拆到三节点局部只剩三种形状。为它们各配一个领域例子:

  • 链(chain)A→B→C:吸烟→肺损伤→运动耐力下降。A 与 C 相关,因为 A 沿因果流影响 C。控制 B(肺损伤),关联消失——效应被"吸收"在中介里。
  • 分叉(fork)A←B→C:年龄→吸烟倾向,年龄→心血管风险。A 与 C 相关,但并非互为因果,它们共享原因 B。控制 B(按年龄分层),关联消失——这正是"控制混杂"的图含义。
  • 对撞(collider)A→B←C:天赋→成为职业球员,训练量→成为职业球员。A 与 C 在总体中可以完全独立,但一旦只看"职业球员"这个样本(即条件化 B),天赋与训练量负相关——能进样本的要么天赋够、要么练得多,两者互相"顶替"。控制对撞变量打开路径,称为对撞偏倚或伯克森悖论。

图:三型结构与通断表

图:三型结构与通断表

对撞偏倚:观察性研究里最隐蔽的坑

对撞结构值得单独放大讲,因为它违反直觉且无处不在。三个真实形态:

入选条件偏倚。 只研究"住院病人"时,已经在条件化"是否住院"这个对撞变量(疾病→住院←事故外伤)。于是在住院样本里,慢性病与意外外伤呈现负相关——不是生理机制,而是入选规则制造的数学关联。

样本筛选偏倚。 分析"仅活跃用户"的行为数据,活跃度由兴趣与补贴共同导致;条件化活跃度后,兴趣与领补贴行为负相关,进而扭曲两者对留存效应的估计。

分析中的隐性对撞。 回归模型里一把梭放入全部变量时,任何一个由处理与结果共同导致的变量(如"治疗后的中间健康指标")都是对撞点,控制它等于亲手造偏倚。这类错误在 Applied 领域的论文里屡见不鲜,被称为"表二悖论"(处理组与对照组在匹配后协变量太平衡,反而提示过度控制)的近亲。

分叉与对撞的对照要刻进直觉:分叉中点是混杂(该控不控则偏),对撞中点是陷阱(不该控而控则偏)。两者在数据的相关系数表上长得几乎一样——都表现为"与处理相关、与结果相关"。这就是第 1.3 节说"关联论混杂定义会翻车"的确切含义。

中介:控制它还是不控制

链结构引出中介分析。设处理 X 通过中介 M 影响 Y(X→M→Y),并可能另有直接路径 X→Y。总效应 = 直接效应 + 间接效应,这个分解只有用 do 语言才严格:自然直接效应定义为"把 M 固定在它在不处理状态下的取值"时 X 对 Y 的效应——一个嵌套反事实,需要比第 3 章更强的假设。

实务上最常见的错误是把中介当混杂控制:为了"净化"模型在回归里同时放入 M,得到"控制中介后 X 的系数"并当成处理效应。这个系数既不是总效应也不是标准化的直接效应,且当 X→M 或 M→Y 存在交互时连解释都困难。什么时候该控制 M?只有当研究问题明确是直接效应、且中介测量在处理之后无测量误差污染时,才有条件地使用。

一个可操作的判别流程,遇到"要不要把变量 Z 放进调整集"时按序走:第一问,Z 在处理之前就取值了吗?否(处理后果/对撞嫌疑)→不控。第二问,Z 是 X 的后代吗?是→不控(除非做中介分析)。第三问,Z 是 X 与 Y 的共同原因或其代理吗?是→候选控制。第四问,控制 Z 会不会打开新的对撞路径(Z 是某对撞点的后代)?会→换变量或补控下游。这个流程是第 3.1 节后门准则的手工预演。

练习:一张稍复杂图的完整判读

设图:A→B,A→C,B→D,C→D,D→E,另有 U→B、U→E(U 未测)。问题:估计 D 对 E 的效应,A、B、C 该控谁?

先找 D 与 E 间的后门路径:D←B→…不通向 E?逐条走。路径一 D←C←A→B→D… 不达 E;真正的后门是 D←…→E 的路:D 的父代是 B、C,U→E 且 U→B,所以 D←B←U→E 是后门路径(经 B、U)。阻断点:U 未测不可用,B 可控(该路径上 B 是链中点,控 B 即断)。再看有没有别的后门:D←C→? C 只通向 D,无路到 E。于是调整集 {B}。但控 B 之前检查对撞:B 是 A→B 与 U→B 的对撞点吗?在路径 A→B←U 上 B 是对撞中点——控制 B 会打开 A 与 U 的关联。这条新开的路径能否延伸到 E?A→C→D 已经是因果方向段……控 B 后打开的 A—U 关联需与 A→C→D←…组合成 D 与 E 的开放路径:A 与 U 相连后可走 U→E,从 D 侧进入需 D←C←A,而 C 是链中点未被控、A 到 U 的连接被打开——于是 D←C←A—U→E 成为开放后门!结论:单纯控 B 不够,需同时控 A 或 C。这个小练习展示了真实图分析的常态:一次控制既关门又开门,必须整图走查而非逐边直觉。

通断规则的快速练习三则

用三道小题巩固判读,每题十秒内作答。题一:路径 A→B←C→D,条件集空,A 与 D 独立吗?——独立:B 是对撞点未被条件化,路径在 B 处断。题二:同一路径,条件集 {B},还独立吗?——不独立:控 B 打开对撞段,且 C 是分叉中点未被控,全路通。题三:路径 A→B→C→D 与 A←E→D 并存,条件集 {B, E},A 与 D 独立吗?——独立:第一条路 B 是链中点被控而断,第二条路 E 是分叉中点被控而断。三题全对说明 d 分离已成本能;有迟疑就回通断表再扫一眼——这套判读在下一章每条准则里都会出现。

误区清单加三条

其一,"控制了统计显著的相关变量就干净了"——显著性与因果角色无关,一个与处理显著相关的变量完全可能是对撞后代。其二,"变量越多模型越保守"——在因果图框架里,多控一个对撞后代不是保守而是主动引入偏倚,方向还常常无法预判。其三,"中介与混杂可以靠时序区分"——部分可以(处理前的变量不可能是中介),但处理前变量仍可能通过对撞路径造成麻烦,时序只是四问流程的第一问而非全部。三条误区的共同根源:把统计相关性当成了因果角色的判据,而判据只存在于图的形状里。

本节要点回顾

  • 三型结构:链与分叉默认传导关联、控制中点即阻断;对撞默认阻断、控制中点(或其后代)反而打开。
  • 对撞偏倚:入选条件、样本筛选、随手控制处理后的变量,都会凭空制造关联。
  • 混杂与对撞的镜像关系:数据表上同貌,控制决策相反,判定必须靠图不能靠相关。
  • 中介纪律:估计总效应时绝不控制中介;直接效应是嵌套反事实,需要额外假设。
  • 下一节:把静态图扩展到时间轴——动态治疗与时间序列因果模型。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U