5.3 多重治疗与连续治疗


5.3 多重治疗与连续治疗

本节摘要:处理取值从二值推广到多类别或连续剂量时,倾向得分推广为广义倾向得分(GPS),效应量推广为剂量反应函数与边际处理效应。本节讲 GPS 加权的构造、共同支撑域在高维下的崩塌、边际处理效应(MTE)的斜率解释,以及动态治疗策略(序贯决策)的最优策略估计思路。

从一个得分到一条曲线

二值处理的机器语言是倾向得分 e(Z),多类别处理(K 个方案)推广为广义倾向得分:一组概率 e_k(Z)=P(X=k|Z)。加权(IPTW 推广)给每个接受方案 k 的人赋权 1/e_k(Zᵢ),伪总体里方案选择与协变量独立,K 个均值的任意两两之差即方案对比。连续剂量(用药克数、补贴金额、定价档位)则更进一步:e(z) 变成密度 f_{X|Z}(x|z),权重为其倒数,估计对象是**剂量反应函数** μ(x)=E[Y(x)],通常用核平滑或样条在剂量轴上拟合整条曲线,关注点(最优剂量、拐点、边际收益递减)都从曲线上读。

# 概念流程:连续剂量的加权剂量反应估计(示意) import numpy as np rng = np.random.default_rng(9) n = 6000 Z = rng.normal(0, 1, n) X = np.clip(10 + 3*Z + rng.normal(0, 2, n), 0, 20) # 剂量受协变量影响 Y = 20*X - 0.6*X**2 + 2*Z + rng.normal(0, 3, n) # 真实最优剂量≈16.7 # 广义倾向得分:条件密度的估计(示意用高斯核密度回归) def gps(x, z, h=1.0): w = np.exp(-(z - Z)**2/(2*h**2)) return np.exp(-(x - X)**2/(2*1.5**2)) * w w = 1.0 / np.maximum(gps(X, Z), 1e-3); w /= w.mean() # 稳定化权重 grid = np.linspace(1, 20, 20); mu = [] for x0 in grid: # 局部核平滑加权重估计 ker = np.exp(-(X - x0)**2/(2*1.2**2)); ww = ker * w mu.append(np.average(Y, weights=ww)) mu = np.array(mu) print("最优剂量≈", grid[mu.argmax()]) # 典型输出在 16-17 附近

支撑域:连续情形的头号敌人

二值情形的共同支撑域问题在连续剂量下指数恶化:有效比较要求每个剂量点附近都有"协变量相似、剂量不同"的个体,而协变量维数稍高时,剂量与协变量的相关会制造大片只有单侧数据的区域——剂量反应曲线在这些区段完全靠外推,样条与核平滑都救不了。诊断与补救:逐剂量点画 GPS 分布的重叠图(类似第 4.2 节但按剂量切片);截断到支撑良好的剂量区间再报告;或者换边际处理效应框架,让数据自己声明"哪个剂量区间可信"。

边际处理效应(MTE):以"倾向接受高剂量的程度"为索引的效应曲线。构造思路(局部工具变量):找一个影响剂量的外生变动源(医生开药偏好、补贴梯度),MTE(x) 定义为沿这个变动源的局部 Wald 比值随倾向变化的轨迹。MTE 的斜率本身就是选择行为的信号:若高倾向人群的 MTE 显著更高,说明"谁选高剂量"与"谁受益于高剂量"正相关——平均效应外的最重要结构信息。ATE、ATT、LATE 都是 MTE 在不同权重下的积分,这是效应量家族的统一视角。

动态治疗策略:从效应到最优方案

第 2.3 节的时间切片图在这里闭环。多重处理加上时间维度,问题升级为动态治疗策略:每期根据历史状态选择动作,目标是最大化长期结果(慢性病方案、强化学习的策略)。两大框架:

g-formula 模拟路径:按第 2.3 节的条件期望序列,沿时间轴迭代模拟任一策略下的结局分布,对所有候选策略枚举比较。优点是直观、可加入领域模型;缺点是序列条件模型每一环的错设都累积。

Q-学习与 AIPW:把每一步的最优选择写成 Bellman 型递推(估计每步的"状态-动作价值"再倒推),或用动态 AIPW 把每步的伪结果像第 4.3 节那样双稳健地拼起来。因果推断与强化学习在这里共享数学骨架,差别在因果框架显式处理混杂(策略选择与预后相关),朴素 RL 的离线评估则容易栽在同一个坑上。

实务提醒:策略搜索空间随期数与动作集指数膨胀,务必把"策略类"事先限定在可解释的小族(阈值策略、有限深度决策表),并对最优策略用保留样本或新实验做一次前瞻验证——在干预策略上,历史数据里的"最优"几乎总是过拟合的乐观估计。

FAQ 与剂量设计的实务选择

问题:连续处理能像二值那样做"匹配"吗?

可以,做法是广义倾向得分的"剂量匹配":对每个目标剂量点,找 GPS 相近、剂量在局部窗口内的个体做局部加权。但支撑域问题比二值严重得多(第 4.2 节的叠加版),实操常退一步把连续剂量分箱成 3-5 档,按多值处理分析——牺牲分辨率换稳定,多数业务够用。

问题:多个二值方案之间的"最优"怎么定义?

按决策规则定义:对每个协变量层选期望结果最大的方案。注意这与"每层比较 K-1 个两两差都显著"不同——最优规则只需要排序正确,不需要每个对比都过显著性。多臂实验配合分层选择(如 Thompson 抽样)在在线场景比全对比检验更贴近决策目标。

广义倾向得分的诊断补充

GPS 的诊断比二值版本多两层。第一层:逐方案的重叠检查——每个方案 k 的 e_k(Z) 分布在其他方案的支撑内都要有覆盖,K 个方案两两检查共 K(K-1)/2 组。第二层:剂量轴上的"共同治疗区间"——连续情形按剂量切片画每个切片的协变量平衡(加权后 SMD)。经验做法:K 大于 5 或剂量维度高时,先做方案聚类(按处理机制相似度合并)再估计,牺牲分辨率换每格的样本量;并在报告里明确"不可比的方案对"(某两方案在协变量空间几乎不重叠),把它们从两两对比中剔除比硬估诚实。

本节要点回顾

  • 广义倾向得分:多类别用 e_k(Z)、连续用条件密度倒数权重,估计对象变为剂量反应曲线。
  • 支撑域崩塌:连续情形外推风险成倍放大,逐点重叠诊断与区间截断是必需动作。
  • MTE 统一视角:以倾向为索引的效应曲线,ATE/ATT/LATE 是其加权积分,斜率揭示选择结构。
  • 动态策略:g-formula 模拟与 Q-学习/AIPW 两条路;限定策略族并做前瞻验证。
  • 下一章:不再假设图已知——从数据反推因果结构。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U