5.1 异质性与子群分析:CATE与uplift


5.1 异质性与子群分析:CATE 与 uplift

本节摘要:平均效应回答"总体上值不值",决策常常需要"对谁值"。条件平均处理效应 τ(z)=E[Y(1)−Y(0)|Z=z] 是异质性的正式语言;uplift 建模把它工程化为营销与干预的目标量。本节讲 CATE 的定义与识别、三类估计范式(两模型、单模型带交互、因果树/森林)、honest splitting 的必要性,以及 uplift 的四种人群划分。

从"平均有效"到"该给谁"

设想药物平均降低复发率 6 个百分点。拆开看:高风险亚组降 15 个点,低风险亚组反而升 3 个点——平均掩盖了结构。若只给高风险人群用药,总收益上升且副作用暴露减半。这类"效应因人而异"在医疗、定价、营销、政策补贴里是常态而非例外,正式语言是 CATE:

τ(Z) = E[Y(1) − Y(0) | Z = z]

识别条件与 ATE 相同(条件可交换、正定性),但估计难度升级:它是每个 z 点上的条件期望差,样本切得更碎,过拟合风险陡增。CATE 估计的元问题因此不是"选哪个模型",而是如何在无法直接观测真值的情况下评估与防过拟合——个体层面 Y(1)−Y(0) 永远缺失,你不能像普通回归那样拿留出集的 MSE 说事。

三类估计范式

范式一:两模型(T-learner)。 分别对处理组、控制组拟合 E[Y|X,Z],预测时作差 τ̂(z)=m̂₁(z)−m̂₀(z)。简单直接;两个模型的独立误差在作差时叠加,且在数据不平衡时两模型在最需要互补的区域各自外推。

范式二:单模型(S-learner)。 把处理指示 X 当普通特征放进一个模型 E[Y|X,Z],预测时切换 X 取值作差。避免双模型误差,但强正则的树模型可能"看不见"弱的处理效应,把 τ̂ 压成零——处理变量在分裂竞争中输给强预后变量是常态。

范式三:直接建模异质(X-learner、因果树/森林)。 X-learner 先训练两个基础模型,再用控制组信息补全处理组的个体效应(反之亦然),在两组规模悬殊时表现突出。因果树(Athey 与 Imbens)的关键创新是 honest splitting:样本一分为二,一半用于决定树的分裂点(选异质性最大的划分),另一半用于估计叶内效应——两份职责不共用数据,使叶内效应估计与置信区间恢复无偏。因果森林是诚实树的集成,给出逐点置信带。

# 概念流程:因果树的诚实估计思想(示意) import numpy as np rng = np.random.default_rng(5) n = 4000 Z = rng.normal(0, 1, (n, 2)) X = rng.integers(0, 2, n) # 随机化场景 tau_true = 1.0 + 2.0 * (Z[:, 0] > 0) # 真实CATE:半群1.0、半群3.0 Y = tau_true * X + Z[:, 0] + rng.normal(0, 1, n) # 诚实分割:一半选分裂点,另一半估叶效应 idx_sel, idx_est = np.split(rng.permutation(n), 2) thr = np.median(Z[idx_sel, 0]) # 用选择样本定阈值 leaf_hi = idx_est[(Z[idx_est, 0] > thr) & (X[idx_est] == 1)] leaf_hi0 = idx_est[(Z[idx_est, 0] > thr) & (X[idx_est] == 0)] print(round(Y[leaf_hi].mean() - Y[leaf_hi0].mean(), 2)) # 典型输出≈3.0

uplift 建模:把 CATE 接到运营

营销场景把 CATE 改名为 uplift:发券对某人转化的提升量。经典人群四分法是 uplift 的运营词典,按 (是否被触达, 是否转化) 的行为倾向划分:

人群 逻辑 正确动作
说服者 persuadables 触达才转化,不触达不转化 唯一值得投入的群
睡美人 sure things 无论如何都转化 别花预算
我行我素 lost causes 无论如何都不转化 别花预算
反弹者 sleeping dogs 触达反而流失(被打扰) 主动回避

四分法理论上漂亮,个体却不可直接观测(又是潜在结果)。实际建模以"预测 uplift 分数→按分位数分桶→增量实验验证"落地:给不同分数桶随机触达/不触达,桶内实测增量应与预测单调对齐——这是 uplift 模型唯一可信的评估方式,离线指标(Qini 曲线)只能做粗筛。

⚠️ 亚组分析的两个纪律:其一,异质性"发现"必须防多重比较(第 4.6 节),树会在噪音里挖出假亚组,交叉验证与预注册亚组是解药;其二,别把"基线风险高"误当"效应大"——高复发人群的绝对收益常更高,但相对效应可能齐性,两种排序给出不同的资源分配方案。

FAQ 与评估细节

问题:CATE 模型怎么比较好坏?

标准做法是"分位数风险比"或按预测 uplift 十分位画实测增量的校准曲线:把样本按预测分数分桶,桶内用随机化数据算实测效应,看实测—预测的斜率与单调性。Qini 曲线做粗筛,分桶校准做终审。切忌用个体 MSE——个体真值不可观测,这个指标在数学上就不成立。

问题:样本量有限时先估异质性还是先报平均?

先平均。异质性估计的方差远大于平均(每个子群都是子样本),小样本里挖亚组几乎必然产出噪声。经验阈值:总样本支撑平均效应的稳定估计后,再谈二到三个粗颗粒亚组(预注册的),细粒度异质性留给因果森林加诚实推断的大样本场景。

Qini 曲线一分钟版

Qini 是 uplift 的洛伦兹曲线:按预测 uplift 从高到低排序,横轴为累计样本占比,纵轴为累计增量(实验设计下可估)。随机定位线是直线;模型曲线在它上方拱起,面积(Qini 系数)越大排序越准。它的两个用途:粗筛模型(面积比较)与定预算阈值(预算覆盖到曲线斜率掉落前)。但 Qini 建立在"分数排序正确"的总体层面,不保证任何一桶的数值准确——所以正文强调分桶实测校准才是终审,Qini 只负责初选。

本节要点回顾

  • CATE 定义:条件期望差;识别同 ATE,估计难点在个体真值不可观测导致的评估困境。
  • 三范式:两模型、单模型、直接建模(X-learner/因果树);诚实分裂用数据隔离换无偏。
  • uplift 落地:四人群是词典,评估靠增量实验分桶对齐,Qini 只做粗筛。
  • 两条纪律:防亚组多重比较;区分基线风险与效应大小的排序。
  • 下一节:SUTVA 的另一头——个体之间互相影响。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U