本节摘要:科技公司手握实验基础设施,难点反而移到了干扰、长期效应与策略优化。本节复盘一个 uplift 营销的完整决策链路、平台实验的 SUTVA 冲击与修正、观察数据与实验数据互补的混合学习,以及定价与库存等定价类应用中的识别要点。
把第 5.1 节的 uplift 建模放进真实运营,完整链路长这样。
背景:某电商平台月度促销预算固定,历史上按"流失风险模型"发券——风险越高越发。模型 AUC 不错,但转化率连年下滑。
重构问题:发券目标是增量转化(persuadables),不是挽留概率。流失风险模型给"最可能流失的人"发券,其中大量是 sure things(券不券都买)与 sleeping dogs(被券打扰反而困惑),预算大量空转。目标量应换成 uplift:券对转化的个体提升。
操作:先做一次随机触达实验(不做定位,随机发 5% 用户)拿训练数据;用因果森林训练 uplift 分数(第 5.1 节范式三);按分数十分位分桶,再做一轮分桶随机实验验证单调性——低分桶实测增量接近零甚至为负,高分桶增量数倍于均值。
结果:同样预算下,券后 30 日增量 GMV 提升(典型量级:分桶策略相对风险模型的增量翻倍);同时停止了对最末两桶(实测增量为负)的触达,骚扰投诉下降。
解读与变式:这个案例的关键不是因果森林多强,而是决策目标被正确翻译成了因果量。变式三问:预算变化时应重估分数阈值还是重训模型(答:预算约束变化影响最优分位点,模型无需重训);券有差异化面额时升级为连续处理(第 5.3 节剂量反应曲线);用户间有传播(拼团分享)时按第 5.2 节做市场级实验复核直接效应与溢出之和。
科技公司最深的因果难题几乎都是第 5.2 节的干扰。三个高频形态与对应工程:双边市场(司机补贴同时影响乘客等待时间与对手平台定价)——以城市为实验单元做 switchback;广告挤占(投流抢的是站内自然流量位)——用 holdout 市场校准增量而非看投放后台的归因转化;社交传播(内容曝光跨用户外溢)——按社交图聚类切片。共同教训:当实验单元小于干扰半径时,仪表盘上的提升是幻觉的开始,且方向都偏向高估。
长期效应是另一根软肋:两周实验测的是短期响应,而推荐算法改版的价值在留存曲线的尾部。工程对策:长周期 holdout(留 1% 用户长期不看新策略)、序列实验设计(允许多期决策修正)、以及用短期代理指标加第 5.3 节动态框架建模代理与长期终点的关系——最后一个仍是开放研究问题,也是各家实验平台竞争的护城河。
实验贵、慢、且不能穷举所有策略变体;观察数据广、快、但有混杂。混合使用的两个成熟范式:观察数据筛假设、实验数据验证——因果发现(第 6 章)在日志数据上挖候选机制(如"哪些特征调节策略效果"),随后用小规模实验确认;实验数据校准观察模型——用历史实验标注部分个体的真实增量,修正观察数据上训练的 uplift 模型(类似第 7.1 节 RWE 用 RCT 锚定)。Meta、Netflix、字节各家公开的实验方法论文章里,这两个范式的变体反复出现。
定价与库存类应用顺带一提:需求的价格弹性是典型因果量,随机改价不可行时,历史上利用促销规则断点(满减门槛,第 4.4 节)、地区分批定价(DID)、供应链冲击作工具(第 4.5 节)完成识别——商业数据的三板斧仍是前六章方法的排列组合。
任何"用模型发券/推内容"的个性化项目,上线前过这张表:
| 检查项 | 不合格的形态 | 合格动作 |
|---|---|---|
| 目标量 | 预测转化概率 | 预测增量(uplift/CATE) |
| 训练数据 | 历史 observational 直接训练 | 随机触达期数据或实验锚定 |
| 验证 | 离线 AUC | 分桶随机实验的实测增量单调性 |
| 干扰 | 用户级实验直接读数 | 单元≥干扰半径或度量溢出 |
| 长期 | 只看 7 日窗口 | holdout 市场校准长期 |
| 回滚 | 无 | 版本化、一键回退旧策略 |
常见误区对照:其一,把"模型分数高"当"策略收益高"——分数排序对即可决策,绝对值无意义;其二,把归因系统的转化增量当因果增量——归因是记账不是实验;其三,一次性验证后常年不复查——人群漂移会让半年前的最优分桶退化成随机发券。营销预算越大的团队,越值得为这套管线付工程成本。
运营最常见的困惑:归因平台显示投放带来 30% 增量,实验测出来只有 8%,信谁?换算一下就明白:归因统计的是"触达人群中本来就会转化的人 + 真增量",若该人群自然转化率是 25%,归因的 30% 里四分之多是本来就会发生的。真增量是 8% ——实验是对的,归因回答的是另一个问题(记账口径)。给管理层的换算句式:归因数字 × (1 − 自然转化占比) 才接近因果增量。这个换算让两个系统的数字从"互相打架"变成"各答各题",是数据团队与业务对齐时最值钱的一句话。
没有历史随机数据时怎么启动 uplift:第一,先跑为期两周的 5% 随机触达,宁可少发一部分券也要拿到无偏训练数据;第二,用随机期数据训练首版模型(哪怕只是逻辑回归交互项),同步上线按分数分桶的小流量验证;第三,把"分数桶 × 实测增量"表格作为每季度例会材料,分数与增量脱钩即刻触发模型复审。清单的关键在第一条——多数项目死在跳过随机期直接用观察数据训练,模型学到的是"谁本来会转化",从第一天起就与预算目标错位。