本节摘要:线上劣化排查的通用链路是「先证伪假警报,再按数据口径、特征供给、分布漂移、模型本身四层向内查」。本节给出可背诵的排查顺序、每层的具体检查动作,以及漂移的类型学与检测手段——这是资深面试里最能区分「跑过生产」与「只有离线经验」的一题。
上一节讲开工,这一节讲救火。线上排查题在面试里的价值在于它的不可背性:排查顺序是真实事故喂出来的肌肉记忆,没救过火的人说不出「先查什么、放弃什么」。本节的主问题是一道完整的场景题,答案的组织方式比任何单项知识都重要。
主问题:「模型上线三个月后,转化率预估的线上效果持续下滑,但离线指标没变,你怎么排查?」
先证伪假警报:确认监控口径本身没变——埋点改版、归因口径调整、统计周期错位都可能制造「假下滑」,这一步花十分钟,能省一整周。然后按四层向内查。第一层查数据口径:上游表结构变更、日志丢失、ETL 延迟,特征原始数据的任何变化都会先于模型暴露;第二层查特征供给:线上推理用的特征与离线训练是否同口径——特征服务延迟、默认值兜底、缓存过期,典型的「训练 serving 偏差」就藏在这层;第三层查分布漂移:用户群体、行为模式、季节因素是否随时间变化,模型学的是旧世界;第四层才是模型本身:是否需要重训、重训频率是否合理。每层给出「有问题的证据」再进下一层,禁止跳层直奔「重训一版」。
「禁止跳层」是这题的纪律高点:跳过前三层直接重训,等于用最贵的手段赌最便宜的假设——重训完没好转,问题还在,而你烧掉了预算。
追问:「分布漂移有几种?分别用什么检测?」
参考答法给一个二乘二的类型学。按「联合分布怎么变」分两类:协变量漂移(输入分布变,P(X) 变了)与概念漂移(输入到标签的关系变,P(Y|X) 变了)——前者的征兆是特征分布位移,后者的征兆是「特征没变、指标掉了」,两者可能同时发生。按「变化快慢」分渐变与突变:渐变靠周期性监控发现,突变常由外部事件触发(大促、政策、疫情)。
检测手段按成本排:单特征统计量(均值、分位数、PSI 群体稳定性指数)最便宜,适合全部关键特征的日报;分类器两样本检验(训练一个「区分两个时期」的分类器,AUC 越大漂移越大)适合整段分布;模型指标本身的滚动监控(线上校准曲线、分桶命中率)是最终裁判——特征没漂而校准漂了,就是概念漂移。

追问:「训练 serving 偏差是什么?你怎么系统性防它?」
参考答法:训练 serving 偏差指「模型训练时看到的特征」与「线上推理时拿到的特征」存在系统性差异。三个常见来源:时间旅行——离线特征用了全量统计(含未来),线上只能拿到当时点数据;兜底值掩盖——线上特征服务超时返回默认值,训练集里却没有这类兜底样本;预处理漂移——离线用库函数、线上用另一套实现,数值口径微差累积。系统性防线有三:特征日志化(线上每次推理把实际用到的特征值落日志,离线训练直接消费同一份日志)、一致性校验(定期抽样对比线上特征与离线重算值)、兜底打点(默认值命中本身作为指标监控)。说出「训练直接用线上日志作为唯一事实源」这个方案,基本就是这题的天花板答案。
及格:给出「查数据、查特征、重训」的大致方向;良好:四层排查顺序完整,能区分协变量漂移与概念漂移并各配检测手段;优秀:训练 serving 偏差的三个来源与特征日志化防线讲得完整,全程体现「止损优先、证据驱动」的工程判断。这道题是全章的面试权重冠军——答好它,等于向面试官证明你可以在生产环境里被托付。
下一节回到面试本身:项目深挖的应对章法。前面的所有知识,都是这一节弹药库里的存货。
问:怎么区分「模型变差」和「环境变难」?
看相对指标:同一时期内,模型对固定流量样本的打分质量(可用近期积累的标注回测)变没变——模型变差则回测掉分;环境变难则市场整体转化率下行、竞品动作、季节因素,模型自身回测不掉分但业务指标掉了。两把尺子分开量,归因才不冤枉模型。
问:灰度与回滚的决策规则怎么定?
事先写死:灰度比例、观察指标、最短观察时长、回滚阈值(如核心指标相对对照组下降超过某百分点即回滚)。决策规则在上线前签字确认,避免事故现场的临场争论——「事前规则化」是事故管理的第一原则。
问:特征重要性在线上和离线不一样,说明什么?
可能说明分布漂移(模型在新分布上依赖了不同特征)、特征供给异常(某特征线上常取兜底值)、或训练 serving 偏差。它是排查链第二层与第三层的联动信号,值得单独监控。
表达纪律:排查题每层结束都给「证据形态」——看什么图表、比对什么数字。没有证据形态的排查顺序只是口诀。
问:怎么搭建一套不添乱的模型监控?
分三层:数据层(特征分布、空值率、PSI 日报)、服务层(延迟、吞吐、特征兜底率)、效果层(滚动业务指标加代理指标)。三层各设报警阈值与负责人;监控本身的误报率要定期审计——狼来了三次的监控等于没有监控。
问:A/B 实验的样本量怎么估?
按最小可检测效应反推:效应越小、方差越大,需要的样本越多;用业务允许的最短实验周期校验样本量够不够。没做功效分析的 A/B 结论大多是在噪声里找信号——这句话在策略岗面试里值一道大题。
问:模型更新的节奏怎么定?
由漂移速度决定:分布稳定的场景季度级重训即可,漂移快的(风控、推荐)周级甚至日级;每次重训都是一次发布,要走完整的验证与灰度。重训频率不是越勤越好,每次发布都有引入回归的风险——稳定性和新鲜度又是一场交易。