本节摘要:K-Means 交替执行「分配到最近质心」与「质心移到簇均值」直到收敛,本质是对含簇内平方和目标的最小化。它的追问链由四个软肋牵引:K 怎么选、初始化怎么稳、什么形状会失败、结果怎么评。本节把这四个软肋各配上标准答法与反例。
从本章起,追问的性质变了:监督学习问「错多少」,无监督问「你怎么知道没错」。K-Means 是这场评估危机的最小样本——三行迭代人人会写,但「K 从哪来」「坏初始化怎么办」两问就能筛掉大半候选人。本节先立主问题,再沿软肋逐层追问。
主问题:「讲一下 K-Means 的过程,它到底在优化什么?」
算法两步交替:分配步把每个样本划给最近的质心,更新步把每个质心移到本簇样本的均值,直到分配不再变化。它隐式优化的目标是簇内平方和(各样本到所属质心距离之和),分配步与更新步每轮都让这个目标单调不增,因此必然收敛——但只保证收敛到局部最优。K-Means++ 通过「概率正比于距离平方」的选点策略让初始质心彼此散开,大幅降低坏局部最优的概率。
白板讲解时建议边画边讲:随手点几个点,画出一次分配与一次更新的动作,比背步骤更有说服力。收尾一定要主动说出「局部最优」四个字,它是整条追问链的入口。
追问:「K 怎么定?肘部法到底在找什么?」
参考答法分三个工具加一个兜底:

追问:「K-Means 什么时候会给出明显不合理的结果?」
背出两个反例就是这题的答案本体:
及格:完整说出两步迭代并点出「优化簇内平方和、收敛到局部最优」;良好:三种选 K 工具的原理与局限各说得出,能现场推导轮廓系数;优秀:两类失败场景配对成因(目标函数的几何假设)与替代方案(DBSCAN、谱聚类、GMM),并主动给出标准化的实践纪律。无监督题的分水岭就在「能不能预判失败」——会跑算法的人很多,知道它会在哪翻车的人少。
下一节从离散分组转向连续压缩:PCA 的方差最大化是全章唯一需要完整推导的考点,值得提前活动一下手腕。
问:K-Means 与高斯混合模型什么关系?
K-Means 是 GMM 的特例:各簇协方差相同且各向同性、混合比例固定、软分配退化为硬分配。GMM 的 EM 框架给出概率归属与椭圆簇形,代价是计算更贵、需要防奇異协方差。面试里能画出这条从 K-Means 到 GMM 的推广链,比多背三个聚类算法更值钱。
问:K-Means++ 为什么有效?
它的选点策略让新质心以正比于距离平方的概率出现在远离已选质心的位置——既保留了随机性(多次重启的意义),又系统性避免质心扎堆,从而大幅降低坏局部最优的概率,并给出接近对数级的近似保证。
问:聚出来的簇怎么向业务解释?
三步走:统计画像(各簇在各特征上的均值与分布对比)、命名(用业务语言给簇起名)、动作映射(每个簇对应什么运营或风控动作)。解释不了动作价值的簇,再高的轮廓系数也只是数字游戏。
白板自测:画出 K-Means 在环形数据上的失败示意,并写出你会改用的两个替代方案及理由。
| 指标 | 度量什么 | 局限 |
|---|---|---|
| 簇内平方和 | 紧凑度 | 随 K 单调降,不能单独选 K |
| 轮廓系数 | 紧凑与分离的平衡 | 大簇与小簇混在时偏乐观 |
| 戴维森堡丁指数 | 簇间散度比簇内散度 | 偏好凸簇 |
| 稳定性(重采样对比) | 划分对扰动的抵抗 | 计算贵,但最能反映真结构 |
四个指标各自只看一面,工程口径是「两两组合交叉验证」:轮廓系数选 K、稳定性确认、业务画像定名。稳定性检验的思路(换一批重采样数据,划分是否大致不变)尤其值得在面试里主动提出——它是无监督里最接近「统计显著」的 analog。
**追加一问: minibatch K-Means 牺牲了什么?**用小批量更新质心,速度快一个量级,收敛质量略降且对小数据不划算——大数据场景的标准提速手段,代价要说得出。
追加一问:聚类的结果怎么和下游系统衔接?
三种常见姿势:簇标签直接作类别特征进监督模型(注意与 5.2 节目标编码同样的泄漏纪律——聚类必须在训练折内拟合);簇画像直接驱动运营策略(分群营销、分层风控);簇中心作检索锚点(相似用户召回)。衔接方式决定评估口径——标签进模型看下游指标,策略驱动看业务实验,别拿轮廓系数给业务汇报。
追加二问:什么时候不该聚类?
数据没有天然分组结构(连续梯度型分布)时,强行聚类的「簇」只是切分痕迹;业务要的是排序而非分组时,先问目标再定方法。聚类是手段不是仪式——「不做聚类」有时是最专业的答案。