第8章 实战拆解台 本章要回答的三个问题: 拿到一份陌生数据,前三十分钟的图形化探索按什么顺序走、每一步排除什么风险? 分类模型的结果(混淆、特征贡献、校准)各自用什么图形表达最诚实? 时间序列的三大成分(趋势、季节、噪声)怎么用图形拆开验证? 为什么会有这一章 前七章按图形家族逐个拆零件,本章把零件装回真实工作的三条产线。实战与教学最大的差别是没有已知答案:探索性数据分析(EDA)要在信息荒地里排雷(缺失、偏态、离群、泄漏的类别编码),模型可视化要防止"只展示好看的那一面",时间序列要区分真趋势与伪装成趋势的噪声。每条产线都有自己的标准动作序列,这些序列比任何单个函数更值得记。 本章所有案例都遵循统一的展开格式:背景、操作、结果、解读、变式——这也是全书的拆解台格式在案例层的落点。
本章要回答的三个问题:
- 拿到一份陌生数据,前三十分钟的图形化探索按什么顺序走、每一步排除什么风险?
- 分类模型的结果(混淆、特征贡献、校准)各自用什么图形表达最诚实?
- 时间序列的三大成分(趋势、季节、噪声)怎么用图形拆开验证?
前七章按图形家族逐个拆零件,本章把零件装回真实工作的三条产线。实战与教学最大的差别是没有已知答案:探索性数据分析(EDA)要在信息荒地里排雷(缺失、偏态、离群、泄漏的类别编码),模型可视化要防止"只展示好看的那一面",时间序列要区分真趋势与伪装成趋势的噪声。每条产线都有自己的标准动作序列,这些序列比任何单个函数更值得记。
本章所有案例都遵循统一的展开格式:背景、操作、结果、解读、变式——这也是全书的拆解台格式在案例层的落点。
| 节 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 8.1 EDA 完整案例 | 问题一 | 四步流程成图清单、缺失排查、辛普森复查 |
| 8.2 机器学习结果可视化 | 问题二 | 混淆热图、系数条形、预测与残差双联图 |
| 8.3 时间序列可视化 | 问题三 | 聚合折线、月度形态分面、异常窗口标注 |
问:四步流程每步该画几张图? 结构步一张缺失热图加一份类型清单;单变量步每个关键数值列一张;关系步一张相关热图加两三张目标散点;组间步按候选假设画两到四张分面。全程控制在十五张以内——图多不是勤奋,是没舍得扔,EDA 的产出是发现清单不是图库;复盘时按四步归档,每张图配一行发现,下次同类数据直接从这份档案起跑。
问:模型可视化和模型评估是什么关系? 评估给分数,可视化给方向。混淆矩阵暴露错在哪个方向,系数条形暴露模型在依赖谁,残差图暴露假设哪里破了——分数及格但方向错掉的模型,只有图形层能拦住。
问:时间序列为什么先画聚合线? 原始高频线会淹没一切结构。先聚合到日或周看趋势与季节,再分面下钻回原始粒度定位异常窗口——从粗到细,每层只回答一个问题,层与层之间的跳转理由就是分析叙事本身;这也解释了为什么时间序列的图常常成组出现,一张答不了问题的图套再多面板也没用。
三条产线跑通后,Seaborn 的能力边界也该摊开讲了:性能天花板在哪、什么需求该换库、版本演进的方向。第 9 章收束全书,给你一张"何时用、何时走"的决策底牌。