第5章 矩阵图的语法


文档摘要

第5章 矩阵图的语法 本章要回答的三个问题: 什么形态的数据适合画成热力图,行列各放什么、颜色编码什么? 相关系数矩阵的热力图里,哪些数字值得看、哪些是统计噪声,配色为什么必须发散型? clustermap 在热力图上加了聚类树,它能"发现分组"吗,边界在哪? 为什么会有这一章 前四章的映射都围绕"列"展开:一列进 x、一列进 hue、一列切分面。但有一类分析对象天生是矩阵——月份对年份的乘客数、任意两个特征的相关系数、用户对商品的评分。这类数据的比较维度有两个(行与列),而 x、y 位置通道已经被行列占用了,于是颜色成为唯一承载数值的通道。矩阵图家族因此完全建立在"数值到颜色的映射"上,这也让它成为第 6 章配色专题的天然前奏:色板选错,矩阵图的结论直接反转。

第5章 矩阵图的语法

本章要回答的三个问题

  1. 什么形态的数据适合画成热力图,行列各放什么、颜色编码什么?
  2. 相关系数矩阵的热力图里,哪些数字值得看、哪些是统计噪声,配色为什么必须发散型?
  3. clustermap 在热力图上加了聚类树,它能"发现分组"吗,边界在哪?

为什么会有这一章

前四章的映射都围绕"列"展开:一列进 x、一列进 hue、一列切分面。但有一类分析对象天生是矩阵——月份对年份的乘客数、任意两个特征的相关系数、用户对商品的评分。这类数据的比较维度有两个(行与列),而 x、y 位置通道已经被行列占用了,于是颜色成为唯一承载数值的通道。矩阵图家族因此完全建立在"数值到颜色的映射"上,这也让它成为第 6 章配色专题的天然前奏:色板选错,矩阵图的结论直接反转。

本章只有两节,但每一节都是独立的完整工具链:heatmap 从数据透视到成图解读,clustermap 从聚类树到"发现结构"的边界讨论。

读完能解决什么

  • 能判断手头的数据该不该画矩阵图,并完成长表到矩阵的透视加工;
  • 能画相关系数热力图并按"强度加符号"双门槛筛出值得关注的变量对;
  • 能解释为什么相关矩阵必须用发散色板并以零为中心,以及 standard_scale 消量纲的时机;
  • 能读 clustermap 的树状图,知道聚类结果对距离度量和标准化有多敏感。

各节怎么分工

回答哪个问题 关键产出
5.1 热力图 heatmap 问题一与二 透视加工、annot 标注、发散色板、相关矩阵筛选流程
5.2 聚类热力图 clustermap 问题三 行列重排、树状图读法、标准化敏感性与结论边界

常见疑问预答

问:长表能直接画热力图吗? 不能。heatmap 只认行列已成网格的矩阵,长表必须先 pivot;它自身也不做任何聚合——pivot 遇到行列组合重复会报错,这恰好是在提醒你先想清楚聚合口径,不是库在找麻烦。pivot 的逆操作 melt 是 1.3 节的主角,两把刀配齐才能在长宽表之间自由走。

问:聚类树能证明分组存在吗? 不能。树状图不提供显著性,结果还随标准化与距离度量摇摆。clustermap 是假设生成器,它发现的块结构要回到第 4 章的组间比较或正式的聚类评估确认后,才能写进结论。

问:相关矩阵为什么要遮一半? 对角线恒为一、上下三角互为镜像,全画信息不变、版面翻倍。mask=np.triu(np.ones_like(corr, dtype=bool)) 传给 heatmap,保留下三角加数值标注,是最紧凑的标准形态。

先决条件

  • 第 1.3 节的 pivot 与 melt 互逆操作(矩阵图的原料加工全靠它);
  • 相关系数的概念:只要求知道它取值负一到一、衡量线性关系;
  • 分类图章节的"先摸底再比较"习惯,本章会延续到矩阵场景。

本章可考核知识点

  • 能完成长表到矩阵的透视加工并说明 heatmap 自身不做聚合的含义;
  • 能背出相关矩阵配色的三条铁律(发散色板、center 零点、两端对称固定);
  • 能按双门槛(0.3 忽略、0.7 核心)筛相关系数并说明分组检查的必要性;
  • 能解释 standard_scale 取 0 与 1 的语义差别及对聚类结论的影响;
  • 能读树状图:合并高度有意义、横向顺序无意义,并能说明双口径验证的流程。

往下走到哪

矩阵图把颜色推上了唯一数值通道的位置,颜色的三套尺度体系(定性、顺序、发散)在 5.1 已经初见威力。第 6 章把这套体系完整展开:从调色板对象到主题上下文,配色与风格将覆盖此前四章所有"细节层"欠下的账。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U