第4章 分类图的语法 本章要回答的三个问题: 同样是"类别对数值",strip、swarm、box、violin、bar、point、count 八种图各自在展示分布的哪个侧面? barplot 的误差棒和 boxplot 的箱体有什么本质区别,什么时候柱状图会系统性误导读者? catplot 作为分类家族的工厂函数,与前两章的 displot、relplot 在语法上如何无缝衔接? 为什么会有这一章 业务数据里最常见的表结构就是"一个类别列加一个或几个数值列":各产品的销量、各渠道的转化率、各科室的住院日。第 3 章的散点图处理两个数值列,一旦 x 是类别,位置通道的语义就变了——类别之间没有距离可言,"星期四到星期五"不比"星期四到星期六"近。这个语义变化催生了整整一个图形家族。
本章要回答的三个问题:
- 同样是"类别对数值",strip、swarm、box、violin、bar、point、count 八种图各自在展示分布的哪个侧面?
- barplot 的误差棒和 boxplot 的箱体有什么本质区别,什么时候柱状图会系统性误导读者?
- catplot 作为分类家族的工厂函数,与前两章的 displot、relplot 在语法上如何无缝衔接?
业务数据里最常见的表结构就是"一个类别列加一个或几个数值列":各产品的销量、各渠道的转化率、各科室的住院日。第 3 章的散点图处理两个数值列,一旦 x 是类别,位置通道的语义就变了——类别之间没有距离可言,"星期四到星期五"不比"星期四到星期六"近。这个语义变化催生了整整一个图形家族。
分类家族最容易被当成"八种无关的图"来背,这是最大的学习浪费。放到拆解台上,它们其实是一条光谱:从"每个观测原样展示"(strip、swarm)到"分布摘要"(box、violin)再到"单统计量加误差"(bar、point),信息压缩程度逐级升高。选图就是在这条光谱上选一个压缩率,而压缩率必须匹配样本量和沟通目的。
| 节 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 4.1 类别散点 strip 与 swarm | 压缩光谱的零压缩端 | 抖动语义、蜂群算法边界、与摘要图叠加 |
| 4.2 箱线、小提琴、柱状、点图 | 光谱中后段 | 五数概括读法、误差棒口径、bar 的误导场景 |
| 4.3 catplot 类别图工厂 | 问题三 | kind 全家桶、col 分面、与 displot 及 relplot 的语法闭环 |
问:八种图该背哪几种? 都不用背。先问样本量(小样本直接展示观测,大样本必须摘要),再问沟通目的(要形态还是单个统计量),压缩光谱上的位置自然落定——选型是有理由的推导,不是记忆比赛。
问:误差棒互相盖住了柱子差异,能说不显著吗? 不能。误差棒重叠与否只是目测线索,不是检验结论。正确动作是回到统计检验,或改画两组差值本身——把比较对象从两组均值换成差值,视觉噪声立刻减半。
问:箱线和小提琴到底选谁? 给大众汇报用箱线,五数概括有标准读法,评审不会吵;给自己探索用小提琴,双峰、截断这类形状证据箱线会丢。两者都能叠加 4.1 的 strip 层做双重确认,成本只是一行代码。
分类图把"类别 x 数值"的二维关系拆完了。当数据的行和列同时都是要比较的维度——相关系数矩阵、时间 x 月份的乘客表——第 5 章的矩阵图把整张表当成一个映射对象,颜色成为唯一的主角。