第3章 · Matplotlib 与数据分析 章节摘要:前两章我们把 Matplotlib 当作一张画布,学的是"怎么把线条、柱子、颜色摆上去"。这一章换一个视角:把 Matplotlib 放回它真正工作的地方——数据分析流水线里。你会看到 NumPy 如何负责造数据、清洗、转换和聚合,Pandas 如何让 DataFrame 一行代码就出图,再往上走一层,用箱线图、小提琴图、热力图这些统计图形去挖分布和相关性,最后用一套可视化原则给图做质检,避免误导。读完这一章,你能独立跑通"数据进来、图出去、结论可讲"的完整闭环。 核心问题 阅读完本章,你应当能够: 用 NumPy 生成、清洗、标准化、分组聚合数据,并直接交给 Matplotlib 绘图。
章节摘要:前两章我们把 Matplotlib 当作一张画布,学的是"怎么把线条、柱子、颜色摆上去"。这一章换一个视角:把 Matplotlib 放回它真正工作的地方——数据分析流水线里。你会看到 NumPy 如何负责造数据、清洗、转换和聚合,Pandas 如何让 DataFrame 一行代码就出图,再往上走一层,用箱线图、小提琴图、热力图这些统计图形去挖分布和相关性,最后用一套可视化原则给图做质检,避免误导。读完这一章,你能独立跑通"数据进来、图出去、结论可讲"的完整闭环。
阅读完本章,你应当能够:
本章四节其实是一条流水线上的四个工位:先把数收拾干净,再画出来,再用更专业的统计图形深挖,最后退后一步检查这张图是否诚实、是否好懂。下面的全景图把这个顺序画了出来,虚线箭头提醒你这条线其实会回头。
一张图的价值,一半在数据本身,一半在你为它挑的形状、颜色和标注。
这条流程不是单向的,它更像一个循环。你画出一张图之后,往往会发现数据里藏着的下一个问题——比如箱线图里冒出一个离群点,你会回头去查这条记录是不是录入错了;散点图里两团点分开了,你会回头按某个字段把数据拆开再看。所以"解读"不是终点,它常常是下一轮"处理"的起点。成熟的探索者就是在这条环上反复走,直到图能自圆其说为止。理解了这个循环,本章四节的分工就清楚了:3.1 和 3.2 管数据准备,3.3 管深挖,3.4 管验收。

NumPy 是 Matplotlib 的数据地基。这一节讲怎么用数组造数据、填缺失值、剔异常值、做标准化和分组聚合,再把干净的数交给绘图。你会发现,很多"画不出好图"的问题,根源其实在数据本身,而不是绘图函数。
Pandas 的 DataFrame 和 Series 能直接喂给绘图函数,一行代码出图。这节讲 plot 方法的快捷用法,以及何时该退回 Matplotlib 的面向对象接口精修。两条路各有用武之地,关键是要分清"快速看一眼"和"精修出报告"。
从直方图、箱线图到小提琴图、热力图、散点矩阵,这节逐个讲"这张图回答什么问题、什么时候该用它",把分布和相关关系挖出来。选对图形,往往比把图形画得花哨更重要。
最后退后一步做质检:选对图、配好色、写清标注、别让坐标轴撒谎。这节把前面的技巧收拢成几条可执行的判断标准,教你一眼看出一张图里藏着的误导。
| 节 | 核心问题 | 你能带走的能力 |
|---|---|---|
| 3.1 NumPy | 怎么把数收拾干净再画 | 清洗、转换、聚合,直连绘图 |
| 3.2 Pandas | 怎么用表格一行出图 | plot 方法与精细控制两套路径 |
| 3.3 统计图形 | 分布和相关性怎么挖 | 为不同分析目的选对统计图形 |
| 3.4 原则实践 | 图怎么才清晰且不误导 | 选图、配色、标注的判断标准 |
四节是"备料 → 出图 → 深挖 → 质检"的顺序,前面每一节都在为后面铺路。没有 3.1 的清洗,3.2 画出来的图就是脏的;没有 3.2 的整理,3.3 的统计图形就缺一个干净的输入;而 3.4 的原则,贯穿于前面每一张图里。
3.1 NumPy 造数与清洗 │ ▼ 3.2 Pandas 整理与聚合 ──────► 3.3 高级统计图形 │ │ └──────────► 3.4 可视化原则 ◄┘
⚠️ 别把这一章读成"库的用法手册"。NumPy、Pandas、Matplotlib 只是三个零件,真正的目标是让它们在一个流程里咬合起来——很多人画不出好图,不是不会调用函数,而是没把数收拾好就急着画。先把流程跑通,再回头抠细节。
💡 读这一章时,与其纠结某个参数的确切默认值,不如盯住一个更本质的问题:这张图到底要回答什么。带着问题去选图形、配颜色,比背参数记得更牢。好图的标准只有一个——别人一眼就懂你想说什么。