章节摘要:Pandas 是 Python 处理表格数据的绝对主力,核心是 Series 与 DataFrame 两个数据结构。本章从数据结构讲起,带你学会加载 CSV、Excel 等常见格式,掌握索引筛选、缺失值处理、分组聚合与多表合并。学完本章,你已经能独立完成一次"读表 → 清洗 → 分析 → 出结果"的完整数据任务。
阅读完本章,你应当能够:
一句话记住本章:DataFrame 就是一张能编程的电子表格——凡是 Excel 里点得出来的操作,Pandas 都有一行代码的对应物,而且能自动化、能上规模。

两个核心数据结构的内部组织、索引的作用、常用属性与创建方式,为后续所有操作打底。
read_csv、read_excel 加载,info、head、describe 探查,loc、iloc、布尔索引三种筛选姿势。
isnull 检测、dropna 删除、fillna 填充,以及列的新增、修改、删除、排序等日常操作。
groupby 分组统计、apply 变换、merge 与 concat 合并多表,完成跨表分析。
认识结构(3.1) → 读入数据(3.2) → 清洗整理(3.3) → 聚合合并(3.4) 数据长啥样 数据进来了 数据变干净 数据能出结论
前三节是"把数据放进表格并用好它",最后一节是"让表格自己说话"——分组聚合是 Pandas 分析能力的高潮。
Pandas 是全书信息密度最高的一章,也是"读表、查表、改表"最频繁用到的工具。练习路线建议:
四个高频坑提前标记:loc 含头含尾、iloc 含头不含尾、布尔组合条件用与或并加括号、fillna 默认返回新对象要重新赋值、merge 前先查重复键。这些坑在第 4、6 章还会以变体出现。
本章验收标准:拿到任意一张表,能在十分钟内完成"读入 → 探查 → 筛选 → 分组汇总 → 输出结果"的完整操作。