描述统计用几个关键数字概括一整批数据:均值、中位数、方差、标准差。本节用一班学生的身高数据手算全部统计量,讨论"均值被极端值绑架"的经典陷阱,并引入频数分布表与直方图。它是"骰子争论"的前半段——大公先得有长期观察记录,才谈得上比较频率。
某班 15 名学生的身高(厘米):158, 162, 165, 167, 168, 170, 170, 171, 172, 174, 175, 176, 178, 180, 185。
均值:全加起来除以 15。求和 = 158+162+165+167+168+170+170+171+172+174+175+176+178+180+185。逐个累加:158+162=320;+165=485;+167=652;+168=820;+170=990;+170=1160;+171=1331;+172=1503;+174=1677;+175=1852;+176=2028;+178=2206;+180=2386;+185=2571。均值 = 2571 ÷ 15 = **171.4 厘米**。
中位数:排序后取正中间(第 8 个)= 171 厘米。15 个数恰好奇数个,中位数唯一。
众数:出现次数最多的 170(出现两次)。
>>> data = [158,162,165,167,168,170,170,171,172,174,175,176,178,180,185] >>> sum(data)/len(data) 171.4 >>> sorted(data)[7] # 中位数:排序取第 8 个 171 >>> from statistics import mean, median, stdev >>> mean(data), median(data) (171.4, 171)
手算与 statistics 模块一致。
把最后一个 185 换成篮球特长生的 201:均值变为 (2571 - 185 + 201) ÷ 15 = 2587 ÷ 15 ≈ 172.47——涨了 1 厘米;中位数纹丝不动(还是第 8 位的 171)。若换成 2 米 21 的校队中锋:均值 ≈ 173.8,中位数依旧 171。三个"中心"的个性一目了然:
| 统计量 | 抗极端值 | 何时用 |
|---|---|---|
| 均值 | 不抗 | 数据对称、无离群点 |
| 中位数 | 抗 | 收入、房价等偏态数据 |
| 众数 | 抗 | 分类数据(如最畅销尺码) |
"平均工资被老板拉高"的新闻争议,本质就是均值与中位数的差异——看到"平均"二字先问一句:分布偏不偏?
中心说了"大概多高",还差一句"参差到什么程度"。方差 = 各数与均值之差的平方的平均:s 平方 = Σ(xi − 均值) 平方 ÷ n。标准差是方差的算术平方根,量纲回到原单位。
手算(用原始数据,均值 171.4):
逐项累加:179.56+88.36=267.92;+40.96=308.88;+19.36=328.24;+11.56=339.8;+1.96=341.76;+1.96=343.72;+0.16=343.88;+0.36=344.24;+6.76=351;+12.96=363.96;+21.16=385.12;+43.56=428.68;+73.96=502.64;+184.96=**687.6**。
方差 = 687.6 ÷ 15 = 45.84(总体口径);标准差 ≈ 6.77 厘米。
>>> from statistics import pvariance, pstdev >>> pvariance(data), pstdev(data) (45.84, 6.770538980589944) >>> # 换上 2米21 特长生后的对比 >>> data2 = data[:-1] + [221] >>> round(pstdev(data2), 2) 12.24
一人之差,标准差从 6.77 飙到 12.24——离散度对极端值比均值更敏感(平方放大了离群的偏差)。
把数据分组:155-160 一人、161-165 两人、166-170 五人、171-175 五人、176-180 两人、181-185 一人。直方图上一看便知:中间高两头低,接近对称——这个形状在 5.3 节将升格为"正态分布"的原型。
⚠️ 常见坑:样本标准差(除 n−1)与总体标准差(除 n)是两个口径,小样本时差异明显(本例 n=15:样本方差 49.11,比总体口径大 7%)。看文献报标准差先查清楚口径。
小明数学 85 分(全班均值 78、标准差 6),英语 88 分(均值 82、标准差 10),哪科相对更好?原始分不可比,标准化后可比:z 分数 = (原始分 − 均值) ÷ 标准差。数学 z = 7/6 ≈ 1.17,英语 z = 6/10 = 0.60——数学的相对位次明显更高。z 的含义是"高于均值几个标准差",正态世界里约 84% 的人低于 z = 1.17。5.3 节的正态分布将给这个直觉精确形状。
>>> (85-78)/6, (88-82)/10 (1.1666666666666667, 0.6)
问:什么时候看中位数、什么时候看均值?
答:分布对称无离群点时两者接近;一旦右偏(收入、房价、响应时间常如此),均值被长尾拖高,中位数更能代表"典型个体"。两个都报、再附标准差,是诚实做法。
问:四分位距是什么?
答:上四分位减下四分位,中间 50% 数据的宽度,比标准差更抗极端值,箱线图的"箱子"用它画边。
数据的语言备齐了,下一节给"不确定"本身立规矩——从大公数错的骰子说起。