5.1 数据描述与整理:把观察变成数字


5.1 数据描述与整理:把观察变成数字

描述统计用几个关键数字概括一整批数据:均值、中位数、方差、标准差。本节用一班学生的身高数据手算全部统计量,讨论"均值被极端值绑架"的经典陷阱,并引入频数分布表与直方图。它是"骰子争论"的前半段——大公先得有长期观察记录,才谈得上比较频率。

一组数据先摆上桌

某班 15 名学生的身高(厘米):158, 162, 165, 167, 168, 170, 170, 171, 172, 174, 175, 176, 178, 180, 185。

均值:全加起来除以 15。求和 = 158+162+165+167+168+170+170+171+172+174+175+176+178+180+185。逐个累加:158+162=320;+165=485;+167=652;+168=820;+170=990;+170=1160;+171=1331;+172=1503;+174=1677;+175=1852;+176=2028;+178=2206;+180=2386;+185=2571。均值 = 2571 ÷ 15 = **171.4 厘米**。

中位数:排序后取正中间(第 8 个)= 171 厘米。15 个数恰好奇数个,中位数唯一。

众数:出现次数最多的 170(出现两次)。

>>> data = [158,162,165,167,168,170,170,171,172,174,175,176,178,180,185] >>> sum(data)/len(data) 171.4 >>> sorted(data)[7] # 中位数:排序取第 8 个 171 >>> from statistics import mean, median, stdev >>> mean(data), median(data) (171.4, 171)

手算与 statistics 模块一致。

均值会撒谎:极端值的绑架案

把最后一个 185 换成篮球特长生的 201:均值变为 (2571 - 185 + 201) ÷ 15 = 2587 ÷ 15 ≈ 172.47——涨了 1 厘米;中位数纹丝不动(还是第 8 位的 171)。若换成 2 米 21 的校队中锋:均值 ≈ 173.8,中位数依旧 171。三个"中心"的个性一目了然:

统计量 抗极端值 何时用
均值 不抗 数据对称、无离群点
中位数 收入、房价等偏态数据
众数 分类数据(如最畅销尺码)

"平均工资被老板拉高"的新闻争议,本质就是均值与中位数的差异——看到"平均"二字先问一句:分布偏不偏?

方差与标准差:离散程度的度量

中心说了"大概多高",还差一句"参差到什么程度"。方差 = 各数与均值之差的平方的平均:s 平方 = Σ(xi − 均值) 平方 ÷ n。标准差是方差的算术平方根,量纲回到原单位。

手算(用原始数据,均值 171.4):

  • 偏差:-13.4, -9.4, -6.4, -4.4, -3.4, -1.4, -1.4, -0.4, 0.6, 2.6, 3.6, 4.6, 6.6, 8.6, 13.6
  • 平方和:179.56 + 88.36 + 40.96 + 19.36 + 11.56 + 1.96 + 1.96 + 0.16 + 0.36 + 6.76 + 12.96 + 21.16 + 43.56 + 73.96 + 184.96

逐项累加:179.56+88.36=267.92;+40.96=308.88;+19.36=328.24;+11.56=339.8;+1.96=341.76;+1.96=343.72;+0.16=343.88;+0.36=344.24;+6.76=351;+12.96=363.96;+21.16=385.12;+43.56=428.68;+73.96=502.64;+184.96=**687.6**。

方差 = 687.6 ÷ 15 = 45.84(总体口径);标准差 ≈ 6.77 厘米

>>> from statistics import pvariance, pstdev >>> pvariance(data), pstdev(data) (45.84, 6.770538980589944) >>> # 换上 2米21 特长生后的对比 >>> data2 = data[:-1] + [221] >>> round(pstdev(data2), 2) 12.24

一人之差,标准差从 6.77 飙到 12.24——离散度对极端值比均值更敏感(平方放大了离群的偏差)。

频数分布表与直方图

把数据分组:155-160 一人、161-165 两人、166-170 五人、171-175 五人、176-180 两人、181-185 一人。直方图上一看便知:中间高两头低,接近对称——这个形状在 5.3 节将升格为"正态分布"的原型。

⚠️ 常见坑:样本标准差(除 n−1)与总体标准差(除 n)是两个口径,小样本时差异明显(本例 n=15:样本方差 49.11,比总体口径大 7%)。看文献报标准差先查清楚口径。

标准化:把两场考试放进同一把尺

小明数学 85 分(全班均值 78、标准差 6),英语 88 分(均值 82、标准差 10),哪科相对更好?原始分不可比,标准化后可比:z 分数 = (原始分 − 均值) ÷ 标准差。数学 z = 7/6 ≈ 1.17,英语 z = 6/10 = 0.60——数学的相对位次明显更高。z 的含义是"高于均值几个标准差",正态世界里约 84% 的人低于 z = 1.17。5.3 节的正态分布将给这个直觉精确形状。

>>> (85-78)/6, (88-82)/10 (1.1666666666666667, 0.6)

常见问题

问:什么时候看中位数、什么时候看均值?
答:分布对称无离群点时两者接近;一旦右偏(收入、房价、响应时间常如此),均值被长尾拖高,中位数更能代表"典型个体"。两个都报、再附标准差,是诚实做法。

问:四分位距是什么?
答:上四分位减下四分位,中间 50% 数据的宽度,比标准差更抗极端值,箱线图的"箱子"用它画边。

本节要点回顾

  • 均值、中位数、众数各有所长:偏态数据报中位数更诚实;
  • 方差 = 平方偏差的平均,标准差回到原单位,平方让离群点权重暴增
  • 一名 2 米 21 特长生让标准差翻近一倍——离散度是敏感指标;
  • 频数直方图是分布的草图,"中间高两头低"是正态的先声;
  • 两个标准差口径(n 与 n−1)不可混谈。

数据的语言备齐了,下一节给"不确定"本身立规矩——从大公数错的骰子说起。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U