3.2 数据分析方法的演进


3.2 数据分析方法的演进

本节摘要:数据分析在 Matlab 里从描述统计起步,经分组聚合、分布检验,演化到拟合与建模。本节讲清这条方法链的每一环——描述统计、分组汇总、相关与分布、曲线拟合——并说明各环节在决策中的位置。

从"均值是多少"到"规律是什么"

分析方法的演化动力是问题变难。第一代问题:均值多少、波动多大——描述统计就够;第二代问题:不同设备、不同批次之间有差别吗——分组聚合登场;第三代问题:两个量之间是什么关系、能否预测——相关、拟合与模型接棒。三代问题对应三代工具,每一代都建立在前一代的结论之上:不先看分布就做拟合,是新手最典型的越级。

第一环:描述统计与分布形态

x = T.temperature; m = mean(x, 'omitmissing'); s = std(x, 'omitmissing'); q = quantile(x, [0.25 0.5 0.75]); histogram(x, 'Normalization', 'pdf') % 直方图按密度归一

看形态先于看数值:直方图双峰,说明样本里混了两个总体,此时均值两头不沾,讨论它没有意义。

第二环:分组聚合

table 时代最顺手的分析写法是按组汇总:

G = groupsummary(T, 'device_id', 'mean', 'temperature'); % 按设备分组 统计量 目标列

一行替代"外层循环设备、内层算均值、结果拼表"的十五行。演化视角看,这类高层函数是语言吸收了用户惯用模式后的沉淀——社区里人人手写的那段循环,最终变成了内置函数。

第三环:相关、检验与拟合

r = corr(T.temperature, T.pressure, ... 'Rows', 'complete'); % 相关系数 [p, tbl] = ttest(x1, x2); % 双样本t检验,判断差异是否显著

相关系数量化线性关系,但要警惕混杂变量:气温与空调销量相关,靠的都是第三个变量"天气热"。

拟合用曲线拟合的是"规律的形状":

f = fit(T.t, T.y, 'poly2'); % 二次多项式 plot(f, T.t, T.y); % 拟合线与原始散点同图 gof = f;

模型选择上我的习惯是从最低阶试起:直线能解释的绝不上多项式,多项式能解释的绝不上神经网络——每一分复杂度都要用解释力来换,换不来就是过拟合。

💡 关键直觉:相关回答"是否同步变化",检验回答"差异是否可能是巧合",拟合回答"能否用公式预测"。三者回答的问题不同,不可互相替代。

完整案例:一次分组对比的全程

背景:三条产线各产出几十个零件,测了关键尺寸,问"三条线是否一致"。先分组看统计量,再检验两两差异,最后给出工程结论:

T = table(line, dim, ... 'VariableNames', {'line','dim'}); G = groupsummary(T, 'line', ... {'mean','std','median'}, 'dim') % 每线一条记录 [p1, st1] = ttest(T.dim(T.line=="A"), T.dim(T.line=="B")); fprintf('A对B:p = %.4f\n', p1) % p小于0.05才谈差异 boxchart(T.dim, 'GroupByColor', T.line) % 分布形状同图对比

解读的纪律是:p 值显著只说明"差异不像巧合",差异是否要紧还得看效应量——两线均值差 0.02 毫米,即便 p 值极小,公差若是 1 毫米就无工程意义。箱线图在此承担"看形状"的职责:某条线若箱体明显更长,说明它不稳定,这常常比均值偏移更值得追查。变式是把 ttest 换成非参数的秩和检验,当分布明显偏斜或样本量小时它更稳。

拟合质量怎么判断

拟合的坑集中在"看着贴合其实失真"。判断质量看三样:残差形态、拟合优度、交叉验证。残差应该像无结构的噪声,若残差随自变量出现弯曲或喇叭形张开,说明模型阶数不够或方差不齐:

f = fit(T.t, T.y, 'poly2'); plot(f, T.t, T.y); hold on rs = T.y - feval(f, T.t); plot(T.t, rs, '.') % 残差散点:应无趋势

多项式阶数的对比有个朴素实验可做:同一数据分别用一、二、三次拟合,把样本随机分成训练与验证两半,比较验证集误差。阶数升高训练误差总在降,验证误差在某阶之后回升——回升的那个拐点就是过拟合开始的信号。这个实验十分钟就能跑完,做过一次,"复杂度要有解释力回报"就从口号变成体感。

辨析:相关、回归与函数关系

三者常被混用。相关只陈述"共变"且对称(x 与 y 的相关等于 y 与 x 的);回归不对称,拟合的是条件期望,x 对 y 回归与 y 对 x 回归是两条不同的线;函数关系则是确定性的理论关系(欧姆定律),数据拟合只是对它的估计。实践中顺序应当是:散点图看有无关系形态,相关系数量化强度,回归给出可预测的公式,三者任何一步跳过散点图直接算数,都是在给"数字相关、实际无关"的伪关系开门。

样本量是贯穿以上所有方法的隐形约束。相关系数在 n 等于 5 时随便凑也能到 0.8,t 检验在每组不足十个样本时对偏斜极其敏感,拟合点数不超过参数个数时残差毫无意义。拿到数据先数一下行数,再决定用什么方法,这个动作十秒钟,却能把一大类"方法没选错、样本不够格"的错误挡在门外。样本不足时的正路是继续采集或改用非参数方法并明说局限,而不是给结果多留几位小数。

分组统计还有一个实务细节值得单独提醒:分组键要先做类型清理。设备编号这一列在导入时若被识别成数值,groupsummary 会把它当连续变量、每组只剩一条记录,统计瞬间失真;正确做法是导入后立刻把编号转成 categorical,分组语义才算钉死。同类问题还有大小写不一致的类别名("A"与"a" 被当成两组)、带首尾空格的标签,清洗阶段跑一遍 unique 检查类别清单,一分钟就能把这些伪装者全部现形。

本节要点回顾

  • 先看分布再谈统计量,双峰数据谈均值是空转;
  • groupsummary 一行完成分组聚合,是 table 时代的分析主力;
  • 相关不等于因果,警惕混杂变量;
  • t 检验把"差异"与"巧合"分开,显著性是结论的地基;
  • 拟合从低阶起步,复杂度必须有解释力回报。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U