1.2 机器学习基本概念:从数据中学习的范式


1.2 机器学习基本概念:从数据中学习的范式

本节摘要:机器学习的定义是"计算机程序在任务 T 上的性能 P 随经验 E 的积累而提高"。本节对比传统编程与机器学习两种范式的根本差异,讲透数据、特征、标签、模型、训练、预测、评估、泛化这组贯穿全书的关键术语,并按学习信号把机器学习划分为监督学习、无监督学习、强化学习三大类型——这一划分将直接对应第二章与第四章的章节结构。

本节目标

阅读完本节,你应当能够:

  1. 用一句话说清机器学习与传统编程在"规则由谁提供"上的差异;
  2. 写出机器学习的形式化定义(任务 T、性能 P、经验 E);
  3. 准确使用特征、标签、训练集、验证集、测试集等术语;
  4. 区分过拟合与欠拟合,并说出各自的表现特征;
  5. 按数据信号将一个具体问题归入监督、无监督或强化学习。

一、两种范式:菜谱与学徒

判断一个数是不是偶数,你会写一段判断代码——规则明确、逻辑确定,传统编程驾轻就熟。但换一个任务:从照片里认出猫。你没法写出"猫"的规则——耳朵形状、毛色分布、姿态角度的组合近乎无穷。传统编程在这里彻底失效。

机器学习给出的方案是换一个供给关系:不给规则,给例子。喂给算法十万张人工标注过的猫与狗照片,让它自己从数据里把"猫的样子"总结出来。一个流传很广的对比是:传统编程像给厨师一本每一步都写死的菜谱;机器学习像给学徒一堆食材和做好的菜,让他通过品尝与反馈自己悟出做法

两种范式在结构上是对偶的:

传统编程: 规则(人写) + 数据 ──程序──> 答案 机器学习: 数据 + 答案(标注) ──学习算法──> 规则(模型)

注意箭头方向:机器学习是把"规则"从输入变成了输出。这个对偶关系也解释了为什么机器学习对数据质量的敏感度远高于传统软件——规则是从数据里"长"出来的,数据有偏,规则就有偏,垃圾进、垃圾出。

形式化地说,经典定义是:一个程序在任务 T(如垃圾邮件分类)上的性能 P(如准确率),随经验 E(历史标注邮件)的积累而提高。这一定义最早可追溯到 1959 年 Arthur Samuel 的表述——"无需明确编程即可赋予计算机学习能力",他当年写的就是那个会下跳棋、越下越好的程序。

二、关键术语:一张词汇表

术语 含义 房价预测例子
数据/样本 机器学习的原料,一行一个实例 一套房子的记录
特征 描述样本的输入属性 面积、卧室数、地段
标签 希望预测的输出 实际成交价
模型 学到的从特征到标签的映射函数 拟合出的定价公式
训练 用训练集调整模型参数的过程 让预测价贴近真实价
预测/推理 用训练好的模型处理新数据 给新挂牌房子估价
评估 用独立测试集量化模型好坏 在没见过的成交上算误差
泛化 模型在未见过数据上的表现能力 换一个区 still 估得准吗

其中最值得展开的是数据集划分与泛化。数据通常被切成三份:训练集用来调整模型参数,验证集用来调超参数与做模型选择,测试集只在最后做一次性的评估。测试集是"期末考试",绝不能在开发过程中反复偷看——一旦用它指导了任何决策,它就退化成了另一个验证集,评估结果随之虚高。

三、三大学习类型

按学习信号的不同,机器学习分为三类。判断依据只有一个问题:算法从环境中得到什么反馈?

1. 监督学习——有标准答案

数据形态是成对的输入与标签。两大任务:分类预测离散类别(垃圾邮件与否、猫狗鸟),回归预测连续数值(房价、气温、股价)。训练的本质是让预测输出不断逼近标签。

2. 无监督学习——没有答案,找结构

数据只有输入没有标签,目标是发现内在结构:聚类把相似样本分组(客户细分),降维在少丢信息的前提下压缩特征(PCA),关联规则挖共现关系(买尿布的人常买啤酒)。此外还有半监督学习(少量标签加大量无标签)与自监督学习(从数据自身构造伪标签,BERT、GPT 的预训练正是这条路)。

3. 强化学习——只有奖惩,要试错

智能体与环境交互,在状态 s 下采取动作 a,环境反馈奖励 r 并转移到新状态。目标是学一个策略,使长期累积奖励最大。AlphaGo、机器人控制、自动驾驶决策都属于此类。

三类范式的对比:

维度 监督学习 无监督学习 强化学习
数据形态 特征+标签 仅特征 状态-动作-奖励序列
反馈信号 即时、明确 延迟、稀疏
典型任务 分类、回归 聚类、降维 序列决策、控制
评估难度 容易(有标签) 较难(无标准答案) 复杂(看长期回报)
典型代价 标注成本高 结果解释主观 交互样本成本高

四、泛化:机器学习的真正考题

模型在训练集上表现好没有意义——把所有训练样本背下来就能得满分,这叫过拟合:训练误差很低、测试误差很高,说明模型学到的是训练数据里的噪声与偶然模式而非普遍规律。反面的欠拟合则是训练误差与测试误差都高,模型太简单,连基本模式都没抓住。

一个直观类比:学生 A 把题库答案全背了,模拟卷满分,高考换题就崩(过拟合);学生 B 连基本概念都没懂,哪种卷子都不及格(欠拟合);理想的学生 C 学会了解题方法,换题也会做——泛化能力好。

对抗过拟合的思路在第五章与第三章会反复出现:更多数据、更简单的模型、正则化惩罚、Dropout、早停、交叉验证。现在只需记住因果链:

模型容量过大 + 训练数据不足或噪声多 ──> 模型记住噪声 ──> 过拟合 │ └──> 解决方向:降容量 / 加数据 / 加约束 / 早停

💡 关键直觉:拿到一个"训练集准确率 99%、测试集 62%"的模型,不要去调模型,先回去查数据泄漏与划分方式——训练与测试集若有重叠,一切指标都是幻觉。

⚠️ 常见坑:用测试集调参。每次"看一眼测试集结果再改模型",都是在把测试信息泄漏进训练过程,最终上线表现会显著低于实验室指标。

五、三种范式的工程细节补充

自监督学习为什么重要。 介于三大类型之间的自监督学习值得单独一提:它从数据自身构造训练信号——把句子里的某个词遮住让模型猜(BERT 的掩码任务)、给模型看前一句让它续写下一句(GPT 的下一词任务)。标注成本为零、数据取之不尽,这是大模型得以在海量文本上预训练的技术前提。可以说,自监督把"标签从哪来"这个监督学习的头号瓶颈直接绕开了。

三种范式可以组合。 真实系统里范式经常混搭:先用无监督聚类做客户分群,再对每个群训练监督模型预测流失;用强化学习做推荐排序时,冷启动阶段靠监督模型先给一个过得去的初始策略。把三大类型当工具箱而不是信仰,组合使用的收益常大于单打独斗。

数据划分的进阶话题。 训练、验证、测试三切分是最简版本,实践中还有两个变体值得知道。其一是时间切分:金融、销量这类有时间结构的数据必须按时间先后切(用过去训练、用未来测试),随机切分会让模型"偷看未来",指标虚高。其二是分层抽样:类别不均衡时按各类别比例切分,保证每个子集里正例比例一致,否则某次划分可能把正例大多分进了测试集。

常见问题

多大的数据量算"够"? 没有普适答案,取决于特征维度、模型复杂度与信噪比。经验范围:简单线性模型几千条即可稳定,树集成几万条进入舒适区,深度网络在原始图像文本上通常要十万级以上,除非借助预训练与迁移。判断"够不够"的实用方法看学习曲线——训练误差与验证误差都高说明数据不够或特征弱;两者差距大才是过拟合。

标签有噪声怎么办? 现实标注错误率常有百分之几。轻度噪声多数算法能容忍;严重时优先清洗标签而非换模型——随机抽一批人工复核,估计噪声率,可疑样本重新标注或降权。模型永远不该学如何更好地拟合错误答案。

无标签数据闲着可惜,能强行用监督方法吗? 可以用半监督思路:先用少量标注样本训一个粗模型,对无标签数据打伪标签,把高置信的伪标签样本加入训练再迭代。效果因场景而异,但常比放弃这些数据好。

一节小结

  • 范式差异:传统编程输出答案,机器学习输出规则(模型),规则由数据中学习得来;
  • 经典定义:性能 P 随经验 E 在任务 T 上提高,Samuel 于 1959 年提出;
  • 三大划分:监督学习有标签、无监督学习找结构、强化学习靠奖励试错;
  • 数据三切分:训练集调参数、验证集调超参数、测试集只考一次;
  • 泛化是终极指标:过拟合=训练好测试差,欠拟合=全都差;
  • 标签决定范式:拿到一个业务问题,先问"标签从哪来、贵不贵",这决定后续一切技术路线。

下一节把镜头拉远,看一个机器学习项目从问题定义到线上监控的完整生命周期。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U