第3章 Scikit-learn 实践应用


文档摘要

第3章 · Scikit-learn 实践应用 章节摘要:前两章我们把估计器、转换器、预测器、管道这些概念骨架搭好了,这一章把它们落到四类真实任务上:分类、回归、聚类、降维,最后补上模型的保存与部署,把整个机器学习闭环走完。你会先看到每类任务最趁手的算法怎么选、怎么跑通一个最小可用的流程,再回头理解评估指标和参数取舍。读完这一章,你应该能独立挑一个任务,从加载数据一路做到把训练好的模型序列化成文件,并知道部署时要盯住版本、环境、安全这几个坑。

第3章 · Scikit-learn 实践应用

章节摘要:前两章我们把估计器、转换器、预测器、管道这些概念骨架搭好了,这一章把它们落到四类真实任务上:分类、回归、聚类、降维,最后补上模型的保存与部署,把整个机器学习闭环走完。你会先看到每类任务最趁手的算法怎么选、怎么跑通一个最小可用的流程,再回头理解评估指标和参数取舍。读完这一章,你应该能独立挑一个任务,从加载数据一路做到把训练好的模型序列化成文件,并知道部署时要盯住版本、环境、安全这几个坑。

核心问题

阅读完本章,你应当能够:

  1. 说清分类、回归、聚类、降维四类任务各自的输入输出和典型应用场景
  2. 根据数据规模、线性可分性和解释性需求,从逻辑回归、SVM、决策树、随机森林里挑一个合适的分类器
  3. 用精确率、召回率、F1、AUC 这些指标判断分类好坏,而不是只盯准确率
  4. 区分 KMeans、层次聚类、DBSCAN 对簇形状的不同假设,并在无标签时评估聚类
  5. 讲清 PCA、LDA、t-SNE 各自适合的目标,用 PCA 做一次可视化降维
  6. 用 joblib 或 pickle 保存模型,并说明部署时的版本兼容与安全注意事项

核心概念速览

这一章的五节,正好对应一条从"问题"到"落地"的链路:前四节处理不同形态的数据和任务,第五节把前面训练出来的任何模型统一收口成可部署的产物。

先挑对算法,再用对指标,最后让模型走出训练脚本——这就是实践和"看懂原理"之间的那条分界线。

小节 回答的核心问题 你能带走的能力
3.1 分类任务 样本属于哪一类 选分类器、读混淆矩阵与各项指标
3.2 回归任务 连续数值是多少 选回归器、读懂误差指标
3.3 聚类任务 没标签怎么分组 对比三种聚类、用内部指标评估
3.4 降维任务 特征太多怎么办 区分 PCA、LDA、t-SNE 的用途
3.5 持久化与部署 模型怎么留存上线 序列化、版本兼容、部署注意

这条链路读起来是线性的,实际用的时候却是反复横跳的:你可能先跑分类,发现特征太多,跳到降维做压缩,再回来训练,最后统一走到持久化。章内的顺序只是为了讲清楚,不是规定你必须按部就班。四个任务里,降维常常以"预处理步骤"的身份插在别的前面,读的时候留意这一点。

⚠️ 别把这一章当算法目录背。四个任务的骨架是同一套——切分、预处理、训练、评估——真正要下功夫的是选型取舍和指标读法,而不是背 API。

💡 动手时先跑最小例子,再回头补原理。这一章每一节都以"能跑通"开头,就是这个用意:跑起来了,后面的取舍才有落点。

子章节导航

3.1 分类任务

监督学习里最常见的一类。从一段能直接跑的分类代码入手,讲清二分类、多分类、多标签的区别,再逐个拆解逻辑回归、SVM、决策树、随机森林的适用边界,最后落到精确率、召回率、F1、AUC 这些指标怎么读。

3.2 回归任务

预测目标从离散类别换成连续数值。先跑线性回归的最小例子,再讲线性模型、树模型和 L1、L2 正则化的取舍,最后解释 MSE、MAE、R 平方这些指标为什么不能脱离量纲单独看。

3.3 聚类任务

数据没有标签时的分组问题。对比 KMeans、层次聚类、DBSCAN 三种算法对簇形状的不同假设,并回答一个反直觉的问题:没有标准答案,怎么判断聚类做得好不好。

3.4 降维任务

特征太多会带来维度灾难。把降维拆成特征选择与特征提取两条路,重点讲 PCA 找方差最大方向、LDA 找类别可分方向、t-SNE 专做可视化,让你在"去噪压缩"和"画图探索"之间选对工具。

3.5 模型持久化与部署

训练好的模型不能只活在内存里。对比 pickle 与 joblib 的取舍,讲清版本兼容这个最容易踩的坑,再落到在线服务与批处理两种部署方式,以及版本、环境、输入校验这些工程细节。

子章节之间的逻辑关系

前四节是并列的四类任务,共同依赖第 2 章的估计器与管道;第五节是一条收口线,把任何一类任务产出的模型统一转成可复用的文件。

┌──────────── 3.1 分类任务 ────────────┐ 第2章 核心概念 ──▶ │ 3.2 回归任务 3.3 聚类任务 │ ──▶ 3.5 模型持久化与部署 ──▶ 生产环境 (估计器/管道) │ 3.4 降维任务(常作为前三者的前置) │ └─────────────────────────────────────┘

降维这一节的位置有点特别:它既可以独立成题,也常常作为分类、回归、聚类之前的数据预处理步骤出现。读的时候可以把它理解成一条"侧支",需要时插到主流程前面。

前置知识与后续延伸

  • 前置:需要先熟悉第 2 章的估计器、转换器、预测器三件套,尤其是 fit、transform、predict 这套统一接口。本章每一节的最小例子都建立在它之上,看不懂 fit 就回看第 2 章。
  • 数据基础:最好能读 Pandas 和 NumPy 的数据结构。本章代码里 X 是二维特征矩阵、y 是一维目标向量,这个约定贯穿始终,聚类那一节会特意丢掉 y。
  • 为后续铺垫:本章的算法选择和评估习惯,会直接延续到第 4 章——自定义估计器要复刻同样的接口,集成方法是对本章随机森林思路的深化,模型解释性则是把"评估"从分数延伸到"为什么这么判"。第 3.5 节的持久化,也是第 4 章所有进阶模型最终落地的共同出口。

本章要点回顾

  • 四类任务一条骨架:分类、回归、聚类、降维都是"切分、预处理、训练、评估",差别在输出形态与指标读法。
  • 选型先于调参:按数据规模、线性可分性、解释性需求挑算法,比换着跑一遍碰运气靠谱。
  • 指标看任务:分类看精确率、召回率、F1、AUC;回归看 MSE、MAE、R 平方;聚类用内部指标;都别只盯单一数字。
  • 降维是侧支:既可以独立成题,也常作为其他任务的预处理步骤插在主流程前面。
  • 持久化是收口:joblib 或 pickle 存模型,部署盯版本、环境、输入校验。

实战闭环走完,第 4 章从"会用"走向"能改、能拼、能造"。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U