第 1 章 向量


文档摘要

第 1 章 向量 向量是机器学习的通用语言。几乎所有的数据——图像、文本、音频、用户行为——最终都会被表示成一组数字,也就是向量。本章从最朴素的「什么是向量」讲起,一路走到向量空间、范数、相似度、基与对偶,为后续所有章节打下线性代数的地基。 本章简介 向量之所以重要,是因为它让我们能用同一套几何语言处理截然不同的数据:一张图片、一句话、一段语音,都可以是某个高维空间中的一个点。一旦数据变成了向量,我们就能谈论「远近」「方向」「相似」「投影」,进而度量、聚类、检索、做注意力。本章的目标是建立这套直觉和工具箱,并把它们与 ML 中的真实场景(特征向量、PCA、嵌入检索)连接起来。 本章小节 向量空间:向量、加法、数乘、封闭性公理、子空间,以及为什么几乎一切都能被表示为向量。

第 1 章 向量

向量是机器学习的通用语言。几乎所有的数据——图像、文本、音频、用户行为——最终都会被表示成一组数字,也就是向量。本章从最朴素的「什么是向量」讲起,一路走到向量空间、范数、相似度、基与对偶,为后续所有章节打下线性代数的地基。

本章简介

向量之所以重要,是因为它让我们能用同一套几何语言处理截然不同的数据:一张图片、一句话、一段语音,都可以是某个高维空间中的一个点。一旦数据变成了向量,我们就能谈论「远近」「方向」「相似」「投影」,进而度量、聚类、检索、做注意力。本章的目标是建立这套直觉和工具箱,并把它们与 ML 中的真实场景(特征向量、PCA、嵌入检索)连接起来。

本章小节

  • 向量空间:向量、加法、数乘、封闭性公理、子空间,以及为什么几乎一切都能被表示为向量。
  • 向量性质:大小、方向、单位向量、相等、平行、正交、线性无关、稀疏性。
  • 范数与度量:L1、L2、L∞ 范数,欧几里得与曼哈顿距离,余弦相似度,以及如何为 kNN、聚类、检索选择合适的距离函数。
  • 向量积:内积、点积、投影、余弦相似度、叉积、外积、三重积——支撑注意力机制和几何推理的基本运算。
  • 基与对偶:线性无关、生成集、基变换、对偶空间、余向量——PCA、特征变换和注意力查询背后的原理。

学习路径

  • 前置知识:基本的算术与一点代数直觉即可,不要求先学过线性代数。
  • 后续章节:本章是第 2 章(矩阵)的直接基础;范数与点积会在第 3 章(微积分、优化)和第 6 章(机器学习)中反复出现;余弦相似度是第 7 章(嵌入)和第 10 章(多模态检索)的核心工具。

关键概念速览

  • 向量空间(vector space):一组可相加、可数乘且不离开该集合的对象。
  • 范数(norm):衡量单个向量「有多大」的函数,如 L2 欧几里得范数。
  • 点积 / 内积(dot product):衡量两个向量方向一致程度的运算,\mathbf{a}\cdot\mathbf{b}=\|\mathbf{a}\|\|\mathbf{b}\|\cos\theta
  • 余弦相似度(cosine similarity):归一化的点积,只看方向、忽略长度,取值在 [-1, 1]
  • 线性无关(linear independence):没有一个向量能由其他向量组合得到,每个都贡献新方向。
  • 基(basis):线性无关且能生成整个空间的一组向量;基变换就是换一种坐标系描述同一个向量。

发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U