算法与数学基础 · 第 6 期

向量与嵌入:把词变成坐标

word2vec · words as coordinates

"国王 − 男人 + 女人 = 女王"——这不是巧合,是词嵌入。每个词被映射成高维向量,相似词靠得近,关系词方向一致。词嵌入让机器第一次"理解"了语义,是所有现代 NLP 的起点。
⏱ 约 10 分钟 🎯 用过 ChatGPT 但不懂词向量的人 📦 源:ht-zvec

01一个反共识:词没有意义,向量才有

机器看不懂"国王"两个字,它只看得懂数字。词嵌入就是把每个词变成一串数字(向量),让"语义相似"变成"距离相近"。

国王 → [0.21, −0.43, 0.88, …] ∈ ℝ³⁰⁰

word2vec 的训练原理很朴素:一个词的向量,应该能预测它周围的词(Skip-gram)。训练完,向量空间里就出现了神奇的几何结构——"国王−男人+女人≈女王","巴黎−法国+中国≈北京"。语义关系,被编码成了向量方向。

词没有意义,
向量才有。
灏天文库 · 算法与数学基础 P.32

02词嵌入可视化:点词看相似与类比

下面是词向量降到二维后的投影(真实是 300 维,这里简化)。点一个词,看它和谁最像;点"类比",看 国王−男人+女人 落在哪。

🧭 词嵌入可视化
点词看最近邻,点"类比演示"看向量加减。

选一个词

点左侧任一词,看它最近的 3 个邻居。
注:二维投影会扭曲真实距离,仅示意。真实词向量在 300 维空间里,相似度远比这里清晰。

03词嵌入的三个关键性质

性质一

相似词聚簇

猫、狗、兔 在空间里靠在一起,因为它们出现在相似的上下文里。

性质二

关系成方向

"国王→女王"和"男人→女人"是平行向量,性别关系被编码成同一方向。

性质三

类比可加减

a−b+c 的最近邻,常给出符合类比的词。这是词嵌入最迷人的能力。

局限

偏见会继承

训练语料有性别/种族偏见,向量里就有。嵌入不是中立,是语料的镜子。

词嵌入是现代 NLP 的基石:BERT、GPT 都从嵌入层开始。理解了"词是向量",就理解了为什么大模型能做类比、推理、翻译——它们不是在理解语言,是在向量空间里做几何运算。

大模型不是在懂语言,
是在做几何。
灏天文库 · 算法与数学基础 P.34

04带走这套清单

✅ 词嵌入 5 条可执行规则

  1. 把词变向量是 NLP 第一步:相似度、聚类、类比都建立在向量上。
  2. 训练原理是"上下文预测词":词的向量由它出现的邻居决定。
  3. 类比用向量加减:a−b+c 的最近邻常给出符合直觉的词。
  4. 嵌入会继承语料偏见:用前先审计,别迷信"客观"。
  5. 维度别太低也别太高:50–300 常用,太高过拟合,太低丢信息。
语义,
就是几何。
灏天文库 · 算法与数学基础 P.35