词嵌入与序列模型 词嵌入把稀疏的符号化文本压缩进稠密的向量空间,在那里,语义相似性就变成了几何上的邻近。本文件涵盖 Word2Vec(CBOW、Skip-gram)、GloVe、FastText、RNN、LSTM、GRU、带注意力的 seq2seq,以及编码器-解码器范式——从词袋模型走向上下文表示的整条进阶之路。 在第 1 节里,我们引入了分布式假设:出现在相似语境中的词,往往意义也相似。在第 2 节中,我们用 TF-IDF 向量这类手工构造的稀疏特征来表示文本。这些向量生活在非常高维的空间里(每个词表词一维),而且大多是零。词嵌入(word embedding)把这些信息压缩成稠密的低维向量,捕捉语义关系,并且是直接从数据中学出来的。