图像与视频分词 图像与视频分词把连续的视觉数据转换成离散的词元序列,让 transformer 能像处理文本一样处理它们。本文件涵盖 VQ-VAE、VQ-GAN、码本学习、DALL-E 的 dVAE、视频分词以及无查表量化。 为什么要给图像分词 把语言想象成一个有限的字母表:英语大约有 26 个字母,而现代语言模型把文本切成 30,000 到 100,000 个子词词元。每个句子都变成一串离散符号序列,transformer 可以一个一个地预测。而图像则生活在一个连续、高维的空间里:一张 256x256 的 RGB 图像是 $\mathbb{R}^{256 \times 256 \times 3} \approx \mathbb{R}^{196{,}608}$ 中的一个点。