视觉 Transformer 与生成模型


文档摘要

视觉 Transformer 与生成模型 视觉 Transformer(Vision Transformer)把自注意力用到了图像块上,用数据驱动的空间学习挑战了 CNN 的统治地位。本文件涵盖 ViT、DeiT、Swin Transformer,以及用 GAN(StyleGAN)、VAE 和扩散模型(DDPM、Stable Diffusion)做图像生成,再加上超分辨率和神经风格迁移。 CNN(文件 02)内置了很强的空间归纳偏置:局部连接、权重共享、平移等变性。视觉 Transformer 提出了一个很尖锐的问题:如果我们完全丢掉这些归纳偏置,只用第 6 章的注意力机制,让模型从数据中自己学空间结构,会怎么样?


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U