跨模态生成


文档摘要

跨模态生成 跨模态生成(cross-modal generation)根据一种模态的输入产生另一种模态的输出:文生图、图生文、文生音频等等。本文件涵盖 DALL-E、Stable Diffusion、无分类器引导(classifier-free guidance)、ControlNet、图像描述生成、文生视频(Sora)以及文生音频。 在本章的第 01–03 节中,你学习了如何表征、对齐和分词不同的模态。现在进入创造性的环节:从一种模态生成另一种模态。跨模态生成是文生图工具、视频合成系统、音乐作曲模型以及图像描述生成背后的引擎。把它想象成教一台机器成为多媒体艺术家——你用文字描述你想要什么,它就画出来、动起来、或者谱写成曲。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U