第 10 章 多模态学习


文档摘要

第 10 章 多模态学习 本章带你走进能够同时「看图、读文、听声、看视频」的 AI 系统。多模态学习是 GPT-4o、Gemini 这类能同时理解图像、视频、文本与音频的模型的核心技术,也是通往通用智能的关键一跃。 本章简介 在第 7 章我们学会了让模型「读懂语言」,在第 8 章学会了让它「看懂图像」,在第 9 章学会了让它「听懂声音」。但真实世界从来不是单模态的——你看到一只狗在叫、听到它吠、还可能用文字描述它「是一只金毛」。多模态学习(multimodal learning)研究的就是如何让机器像人一样,把视觉、语言、音频乃至视频这些截然不同的信息通道融合到一个统一的表征与推理系统中。

第 10 章 多模态学习

本章带你走进能够同时「看图、读文、听声、看视频」的 AI 系统。多模态学习是 GPT-4o、Gemini 这类能同时理解图像、视频、文本与音频的模型的核心技术,也是通往通用智能的关键一跃。

本章简介

在第 7 章我们学会了让模型「读懂语言」,在第 8 章学会了让它「看懂图像」,在第 9 章学会了让它「听懂声音」。但真实世界从来不是单模态的——你看到一只狗在叫、听到它吠、还可能用文字描述它「是一只金毛」。**多模态学习(multimodal learning)**研究的就是如何让机器像人一样,把视觉、语言、音频乃至视频这些截然不同的信息通道融合到一个统一的表征与推理系统中。

本章从最底层的「如何把不同模态对齐到同一个空间」讲起,一步步走到「如何让一个模型同时生成图像、视频、音频和文本」。你会遇到 CLIP、LLaVA、Flamingo、DALL-E、Stable Diffusion、Sora、Gemini、GPT-4o 等一系列里程碑式的模型,理解它们背后共享的少数几个核心思想:对比对齐、词元化、跨模态条件生成,以及统一架构。这些思想正是当今最强大 AI 系统的基石。

本章小节

  • 第 01 节 多模态表征(Multimodal Representations):讲解早期/中间/晚期融合策略、联合嵌入空间,以及 CLIP、ALIGN、SigLIP 如何用对比学习(InfoNCE、NT-Xent)把视觉与语言对齐,从而实现零样本分类与检索。

  • 第 02 节 视觉语言模型(Vision Language Models):从 VQA 和图像描述生成出发,介绍双编码器、融合编码器、编码器–解码器三种架构范式,以及 Flamingo、LLaVA、PaLI、Qwen-VL 等如何把视觉编码器接入大型语言模型,还涵盖视觉定位与免 OCR 文档理解。

  • 第 03 节 图像与视频分词(Image and Video Tokenisation):解释为什么以及如何把连续的像素和视频帧转换成离散词元,涵盖 VQ-VAE、VQ-GAN、码本坍缩、残差量化、有限标量量化(FSQ),以及 3D 与因果视频分词器。

  • 第 04 节 跨模态生成(Cross-Modal Generation):进入「创造」环节,讲解 DALL-E 的自回归生成、Stable Diffusion 的潜在扩散、无分类器引导(CFG)、ControlNet,以及文生视频(Sora、Wan)与文生音频(AudioLM、MusicGen)。

  • 第 05 节 统一多模态架构(Unified Multimodal Architectures):审视用一个模型处理所有模态的终极目标,涵盖任意到任意模型(CoDi、NExT-GPT)、原生多模态 LLM(Gemini、GPT-4o)、分阶段训练、多模态思维链、多模态智能体与世界模型。

学习路径

前置知识:本章建立在前面几章的基础之上。建议先掌握第 7 章(NLP 与语言模型,尤其是 transformer、注意力机制、下一个词元预测)、第 8 章(计算机视觉,尤其是 ViT、卷积网络、扩散模型)以及第 9 章(音频处理,尤其是梅尔频谱图、语音识别)。第 6 章(深度学习基础,VAE、GAN)中的自编码器与对抗训练概念也会在第 03 节反复出现。

后续章节:多模态能力是后续内容的重要前置。第 11 章自主系统(autonomous system)中的机器人与具身智能会把多模态感知与行动结合起来;第 17 章 AI 推理(AI reasoning)会大量用到多模态思维链与多模态智能体。世界模型这一节也直接为基于模型的强化学习埋下伏笔。

关键概念速览

  • 对比学习(contrastive learning):通过把匹配的对(如一张图和它的说明)拉近、把不匹配的对推远,学习一个让不同模态可以互换的共享嵌入空间,是 CLIP 系列模型的核心。

  • 联合嵌入空间(joint embedding space):一个共享的向量空间,图像、文本、音频等不同模态的输入都被映射进来,语义相近的样本距离也相近,从而支持零样本分类与跨模态检索。

  • 视觉词元流水线(visual token pipeline):把图像切成图块、用 ViT 编码、可选地压缩(Perceiver/Q-Former)、再投影到语言模型嵌入空间,最终与文本词元拼接送入 LLM 的标准流程。

  • 无分类器引导(classifier-free guidance,CFG):同时训练条件与无条件模型,并在采样时放大两者之差,使生成结果更贴合文本提示,是文生图与文生视频模型的「秘密武器」。

  • 分阶段训练(staged training):先做单模态预训练,再做跨模态对齐,接着联合多模态预训练,最后做指令微调,是一种让统一多模态模型稳定收敛的标准配方。

  • 世界模型(world model):一个能在潜在空间中预测世界下一个状态的内部模拟器,跨视觉、音频、语义等多模态给出未来预测,是具身智能与基于模型强化学习的关键组件。


作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U