第 10 章 多模态学习 本章带你走进能够同时「看图、读文、听声、看视频」的 AI 系统。多模态学习是 GPT-4o、Gemini 这类能同时理解图像、视频、文本与音频的模型的核心技术,也是通往通用智能的关键一跃。 本章简介 在第 7 章我们学会了让模型「读懂语言」,在第 8 章学会了让它「看懂图像」,在第 9 章学会了让它「听懂声音」。但真实世界从来不是单模态的——你看到一只狗在叫、听到它吠、还可能用文字描述它「是一只金毛」。多模态学习(multimodal learning)研究的就是如何让机器像人一样,把视觉、语言、音频乃至视频这些截然不同的信息通道融合到一个统一的表征与推理系统中。