第1章 单模态局限与多模态导论 章节摘要 人类感知世界从不依赖单一通道——我们用眼睛看、用耳朵听、用语言沟通,不同模态(Modality)的信息在大脑中相互印证、彼此补全。然而过去十年的深度学习,绝大多数模型都只精通一种模态:视觉模型(如 ResNet)擅长分类图像却看不懂图中的故事,语言模型(如 BERT、GPT)能写文章却对一张随手拍的照片束手无策。这种单模态局限正是「多模态大模型」(Multimodal Large Language Model, MLLM)诞生的根本动因。
人类感知世界从不依赖单一通道——我们用眼睛看、用耳朵听、用语言沟通,不同模态(Modality)的信息在大脑中相互印证、彼此补全。然而过去十年的深度学习,绝大多数模型都只精通一种模态:视觉模型(如 ResNet)擅长分类图像却看不懂图中的故事,语言模型(如 BERT、GPT)能写文章却对一张随手拍的照片束手无策。这种单模态局限正是「多模态大模型」(Multimodal Large Language Model, MLLM)诞生的根本动因。本章作为整份教程的起点,先剖析单模态模型在真实场景中遇到的天花板,再给出多模态大模型的核心定义与五大关键能力,最后梳理从早期双流网络到 CLIP、再到 GPT-4V 一路演进的技术脉络,并在章末提供 GPT-4o、Gemini 2.x、Claude 3.5 Sonnet 视觉等 2024–2026 前沿模型的全景速览。
完成本章后,你应当能够:
本章共 4 个子节,按「问题—定义—历史—前沿」的逻辑展开:
四个子节之间是层层递进的:1.1 制造需求,1.2 给出概念框架,1.3 用历史脉络把概念落到具体模型,1.4 拉到当下让你看到这套范式的最新形态。读完本章,你就握住了整份教程的地图。
前置知识:无硬性要求,了解神经网络基本概念即可。
后续衔接: