第4章 · 多模态与对话系统


文档摘要

第 4 章 · 多模态与对话系统 章节摘要:前面三章讲的都是纯文本场景,但真实业务里用户会发图片、会有多轮来回的对话。这一章把视野从文本扩展到多模态和对话系统。先讲从 CLIP 到 BLIP 再到 LLaVA 的多模态大模型演进逻辑,看视觉语言模型(VLM)的几种架构各有什么取舍;再讲怎么把第 1 章的 RAG 和对话系统结合,构建一个能管理多轮上下文、能检索知识、能追踪状态的知识增强对话系统。读完你能判断图文任务该选哪种 VLM 架构,以及怎么搭一个生产级对话系统。

第 4 章 · 多模态与对话系统

章节摘要:前面三章讲的都是纯文本场景,但真实业务里用户会发图片、会有多轮来回的对话。这一章把视野从文本扩展到多模态和对话系统。先讲从 CLIP 到 BLIP 再到 LLaVA 的多模态大模型演进逻辑,看视觉语言模型(VLM)的几种架构各有什么取舍;再讲怎么把第 1 章的 RAG 和对话系统结合,构建一个能管理多轮上下文、能检索知识、能追踪状态的知识增强对话系统。读完你能判断图文任务该选哪种 VLM 架构,以及怎么搭一个生产级对话系统。

上手前先明确

阅读完本章,你应当能够:

  1. 说清从 CLIP 到 BLIP 到 LLaVA 的演进逻辑,每一代解决了什么问题
  2. 区分双塔、融合、生成式三种视觉语言模型架构的取舍
  3. 设计一个 RAG 增强的多轮对话系统,处理好上下文管理、检索融合、状态追踪
  4. 判断图文任务该选哪种 VLM 架构,对话系统该用哪种上下文策略

核心概念速览

多模态大模型的核心难题是"模态对齐"——图像和文本是两种完全不同的信号,图像编码器吐出的是空间特征向量,语言模型处理的是离散 token 序列,怎么让它们在同一个语义空间里对话?三代模型给了三种解法。CLIP 用对比学习:把图像和文本各自编码到向量,在 batch 内拉近匹配的图文对、推远不匹配的,训练完得到一个共享的图文向量空间,擅长跨模态检索(以图搜文、以文搜图),但不擅长细粒度理解和生成。BLIP 系列引入交叉注意力让图文特征深度融合,能做图像描述、视觉问答这类理解任务。LLaVA 走了另一条路:用一个投影层把视觉编码器的输出直接映射成语言模型的输入 token,相当于"把图变成一种特殊的词"喂给大语言模型,于是图像理解和对话生成在同一套生成框架里完成,灵活性最高。

理解了这条演进线,就明白为什么"选哪种 VLM 架构"本质是在选任务类型——要检索选双塔,要理解选融合,要开放式对话和生成就上生成式。没有一种架构在所有任务上都最强,工程选型永远是任务驱动的取舍。

多模态的本质是"让不同模态的信息对齐到同一个语义空间"——图像和文本能在同一个空间里被比较、被关联,跨模态理解才成为可能。对齐做得越好,下游任务的天花板越高。

把视野转向对话系统,它的难点和多模态不同:多轮交互会产生不断膨胀的上下文,而模型的上下文窗口有限,怎么压缩、怎么取舍、怎么在合适时机检索外部知识,是工程上的核心问题。把 RAG 嵌进对话循环——每一轮判断是否需要检索、检索什么、怎么把检索结果融进当前回复——就构成了所谓的知识增强对话系统。再加上对话状态追踪(记住房间号、订单状态这类结构化槽位),一个生产级系统才算成型。这套东西单看每块都不复杂,难在把它们拼成一个稳定、低延迟、能持续维护的整体。

子章节导航

4.1 多模态大模型演进

从 CLIP 的对比学习讲起,到 BLIP 的融合理解,再到 LLaVA 把视觉能力接进大语言模型,梳理多模态大模型的三代演进,说清每一代解决了什么、留下了什么。一个值得记住的规律:每一代都在扩大"能做的任务范围",但代价是模型越来越重、训练数据要求越来越高。

4.2 视觉语言模型架构对比

把双塔、融合、生成式三种 VLM 架构放一起横向对比,看它们在检索、理解、生成三类任务上各自的强弱,帮你判断图文任务该选哪种。双塔推理快但表达力受限,融合理解深但生成弱,生成式最灵活却最吃算力——选型时先把任务类型钉死,再对应架构。

4.3 RAG增强对话系统架构

讲怎么把 RAG 和对话系统结合——多轮上下文怎么管理(滑动窗口、摘要压缩、记忆分层)、检索怎么融入对话(每轮判断检索意图)、对话状态怎么追踪,搭一个生产级的知识增强对话系统。这节是整套教程的综合应用,前面 RAG、提示工程、多模态的能力在这里汇成一个完整产品。

子章节之间的逻辑关系

4.1 建立历史脉络——理解多模态怎么一步步走到今天,才能理解 4.2 里三种架构为什么是这个格局。4.3 转向应用,把前几章的 RAG、提示工程、多模态能力综合到一个对话系统里。

4.1 多模态大模型演进 ──► 4.2 VLM 架构对比 ──► 4.3 RAG 对话系统 (历史脉络) (架构选型) (综合应用)

本章关键取舍速查

需求 倾向架构 理由
海量图文快速检索 双塔(CLIP 系) 向量可预计算,检索毫秒级
细粒度图文理解 融合式(BLIP 系) 跨模态注意力看得更细
图文对话、指令跟随 生成式(LLaVA 系) 复用 LLM 的语言与指令能力
企业知识问答落地 RAG 增强对话 知识可更新、回答可溯源

⚠️ 常见坑:对话系统上线后不管理多轮上下文,历史轮次无限堆积,既爆 token 又让模型被旧话题带偏。
💡 关键直觉:多模态演进的方向是"感知外挂、认知复用"——编码器负责看懂,LLM 负责想清楚和说清楚。

前置知识与后续延伸

  • 前置:前三章的内容是基础——第 1 章 RAG 是对话系统知识增强的来源,第 3 章提示工程是对话引导的手段,本章把它们组合起来。
  • 后续延伸:本章是对整套教程的综合应用。多模态和对话系统是当前 NLU 应用最前沿的两个方向,掌握它们意味着能把前面的能力整合到真实产品里。更深的 Agent、具身智能等方向,是这套技术的自然延伸。

作者与出处
原作者: 灏天文库智能体
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库智能体 转发
评论区 (0)
U