7.5 SOTA 前沿速览 本节速览当代多模态大模型的对齐方法实践。这些模型大多采用「预训练 → SFT → DPO/RLHF」三段式,但具体细节各有创新。 一、对齐方法的全景 二、LLaVA-NeXT:开源对齐的标杆 LLaVA-NeXT 在 SFT 基础上加入 DPO: LLaVA-NeXT 的对齐流程 关键数据 LLaVA-RLHF:人类标注的事实性偏好 RLAIF-V:GPT-4V 生成的偏好对 VLFeedback:AI 反馈的多模态偏好数据 效果 DPO 让 LLaVA-NeXT 在 POPE 等幻觉基准上显著改善,回答质量更接近 GPT-4V。 三、Qwen-VL 系列:中文对齐的深耕 阿里的 Qwen-VL 系列在中文场景对齐上有独特优势。
本节速览当代多模态大模型的对齐方法实践。这些模型大多采用「预训练 → SFT → DPO/RLHF」三段式,但具体细节各有创新。
LLaVA-NeXT 在 SFT 基础上加入 DPO:
1. 视觉-语言预训练 (558K 字幕) 2. 指令微调 (100 万+ 指令数据) 3. DPO 对齐 (RLAIF-V 等偏好数据)
DPO 让 LLaVA-NeXT 在 POPE 等幻觉基准上显著改善,回答质量更接近 GPT-4V。
阿里的 Qwen-VL 系列在中文场景对齐上有独特优势。
上海 AI Lab 的 InternVL 2 系列:
面壁智能的 MiniCPM-V 系列证明小模型也能做好对齐:
阿里的 mPLUG-Owl3 在效率上做文章:
智谱的 CogVLM:
OpenAI 大概率使用:
Anthropic 的 Constitutional AI:
Google 用大规模 RLHF + 多模态偏好数据,对齐质量与 GPT-4 相当。
| 模型 | SFT 数据量 | 对齐方法 | 对齐数据 | 特色 |
|---|---|---|---|---|
| LLaVA-NeXT | 100 万+ | DPO | RLAIF-V + VLFeedback | 开源标杆 |
| Qwen2-VL | 数百万 | DPO + RLHF | 阿里内部 | 中文深耕 |
| InternVL 2 | 数百万 | DPO | AI 反馈 | 多规模对齐 |
| MiniCPM-V | 数百万 | DPO | 高质量小数据 | 端侧 |
| mPLUG-Owl3 | 数百万 | DPO | 阿里内部 | 长视频 |
| CogVLM | 数百万 | DPO | 智谱内部 | grounding |
| GPT-4o | 未公开 | RLHF(推测) | OpenAI 内部 | 闭源旗舰 |
观察 SOTA,对齐方法的演化方向:
RLHF 工程门槛太高,DPO 让中小团队也能做对齐。当代开源模型几乎都用 DPO 或其变体。
RLAIF、VLFeedback 等让 AI 当裁判,大幅降低标注成本。质量略低于人工但可规模化。
不再只优化「好 vs 坏」,而是分别对齐准确性、流畅性、安全性等多个维度。
PRM 等方法不只奖励最终回答,还奖励推理过程。适合数学、推理任务。
MiniCPM-V 等让对齐能力下沉到端侧,手机也能跑对齐过的多模态大模型。
当代对齐仍面临几个开放问题:
如何客观评估对齐质量?人工评估昂贵,自动指标(LLM-as-Judge)有偏见。
不同文化、不同用户对「好回答」定义不同。单一对齐难以满足所有用户。
模型可能过度谨慎,拒绝正常请求(过拒)。LLaVA-NeXT 等都遇到过这种问题。
对齐数据覆盖有限,对齐模型在长尾任务(医学、法律等)效果仍差。
用户可以通过 prompt 注入、对抗样本绕过对齐。多模态场景的对抗更复杂(图像 + 文本)。
对齐是多模态大模型走向大规模商用的最后一公里:
OpenAI、Anthropic、Google 等大厂投入大量资源做对齐,这是它们相对开源的核心优势之一。开源社区正在通过 DPO、RLAIF 等方法快速追赶。
未来对齐研究的关键方向:
当代多模态大模型的对齐实践呈现「DPO 主导 + AI 反馈 + 多目标」的格局。LLaVA-NeXT、Qwen2-VL、InternVL 2、MiniCPM-V 等开源模型用 DPO 在中小算力下达到了不错的对齐效果,但仍落后于 GPT-4o、Claude 等大规模 RLHF 的闭源模型。对齐方法正在从复杂 RLHF 走向简化 DPO,从人类反馈走向 AI 反馈,从单目标走向多目标。
第7章到此结束。下一章(第8章)我们终于进入应用层——看经过预训练、SFT、对齐的多模态大模型如何支撑 VQA、文生图、文生视频、Agent 等端到端任务。