第7章 指令微调与人类对齐 章节摘要 经过预训练的多模态大模型(MLLM)具备了「看图」与「说话」的潜力,但它仍像一个只会自由联想的孩子——给它一张图,它可能输出的不是有用回答,而是任意一段相关文本。要让模型真正「听话」、按人类意图回答问题,必须经过指令微调(Instruction Tuning) 与人类对齐(Human Alignment) 两个关键阶段。本章从视觉指令微调范式(LLaVA 提出)出发,看如何用「图像 + 指令 → 高质量回答」的数据让模型学会遵循人类意图;深入拆解 LLaVA 系列从 1.0 到 1.5、NeXT、OneVision 的架构与数据演化;
经过预训练的多模态大模型(MLLM)具备了「看图」与「说话」的潜力,但它仍像一个只会自由联想的孩子——给它一张图,它可能输出的不是有用回答,而是任意一段相关文本。要让模型真正「听话」、按人类意图回答问题,必须经过指令微调(Instruction Tuning) 与人类对齐(Human Alignment) 两个关键阶段。本章从视觉指令微调范式(LLaVA 提出)出发,看如何用「图像 + 指令 → 高质量回答」的数据让模型学会遵循人类意图;深入拆解 LLaVA 系列从 1.0 到 1.5、NeXT、OneVision 的架构与数据演化;接着讨论 RLHF(基于人类反馈的强化学习)在多模态中的应用——如何用人类偏好数据训练奖励模型、再用 PPO 等强化学习算法微调模型;最后介绍 DPO(直接偏好优化)等更简洁的对齐方法。章末提供 LLaVA-NeXT、mPLUG-Owl3、MiniCPM-V 等对齐方法的 SOTA 速览。掌握本章后,你将理解为什么同样的预训练模型,经过不同的微调与对齐会表现出截然不同的「人格」与能力。
完成本章后,你应当能够:
本章共 6 个子节,按「SFT → 经典模型 → RLHF → DPO → 前沿」的逻辑展开:
子节之间是「方法 → 实践 → 进阶对齐 → 简化对齐 → 前沿」的递进:7.1-7.2 讲 SFT 与 LLaVA,7.3-7.4 讲 RLHF 与 DPO 两种对齐方法,7.5 看当代 SOTA。
前置知识:
后续衔接:
本章是「架构(2-5章)+ 训练(6章)」与「应用(8章)」之间的最后一道桥梁——预训练给能力,指令微调让模型听话,对齐让模型符合价值观。