第7章 指令微调与人类对齐


文档摘要

第7章 指令微调与人类对齐 章节摘要 经过预训练的多模态大模型(MLLM)具备了「看图」与「说话」的潜力,但它仍像一个只会自由联想的孩子——给它一张图,它可能输出的不是有用回答,而是任意一段相关文本。要让模型真正「听话」、按人类意图回答问题,必须经过指令微调(Instruction Tuning) 与人类对齐(Human Alignment) 两个关键阶段。本章从视觉指令微调范式(LLaVA 提出)出发,看如何用「图像 + 指令 → 高质量回答」的数据让模型学会遵循人类意图;深入拆解 LLaVA 系列从 1.0 到 1.5、NeXT、OneVision 的架构与数据演化;

第7章 指令微调与人类对齐

章节摘要

经过预训练的多模态大模型(MLLM)具备了「看图」与「说话」的潜力,但它仍像一个只会自由联想的孩子——给它一张图,它可能输出的不是有用回答,而是任意一段相关文本。要让模型真正「听话」、按人类意图回答问题,必须经过指令微调(Instruction Tuning)人类对齐(Human Alignment) 两个关键阶段。本章从视觉指令微调范式(LLaVA 提出)出发,看如何用「图像 + 指令 → 高质量回答」的数据让模型学会遵循人类意图;深入拆解 LLaVA 系列从 1.0 到 1.5、NeXT、OneVision 的架构与数据演化;接着讨论 RLHF(基于人类反馈的强化学习)在多模态中的应用——如何用人类偏好数据训练奖励模型、再用 PPO 等强化学习算法微调模型;最后介绍 DPO(直接偏好优化)等更简洁的对齐方法。章末提供 LLaVA-NeXT、mPLUG-Owl3、MiniCPM-V 等对齐方法的 SOTA 速览。掌握本章后,你将理解为什么同样的预训练模型,经过不同的微调与对齐会表现出截然不同的「人格」与能力。

学习目标

完成本章后,你应当能够:

  1. 用一句话讲清指令微调与预训练的本质区别
  2. 写出 LLaVA 视觉指令微调的两阶段流程(投影器预训练 + 全量指令微调)
  3. 解释 RLHF 的三步流程(SFT → RM → PPO)及其在多模态中的适配
  4. 说出 DPO 相对 RLHF 的两个工程优势
  5. 复述 LLaVA 系列从 1.0 到 OneVision 的关键演化
  6. 在为自己的多模态任务设计微调方案时,能根据数据量与目标选择 SFT、RLHF 还是 DPO

核心概念速览

  • SFT(Supervised Fine-Tuning):监督微调,用「指令-回答」对训练模型跟随指令
  • 指令微调(Instruction Tuning):SFT 的一种,强调开放性、多任务、零样本泛化
  • RM(Reward Model):奖励模型,学习人类偏好打分
  • RLHF:基于人类反馈的强化学习,用 RM 引导模型优化
  • PPO:近端策略优化,RLHF 中最常用的强化学习算法
  • DPO(Direct Preference Optimization):直接偏好优化,绕过 RM 直接优化偏好
  • KL 散度约束:RLHF 中防止模型偏离预训练分布的正则项
  • 幻觉(Hallucination):模型生成与图像不符的内容,是多模态对齐的重点问题

子章节导览

本章共 6 个子节,按「SFT → 经典模型 → RLHF → DPO → 前沿」的逻辑展开:

  • 7.1 视觉指令微调范式 —— LLaVA 提出的「图像 + 指令 → 回答」数据构造与训练流程
  • 7.2 LLaVA 系列架构演进 —— 从 LLaVA 1.0 到 1.5、NeXT、OneVision 的迭代
  • 7.3 RLHF 在多模态中的应用 —— 三步流程、奖励模型设计、PPO 训练细节
  • 7.4 DPO 与直接偏好优化 —— DPO 的数学推导与工程优势
  • 7.5 SOTA 前沿速览 —— LLaVA-NeXT、mPLUG-Owl3、MiniCPM-V 等的对齐方法对比

子节之间是「方法 → 实践 → 进阶对齐 → 简化对齐 → 前沿」的递进:7.1-7.2 讲 SFT 与 LLaVA,7.3-7.4 讲 RLHF 与 DPO 两种对齐方法,7.5 看当代 SOTA。

前置知识与后续衔接

前置知识

  • 第6章的预训练任务(指令微调建立在预训练之上)
  • 第5章的融合架构(指令微调作用于融合后的模型)
  • 强化学习的基本概念(策略、奖励、价值函数)对 7.3 有帮助

后续衔接

  • 第8章的 VQA、文生图、Agent 等应用直接使用经过指令微调与对齐的模型
  • 第9章的展望会讨论「让模型真正理解人类意图」这一未竟之业

本章是「架构(2-5章)+ 训练(6章)」与「应用(8章)」之间的最后一道桥梁——预训练给能力,指令微调让模型听话,对齐让模型符合价值观。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U