AI 与大模型 · 第 8 期 · 第一季收官

单卡微调 7B,怎么做到的?

LoRA/QLoRA 参数高效微调 · PEFT

不全参微调,只训少量低秩矩阵——LoRA 让单卡微调 7B 成为可能。QLoRA 再加 4bit 量化,13B 也能单卡微调。原理:模型权重里大部分信息是"低秩"的,只训那点低秩部分,效果接近全参,成本降到 1/10。
⏱ 约 11 分钟 🎯 想微调大模型但显存不够的人 📦 源:ai-engineering-from-scratch §11

01一个反共识:不全参,反而够用

全参微调要更新所有参数,7B 模型光优化器状态就要 56GB 显存(Adam 两份动量),单卡 24G 根本装不下。

LoRA 的洞见:微调时权重的变化 ΔW 是低秩的——可以用两个小矩阵 A、B 近似,ΔW ≈ B×A,其中 A、B 远小于 W。只训 A、B,参数量从 7B 降到几十 M,显存从 56GB 降到 16GB。效果接近全参,成本降到 1/10。

W新 = W冻结 + B × A  (只训 A、B,W 冻结)

QLoRA 再进一步:把冻结的 W 量化到 4bit(显存再砍 4 倍),只训 A、B 用 fp16。13B 模型单卡 24G 就能微调。这是为什么 2023 年后"人人能微调大模型"——技术把门槛打下来了。

不全参,反而够用,
因为变化是低秩的。
灏天文库 · AI 与大模型 P.23

02微调成本对比:选模型看三种方法

选模型大小,看全参 / LoRA / QLoRA 三种方法的显存、可训参数、时间、效果差距。

💾 微调成本对比
选模型大小,看三种微调方法的成本与效果。

03LoRA 的三个关键选择

一个常见坑:LoRA 效果不如全参,多半是数据太少或 r 太小。先确认数据够(几千条起步),再调 r,别一上来怀疑方法。多数"LoRA 没用"的案例,问题在数据不在方法。

LoRA 没用,
多半是数据不是方法。
灏天文库 · AI 与大模型 P.24

04带走这套清单

✅ LoRA/QLoRA 6 条可执行规则

  1. 显存不够先 LoRA:单卡微调 7B 的标配,成本降到全参 1/10。
  2. 13B+ 用 QLoRA:4bit 量化冻结权重,24G 卡能微调 13B。
  3. 秩 r 从 16 起步:多数任务够用,效果不够再加,别盲目调大。
  4. 挂 q/v 投影起步:预算够再挂全层,all-linear 效果更好但更贵。
  5. 学习率调大:1e-4 ~ 1e-3,比全参大一个数量级,小矩阵需要。
  6. 先查数据再怀疑方法:LoRA 没用多半是数据少,几千条起步再调 r。
参数高效微调,
让人人能微调大模型。
灏天文库 · AI 与大模型 P.25