内容摘要
LoRA/QLoRA · 单卡微调 7B 模型怎么做到的 灏 灏天文库 · AI 与大模型 第 8 期 · 第一季收官 AI 与大模型 · 第 8 期 · 第一季收官 单卡微调 7B, 怎么做到的 ? LoRA/QLoRA 参数高效微调 · PEFT 不全参微调,只训 少量低秩矩阵 ——LoRA 让单卡微调 7B 成为可能。QLoRA 再加 4bit 量化,13B 也能单卡微调。原理:模型权重里大部分信息是"低秩"的,只训那点低秩部分,效果接近全参,成本降到 1/10。 ⏱ 约 11 分钟 🎯 想微调大模型但显存不够的人 📦 源:ai-engineering-from-scratch §11 01 一个反共识:不全参,反而够用 全参微调要更新所有参数,7B 模型光优化器状态就要 56GB 显存(Adam 两份动量),单卡 24G 根本装不下。 LoRA 的洞见:微调时权重的变化 ΔW 是 低秩 的——可以用两个小矩阵 A、B 近似,ΔW ≈ B×A,其中 A、B 远小于 W。只训 A、B,参数量从 7B 降到几十 M,显存从 56GB 降到 16GB。