AI基础设施与推理优化 · 第 2 期

7B从14GB压到3.5GB,效果只掉2%

量化 · INT8/INT4 · 模型压缩

量化把权重从FP16(16bit/参数)压到INT8(8bit)或INT4(4bit),体积砍4倍、推理快2~3倍,困惑度只涨2~5%。4bit是部署的免费午餐——单卡能塞下原本装不下的模型。代价是精度损失和量化方法的选择。
⏱ 约 10 分钟 🎯 想把大模型塞进单卡的人 📦 源:ht-distillation 量化教程

01量化在压什么:权重的精度

一个FP16权重占2字节,INT8占1字节,INT4占0.5字节——精度越低,能塞的参数越多。

大模型权重本质是一堆浮点数。FP16用16个bit表示一个数(精度高、范围大),INT8用8个bit(256个离散值),INT4用4个bit(只有16个值)。量化就是把高精度浮点映射到低精度整数:找一个缩放因子scale,让原值×scale落在整数范围内,存整数和scale,用时再除回来。

q = round(w / scale)  w还原 ≈ q × scale
INT4:每个权重 4 bit,仅 16 个离散值

关键认知:模型权重大多是「密集分布在0附近」的钟形,少数离群值(outlier)很大。朴素量化会被离群值带歪scale,把大多数密集值压到几个整数上——这是精度损失的元凶。现代量化方法(GPTQ/AWQ/SmoothQuant)都在处理离群值:要么按通道缩放、要么屏蔽重要权重、要么把离群值单独存FP16。

量化损失不在「压」,
在离群值带歪了刻度。
灏天文库 · AI基础设施与推理优化 P.4

02量化对比:精度 vs 体积 vs 速度

选模型大小,看FP16/INT8/INT4三种精度的体积、推理速度、困惑度(越低越好)差距。INT4是性价比拐点。

🗜 量化对比演示
选模型大小,看三种精度的体积/速度/精度权衡。

03三种量化方法怎么选

一个常见误区:量化不是无损的。INT8基本无损,INT4会有2~5%困惑度上升,长任务、数学、代码任务损失更明显。判断标准:跑你的真实任务评测,掉点在2%内就大胆用,掉多了换INT8或上AWQ重压。

FP16

基准

2字节/参数,精度满分,体积大,单卡塞不下大模型。

INT8

近乎无损

1字节/参数,困惑度涨<1%,速度+50%,首选稳妥方案。

INT4

性价比拐点

0.5字节/参数,困惑度涨2~5%,速度+100%,单卡跑大模型靠它。

INT2

实验性

精度损失大,多数任务不可用,研究为主,别上生产。

INT4是部署的免费午餐,
但午餐不是无限的。
灏天文库 · AI基础设施与推理优化 P.5

04带走这套清单

✅ 量化部署 6 条可执行规则

  1. 显存不够先INT4:AWQ/GPTQ压一遍,体积砍4倍,多数任务掉点<2%。
  2. 要稳就INT8:困惑度几乎无损,速度+50%,生产环境稳妥首选。
  3. 量化前跑真实任务评测:别只看困惑度,跑你的业务指标,掉点超2%再回退。
  4. 校准集要贴近业务:GPTQ/AWQ量化用几百条真实数据校准,比通用数据精度好。
  5. 长上下文小心量化:KV缓存量化+权重量化叠加,长序列损失放大,单独测。
  6. 微调用QLoRA:4bit冻结权重+LoRA训fp16,单卡微调13B的标准姿势。
压到4bit还能用,
是因为权重本就冗余。
灏天文库 · AI基础设施与推理优化 P.6