灏天文库

量化·把模型压到4bit还能用

作者: 灏天 · 收录于 AI基础设施与推理优化

内容摘要

 量化·把模型压到4bit还能用 灏 灏天文库 · AI基础设施与推理优化 第 2 期 AI基础设施与推理优化 · 第 2 期 7B从14GB压到3.5GB, 效果只掉2% 量化 · INT8/INT4 · 模型压缩 量化把权重从FP16(16bit/参数)压到INT8(8bit)或INT4(4bit),体积砍4倍、推理快2~3倍,困惑度只涨2~5%。 4bit是部署的免费午餐 ——单卡能塞下原本装不下的模型。代价是精度损失和量化方法的选择。 ⏱ 约 10 分钟 🎯 想把大模型塞进单卡的人 📦 源:ht-distillation 量化教程 01 量化在压什么:权重的精度 一个FP16权重占2字节,INT8占1字节,INT4占0.5字节——精度越低,能塞的参数越多。 大模型权重本质是一堆浮点数。FP16用16个bit表示一个数(精度高、范围大),INT8用8个bit(256个离散值),INT4用4个bit(只有16个值)。量化就是 把高精度浮点映射到低精度整数 :找一个缩放因子scale,让原值×scale落在整数范围内,存整数和scale,用时再除回来。

打开完整知识页 返回工坊集