内容摘要
airllm·单卡跑70B的极限省内存 灏 灏天文库 · AI基础设施与推理优化 第 4 期 AI基础设施与推理优化 · 第 4 期 70B模型只要 4GB显存 ? airllm · 层流式加载 · CPU offload airllm的极端思路:模型太大装不下?那就 一次只加载一层 到GPU,算完立刻丢回CPU,下一层再传上来。显存需求降到单层大小(70B只要4GB),代价是CPU↔GPU来回传, 慢10~50倍 。换的是「能跑」vs「跑不了」——不是快,是兜底。 ⏱ 约 9 分钟 🎯 显存不够又想跑大模型的人 📦 源:airllm 库 01 核心招式:层流式加载 70B模型FP16要140GB显存,单卡24G根本装不下。airllm的解法:把模型放CPU内存(或磁盘),推理时一层一层搬到GPU。 Transformer是层叠结构:每层输入是上层的输出。airllm利用这点—— 第i层算完,输出留下,权重丢掉,传第i+1层上来 。显存里同一时刻只有一层权重 + 当前激活 + KV缓存。70B有80层,单层约1.7GB,加上激活和KV,4GB就能跑。