AirLLM · 第 1 章 AirLLM 全貌与"显存只需一层"的魔术


AirLLM · 第 1 章 AirLLM 全貌与"显存只需一层"的魔术

章节摘要:70B 模型跑在 4GB 显卡、Llama 3.1 405B 跑在 8GB、DeepSeek-V3 671B 跑在约 12GB、Kimi K3 2.8T 跑在 4GB 以内——不量化、不蒸馏、不剪枝。本章是"一层权重的一生"的旅程起点(启程前的俯瞰阶段):看清 AirLLM 解决什么问题、层级权重流式的原理,摸清 monorepo 代码版图,并直面速度的诚实代价。

旅程坐标

旅程坐标

本章位于旅程起点:尚未出发,先俯瞰整条"磁盘→CPU→GPU→meta"流水线,理解显存为何只需一层。

学习目标

  • 说清 AirLLM 的定位:在显存不足的机器上推理超大 LLM(v3.2.0,核心仅约 2695 行)
  • 推导宣传数字的原理:70B@4GB/405B@8GB/671B@12GB/KimiK3@4GB——显存需求从"模型总大小"降到"单层大小"
  • 理解"不量化、不蒸馏、不剪枝"的克制:代价转移到磁盘带宽
  • 画出 monorepo 版图:AirLLM 核心约 2695 行 + Anima 训练侧约 3900 行
  • 记住速度的诚实代价(约 0.1-2 token/s 量级)与适用场景(离线批处理、长文本、RAG 索引)

子章节导航

01 AirLLM 定位与宣传数字的原理

极低显存推理超大 LLM:层级权重流式(layer streaming)如何让 70B@4GB/405B@8GB/671B@12GB/KimiK3@4GB 在不量化、不蒸馏、不剪枝的前提下成立。

02 monorepo 结构与速度的诚实代价

AirLLM 核心(airllm_base.py 836 行 + utils.py 556 行 + 十余个薄壳子类)+ Anima 训练侧;瓶颈在磁盘带宽——它买到的是"能跑"与"极低显存",不是"快"。

前置知识与后续延伸

前置知识:无硬性前置——本章即全书入口,有 Python 与 PyTorch 基础即可启程。
后续延伸:第 2 章进入离线"出生"阶段,看 split_and_save_layers 如何把 HF checkpoint 切成磁盘上的按层分片。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U