章节摘要:70B 模型跑在 4GB 显卡、Llama 3.1 405B 跑在 8GB、DeepSeek-V3 671B 跑在约 12GB、Kimi K3 2.8T 跑在 4GB 以内——不量化、不蒸馏、不剪枝。本章是"一层权重的一生"的旅程起点(启程前的俯瞰阶段):看清 AirLLM 解决什么问题、层级权重流式的原理,摸清 monorepo 代码版图,并直面速度的诚实代价。

本章位于旅程起点:尚未出发,先俯瞰整条"磁盘→CPU→GPU→meta"流水线,理解显存为何只需一层。
极低显存推理超大 LLM:层级权重流式(layer streaming)如何让 70B@4GB/405B@8GB/671B@12GB/KimiK3@4GB 在不量化、不蒸馏、不剪枝的前提下成立。
AirLLM 核心(airllm_base.py 836 行 + utils.py 556 行 + 十余个薄壳子类)+ Anima 训练侧;瓶颈在磁盘带宽——它买到的是"能跑"与"极低显存",不是"快"。
前置知识:无硬性前置——本章即全书入口,有 Python 与 PyTorch 基础即可启程。
后续延伸:第 2 章进入离线"出生"阶段,看 split_and_save_layers 如何把 HF checkpoint 切成磁盘上的按层分片。