本附录汇总算力决策的速查表:云 GPU 档位、全流程成本量级、SFT 显存估算与省钱纪律。所有价格均为示意估算(2025 年前后市场量级,随平台、供需与地区浮动),下单前以租用平台实时报价为准;nanochat 官方数字(约 4 小时、约 100 美元)为发布帖口径。方法论的展开在 0.2 节,本附录是价格与数字的一页速查。
| 档位 | 显存 | 参考单价(示意估算) | 适合的活 |
|---|---|---|---|
| 消费级 24GB(RTX 3090/4090 云租) | 24GB | 0.3~0.8 美元/时 | 124M 全流程(SFT/量化推理/语音) |
| A100 40GB | 40GB | 1~2 美元/时 | 1B 级 SFT、批量蒸馏推理 |
| A100 80GB | 80GB | 1.5~3 美元/时 | 1B~7B SFT 或 LoRA |
| H100 80GB | 80GB | 2~4 美元/时 | 预训练复现加速、7B+ |
| 8×H100 节点 | 640GB | 16~32 美元/时 | nanochat 官方口径的完整四阶段 |
国内平台以人民币计价,量级同理(24GB 卡约每小时几元到十几元,示意估算)。选平台时三个非价格因素:数据上传带宽(SFT 数据几十 MB、基座权重几百 MB,上传慢比 GPU 贵更磨人)、镜像环境(预装 PyTorch/CUDA 的镜像省一小时配置)、计费粒度(短实验选按秒计费)。
| 阶段 | 算力 | 时长/成本(口径) |
|---|---|---|
| 四阶段完整跑通 | 8×H100 单节点 | 约 4 小时、约 100 美元(官方自报,Discussion #1) |
| 分词器 + 预训练(①②) | 同上里的大头 | 占官方口径成本的主要部分 |
| SFT(③,本书第 3 章) | 单卡 24GB 足够 | 数万条数据数小时,合计 1~3 美元(示意估算) |
| 数据蒸馏(第 2 章) | 无 GPU(走 API) | 十万条约 70~100 美元(示意估算,2.3 的成本速算) |
| 部署与语音(第 6~7 章) | 本机 CPU/GPU | 无租用成本 |
结论复述 0.2 的基调:SFT 是流水线里最便宜的阶段——没有 GPU 的读者租一台 24GB 卡几个小时,即可完成本书全部训练实验;第 2 章数据实验与第 6~7 章部署甚至不需要租用。
0.2 节速算公式的常用档位换算(bf16 权重 + Adam 优化器:静态部分约等于参数量 × 12 bytes;激活值随 batch × 序列长度增长,开梯度检查点后大幅下降):
| 模型规模 | 静态部分(权重+梯度+优化器) | 开检查点后的总预算 | 24GB 卡 |
|---|---|---|---|
| 124M | ~1.5GB | 48GB(batch 8) | 宽裕 |
| ~0.5B | ~6GB | 814GB | 可行,控制 batch |
| 1.5B | ~18GB | ~20GB 以上 | 需检查点 + 小 batch(0.2) |
三个省显存开关的优先级(3.3 六连降级的浓缩):梯度累积(几乎免费)→ 梯度检查点(慢约 30%)→ 8-bit 优化器(精度微降)。124M 量级几乎用不到第三档。
resume_from_checkpoint 的路径想清楚,失败重跑的浪费最大。与 0.2 的三方案表对照使用:0.2 是选型方法论(本地/云租/Modal),本附录是价格与时长的速查页。