附录 B · GPU 租用与成本速查


附录 B · GPU 租用与成本速查

本附录汇总算力决策的速查表:云 GPU 档位、全流程成本量级、SFT 显存估算与省钱纪律。所有价格均为示意估算(2025 年前后市场量级,随平台、供需与地区浮动),下单前以租用平台实时报价为准;nanochat 官方数字(约 4 小时、约 100 美元)为发布帖口径。方法论的展开在 0.2 节,本附录是价格与数字的一页速查。

一、云 GPU 档位速查

档位 显存 参考单价(示意估算) 适合的活
消费级 24GB(RTX 3090/4090 云租) 24GB 0.3~0.8 美元/时 124M 全流程(SFT/量化推理/语音)
A100 40GB 40GB 1~2 美元/时 1B 级 SFT、批量蒸馏推理
A100 80GB 80GB 1.5~3 美元/时 1B~7B SFT 或 LoRA
H100 80GB 80GB 2~4 美元/时 预训练复现加速、7B+
8×H100 节点 640GB 16~32 美元/时 nanochat 官方口径的完整四阶段

国内平台以人民币计价,量级同理(24GB 卡约每小时几元到十几元,示意估算)。选平台时三个非价格因素:数据上传带宽(SFT 数据几十 MB、基座权重几百 MB,上传慢比 GPU 贵更磨人)、镜像环境(预装 PyTorch/CUDA 的镜像省一小时配置)、计费粒度(短实验选按秒计费)。

二、全流程成本量级

阶段 算力 时长/成本(口径)
四阶段完整跑通 8×H100 单节点 约 4 小时、约 100 美元(官方自报,Discussion #1)
分词器 + 预训练(①②) 同上里的大头 占官方口径成本的主要部分
SFT(③,本书第 3 章) 单卡 24GB 足够 数万条数据数小时,合计 1~3 美元(示意估算)
数据蒸馏(第 2 章) 无 GPU(走 API) 十万条约 70~100 美元(示意估算,2.3 的成本速算)
部署与语音(第 6~7 章) 本机 CPU/GPU 无租用成本

结论复述 0.2 的基调:SFT 是流水线里最便宜的阶段——没有 GPU 的读者租一台 24GB 卡几个小时,即可完成本书全部训练实验;第 2 章数据实验与第 6~7 章部署甚至不需要租用。

三、SFT 显存估算

0.2 节速算公式的常用档位换算(bf16 权重 + Adam 优化器:静态部分约等于参数量 × 12 bytes;激活值随 batch × 序列长度增长,开梯度检查点后大幅下降):

模型规模 静态部分(权重+梯度+优化器) 开检查点后的总预算 24GB 卡
124M ~1.5GB 48GB(batch 8) 宽裕
~0.5B ~6GB 814GB 可行,控制 batch
1.5B ~18GB ~20GB 以上 需检查点 + 小 batch(0.2)

三个省显存开关的优先级(3.3 六连降级的浓缩):梯度累积(几乎免费)→ 梯度检查点(慢约 30%)→ 8-bit 优化器(精度微降)。124M 量级几乎用不到第三档。

四、省钱纪律

  1. 先小后大(全书默认纪律):一切实验先在 124M 或更小配置上跑通再放大——错误在大卡上才暴露,是最贵的学费。
  2. 数据本地处理:第 2 章清洗、token 统计、长度分析全部 CPU 本地做完,租卡只跑训练循环。
  3. checkpoint 即取即停:训练完立刻下载产物、销毁实例——按时计费平台上"挂着忘关"是头号账单事故。
  4. 断点续跑先想好:上传数据的几分钟里把 resume_from_checkpoint 的路径想清楚,失败重跑的浪费最大。
  5. 比价看单价也看带宽:每小时便宜 0.5 美元但上传 1MB/s 的平台,跑本书实验的综合成本可能高于单价略贵、管道快的平台。

与 0.2 的三方案表对照使用:0.2 是选型方法论(本地/云租/Modal),本附录是价格与时长的速查页。


作者与出处
原作者: 灏天文库
整理: 灏天文库整理
本站整理收录,版权归原作者/开源协议所有;欢迎通过原文链接访问源仓库。
发布者: 作者: 灏天文库 转发
评论区 (0)
U