nanochat 全流水线成本拆解 · LLM training cost
很多人觉得"自己训模型"是烧钱游戏,得买 H100 集群。nanochat 这个项目用 1.5B 参数的小模型把账算明白了:
算力侧:1.5B 模型按 Chinchilla 定律最优约 30B token,nanochat 实际用 ~10B 高质量 FineWeb-Edu,总计算量约 9×10¹⁹ FLOPs,8×H100(~2400 TFLOPS 有效)跑约 10 小时,云上成本几百美元。
数据侧:几十 B token 的高质量语料,清洗、去重、去毒之后,从 Common Crawl 里炼出来要花几周到几个月,外包标注更贵。这才是真正的瓶颈——
训练成本的核心是两条公式:
系数 6 是一次前向+反向的近似 FLOPs;Chinchilla(DeepMind 2022)发现"计算最优"的训练数据量约为参数量的 20 倍——少于这个,模型欠拟合;多于这个,算力浪费。下面这个计算器把两条公式接起来。
算清账后,按你的目标分档投入:
三档的共同点:算力都不是最贵的,数据和人才是。nanochat 的价值就在这——它把"训个能聊天的模型"这件事的算力门槛打到几百美元一晚,让你把预算和注意力放到真正卡脖子的数据上。