AI 与大模型 · 第 1 期

从零训练一个能聊天的模型,要花多少钱?

nanochat 全流水线成本拆解 · LLM training cost

1.5B 参数的聊天模型,8 张 H100 训一晚就能跑完预训练——但大多数人卡在数据不在算力。瓶颈不是 GPU 贵,是你拿不出几十 B token 的高质量语料。算清这笔账,你才知道自己该花在哪。
⏱ 约 12 分钟 🎯 想自己训/微调 LLM 的开发者 📦 源:nanochat 教程

01一个反共识:瓶颈是数据,不是算力

很多人觉得"自己训模型"是烧钱游戏,得买 H100 集群。nanochat 这个项目用 1.5B 参数的小模型把账算明白了:

参数量
1.5B
训练数据
~10B token
预训练成本
8×H100 ~10时

算力侧:1.5B 模型按 Chinchilla 定律最优约 30B token,nanochat 实际用 ~10B 高质量 FineWeb-Edu,总计算量约 9×10¹⁹ FLOPs,8×H100(~2400 TFLOPS 有效)跑约 10 小时,云上成本几百美元。

数据侧:几十 B token 的高质量语料,清洗、去重、去毒之后,从 Common Crawl 里炼出来要花几周到几个月,外包标注更贵。这才是真正的瓶颈——

自己训模型的瓶颈
不是算力贵,是数据难。
灏天文库 · AI 与大模型 P.01

02两条公式:FLOPs 给算力,Chinchilla 给数据量

训练成本的核心是两条公式:

训练 FLOPs ≈ 6 × 参数量 × 训练 token 数
Chinchilla 最优 token ≈ 20 × 参数量

系数 6 是一次前向+反向的近似 FLOPs;Chinchilla(DeepMind 2022)发现"计算最优"的训练数据量约为参数量的 20 倍——少于这个,模型欠拟合;多于这个,算力浪费。下面这个计算器把两条公式接起来。

💰 训练成本计算器
输入参数量、数据量、GPU 型号,实时算出训练时间与美元成本。
B(十亿)
B token
~300 TFLOPS 有效
张
总训练 FLOPs
—
训练时间
—
云上成本(约)
$ —
Chinchilla 建议数据
—

03钱该花在哪:三个档位的建议

算清账后,按你的目标分档投入:

三档的共同点:算力都不是最贵的,数据和人才是。nanochat 的价值就在这——它把"训个能聊天的模型"这件事的算力门槛打到几百美元一晚,让你把预算和注意力放到真正卡脖子的数据上。

算力是门票,
数据才是主角。
灏天文库 · AI 与大模型 P.02

04带走这套清单

✅ 训练成本 6 条可执行规则

  1. 先算 FLOPs:6 × 参数量 × token 数,知道这单生意多大。
  2. 按 Chinchilla 配数据:token ≈ 20 × 参数量,少了欠拟合、多了浪费算力。
  3. 选 GPU 看有效算力不是峰值:4090 有效 ~30T、A100 ~150T、H100 ~300T FLOPS。
  4. 预算优先级:数据清洗 > 评测 > 算力,别一上来就堆卡。
  5. 小模型先跑通:1.5B 验证流水线,再放大,避免在 70B 上才发现数据有 bug。
  6. 微调用 LoRA/QLoRA:7B+ 模型单卡可微调,成本比全参微调低 10 倍。
先让流水线跑通,
再让模型变大。
灏天文库 · AI 与大模型 P.03