AI 与大模型 · 第 20 期 · 第二季收官

模型不是越大越好,Chinchilla 之后怎么选

参数-数据-算力配比 · 缩放定律

一句话结论:Chinchilla 定律:固定算力下,参数和数据要按约 20:1 配比才最优。GPT-3 用 175B 参数只配 300B token(严重欠训),Chinchilla 用 70B 参数配 1.4T token 反超。所以选模型不是越大越好,是看算力预算算出最优配比——大算力配大模型,小算力配小模型多喂数据。
⏱ 约 10 分钟 🎯 想选模型不被参数量骗的人 📦 源:ai-engineering-from-scratch §11

01反共识:GPT-3 其实是欠训的

2020 年大家以为"参数越大越强",于是 GPT-3 堆到 175B。2022 年 Chinchilla 论文打脸:GPT-3 训练严重不足。

DeepMind 系统研究缩放定律后发现:固定算力预算 C(FLOPs),最优的参数量 N 和数据量 D 满足 N : D ≈ 20 : 1(按 token 计)。也就是每 20 个参数配 1 个 token 的训练量才不浪费算力。

C ≈ 6 · N · D  (训练算力 ≈ 6 × 参数 × 数据)

GPT-3:N=175B,D=300B token,比例 0.58:1——参数是数据量的 175/300 倍,远高于 20:1,严重欠训。Chinchilla:N=70B,D=1.4T token,比例 20:1,用更少参数+更多数据反超 GPT-3。结论:不是越大越好,是配比要对。

不是越大越好,
是配比要对。
灏天文库 · AI 与大模型 P.59

02参数-数据-算力配比计算器

调你的算力预算,看 Chinchilla 最优的参数和数据配比。

⚖️ Chinchilla 配比计算器
调算力预算(FLOPs),看最优参数 N 和数据 D。
1e23
最优参数 N
—
—
最优数据 D
—
—

03Chinchilla 之后的三个变化

一个常见坑:盲目追大模型,结果算力不够训不足,70B 欠训不如 13B 训足。先算算力预算,再定参数和数据,别先定参数再凑数据。

欠训的大模型,
不如训够的小模型。
灏天文库 · AI 与大模型 P.60

04带走这套选型清单

✅ Chinchilla 之后 6 条选型规则

  1. 配比 20:1:每 20 参数配 1 token,固定算力下最优。
  2. 算力 C≈6ND:先定预算再算参数和数据。
  3. 数据比参数重要:多买数据比堆参数收益高。
  4. 小模型够用:7B-13B 配足数据能打大模型。
  5. 训练要训够:欠训的大模型不如训足的小模型。
  6. 先算预算再定参数:别先定参数再凑数据。
算力定配比,
配比定强弱。
灏天文库 · AI 与大模型 P.61