参数-数据-算力配比 · 缩放定律
2020 年大家以为"参数越大越强",于是 GPT-3 堆到 175B。2022 年 Chinchilla 论文打脸:GPT-3 训练严重不足。
DeepMind 系统研究缩放定律后发现:固定算力预算 C(FLOPs),最优的参数量 N 和数据量 D 满足 N : D ≈ 20 : 1(按 token 计)。也就是每 20 个参数配 1 个 token 的训练量才不浪费算力。
GPT-3:N=175B,D=300B token,比例 0.58:1——参数是数据量的 175/300 倍,远高于 20:1,严重欠训。Chinchilla:N=70B,D=1.4T token,比例 20:1,用更少参数+更多数据反超 GPT-3。结论:不是越大越好,是配比要对。
调你的算力预算,看 Chinchilla 最优的参数和数据配比。
一个常见坑:盲目追大模型,结果算力不够训不足,70B 欠训不如 13B 训足。先算算力预算,再定参数和数据,别先定参数再凑数据。