缩放定律


文档摘要

缩放定律 本节摘要:2020 年 Kaplan 论文说「模型越大损失越低」,2022 年 Hoffmann 论文说「你训练得不够」。算力进两个桶——参数和token——而两者的配比并不显然。当你有 FLOPs 训练算力、想要最好的模型,你面对两个旋钮:参数量 (更大=更高容量)和训练 token 数 (更多数据=更好利用容量),FLOPs 约等于 ,你可以 大 小或反之,哪个更好?2022 年前答案是「猛推 」——GPT-3(2020)是 1750 亿参数训约 3000 亿 token,每参数约 1.7 个 token,Kaplan 定律背书这个方向。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U