缩放定律


文档摘要

缩放定律 本节摘要:2020 年 Kaplan 论文说「模型越大损失越低」,2022 年 Hoffmann 论文说「你训练得不够」。算力进两个桶——参数和token——而两者的配比并不显然。当你有 FLOPs 训练算力、想要最好的模型,你面对两个旋钮:参数量 (更大=更高容量)和训练 token 数 (更多数据=更好利用容量),FLOPs 约等于 ,你可以 大 小或反之,哪个更好?2022 年前答案是「猛推 」——GPT-3(2020)是 1750 亿参数训约 3000 亿 token,每参数约 1.7 个 token,Kaplan 定律背书这个方向。


作者与出处
原作者: Rohit Gupta
来源:rohitg00
许可证:MIT
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: Rohit Gupta 转发
评论区 (0)
U