灏天文库

模型不是越大越好·Chinchilla之后怎么选

作者: 灏天 · 收录于 AI与大模型

内容摘要

 模型不是越大越好·Chinchilla之后怎么选 灏 灏天文库 · AI 与大模型 第 20 期 · 第二季收官 AI 与大模型 · 第 20 期 · 第二季收官 模型不是越大越好, Chinchilla 之后怎么选 参数-数据-算力配比 · 缩放定律 一句话结论: Chinchilla 定律:固定算力下,参数和数据要按约 20:1 配比才最优 。GPT-3 用 175B 参数只配 300B token(严重欠训),Chinchilla 用 70B 参数配 1.4T token 反超。所以选模型不是越大越好,是看算力预算算出最优配比——大算力配大模型,小算力配小模型多喂数据。 ⏱ 约 10 分钟 🎯 想选模型不被参数量骗的人 📦 源:ai-engineering-from-scratch §11 01 反共识:GPT-3 其实是欠训的 2020 年大家以为"参数越大越强",于是 GPT-3 堆到 175B。2022 年 Chinchilla 论文打脸:GPT-3 训练严重不足。

打开完整知识页 返回工坊集