缩放定律


缩放定律

本节摘要:2020 年 Kaplan 论文说「模型越大损失越低」,2022 年 Hoffmann 论文说「你训练得不够」。算力进两个桶——参数和token——而两者的配比并不显然。当你有 C FLOPs 训练算力、想要最好的模型,你面对两个旋钮:参数量 N(更大=更高容量)和训练 token 数 D(更多数据=更好利用容量),FLOPs 约等于 6·N·D,你可以 N 大 D 小或反之,哪个更好?2022 年前答案是「猛推 N」——GPT-3(2020)是 1750 亿参数训约 3000 亿 token,每参数约 1.7 个 token,Kaplan 定律背书这个方向。Hoffmann 等(2022)训了 Chinchilla,发现最优比接近**每参数 20 个 token**,GPT-3 训练不足 10 倍,Chinchilla(70B 参数、1.4T token)在每个基准上击败 GPT-3(175B、300B token)且推理成本低 2.5 倍。但 2026 年是 Chinchilla 的世界加一个重要反转——Llama 3 8B 训了 15 万亿 token,每参数 1875 个 token,是 Chinchilla 最优的 94 倍:因为推理成本比训练成本重要,「过训练(超 Chinchilla)换更小可部署 footprint」成了 2026 的默认。本节带你实现 Chinchilla 损失方程 L(N,D)=A/N^α+B/D^β+E,求出算力最优配比,并算清「过训练」用多少训练 FLOPs 换回多少推理 FLOPs。

学习目标

阅读完本节,你应当能够:

  1. 写出 Hoffmann/Chinchilla 损失方程 L(N,D) = A/N^α + B/D^β + E,并说清各项含义(α≈0.34, β≈0.28, E≈1.69 不可约损失)。
  2. 在固定算力 C=6ND 下求算力最优配比:N_opt ≈ 0.6·(C/6)^0.5、D_opt ≈ 0.6·(C/6)^0.5、D/N ≈ 20。
  3. 解释为什么 2026 年流行过训练(超 Chinchilla):训练成本付一次,推理成本付到永远——对推理主导的负载,正确配比是每参数 100~500 token。
  4. 说清**「涌现」争议**:Schaeffer 2023 论证它是评测指标(精确匹配、阈值准确率)的间断打分造成的假象,连续指标(交叉熵)是平滑曲线。
  5. 列出 2026 年缩放定律的五个变化因素:数据质量、MoE、后训练、多模态、合成数据。

一、问题与直觉

算力进两个桶——参数和 token——配比不显然。2022 年前猛推 N(GPT-3 每参数 1.7 token),Hoffmann 2022 训 Chinchilla 发现最优是每参数 20 token,GPT-3 训练不足 10 倍。Chinchilla(70B、1.4T)在每个基准上击败 GPT-3(175B、300B)且推理成本低 2.5 倍。

2026 是 Chinchilla 的世界加一个反转:Llama 3 8B 训 15T token,每参数 1875 token,超 Chinchilla 最优 94 倍——因为推理成本主导,过训练换更小部署 footprint 是默认。

Hoffmann 定律

Chinchilla 论文的损失:

L(N, D) = A / N^α + B / D^β + E ​
  • N = 参数(非嵌入)。
  • D = 训练 token。
  • α ≈ 0.34、β ≈ 0.28(大致对称)。
  • E ≈ 1.69,不可约损失地板(数据本身的熵)。
  • A ≈ 406、B ≈ 411。

两项在 scale 时互相权衡。对 N 求导(固定算力 C=6ND)解出:

N_opt ≈ 0.6 × (C/6)^0.5 D_opt ≈ 0.6 × (C/6)^0.5 D_opt / N_opt ≈ 20 ​

算力最优:每参数 20 token。

为什么还要过训练

Chinchilla 最优最小化每训练 FLOP 的训练损失,但训练成本付一次,推理成本付到永远。对一个月服务一万亿 token 的聊天机器人,推理主导总成本。Llama 的策略:训小一点、训久一点。8B 训 15T token 是深度推理优化:能塞进消费级 GPU,延迟是 70B Chinchilla 最优的一小部分,质量对多数任务够用。DeepMind 2024 论文《Over-training is the new optimal》形式化了这一点:对推理主导负载,正确配比视服务量在每参数 100~500 token。

涌现 vs 平滑

有人声称某些能力(算术、多步推理、思维链遵循)在某些规模「突然涌现」。Schaeffer 等(2023)论证这是评测假象:涌现指标用间断打分(精确匹配、阈值准确率),掩盖了底层 logits 的平滑改进;连续指标(交叉熵)显示平滑曲线。2026 共识:用连续损失做的预测可靠,基准的跳跃往往是打分器假象,预算要按连续指标规划。

2026 年的全景

缩放定律仍有效,但:

因素 怎么变了
数据质量 策划「好」token(Phi 风格)把曲线平移 >2 倍有效算力
MoE 总参数与激活 FLOPs 解耦,缩放定律按每激活 FLOP
后训练 某些能力(指令遵循、代码)随 SFT+RLHF 变化大于预训练
多模态 图像 + 文本 token 一起 scale,每模态各一条曲线
合成数据 模型生成训练数据,有效算力可复利

Muon 优化器(Kimi Moonlight,2024)在等数据下相对 AdamW 有约 2 倍有效算力增益,部分 2026 训练默认用 Muon——它改变缩放定律的绝对常数,不改形状。

💡 不可约损失 E≈1.69:这是数据本身的熵——再好的模型也压不下去。它告诉你「损失能降到多低」有硬下限,不是靠堆算力就能突破的。理解这一点能避免对缩放的盲目乐观。

二、从零实现

完整代码见原课程 phases/07-transformers-deep-dive/13-scaling-laws/code/main.py。实现 Chinchilla 损失方程,在多个算力预算下求算力最优 (N, D)。

Step 1:Chinchilla 损失

def chinchilla_loss(N, D, A=406.4, B=410.7, alpha=0.34, beta=0.28, E=1.69): return A / N ** alpha + B / D ** beta + E ​

在固定 C=6ND 下画 L 对 (N, D) 的等值线,找最小值。

Step 2:算力最优前沿

对算力预算从 1e17 到 1e25 FLOPs,在 6ND=C 约束下找最小化损失的 (N, D),验证 D/N ≈ 20。

Step 3:过训练成本

算「训一个 10 倍小的模型」(1/10 最优 N、10 倍最优 D)付的额外损失,并报告换回的推理 FLOP 节省(正比于 N)。

Step 4:对比真实模型

代入 GPT-3、Chinchilla、Llama 3 8B、DeepSeek-V3(激活参数)的 (N, D),对比预测损失与报告损失。

设计要点:Chinchilla 损失的两项 A/N^α(容量不足)和 B/D^β(数据不足)互相竞争——固定算力下,N 太大则每参数 token 不够(数据项主导),N 太小则容量不够(参数项主导),最优在两者平衡点。这就是为什么 D/N≈20 是「每 FLOP 最优」,而非任意值。

三、框架对比:把缩放定律用在哪儿

你不太可能自己训前沿模型,但缩放定律告诉你:

  1. 微调数据够不够:若任务数据低于基座模型每参数 20 token,预期在某损失地板饱和。
  2. 该不该选更大基座:若预算全花在推理上,优先选更小、训更久的模型。
  3. 回报在哪里递减:超 Chinchilla 最优 1000 倍后,log-loss 变化变成噪声。

2026 年的研究轨迹:

  • 数据受限区:过滤后全网高质量 token 数有限(英文约 5~10 万亿),前沿预训练接近这个天花板,合成数据、多语言、多模态、RLHF 放大微调是下一组杠杆。
  • 算力倍增器技巧:Muon 优化器、MoE、更好数据策展——每个都平移绝对常数,不动渐近线。
  • RL 的缩放定律:开放问题,早期证据显示在 RL 样本上有幂律但指数与预训练大不同。

四、可复用产物

原课程产出 outputs/skill-training-budget-estimator.md:一个预算估算 Skill,给定算力预算、部署约束、目标损失,为新训练选 (N, D, 小时数, GPU)。

五、练习

  1. (Easy) 跑 code/main.py,打印算力预算 1e20、1e22、1e24 的 Chinchilla 最优 (N, D),对比真实模型表。
  2. (Medium) 实现「损失作为算力函数」曲线,画算力最优前沿的损失 vs log10(C)。找出定律预测「损失再降 0.1 需 >10²⁸ FLOPs」的位置。
  3. (Hard) 在同数据集上训 5 个微型模型(10 万到 1000 万参数),拟合并估计 α 和 E,你的指数与公布值吻合度如何?

本节要点回顾

  1. 算力进两个桶:参数 N(容量)和 token D(利用容量),C≈6ND,配比不显然。
  2. Chinchilla 损失:L=A/N^α + B/D^β + E,α≈0.34、β≈0.28、E≈1.69 不可约损失(数据熵地板)。
  3. 算力最优 D/N≈20:GPT-3(1.7 token/参数)训练不足 10 倍;Chinchilla(70B、1.4T)以 2.5 倍低推理成本击败 GPT-3。
  4. 2026 流行过训练:训练付一次、推理付到永远;Llama 3 8B(1875 token/参数)超 Chinchilla 94 倍,推理主导负载正确配比是 100~500 token/参数。
  5. 「涌现」多是评测假象:Schaeffer 2023 论证间断打分(精确匹配)掩盖平滑改进,连续指标(交叉熵)平滑——按连续指标规划预算。
  6. 五个变化因素:数据质量(>2× 有效算力)、MoE(按激活 FLOP)、后训练(SFT+RLHF)、多模态(每模态一条曲线)、合成数据(复利)。
  7. Muon 等优化器改绝对常数不改形状:缩放定律的渐近线不变,但每 FLOP 走得更远。
  8. 不可约损失 E≈1.69 是硬下限:再堆算力也压不过数据本身的熵。

下一节,我们把前 13 节的积木全部用上,做一个毕业项目——从零实现一个能跑通前向、能生成文本的完整 Transformer。


作者与出处
原作者: Rohit Gupta
来源:rohitg00
许可证:MIT
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: Rohit Gupta 转发
评论区 (0)
U