1.1 大模型时代的算力需求演进 为什么十年前的"卡皇"放今天连一个中型模型的预训练都跑不动?答案藏在 Scaling Law(缩放定律)里。 1.1.1 Scaling Law:算力需求爆炸的物理根源 大模型能力之所以随规模跃升,背后有一条经验规律:在数据、参数、算力三者同比例放大的区间内,损失函数会近似按幂律下降。这条规律被称为 Scaling Law。它的直接推论是——想要更强的模型,最稳妥的办法就是把规模整体往上抬:参数翻倍,数据翻倍,算力自然也要翻倍。 这条规律带来的后果是,训练一个前沿模型的算力需求,正以远超摩尔定律的速度增长。业界统计显示,前沿模型训练所用算力大约每过一段时间就翻一个量级,而单颗芯片的性能增长却远远跟不上这个节奏。
为什么十年前的"卡皇"放今天连一个中型模型的预训练都跑不动?答案藏在 Scaling Law(缩放定律)里。
大模型能力之所以随规模跃升,背后有一条经验规律:在数据、参数、算力三者同比例放大的区间内,损失函数会近似按幂律下降。这条规律被称为 Scaling Law。它的直接推论是——想要更强的模型,最稳妥的办法就是把规模整体往上抬:参数翻倍,数据翻倍,算力自然也要翻倍。
这条规律带来的后果是,训练一个前沿模型的算力需求,正以远超摩尔定律的速度增长。业界统计显示,前沿模型训练所用算力大约每过一段时间就翻一个量级,而单颗芯片的性能增长却远远跟不上这个节奏。缺口一旦出现,就只能靠"堆数量"来补——于是算力的主战场,从一颗芯片迁移到了一片集群。
单卡性能增长(平缓) ╱──────────────────────── ╱ ╱ ╱ ╱ ╱ ╱ ╱ ╱──────────────────────────────────► 时间 ───────────────────────────────────► ╲ ╲ 前沿模型训练算力需求(陡峭) ╲ ╲──────────────────────── ← 缺口靠"堆卡"补
💡 关键认知:Scaling Law 不是"大就是好"的口号,它是一条可量化的工程规律。它解释了为什么所有头部厂商都在拼命造更大的集群——不是因为喜欢烧钱,而是因为在当前范式下,规模就是竞争力本身。
理解算力需求的演化,最直观的方式是看"算力单元"是怎么一步步放大的。整个过程大致经历了三次跃迁:
| 阶段 | 算力单元 | 典型形态 | 核心矛盾 |
|---|---|---|---|
| 单卡时代 | 一颗加速芯片 | GPU/NPU 插在服务器里 | 单卡算力够不够 |
| 单机多卡 | 一台服务器内多卡 | 8 卡服务器 + PCIe/互联 | 卡间通信与内存墙 |
| 整柜/整集群 | 机柜乃至机房级 | NVL72 / SuperPoD | 供电、散热、跨柜互联 |
第一次跃迁(单卡 → 单机多卡)解决的是"一台机器内怎么让多颗芯片协同",于是出现了片间高速互联。第二次跃迁(单机 → 整柜)解决的是"怎么把一个机柜里的几十颗芯片当成一颗用",这正是 NVL72 这类整机柜系统的由来。第三次跃迁(整柜 → 整集群)解决的是"一个机柜装不下,怎么把成百上千个机柜连起来",于是有了 SuperPoD 这类大规模组网架构。
单卡 ──► 单机8卡 ──► 整机柜(NVL72/整柜) ──► 整集群(SuperPoD/数据中心) 1颗 8颗协同 数十颗单一内存域 成百上千柜 scale-out 组网
算力单元放大并不是免费的,每放大一次,就会撞上新一堵"墙":
这三堵墙是本教程后续章节反复回响的主题。「芯」两章(第 2、3 章)正面回应算力墙与内存墙;「网」两章(第 4、5 章)回应互联墙;而「体」与「链」(第 6–9 章)则回应支撑这一切的物理与产业基础。
⚠️ 常见的误解:很多人以为"算力 = 芯片数量 × 单卡算力"。但在集群里,通信、内存带宽、调度损耗都会吃掉相当一部分名义算力,集群的有效算力往往远低于简单相加的峰值。这一点在第 1.4 节和第 2.4 节会专门展开。
有意思的是,尽管 NVIDIA 与华为在技术路线上差异巨大,但他们面对的是同一堵墙,目标也完全一致——用更低的单位成本和能耗,支撑更大规模的模型训练。区别只在于各自用什么手段去翻墙:
这种"同一目标、不同手段"的格局,正是本教程值得把两大平台放在一起讲的根本原因。下一节(1.2)我们就分别看清这两台机器的全貌。
本节关键词:Scaling Law、算力墙、内存墙、互联墙、算力单元 返回:第 1 章支柱页 下一节:1.2 两大平台定位与系统全貌