1.1 大模型时代的算力需求演进


文档摘要

1.1 大模型时代的算力需求演进 为什么十年前的"卡皇"放今天连一个中型模型的预训练都跑不动?答案藏在 Scaling Law(缩放定律)里。 1.1.1 Scaling Law:算力需求爆炸的物理根源 大模型能力之所以随规模跃升,背后有一条经验规律:在数据、参数、算力三者同比例放大的区间内,损失函数会近似按幂律下降。这条规律被称为 Scaling Law。它的直接推论是——想要更强的模型,最稳妥的办法就是把规模整体往上抬:参数翻倍,数据翻倍,算力自然也要翻倍。 这条规律带来的后果是,训练一个前沿模型的算力需求,正以远超摩尔定律的速度增长。业界统计显示,前沿模型训练所用算力大约每过一段时间就翻一个量级,而单颗芯片的性能增长却远远跟不上这个节奏。

1.1 大模型时代的算力需求演进

为什么十年前的"卡皇"放今天连一个中型模型的预训练都跑不动?答案藏在 Scaling Law(缩放定律)里。

1.1.1 Scaling Law:算力需求爆炸的物理根源

大模型能力之所以随规模跃升,背后有一条经验规律:在数据、参数、算力三者同比例放大的区间内,损失函数会近似按幂律下降。这条规律被称为 Scaling Law。它的直接推论是——想要更强的模型,最稳妥的办法就是把规模整体往上抬:参数翻倍,数据翻倍,算力自然也要翻倍。

这条规律带来的后果是,训练一个前沿模型的算力需求,正以远超摩尔定律的速度增长。业界统计显示,前沿模型训练所用算力大约每过一段时间就翻一个量级,而单颗芯片的性能增长却远远跟不上这个节奏。缺口一旦出现,就只能靠"堆数量"来补——于是算力的主战场,从一颗芯片迁移到了一片集群。

单卡性能增长(平缓) ╱──────────────────────── ╱ ╱ ╱ ╱ ╱ ╱ ╱ ╱──────────────────────────────────► 时间 ───────────────────────────────────► ╲ ╲ 前沿模型训练算力需求(陡峭) ╲ ╲──────────────────────── ← 缺口靠"堆卡"补

💡 关键认知:Scaling Law 不是"大就是好"的口号,它是一条可量化的工程规律。它解释了为什么所有头部厂商都在拼命造更大的集群——不是因为喜欢烧钱,而是因为在当前范式下,规模就是竞争力本身。

1.1.2 从单卡到集群:算力单元的三次跃迁

理解算力需求的演化,最直观的方式是看"算力单元"是怎么一步步放大的。整个过程大致经历了三次跃迁:

阶段 算力单元 典型形态 核心矛盾
单卡时代 一颗加速芯片 GPU/NPU 插在服务器里 单卡算力够不够
单机多卡 一台服务器内多卡 8 卡服务器 + PCIe/互联 卡间通信与内存墙
整柜/整集群 机柜乃至机房级 NVL72 / SuperPoD 供电、散热、跨柜互联

第一次跃迁(单卡 → 单机多卡)解决的是"一台机器内怎么让多颗芯片协同",于是出现了片间高速互联。第二次跃迁(单机 → 整柜)解决的是"怎么把一个机柜里的几十颗芯片当成一颗用",这正是 NVL72 这类整机柜系统的由来。第三次跃迁(整柜 → 整集群)解决的是"一个机柜装不下,怎么把成百上千个机柜连起来",于是有了 SuperPoD 这类大规模组网架构。

单卡 ──► 单机8卡 ──► 整机柜(NVL72/整柜) ──► 整集群(SuperPoD/数据中心) 1颗 8颗协同 数十颗单一内存域 成百上千柜 scale-out 组网

1.1.3 集群化的三堵墙:算力墙、内存墙、互联墙

算力单元放大并不是免费的,每放大一次,就会撞上新一堵"墙":

  • 算力墙:单芯片算力受制于制程与功耗,堆得越多,单卡能贡献的相对比例越低,调度开销越大。
  • 内存墙:模型参数和激活值越来越大,而显存带宽增长跟不上算力增长,数据搬运成了瓶颈——这往往比算力本身更致命。
  • 互联墙:芯片越多,彼此之间要同步的梯度(Gradient)越多,通信开销指数级上升,搞不好一半时间都在等数据。

这三堵墙是本教程后续章节反复回响的主题。「芯」两章(第 2、3 章)正面回应算力墙与内存墙;「网」两章(第 4、5 章)回应互联墙;而「体」与「链」(第 6–9 章)则回应支撑这一切的物理与产业基础。

⚠️ 常见的误解:很多人以为"算力 = 芯片数量 × 单卡算力"。但在集群里,通信、内存带宽、调度损耗都会吃掉相当一部分名义算力,集群的有效算力往往远低于简单相加的峰值。这一点在第 1.4 节和第 2.4 节会专门展开。

1.1.4 两条路线的同一个目标

有意思的是,尽管 NVIDIA 与华为在技术路线上差异巨大,但他们面对的是同一堵墙,目标也完全一致——用更低的单位成本和能耗,支撑更大规模的模型训练。区别只在于各自用什么手段去翻墙:

  • NVIDIA 依托全球最强的芯片设计与先进制程生态,把单柜算力做到极致,再用 NVLink 把柜内焊成一颗"大芯片"。
  • 华为则在制程受限的现实下,用架构与工程创新弥补单卡差距,靠全栈自主和规模化集群路线争取整体竞争力。

这种"同一目标、不同手段"的格局,正是本教程值得把两大平台放在一起讲的根本原因。下一节(1.2)我们就分别看清这两台机器的全貌。

思考与延伸

  1. 如果 Scaling Law 在某个规模点之后开始失效(即"再加算力收益递减"),算力竞赛的格局会发生什么变化?这对两大路线谁更不利?
  2. 假设单卡算力永远追不上模型需求,那么决定训练速度的到底是"峰值算力"还是"有效算力"?试着用本节的三堵墙解释你的判断。
  3. 回顾你接触过的任何一次"从单机到集群"的迁移(哪怕是分布式数据库或微服务),它们各自撞上了哪几堵墙?和 AI 集群的墙有何异同?

本节关键词:Scaling Law、算力墙、内存墙、互联墙、算力单元 返回:第 1 章支柱页 下一节:1.2 两大平台定位与系统全貌


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U