5.2 NVL72 的机柜间扩展 一个 NVL72 机柜已经是"一颗大 GPU",但要训练万亿参数模型,往往需要几十甚至上百个机柜。怎么把这些"大 GPU"高效连起来?NVIDIA 的答案是 fat tree 组网 + 轨道优化。 5.2.1 从单柜到多柜:两纤网络的必然 回顾第 4.4 节,机柜内的 NVSwitch 铜背板无法跨柜延伸——铜的传输距离有限,无阻塞全互联被物理上限制在一个机柜内。所以一旦训练规模超过单柜 72 卡,就必须把多个 NVL72 机柜通过机柜间网络连起来。 这个机柜间网络用的就是第 5.1 节讲的 fat tree(Spine-Leaf)+ 无损网络。
一个 NVL72 机柜已经是"一颗大 GPU",但要训练万亿参数模型,往往需要几十甚至上百个机柜。怎么把这些"大 GPU"高效连起来?NVIDIA 的答案是 fat tree 组网 + 轨道优化。
回顾第 4.4 节,机柜内的 NVSwitch 铜背板无法跨柜延伸——铜的传输距离有限,无阻塞全互联被物理上限制在一个机柜内。所以一旦训练规模超过单柜 72 卡,就必须把多个 NVL72 机柜通过机柜间网络连起来。
这个机柜间网络用的就是第 5.1 节讲的 fat tree(Spine-Leaf)+ 无损网络。每个 NVL72 机柜作为一个计算单元,上联到 Leaf 交换机,多个 Leaf 再通过 Spine 互连,构成跨柜的无阻塞(或接近无阻塞)网络。
NVL72 多柜组网(概念): Spine 层(全互连所有 Leaf) │ ┌─────┬─────┬─────┐ Leaf1 Leaf2 Leaf3 Leaf... │ │ │ NVL72 NVL72 NVL72 ... 机柜1 机柜2 机柜3 每个机柜是一个"大 GPU"单元 机柜间靠 fat tree + 无损网络连接
💡 两纤网络的分工:机柜内(NVSwitch)负责"极紧耦合、无阻塞全互联",机柜间(fat tree)负责"较松耦合、大规模连接"。两层网络各司其职,是 AI 集群的标配结构。
把多个 NVL72 机柜简单连起来,组网是通了,但效率未必高。一个关键问题——机柜内 72 颗 GPU 和机柜间网络的对接方式,会显著影响集合通信的效率。
NVIDIA 在这方面引入了"轨道优化"(Rail-aware / Rail-optimized)的设计思想。它的核心是:把每个机柜内的 GPU 按编号分组(比如 8 组),每组 GPU 上联到一个专属的 Leaf 交换机(一个"Rail")。这样,跨机柜通信时,相同编号(同轨)的 GPU 之间的通信只经过一层 Leaf,延迟最低、路径最短。
轨道优化(概念示意,以每柜分 R 轨为例): Leaf(Rail 0) ── 各柜的 GPU 0 Leaf(Rail 1) ── 各柜的 GPU 1 Leaf(Rail 2) ── 各柜的 GPU 2 ... 同一个 Rail(如 Rail 0)上的 GPU 互访: 只经过一层 Leaf,延迟低、路径短
为什么这能提升效率?因为在张量并行等紧耦合策略里,频繁通信的往往是"同一编号"的 GPU 组(它们各自负责模型同一部分的切片)。把这些 GPU 放在同一个 Rail 上,让它们的通信只走一层 Leaf,就把跨柜通信的延迟和拥塞降到最低。这是用拓扑设计"配合"通信模式的典型做法。
⚠️ 轨道优化的前提:它要求硬件拓扑和软件通信模式匹配——哪些 GPU 频繁通信,就把它们放在同一个 Rail。这需要集群规划者和训练框架的紧密协作,不是单纯堆网络设备就能实现。
把轨道优化纳入,NVL72 的多柜架构呈现出清晰的层次:
NVL72 多柜架构层次: 层0:单颗 Blackwell GPU(第2章) 层1:单柜 72 GPU,NVSwitch 铜背板全互联(第4章) ── "一颗大 GPU" 层2:多柜通过 Leaf 互连(含轨道优化)(本章) ── 同轨 GPU 单层 Leaf 通信 层3:多 Leaf 通过 Spine 全互连(本章) ── 跨轨、跨大组通信 每往上一层,带宽下降、延迟上升, 但能连接的规模越来越大。
这个层次结构有一个重要特征——越往下越紧耦合,越往上越松耦合。层1(单柜)是硬件一致性内存域,层2(同轨)是单层 Leaf 低延迟,层3(跨轨)是多跳网络较高延迟。训练框架在分配任务时,要把紧耦合的并行(如张量并行)放在低层,把松耦合的并行(如数据并行)放在高层——这正是第 5.4 节要讲的"拓扑协同"。
在具体网络技术上,NVL72 体系同时支持 InfiniBand 和无损以太网(RoCE)两种组网方式,由部署方根据成本、生态、规模选择:
💡 选型的本质:不是"哪个更好",而是"匹配场景"。对延迟极其敏感、预算充足的场景选 IB;注重成本效益、需要通用生态的场景选 RoCE。两者在 NVL72 体系里都被广泛使用。
把 NVL72 的多柜组网放回整体战略,它的意义在于——它把"单柜极致"延伸到了"多柜规模",让 NVIDIA 同时具备单柜最强和多柜可扩两个维度的竞争力。
回顾第 4.4 节的对比,昇腾在机柜内全互联规模上不及 NVL72,但靠超节点+大规模组网争取总吞吐。而 NVL72 体系不仅单柜最强,多柜组网也不弱(轨道优化 + fat tree + 双网络选型),这意味着 NVIDIA 在"网"的几乎所有维度都保持领先。这也是为什么 NVIDIA 在 AI 集群网络领域长期占据主导地位。
下一节看昇腾 SuperPod 在同样的网络底座上,如何用不同的组织方式构建大规模集群。
本节关键词:NVL72 机柜间扩展、轨道优化、Rail-aware、Spine-Leaf、InfiniBand、RoCE 返回:第 5 章支柱页 下一节:5.3 昇腾 SuperPod 的组网架构