5.2 NVL72 的机柜间扩展


文档摘要

5.2 NVL72 的机柜间扩展 一个 NVL72 机柜已经是"一颗大 GPU",但要训练万亿参数模型,往往需要几十甚至上百个机柜。怎么把这些"大 GPU"高效连起来?NVIDIA 的答案是 fat tree 组网 + 轨道优化。 5.2.1 从单柜到多柜:两纤网络的必然 回顾第 4.4 节,机柜内的 NVSwitch 铜背板无法跨柜延伸——铜的传输距离有限,无阻塞全互联被物理上限制在一个机柜内。所以一旦训练规模超过单柜 72 卡,就必须把多个 NVL72 机柜通过机柜间网络连起来。 这个机柜间网络用的就是第 5.1 节讲的 fat tree(Spine-Leaf)+ 无损网络。

5.2 NVL72 的机柜间扩展

一个 NVL72 机柜已经是"一颗大 GPU",但要训练万亿参数模型,往往需要几十甚至上百个机柜。怎么把这些"大 GPU"高效连起来?NVIDIA 的答案是 fat tree 组网 + 轨道优化。

5.2.1 从单柜到多柜:两纤网络的必然

回顾第 4.4 节,机柜内的 NVSwitch 铜背板无法跨柜延伸——铜的传输距离有限,无阻塞全互联被物理上限制在一个机柜内。所以一旦训练规模超过单柜 72 卡,就必须把多个 NVL72 机柜通过机柜间网络连起来。

这个机柜间网络用的就是第 5.1 节讲的 fat tree(Spine-Leaf)+ 无损网络。每个 NVL72 机柜作为一个计算单元,上联到 Leaf 交换机,多个 Leaf 再通过 Spine 互连,构成跨柜的无阻塞(或接近无阻塞)网络。

NVL72 多柜组网(概念): Spine 层(全互连所有 Leaf) │ ┌─────┬─────┬─────┐ Leaf1 Leaf2 Leaf3 Leaf... │ │ │ NVL72 NVL72 NVL72 ... 机柜1 机柜2 机柜3 每个机柜是一个"大 GPU"单元 机柜间靠 fat tree + 无损网络连接

💡 两纤网络的分工:机柜内(NVSwitch)负责"极紧耦合、无阻塞全互联",机柜间(fat tree)负责"较松耦合、大规模连接"。两层网络各司其职,是 AI 集群的标配结构。

5.2.2 轨道优化(Rail-aware):让通信少绕路

把多个 NVL72 机柜简单连起来,组网是通了,但效率未必高。一个关键问题——机柜内 72 颗 GPU 和机柜间网络的对接方式,会显著影响集合通信的效率。

NVIDIA 在这方面引入了"轨道优化"(Rail-aware / Rail-optimized)的设计思想。它的核心是:把每个机柜内的 GPU 按编号分组(比如 8 组),每组 GPU 上联到一个专属的 Leaf 交换机(一个"Rail")。这样,跨机柜通信时,相同编号(同轨)的 GPU 之间的通信只经过一层 Leaf,延迟最低、路径最短。

轨道优化(概念示意,以每柜分 R 轨为例): Leaf(Rail 0) ── 各柜的 GPU 0 Leaf(Rail 1) ── 各柜的 GPU 1 Leaf(Rail 2) ── 各柜的 GPU 2 ... 同一个 Rail(如 Rail 0)上的 GPU 互访: 只经过一层 Leaf,延迟低、路径短

为什么这能提升效率?因为在张量并行等紧耦合策略里,频繁通信的往往是"同一编号"的 GPU 组(它们各自负责模型同一部分的切片)。把这些 GPU 放在同一个 Rail 上,让它们的通信只走一层 Leaf,就把跨柜通信的延迟和拥塞降到最低。这是用拓扑设计"配合"通信模式的典型做法。

⚠️ 轨道优化的前提:它要求硬件拓扑和软件通信模式匹配——哪些 GPU 频繁通信,就把它们放在同一个 Rail。这需要集群规划者和训练框架的紧密协作,不是单纯堆网络设备就能实现。

5.2.3 NVL72 多柜架构的层次

把轨道优化纳入,NVL72 的多柜架构呈现出清晰的层次:

NVL72 多柜架构层次: 层0:单颗 Blackwell GPU(第2章) 层1:单柜 72 GPU,NVSwitch 铜背板全互联(第4章) ── "一颗大 GPU" 层2:多柜通过 Leaf 互连(含轨道优化)(本章) ── 同轨 GPU 单层 Leaf 通信 层3:多 Leaf 通过 Spine 全互连(本章) ── 跨轨、跨大组通信 每往上一层,带宽下降、延迟上升, 但能连接的规模越来越大。

这个层次结构有一个重要特征——越往下越紧耦合,越往上越松耦合。层1(单柜)是硬件一致性内存域,层2(同轨)是单层 Leaf 低延迟,层3(跨轨)是多跳网络较高延迟。训练框架在分配任务时,要把紧耦合的并行(如张量并行)放在低层,把松耦合的并行(如数据并行)放在高层——这正是第 5.4 节要讲的"拓扑协同"。

5.2.4 NVL72 路线的网络选型

在具体网络技术上,NVL72 体系同时支持 InfiniBand 和无损以太网(RoCE)两种组网方式,由部署方根据成本、生态、规模选择:

  • InfiniBand:天生无损、延迟极低、管理简单,但设备成本高、生态相对封闭。常见于追求极致性能的超大规模部署。
  • 无损以太网(RoCE):经济、通用、生态广,配合 PFC/ECN 可达到接近 IB 的性能。常见于注重成本效益的大规模部署。

💡 选型的本质:不是"哪个更好",而是"匹配场景"。对延迟极其敏感、预算充足的场景选 IB;注重成本效益、需要通用生态的场景选 RoCE。两者在 NVL72 体系里都被广泛使用。

5.2.5 NVL72 多柜组网的战略意义

把 NVL72 的多柜组网放回整体战略,它的意义在于——它把"单柜极致"延伸到了"多柜规模",让 NVIDIA 同时具备单柜最强和多柜可扩两个维度的竞争力。

回顾第 4.4 节的对比,昇腾在机柜内全互联规模上不及 NVL72,但靠超节点+大规模组网争取总吞吐。而 NVL72 体系不仅单柜最强,多柜组网也不弱(轨道优化 + fat tree + 双网络选型),这意味着 NVIDIA 在"网"的几乎所有维度都保持领先。这也是为什么 NVIDIA 在 AI 集群网络领域长期占据主导地位。

下一节看昇腾 SuperPod 在同样的网络底座上,如何用不同的组织方式构建大规模集群。

思考与延伸

  1. 轨道优化让同轨 GPU 单层 Leaf 通信,但跨轨通信仍要走 Spine。如果一个训练任务的通信模式恰好跨轨频繁,轨道优化还有用吗?该如何重新分组?
  2. NVL72 同时支持 IB 和 RoCE,但两者在同一集群里混用时会有兼容性问题。你认为在什么情况下值得混用?
  3. 假设你要为一个 100 柜的 NVL72 集群设计组网,你会如何分配轨道数、Leaf 数、Spine 数,以在成本和无阻塞之间取平衡?

本节关键词:NVL72 机柜间扩展、轨道优化、Rail-aware、Spine-Leaf、InfiniBand、RoCE 返回:第 5 章支柱页 下一节:5.3 昇腾 SuperPod 的组网架构


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U