5.3 昇腾 SuperPod 的组网架构 昇腾的 SuperPod 不是"把超节点简单连起来",而是一套精心设计的分层组网——它要在单柜全互联规模不如 NVL72 的现实下,用网络架构把大规模集群组织成高效的训练整体。 5.3.1 SuperPod 的基本思想 SuperPod 这个词源自"Pod"(豆荚)——一个 Pod 是一组紧密协作的算力单元。昇腾的 SuperPod 就是把大量"超节点"(第 4.3 节讲过,由 HCCS 互联的 NPU 组)通过高速网络组织成一个大型训练集群,规模可达数千卡。 SuperPod 的基本思想是"分层 + 就近": 超节点内(柜内):用 HCCS 实现紧耦合全互联,承担张量并行等高频通信。
昇腾的 SuperPod 不是"把超节点简单连起来",而是一套精心设计的分层组网——它要在单柜全互联规模不如 NVL72 的现实下,用网络架构把大规模集群组织成高效的训练整体。
SuperPod 这个词源自"Pod"(豆荚)——一个 Pod 是一组紧密协作的算力单元。昇腾的 SuperPod 就是把大量"超节点"(第 4.3 节讲过,由 HCCS 互联的 NPU 组)通过高速网络组织成一个大型训练集群,规模可达数千卡。
SuperPod 的基本思想是"分层 + 就近":
昇腾 SuperPod 分层(概念): 层0:单颗昇腾950 NPU(第2章) 层1:超节点内,HCCS 全互联(第4章) ── "局部紧耦合" 层2:超节点间,无损以太/IB(本章) ── "整体广连接" 层3:多 SuperPod 互连(数据中心级) ── "规模扩展" 每往上一层,带宽下降、延迟上升,但规模扩大。
💡 与 NVL72 体系的对称性:其实 NVL72 多柜和昇腾 SuperPod 都是"两纤网络"结构——柜内/超节点内一层,柜间/超节点间一层。区别只在于柜内单元的规模(NVL72 是 72 卡大单元,昇腾超节点是较小的组)和组网的侧重。理解了这个对称性,就不会被两个名字绕晕。
昇腾组网的关键设计选择是"以超节点为基本单元"。这与 NVL72 体系以"72 卡机柜"为基本单元是对称的,但单元的内部结构和规模不同。
回顾第 4.3 节,昇腾超节点内是 HCCS 近邻全互联。这个超节点对外(对网络)呈现为一个算力单元,有自己的网络接口上联到汇聚交换机。多个超节点的网络接口汇聚到一层交换机,再上联到核心层,构成 SuperPod。
这种设计的好处是:超节点内部的紧耦合通信(最高频、最敏感)被 HCCS 消化,留给机柜间网络的只是相对低频的跨节点通信。这就降低了对机柜间网络的带宽压力——网络不必处理张量并行那种极高频的通信,只需要处理数据并行等相对宽松的通信。
超节点作为组网单元的通信分工: 超节点内(HCCS):张量并行、激活交换(高频、大流量) ── 用 HCCS 高速消化 │ 超节点间(网络):数据并行梯度同步(相对低频) ── 交给无损以太/IB
⚠️ 分工的前提:这种"柜内消化高频、柜间处理低频"的分工,要求训练框架的并行策略与拓扑匹配——把高频通信限制在超节点内,把低频通信放到超节点间。如果策略不当(比如把张量并行跨超节点做),柜间网络会被打爆。这就是第 5.4 节"拓扑协同"的核心议题。
SuperPod 的分层组网通常包含三层交换(具体层数随规模调整):
| 层级 | 作用 | 特征 |
|---|---|---|
| 接入层 | 接入超节点的网络接口 | 带宽适中,端口密度高 |
| 汇聚层 | 汇聚多个接入交换机 | 提供超节点组内互连 |
| 核心层 | 全互连所有汇聚层 | 提供跨组、大规模互连 |
这三层共同构成一个 fat tree 式的无阻塞(或接近无阻塞)网络。超节点内的 NPU 通过 HCCS 紧耦合,超节点之间通过这套三层网络松耦合,整体上既有局部的紧耦合,又有全局的可扩展性。
SuperPod 三层组网(概念): 核心交换层(全互连) │ ┌───────┬───────┐ 汇聚1 汇聚2 汇聚3 ╱ │ ╲ ╱ │ ╲ ╱ │ ╲ 接入 接入 接入 接入 接入 接入 │ │ │ │ │ │ 超节点...超节点...超节点... (柜内HCCS紧耦合)
在网络技术上,昇腾 SuperPod 同样在无损以太网和 InfiniBand 之间有选择空间。公开资料中,昇腾大规模集群常用基于 RoCE 的无损以太网组网,配合华为自家的网络设备(交换机、网卡)形成端到端的解决方案。这与 NVL72 体系的网络选型逻辑一致——都是"无损网络 + fat tree",区别在于具体设备和生态。
💡 昇腾组网的特色:相对 NVL72 体系高度依赖 InfiniBand(及其主导厂商),昇腾更倾向于基于以太网的开放组网,这与其"全栈自主 + 开放生态"的整体定位一致。以太网路线的好处是设备来源多元、成本可控,挑战是损耗网络的调优更复杂。
把 SuperPod 组网放回昇腾整体战略,它的意义在于——它是昇腾"用规模补单卡"战略在网络层面的具体落地。
回顾第 3.3、4.4 节,昇腾在单卡带宽和单柜全互联规模上都受约束。SuperPod 组网通过"超节点紧耦合 + 大规模分层网络",把这些约束的影响降到最低:单柜能做的事在超节点内做掉,单柜做不了的事靠大规模组网摊薄。这种"局部紧、整体广"的设计,使得昇腾在单点算力不如 NVL72 的现实下,仍能在集群总吞吐上保持竞争力。
这也是为什么昇腾特别强调 SuperPod 的"规模化能力"——在它的战略里,规模本身就是武器。下一节我们上升到软件层,看集合通信库如何让这套复杂的网络真正高效运转。
本节关键词:SuperPod、超节点组网、分层组网、无损以太网、RoCE、昇腾网络 返回:第 5 章支柱页 下一节:5.4 集合通信库与拓扑协同