5.3 昇腾 SuperPod 的组网架构


文档摘要

5.3 昇腾 SuperPod 的组网架构 昇腾的 SuperPod 不是"把超节点简单连起来",而是一套精心设计的分层组网——它要在单柜全互联规模不如 NVL72 的现实下,用网络架构把大规模集群组织成高效的训练整体。 5.3.1 SuperPod 的基本思想 SuperPod 这个词源自"Pod"(豆荚)——一个 Pod 是一组紧密协作的算力单元。昇腾的 SuperPod 就是把大量"超节点"(第 4.3 节讲过,由 HCCS 互联的 NPU 组)通过高速网络组织成一个大型训练集群,规模可达数千卡。 SuperPod 的基本思想是"分层 + 就近": 超节点内(柜内):用 HCCS 实现紧耦合全互联,承担张量并行等高频通信。

5.3 昇腾 SuperPod 的组网架构

昇腾的 SuperPod 不是"把超节点简单连起来",而是一套精心设计的分层组网——它要在单柜全互联规模不如 NVL72 的现实下,用网络架构把大规模集群组织成高效的训练整体。

5.3.1 SuperPod 的基本思想

SuperPod 这个词源自"Pod"(豆荚)——一个 Pod 是一组紧密协作的算力单元。昇腾的 SuperPod 就是把大量"超节点"(第 4.3 节讲过,由 HCCS 互联的 NPU 组)通过高速网络组织成一个大型训练集群,规模可达数千卡。

SuperPod 的基本思想是"分层 + 就近":

  • 超节点内(柜内):用 HCCS 实现紧耦合全互联,承担张量并行等高频通信。
  • 超节点间(柜间):用无损以太网或 InfiniBand 把超节点连起来,承担数据并行等较低频通信。
  • 更大的集群:多个 SuperPod 还可以再通过上层网络互连,形成数据中心级规模。
昇腾 SuperPod 分层(概念): 层0:单颗昇腾950 NPU(第2章) 层1:超节点内,HCCS 全互联(第4章) ── "局部紧耦合" 层2:超节点间,无损以太/IB(本章) ── "整体广连接" 层3:多 SuperPod 互连(数据中心级) ── "规模扩展" 每往上一层,带宽下降、延迟上升,但规模扩大。

💡 与 NVL72 体系的对称性:其实 NVL72 多柜和昇腾 SuperPod 都是"两纤网络"结构——柜内/超节点内一层,柜间/超节点间一层。区别只在于柜内单元的规模(NVL72 是 72 卡大单元,昇腾超节点是较小的组)和组网的侧重。理解了这个对称性,就不会被两个名字绕晕。

5.3.2 超节点作为组网基本单元

昇腾组网的关键设计选择是"以超节点为基本单元"。这与 NVL72 体系以"72 卡机柜"为基本单元是对称的,但单元的内部结构和规模不同。

回顾第 4.3 节,昇腾超节点内是 HCCS 近邻全互联。这个超节点对外(对网络)呈现为一个算力单元,有自己的网络接口上联到汇聚交换机。多个超节点的网络接口汇聚到一层交换机,再上联到核心层,构成 SuperPod。

这种设计的好处是:超节点内部的紧耦合通信(最高频、最敏感)被 HCCS 消化,留给机柜间网络的只是相对低频的跨节点通信。这就降低了对机柜间网络的带宽压力——网络不必处理张量并行那种极高频的通信,只需要处理数据并行等相对宽松的通信。

超节点作为组网单元的通信分工: 超节点内(HCCS):张量并行、激活交换(高频、大流量) ── 用 HCCS 高速消化 │ 超节点间(网络):数据并行梯度同步(相对低频) ── 交给无损以太/IB

⚠️ 分工的前提:这种"柜内消化高频、柜间处理低频"的分工,要求训练框架的并行策略与拓扑匹配——把高频通信限制在超节点内,把低频通信放到超节点间。如果策略不当(比如把张量并行跨超节点做),柜间网络会被打爆。这就是第 5.4 节"拓扑协同"的核心议题。

5.3.3 分层组网的具体结构

SuperPod 的分层组网通常包含三层交换(具体层数随规模调整):

层级 作用 特征
接入层 接入超节点的网络接口 带宽适中,端口密度高
汇聚层 汇聚多个接入交换机 提供超节点组内互连
核心层 全互连所有汇聚层 提供跨组、大规模互连

这三层共同构成一个 fat tree 式的无阻塞(或接近无阻塞)网络。超节点内的 NPU 通过 HCCS 紧耦合,超节点之间通过这套三层网络松耦合,整体上既有局部的紧耦合,又有全局的可扩展性。

SuperPod 三层组网(概念): 核心交换层(全互连) │ ┌───────┬───────┐ 汇聚1 汇聚2 汇聚3 ╱ │ ╲ ╱ │ ╲ ╱ │ ╲ 接入 接入 接入 接入 接入 接入 │ │ │ │ │ │ 超节点...超节点...超节点... (柜内HCCS紧耦合)

5.3.4 昇腾组网的路线选择

在网络技术上,昇腾 SuperPod 同样在无损以太网和 InfiniBand 之间有选择空间。公开资料中,昇腾大规模集群常用基于 RoCE 的无损以太网组网,配合华为自家的网络设备(交换机、网卡)形成端到端的解决方案。这与 NVL72 体系的网络选型逻辑一致——都是"无损网络 + fat tree",区别在于具体设备和生态。

💡 昇腾组网的特色:相对 NVL72 体系高度依赖 InfiniBand(及其主导厂商),昇腾更倾向于基于以太网的开放组网,这与其"全栈自主 + 开放生态"的整体定位一致。以太网路线的好处是设备来源多元、成本可控,挑战是损耗网络的调优更复杂。

5.3.5 SuperPod 组网的战略意义

把 SuperPod 组网放回昇腾整体战略,它的意义在于——它是昇腾"用规模补单卡"战略在网络层面的具体落地。

回顾第 3.3、4.4 节,昇腾在单卡带宽和单柜全互联规模上都受约束。SuperPod 组网通过"超节点紧耦合 + 大规模分层网络",把这些约束的影响降到最低:单柜能做的事在超节点内做掉,单柜做不了的事靠大规模组网摊薄。这种"局部紧、整体广"的设计,使得昇腾在单点算力不如 NVL72 的现实下,仍能在集群总吞吐上保持竞争力。

这也是为什么昇腾特别强调 SuperPod 的"规模化能力"——在它的战略里,规模本身就是武器。下一节我们上升到软件层,看集合通信库如何让这套复杂的网络真正高效运转。

思考与延伸

  1. SuperPod 以超节点为基本单元组网,好处是柜内消化高频通信。但如果一个模型的张量并行规模必须超过单个超节点,该怎么办?会对网络造成什么压力?
  2. 昇腾偏向以太网组网,NVIDIA 体系高度依赖 IB。如果某天 IB 的主导厂商大幅提价,这对两大路线的相对竞争力会有什么影响?
  3. 三层组网(接入/汇聚/核心)层数越多,延迟越高。如果一个 SuperPod 规模特别大,需要四层甚至五层组网,最先遇到什么瓶颈?

本节关键词:SuperPod、超节点组网、分层组网、无损以太网、RoCE、昇腾网络 返回:第 5 章支柱页 下一节:5.4 集合通信库与拓扑协同


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U