4.4 机柜内互联对比:带宽、规模与扩展边界


文档摘要

4.4 机柜内互联对比:带宽、规模与扩展边界 前两节分别看了 NVL72 和 HCCS 两条机柜内互联路线,现在把它们放回同一坐标系,从带宽、规模、扩展边界三个维度做一次系统对比。 4.4.1 带宽维度:谁的柜内更快 带宽是机柜内互联最直观的指标。在这个维度上,两条路线的差异主要来自架构哲学: NVLink/NVSwitch 走的是"多链路聚合 + 无阻塞交换"路线。每颗 GPU 拥有多条 NVLink,通过 NVSwitch 阵列实现任意两点的高带宽直连。由于没有阻塞,机柜内任意两颗 GPU 之间都能同时跑满各自链路的带宽,集合通信(如 AllReduce)可以把所有 GPU 的互联带宽充分利用。 HCCS 走的是"近邻高速 + 组间扩展"路线。

4.4 机柜内互联对比:带宽、规模与扩展边界

前两节分别看了 NVL72 和 HCCS 两条机柜内互联路线,现在把它们放回同一坐标系,从带宽、规模、扩展边界三个维度做一次系统对比。

4.4.1 带宽维度:谁的柜内更快

带宽是机柜内互联最直观的指标。在这个维度上,两条路线的差异主要来自架构哲学:

NVLink/NVSwitch 走的是"多链路聚合 + 无阻塞交换"路线。每颗 GPU 拥有多条 NVLink,通过 NVSwitch 阵列实现任意两点的高带宽直连。由于没有阻塞,机柜内任意两颗 GPU 之间都能同时跑满各自链路的带宽,集合通信(如 AllReduce)可以把所有 GPU 的互联带宽充分利用。

HCCS 走的是"近邻高速 + 组间扩展"路线。组内(超节点内)NPU 之间的 HCCS 带宽同样很高,足以支撑紧耦合训练;但跨组通信的带宽相对组内要低,因为组间没有 NVSwitch 那样的无阻塞交换,而是依赖有限的跨组链路或上层网络。

带宽特征对比(定性): 组内/柜内全互联 跨组/跨域 NVLink/NVSwitch: ◆◆◆◆◆(无阻塞) ◆◆◆◆(仍较高,同柜内) HCCS: ◆◆◆◆(组内高) ◆◆(跨组受限) 定性比较,非具体数值。 关键差异:跨组/跨域带宽的衰减程度。

💡 带宽的真正含义:机柜内互联的带宽不只是"峰值多少",更重要的是"在集合通信模式下的有效带宽"。无阻塞网络能让集合通信跑满,而近邻式拓扑在跨组通信时会打折。这是两条路线在带宽上的本质差异。

4.4.2 规模维度:单柜能装多少卡

规模维度看的是"一个机柜里能全互联多少颗芯片"。这是两种路线最显著的差异之一。

NVL72 在一个机柜内实现了 72 颗 GPU 的无阻塞全互联。这个规模在当前是业界领先的,意味着一个机柜就能提供非常大的紧耦合算力。代价是铜背板、NVSwitch 阵列、功耗散热都极其复杂——这也是为什么 NVL72 是整机柜级产品。

昇腾超节点的全互联规模相对较小,通常以"组"为单位。组内 NPU 全互联,组间则交给上层网络。这意味着单个机柜内的紧耦合算力单元比 NVL72 小,但可以通过堆叠更多超节点来扩大总规模。

维度 NVL72 昇腾超节点
单柜全互联规模 大(72 卡量级,无阻塞) 相对较小(超节点组内全互联)
单柜紧耦合算力 极高 较高(受单组规模限制)
实现复杂度 极高(铜背板+交换阵列) 相对较低(片间直连)
单柜成本 相对较低

⚠️ 规模不是越大越好:单柜全互联规模大,紧耦合算力强,但代价是铜背板和散热的工程难度急剧上升,可维护性下降。昇腾选择相对小的超节点规模,部分也是工程权衡——用更可控的单元去堆叠规模,而非把所有复杂度塞进一个机柜。

4.4.3 扩展边界维度:从柜内到柜间

扩展边界是最容易被忽略、却最关键的维度。它问的是——机柜内的全互联能"自然延伸"到机柜外吗?

答案是:机柜内互联和机柜间互联是两个不同的世界,不能直接延伸。 NVL72 的无阻塞全互联建立在"所有 GPU 在一个机柜里、用铜背板连接"的前提上。一旦要跨机柜,铜背板的物理限制(铜的传输距离有限)就使得无阻塞全互联无法直接延伸——必须改用机柜间网络(InfiniBand/以太网),带宽和延迟特征都会改变。

HCCS 也面临同样的边界。超节点内的 HCCS 高速互联无法跨机柜延伸,跨机柜同样要交给上层网络。这一点上两条路线是相同的。

机柜内 vs 机柜间:两个不同的世界 NVL72: 柜内:NVSwitch 铜背板(无阻塞,极高带宽) │ ╳ 铜背板无法跨柜延伸 ▼ 柜间:InfiniBand / 以太网(带宽骤降,需新协议) 昇腾: 超节点内:HCCS(近邻全互联,高带宽) │ ╳ HCCS 无法跨柜延伸 ▼ 超节点间:无损以太 / IB(带宽骤降)

💡 扩展边界的含义:它意味着 AI 集群天生是"两层网络"——机柜内一层(紧耦合、高带宽),机柜间一层(松耦合、相对低带宽)。如何让训练任务在这两层之间合理分配,是第 5 章的核心议题。可以说,正是这个扩展边界,定义了 SuperPoD 这种大规模组网架构的存在意义。

4.4.4 综合对比与战略含义

把三个维度合起来,两条路线的画像就清晰了:

维度 NVLink/NVSwitch HCCS
带宽 无阻塞,集合通信友好 组内高,跨组受限
单柜规模 大(72 卡) 相对小(超节点组)
扩展边界 柜内→柜间需换网络 同左
战略定位 单柜算力极致 超节点+规模化

这两条路线的战略含义,呼应了第 1 章建立的总判断:NVIDIA 用更强的机柜内全互联把单柜做到极致,靠单柜规模压制对手;昇腾在机柜内全互联规模不及的前提下,靠超节点+大规模组网争取总吞吐。两者没有绝对优劣,只是在不同约束下的工程选择。

💡 回到内存墙:还记得第 3.4 节的内存墙吗?它催生了对机柜内全互联的需求。本章我们看到,两大平台对"如何满足这个需求"给出了不同答案。而无论哪种答案,机柜内全互联都受物理边界限制,跨柜必须交给网络——这就是第 5 章"机柜间组网"要解决的问题。

思考与延伸

  1. 如果未来光互联技术成熟,能把"无阻塞全互联"的边界从机柜内扩展到多个机柜,NVL72 和 HCCS 的路线差异还会重要吗?谁会更受益?
  2. 昇腾超节点规模相对小,意味着同样总算力需要更多超节点。这对机柜间网络的带宽和拓扑提出了什么额外要求?
  3. 假设你要设计一个"混合"集群——一部分用 NVL72 做紧耦合训练,一部分用普通服务器做数据并行,你会如何在这两类资源之间分配模型的不同部分?

第 4 章小结

  • 集合通信(AllReduce 等)有显著的带宽放大效应,机柜内必须用专用高速互联,普通以太网扛不住。
  • NVL72 用 NVLink/NVSwitch 铜背板实现 72 GPU 无阻塞全互联,构建单一内存域;昇腾用 HCCS 实现超节点内近邻全互联。
  • 两条路线的差异是"交换式 vs 近邻式",在带宽、单柜规模、扩展边界上各有取舍。
  • 机柜内互联无法跨柜延伸,跨柜必须交给机柜间网络——这正是第 5 章的主题。

读完本章,你已经理解了"网"的第一层。但单机柜装不下万亿参数,下一章我们看机柜间如何用 InfiniBand 和无损以太网把成百上千个机柜连成 SuperPod。

本节关键词:机柜内互联对比、无阻塞网络、扩展边界、超节点规模 返回:第 4 章支柱页 下一篇:第 5 章 · 网(二):机柜间组网与 SuperPoD 扩展


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U