4.4 机柜内互联对比:带宽、规模与扩展边界 前两节分别看了 NVL72 和 HCCS 两条机柜内互联路线,现在把它们放回同一坐标系,从带宽、规模、扩展边界三个维度做一次系统对比。 4.4.1 带宽维度:谁的柜内更快 带宽是机柜内互联最直观的指标。在这个维度上,两条路线的差异主要来自架构哲学: NVLink/NVSwitch 走的是"多链路聚合 + 无阻塞交换"路线。每颗 GPU 拥有多条 NVLink,通过 NVSwitch 阵列实现任意两点的高带宽直连。由于没有阻塞,机柜内任意两颗 GPU 之间都能同时跑满各自链路的带宽,集合通信(如 AllReduce)可以把所有 GPU 的互联带宽充分利用。 HCCS 走的是"近邻高速 + 组间扩展"路线。
前两节分别看了 NVL72 和 HCCS 两条机柜内互联路线,现在把它们放回同一坐标系,从带宽、规模、扩展边界三个维度做一次系统对比。
带宽是机柜内互联最直观的指标。在这个维度上,两条路线的差异主要来自架构哲学:
NVLink/NVSwitch 走的是"多链路聚合 + 无阻塞交换"路线。每颗 GPU 拥有多条 NVLink,通过 NVSwitch 阵列实现任意两点的高带宽直连。由于没有阻塞,机柜内任意两颗 GPU 之间都能同时跑满各自链路的带宽,集合通信(如 AllReduce)可以把所有 GPU 的互联带宽充分利用。
HCCS 走的是"近邻高速 + 组间扩展"路线。组内(超节点内)NPU 之间的 HCCS 带宽同样很高,足以支撑紧耦合训练;但跨组通信的带宽相对组内要低,因为组间没有 NVSwitch 那样的无阻塞交换,而是依赖有限的跨组链路或上层网络。
带宽特征对比(定性): 组内/柜内全互联 跨组/跨域 NVLink/NVSwitch: ◆◆◆◆◆(无阻塞) ◆◆◆◆(仍较高,同柜内) HCCS: ◆◆◆◆(组内高) ◆◆(跨组受限) 定性比较,非具体数值。 关键差异:跨组/跨域带宽的衰减程度。
💡 带宽的真正含义:机柜内互联的带宽不只是"峰值多少",更重要的是"在集合通信模式下的有效带宽"。无阻塞网络能让集合通信跑满,而近邻式拓扑在跨组通信时会打折。这是两条路线在带宽上的本质差异。
规模维度看的是"一个机柜里能全互联多少颗芯片"。这是两种路线最显著的差异之一。
NVL72 在一个机柜内实现了 72 颗 GPU 的无阻塞全互联。这个规模在当前是业界领先的,意味着一个机柜就能提供非常大的紧耦合算力。代价是铜背板、NVSwitch 阵列、功耗散热都极其复杂——这也是为什么 NVL72 是整机柜级产品。
昇腾超节点的全互联规模相对较小,通常以"组"为单位。组内 NPU 全互联,组间则交给上层网络。这意味着单个机柜内的紧耦合算力单元比 NVL72 小,但可以通过堆叠更多超节点来扩大总规模。
| 维度 | NVL72 | 昇腾超节点 |
|---|---|---|
| 单柜全互联规模 | 大(72 卡量级,无阻塞) | 相对较小(超节点组内全互联) |
| 单柜紧耦合算力 | 极高 | 较高(受单组规模限制) |
| 实现复杂度 | 极高(铜背板+交换阵列) | 相对较低(片间直连) |
| 单柜成本 | 高 | 相对较低 |
⚠️ 规模不是越大越好:单柜全互联规模大,紧耦合算力强,但代价是铜背板和散热的工程难度急剧上升,可维护性下降。昇腾选择相对小的超节点规模,部分也是工程权衡——用更可控的单元去堆叠规模,而非把所有复杂度塞进一个机柜。
扩展边界是最容易被忽略、却最关键的维度。它问的是——机柜内的全互联能"自然延伸"到机柜外吗?
答案是:机柜内互联和机柜间互联是两个不同的世界,不能直接延伸。 NVL72 的无阻塞全互联建立在"所有 GPU 在一个机柜里、用铜背板连接"的前提上。一旦要跨机柜,铜背板的物理限制(铜的传输距离有限)就使得无阻塞全互联无法直接延伸——必须改用机柜间网络(InfiniBand/以太网),带宽和延迟特征都会改变。
HCCS 也面临同样的边界。超节点内的 HCCS 高速互联无法跨机柜延伸,跨机柜同样要交给上层网络。这一点上两条路线是相同的。
机柜内 vs 机柜间:两个不同的世界 NVL72: 柜内:NVSwitch 铜背板(无阻塞,极高带宽) │ ╳ 铜背板无法跨柜延伸 ▼ 柜间:InfiniBand / 以太网(带宽骤降,需新协议) 昇腾: 超节点内:HCCS(近邻全互联,高带宽) │ ╳ HCCS 无法跨柜延伸 ▼ 超节点间:无损以太 / IB(带宽骤降)
💡 扩展边界的含义:它意味着 AI 集群天生是"两层网络"——机柜内一层(紧耦合、高带宽),机柜间一层(松耦合、相对低带宽)。如何让训练任务在这两层之间合理分配,是第 5 章的核心议题。可以说,正是这个扩展边界,定义了 SuperPoD 这种大规模组网架构的存在意义。
把三个维度合起来,两条路线的画像就清晰了:
| 维度 | NVLink/NVSwitch | HCCS |
|---|---|---|
| 带宽 | 无阻塞,集合通信友好 | 组内高,跨组受限 |
| 单柜规模 | 大(72 卡) | 相对小(超节点组) |
| 扩展边界 | 柜内→柜间需换网络 | 同左 |
| 战略定位 | 单柜算力极致 | 超节点+规模化 |
这两条路线的战略含义,呼应了第 1 章建立的总判断:NVIDIA 用更强的机柜内全互联把单柜做到极致,靠单柜规模压制对手;昇腾在机柜内全互联规模不及的前提下,靠超节点+大规模组网争取总吞吐。两者没有绝对优劣,只是在不同约束下的工程选择。
💡 回到内存墙:还记得第 3.4 节的内存墙吗?它催生了对机柜内全互联的需求。本章我们看到,两大平台对"如何满足这个需求"给出了不同答案。而无论哪种答案,机柜内全互联都受物理边界限制,跨柜必须交给网络——这就是第 5 章"机柜间组网"要解决的问题。
读完本章,你已经理解了"网"的第一层。但单机柜装不下万亿参数,下一章我们看机柜间如何用 InfiniBand 和无损以太网把成百上千个机柜连成 SuperPod。
本节关键词:机柜内互联对比、无阻塞网络、扩展边界、超节点规模 返回:第 4 章支柱页 下一篇:第 5 章 · 网(二):机柜间组网与 SuperPoD 扩展