一个是"把整机柜做成一颗大芯片",一个是"把成百上千柜做成一个超大节点"——同样在造 AI 超算,两者的发力点却截然不同。
NVIDIA 的 GB200 NVL72 是一种"机架级(rack-scale)"的算力系统。它的设计哲学可以用一句话概括:把一个机柜里的几十颗 GPU,用专用高速互联焊成一个共享内存域,让它们对软件看起来就像一颗超大 GPU。
NVL72 的"72"指的是机柜内通过 NVLink/NVSwitch 互联的 GPU 数量。在这个机柜内部,所有 GPU 共享地址空间、可以彼此直接访问显存,无需经过传统网络的转发和拷贝。配合 Grace CPU,整个机柜对外呈现为一个紧密耦合的计算单元。
它的层次大致是这样的:
NVL72 整机柜 ┌─────────────────────────────┐ │ 铜背板 + NVSwitch 互联网络 │ ← 网(机柜内) │ ┌─────┬─────┬─────┬─────┐ │ │ │GPU群│GPU群│GPU群│GPU群│ │ ← 芯(72 颗 Blackwell GPU) │ ├─────┼─────┼─────┼─────┤ │ │ │ HBM │ HBM │ HBM │ HBM │ │ ← 芯(高带宽显存) │ └─────┴─────┴─────┴─────┘ │ │ Grace CPU + 液冷 + 供电 │ ← 体 └─────────────────────────────┘ │ InfiniBand / 以太网 ← 网(机柜间) │ 其他 NVL72 机柜
💡 定位要点:NVL72 的核心卖点是"机柜内全互联 + 单一内存域"。它把传统集群里最痛的"跨节点通信"在机柜内就消化掉了,留给机柜间网络的,是相对更少、更可优化的流量。
华为昇腾的路线用的是"超节点(SuperNode)+ SuperPoD"的两层结构。昇腾950 是其新一代 NPU 芯片,多颗昇腾950 在机柜内通过 HCCS(高速片间互联)组成一个"超节点",再把大量超节点用无损以太网或 InfiniBand 连起来,构成 SuperPoD 级别的大集群。
与 NVL72 偏向"把柜做厚"不同,昇腾路线更偏向"把集群做宽"——在单柜算力受制程约束的现实下,用更大规模的组网和全栈软件来争取整体吞吐。
昇腾950 SuperPoD(数千卡级) ┌──────────────────────────────────┐ │ 无损以太网 / IB 顶层交换 │ ← 网(集群级) │ ┌────┐ ┌────┐ ┌────┐ ┌────┐│ │ │超节│ │超节│ │超节│ ... │超节││ ← 网(机柜间) │ │点 1│ │点 2│ │点 3│ │点 N││ │ └─┬──┘ └─┬──┘ └─┬──┘ └─┬──┘│ │ HCCS HCCS HCCS HCCS │ ← 网(机柜内) │ ┌┴───┐ ┌┴───┐ ┌┴───┐ ┌┴───┐│ │ │昇腾│ │昇腾│ │昇腾│ ... │昇腾││ ← 芯(NPU) │ │950 │ │950 │ │950 │ │950 ││ │ └────┘ └────┘ └────┘ └────┘│ └──────────────────────────────────┘
💡 定位要点:昇腾路线的关键词是"全栈自主"。从芯片、互联、服务器到机房液冷与训练框架,华为都有自有方案,这使得整套系统在国产替代语境下具备特殊意义,第 8 章会详细讨论其产业含义。
把两者放在一起,差异主要在三个层面:
| 维度 | NVL72 | 昇腾950 SuperPoD |
|---|---|---|
| 设计哲学 | 机柜内全互联,把柜做成"一颗大芯片" | 超节点 + 大规模组网,把集群做成"一个大节点" |
| 发力点 | 单柜算力与内存域极致 | 集群规模与全栈协同 |
| 生态来源 | 全球供应链垂直整合 | 全栈自主 + 国产替代 |
| 典型瓶颈 | 单柜功耗/散热、CoWoS/HBM 产能 | 单柜算力密度、跨柜通信开销 |
| 适用语境 | 生态最强、单点算力最高 | 自主可控、规模化部署 |
⚠️ 不要把两者简单对立:它们不是"谁比谁强"的关系,而是面对同一个 Scaling Law 挑战的两种工程回应。理解这种"同题不同答",比记住谁的参数更高更有价值。
这一节给出的两张层次图,其实就是后续九章的目录索引:
有了这两张全景图,下一节我们就可以安全地引入贯穿全书的分析框架了。
本节关键词:NVL72、SuperPoD、超节点、单一内存域、全栈自主 返回:第 1 章支柱页 下一节:1.3 四维分析框架:芯网体链