第 1 章 · 导览:AI 算力竞赛与两大平台全景


文档摘要

第 1 章 · 导览:AI 算力竞赛与两大平台全景 本章要回答的核心问题:当大模型把算力需求推到单机柜百千瓦级,我们该如何建立一个坐标系,去理解 NVIDIA NVL72 与华为昇腾950 SuperPoD 这两台"AI 超算"到底在比什么、又各自站在这场比赛的什么位置? 章节摘要 大模型训练把算力需求推到了单机柜百千瓦级,单芯片时代已让位于整柜乃至整集群的系统工程。本章作为全教程的导览,建立宏观坐标:先回顾算力需求如何从一张 GPU 演化到一座数据中心,再对比 NVIDIA GB200 NVL72 与华为昇腾950 SuperPoD 两大顶尖平台的整体定位,最后铺设贯穿全教程的「芯→网→体→链」四维分析框架,并提示看懂公开指标时容易踩到的口径陷阱。

第 1 章 · 导览:AI 算力竞赛与两大平台全景

本章要回答的核心问题:当大模型把算力需求推到单机柜百千瓦级,我们该如何建立一个坐标系,去理解 NVIDIA NVL72 与华为昇腾950 SuperPoD 这两台"AI 超算"到底在比什么、又各自站在这场比赛的什么位置?

章节摘要

大模型训练把算力需求推到了单机柜百千瓦级,单芯片时代已让位于整柜乃至整集群的系统工程。本章作为全教程的导览,建立宏观坐标:先回顾算力需求如何从一张 GPU 演化到一座数据中心,再对比 NVIDIA GB200 NVL72 与华为昇腾950 SuperPoD 两大顶尖平台的整体定位,最后铺设贯穿全教程的「芯→网→体→链」四维分析框架,并提示看懂公开指标时容易踩到的口径陷阱。读完本章,你将获得一张阅读后续九章的"地图"。

学习目标

  • 理解大模型时代算力需求的驱动力(Scaling Law)与集群化趋势。
  • 识别 NVL72 与昇腾950 SuperPoD 两大平台的整体架构差异。
  • 建立并运用「芯网体链」四维分析框架。
  • 辨析算力、带宽、功耗、能效等关键指标的统计口径。

本章子章节关系

本章四节是递进式的认知铺垫。第 1 节先讲"为什么"——算力需求为什么会爆炸;第 2 节讲"是什么"——两大平台分别是什么样子;第 3 节给出"怎么看"——一套贯穿全书的分析框架;第 4 节则是"防踩坑"——公开指标里那些容易误读的口径。四节合起来,为后续从第 2 章「芯」开始的逐层下钻做好准备。

为什么(1.1 算力需求演进) │ ▼ 是什么(1.2 两大平台全貌) │ ▼ 怎么看(1.3 四维分析框架) ──► 贯穿全书第 2~10 章 │ ▼ 防踩坑(1.4 指标口径辨析)

两大平台系统全景对比图

下面这张图把两大平台的"从芯片到集群"层次放在同一张坐标系里,是后续九章反复回看的总图。

<svg xmlns="http://www.w3.org/2000/svg" viewBox="0 0 980 540" font-family="Segoe UI, Microsoft YaHei, sans-serif"> <rect width="980" height="540" fill="#0f172a" rx="12"/> <text x="490" y="34" text-anchor="middle" fill="#f8fafc" font-size="20" font-weight="bold">两大 AI 算力平台 · 系统全景对比</text> <line x1="490" y1="52" x2="490" y2="500" stroke="#334155" stroke-width="2" stroke-dasharray="6 5"/> <!-- 左侧 NVIDIA NVL72 --> <text x="245" y="78" text-anchor="middle" fill="#60a5fa" font-size="16" font-weight="bold">NVIDIA GB200 NVL72</text> <rect x="60" y="95" width="370" height="62" rx="8" fill="#1e293b" stroke="#60a5fa"/> <text x="245" y="118" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">芯 · Blackwell GPU + Grace CPU</text> <text x="245" y="138" text-anchor="middle" fill="#94a3b8" font-size="11">HBM3e 高带宽显存 · 张量核心</text> <rect x="60" y="175" width="370" height="62" rx="8" fill="#1e293b" stroke="#60a5fa"/> <text x="245" y="198" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">网 · NVLink + NVSwitch 铜背板</text> <text x="245" y="218" text-anchor="middle" fill="#94a3b8" font-size="11">72 GPU 单一内存域 · InfiniBand 扩展</text> <rect x="60" y="255" width="370" height="62" rx="8" fill="#1e293b" stroke="#60a5fa"/> <text x="245" y="278" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">体 · 整机柜液冷 · 百千瓦级</text> <text x="245" y="298" text-anchor="middle" fill="#94a3b8" font-size="11">冷板式液冷 · 高密度供电</text> <rect x="60" y="335" width="370" height="62" rx="8" fill="#1e293b" stroke="#60a5fa"/> <text x="245" y="358" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">链 · 台积电 CoWoS + HBM 生态</text> <text x="245" y="378" text-anchor="middle" fill="#94a3b8" font-size="11">全球光模块/铜缆供应链 · ODM 整机</text> <text x="245" y="430" text-anchor="middle" fill="#fbbf24" font-size="12" font-style="italic">关键词:垂直整合 · 生态最强 · 单柜算力极致</text> <!-- 右侧 昇腾950 SuperPoD --> <text x="735" y="78" text-anchor="middle" fill="#f87171" font-size="16" font-weight="bold">华为昇腾950 SuperPoD</text> <rect x="550" y="95" width="370" height="62" rx="8" fill="#1e293b" stroke="#f87171"/> <text x="735" y="118" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">芯 · 达芬奇架构 NPU · 昇腾950</text> <text x="735" y="138" text-anchor="middle" fill="#94a3b8" font-size="11">Cube/Vector 协同 · 自研内存路线</text> <rect x="550" y="175" width="370" height="62" rx="8" fill="#1e293b" stroke="#f87171"/> <text x="735" y="198" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">网 · HCCS 片间互联 + 以太网/IB</text> <text x="735" y="218" text-anchor="middle" fill="#94a3b8" font-size="11">超节点扩展 · SuperPoD 分层组网</text> <rect x="550" y="255" width="370" height="62" rx="8" fill="#1e293b" stroke="#f87171"/> <text x="735" y="278" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">体 · 整柜液冷 · 高功率密度</text> <text x="735" y="298" text-anchor="middle" fill="#94a3b8" font-size="11">冷板/浸没式液冷 · 国产供配电</text> <rect x="550" y="335" width="370" height="62" rx="8" fill="#1e293b" stroke="#f87171"/> <text x="735" y="358" text-anchor="middle" fill="#e2e8f0" font-size="13" font-weight="bold">链 · 国产替代 + 自主封装</text> <text x="735" y="378" text-anchor="middle" fill="#94a3b8" font-size="11">国内光模块/液冷/整机集成生态</text> <text x="735" y="430" text-anchor="middle" fill="#fbbf24" font-size="12" font-style="italic">关键词:自主可控 · 全栈国产 · 集群规模化</text> <!-- 底部共同维度 --> <rect x="60" y="460" width="860" height="58" rx="8" fill="#1e293b" stroke="#475569"/> <text x="490" y="484" text-anchor="middle" fill="#cbd5e1" font-size="13" font-weight="bold">共同战场:万亿参数训练 · 功耗墙 · 互联墙 · 供应链博弈</text> <text x="490" y="504" text-anchor="middle" fill="#94a3b8" font-size="11">本教程以「芯→网→体→链」四章法,逐层拆解两大平台异同</text> </svg>

💡 如何读这张图:左右两栏是两大平台,纵向四层正好对应全教程的「芯网体链」四章法。两台机器在每一层都在做同类问题的不同回答,这正是后续九章要逐层展开的对比。

本章导览

本支柱页是第 1 章的入口,正式内容由四个子章节展开:

  • 子章节 1.1 · 大模型时代的算力需求演进:从 Scaling Law 讲到"为什么单卡不够用了"。
  • 子章节 1.2 · 两大平台定位与系统全貌:分别拆解 NVL72 与昇腾950 SuperPoD 的层次结构。
  • 子章节 1.3 · 四维分析框架:芯网体链:给出贯穿全书的分析坐标。
  • 子章节 1.4 · 关键技术指标速览与口径辨析:算力、带宽、功耗、能效的常见统计口径与陷阱。

建议按 1.1 → 1.2 → 1.3 → 1.4 顺序阅读,建立完整地图后再进入第 2 章「芯」。

本章小结

  • 大模型时代的算力竞赛已从"单卡比拼"升级为"系统工程比拼",单芯片不再决定胜负。
  • NVL72 代表"垂直整合 + 全球生态 + 单柜算力极致"路线,昇腾950 SuperPoD 代表"全栈自主 + 国产替代 + 集群规模化"路线。
  • 「芯网体链」四维框架是贯穿全教程的分析坐标,建议在后续每章都用它来定位。
  • 看公开指标时务必先问"口径",稠密/稀疏、峰值/实测、单卡/整柜的差异足以改变结论。

本章关键词:AI 集群、NVL72、昇腾950、SuperPoD、算力基础设施、芯网体链 下一篇:第 2 章 · 芯(一):单芯片计算架构对比


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U