2.2 Blackwell 架构与张量核心演进 NVIDIA 为什么能长期占据 AI 算力霸主地位?答案不在于单点创新,而在于它每一代都在"张量核心"这条主线上做精确加法。Blackwell 就是这条主线的最新一程。 2.2.1 张量核心:Blackwell 的算力心脏 要理解 Blackwell,先要理解张量核心(Tensor Core)。传统 CUDA 核心一次只能做一个标量乘加,而张量核心是一个矩阵乘加专用单元——它在单个时钟周期内一次性完成一小块矩阵(比如 4×4 或更大)的乘法并累加到结果矩阵。对于以矩阵乘为骨架的神经网络运算,这等于把效率提升了一个量级。
NVIDIA 为什么能长期占据 AI 算力霸主地位?答案不在于单点创新,而在于它每一代都在"张量核心"这条主线上做精确加法。Blackwell 就是这条主线的最新一程。
要理解 Blackwell,先要理解张量核心(Tensor Core)。传统 CUDA 核心一次只能做一个标量乘加,而张量核心是一个矩阵乘加专用单元——它在单个时钟周期内一次性完成一小块矩阵(比如 4×4 或更大)的乘法并累加到结果矩阵。对于以矩阵乘为骨架的神经网络运算,这等于把效率提升了一个量级。
张量核心的演进史,几乎就是 NVIDIA AI 算力的演进史:从早期支持 FP16,到加入 INT8、BF16,再到支持更低精度、更高吞吐的格式。每一代的核心思路都是"用更低的精度换更高的吞吐"——因为 AI 训练对精度的容忍度比科学计算高,可以用更少的比特表达同样的信息,从而在同样晶体管预算下算得更快。
张量核心精度演进(示意主线): FP16 ──► INT8/BF16 ──► FP8 ──► FP4 高精度 中低精度 极低精度 超低精度 慢 ──────────────────────────────► 快
💡 为什么低精度能加速:算力单元的吞吐 roughly 与数据位宽成反比。位宽减半,理论上吞吐翻倍。只要训练算法能容忍这种精度损失(实践证明很多阶段可以),低精度就是"免费的"算力。
Blackwell 是 NVIDIA 在 Hopper 之后的新一代架构(GB200 系统即由 Blackwell GPU 组成)。它在张量核心这条主线之外,有几个值得重点关注的设计方向:
⚠️ 稀疏算力的兑现条件:稀疏算力不是"自动生效"的。它要求权重张量满足特定稀疏模式(如 2:4),且推理/训练框架要支持稀疏算子。实际业务里能拿到多少稀疏加速,高度依赖模型适配工作量。这也是为什么 2.4 节要专门讲口径。
Blackwell 的基本计算单元仍然是 SM(Streaming Multiprocessor,流多处理器)。一个 GPU 由多个 SM 组成,每个 SM 内部既有通用的 CUDA 核心,也有专用的张量核心。这种"通用 + 专用"的混合结构,正是上一节讲的"GPU 是通用处理器里加了 AI 加速器"的具体落地。
SM 内部的关键组成:
单个 SM(示意): ┌─────────────────────────────────────┐ │ Warp 调度器 / 指令调度 │ ← SIMT 调度核心 ├──────────────┬──────────────────────┤ │ CUDA 核心 │ 张量核心 Tensor Core │ ← 通用 + AI 加速 │ (整数/浮点) │ (矩阵乘加) │ ├──────────────┴──────────────────────┤ │ Transformer 引擎(低精度/稀疏) │ ← 专用加速 ├─────────────────────────────────────┤ │ 寄存器文件 + 共享内存(L1) │ ← 片上存储 └─────────────────────────────────────┘
这里有个经常被忽略的细节:SM 内的共享内存(shared memory)是 GPU 高效并行的关键。它是一块程序员可显式管理的高速片上存储,让同一个 SM 内的线程能共享中间结果,避免反复访问慢得多的 HBM。很多 AI 算子的优化(比如分块矩阵乘、注意力机制的分块计算)都依赖对共享内存的精细使用。这部分与第 3 章的"内存墙"密切相关。
把 Blackwell 放回 NVL72 的语境,它的意义就清晰了:NVL72 把 72 颗 Blackwell GPU 用 NVLink 焊成一个内存域,前提是单颗 Blackwell 已经把单卡算力和能效做到极高。Blackwell 的低精度计算和 Transformer 引擎,使得单柜 72 卡能够在万亿参数训练上保持高吞吐,这是 NVL72"单柜算力极致"路线的物理基础。
换句话说,Blackwell 是 NVL72 这台机器的"芯",没有它在单卡层面的强度,机柜级的全互联就失去了意义。这与下一节要讲的昇腾950 在昇腾 SuperPoD 里的角色是对称的——两条路线都需要先有一颗足够强的"芯",才能谈互联和集群。
本节关键词:Blackwell、张量核心、Transformer 引擎、SM、低精度计算、结构化稀疏 返回:第 2 章支柱页 下一节:2.3 达芬奇架构与昇腾 AI Core