2.2 Blackwell 架构与张量核心演进


文档摘要

2.2 Blackwell 架构与张量核心演进 NVIDIA 为什么能长期占据 AI 算力霸主地位?答案不在于单点创新,而在于它每一代都在"张量核心"这条主线上做精确加法。Blackwell 就是这条主线的最新一程。 2.2.1 张量核心:Blackwell 的算力心脏 要理解 Blackwell,先要理解张量核心(Tensor Core)。传统 CUDA 核心一次只能做一个标量乘加,而张量核心是一个矩阵乘加专用单元——它在单个时钟周期内一次性完成一小块矩阵(比如 4×4 或更大)的乘法并累加到结果矩阵。对于以矩阵乘为骨架的神经网络运算,这等于把效率提升了一个量级。

2.2 Blackwell 架构与张量核心演进

NVIDIA 为什么能长期占据 AI 算力霸主地位?答案不在于单点创新,而在于它每一代都在"张量核心"这条主线上做精确加法。Blackwell 就是这条主线的最新一程。

2.2.1 张量核心:Blackwell 的算力心脏

要理解 Blackwell,先要理解张量核心(Tensor Core)。传统 CUDA 核心一次只能做一个标量乘加,而张量核心是一个矩阵乘加专用单元——它在单个时钟周期内一次性完成一小块矩阵(比如 4×4 或更大)的乘法并累加到结果矩阵。对于以矩阵乘为骨架的神经网络运算,这等于把效率提升了一个量级。

张量核心的演进史,几乎就是 NVIDIA AI 算力的演进史:从早期支持 FP16,到加入 INT8、BF16,再到支持更低精度、更高吞吐的格式。每一代的核心思路都是"用更低的精度换更高的吞吐"——因为 AI 训练对精度的容忍度比科学计算高,可以用更少的比特表达同样的信息,从而在同样晶体管预算下算得更快。

张量核心精度演进(示意主线): FP16 ──► INT8/BF16 ──► FP8 ──► FP4 高精度 中低精度 极低精度 超低精度 慢 ──────────────────────────────► 快

💡 为什么低精度能加速:算力单元的吞吐 roughly 与数据位宽成反比。位宽减半,理论上吞吐翻倍。只要训练算法能容忍这种精度损失(实践证明很多阶段可以),低精度就是"免费的"算力。

2.2.2 Blackwell 的关键设计

Blackwell 是 NVIDIA 在 Hopper 之后的新一代架构(GB200 系统即由 Blackwell GPU 组成)。它在张量核心这条主线之外,有几个值得重点关注的设计方向:

  • 更低精度计算:延续低精度路线,支持更小的浮点格式,使单位算力进一步抬升。这部分是 Blackwell 算力数字增长的重要来源。
  • Transformer 引擎:这是针对 Transformer 架构(当前大模型的主流形态)的专用数据通路。它把注意力机制(Attention)和前馈网络(MLP)里最高频的运算做硬件级加速,并自动管理精度切换,让开发者无需手动调参就能享受低精度红利。
  • 第二代 Transformer 引擎与稀疏加速:在结构化稀疏(典型 2:4 稀疏,即每 4 个元素最多 2 个非零)的支持下,理论算力可以再翻倍——但前提是模型和算法都做了稀疏化适配。

⚠️ 稀疏算力的兑现条件:稀疏算力不是"自动生效"的。它要求权重张量满足特定稀疏模式(如 2:4),且推理/训练框架要支持稀疏算子。实际业务里能拿到多少稀疏加速,高度依赖模型适配工作量。这也是为什么 2.4 节要专门讲口径。

2.2.3 SM 结构:通用与专用的混合体

Blackwell 的基本计算单元仍然是 SM(Streaming Multiprocessor,流多处理器)。一个 GPU 由多个 SM 组成,每个 SM 内部既有通用的 CUDA 核心,也有专用的张量核心。这种"通用 + 专用"的混合结构,正是上一节讲的"GPU 是通用处理器里加了 AI 加速器"的具体落地。

SM 内部的关键组成:

单个 SM(示意): ┌─────────────────────────────────────┐ │ Warp 调度器 / 指令调度 │ ← SIMT 调度核心 ├──────────────┬──────────────────────┤ │ CUDA 核心 │ 张量核心 Tensor Core │ ← 通用 + AI 加速 │ (整数/浮点) │ (矩阵乘加) │ ├──────────────┴──────────────────────┤ │ Transformer 引擎(低精度/稀疏) │ ← 专用加速 ├─────────────────────────────────────┤ │ 寄存器文件 + 共享内存(L1) │ ← 片上存储 └─────────────────────────────────────┘

这里有个经常被忽略的细节:SM 内的共享内存(shared memory)是 GPU 高效并行的关键。它是一块程序员可显式管理的高速片上存储,让同一个 SM 内的线程能共享中间结果,避免反复访问慢得多的 HBM。很多 AI 算子的优化(比如分块矩阵乘、注意力机制的分块计算)都依赖对共享内存的精细使用。这部分与第 3 章的"内存墙"密切相关。

2.2.4 Blackwell 的战略意义

把 Blackwell 放回 NVL72 的语境,它的意义就清晰了:NVL72 把 72 颗 Blackwell GPU 用 NVLink 焊成一个内存域,前提是单颗 Blackwell 已经把单卡算力和能效做到极高。Blackwell 的低精度计算和 Transformer 引擎,使得单柜 72 卡能够在万亿参数训练上保持高吞吐,这是 NVL72"单柜算力极致"路线的物理基础。

换句话说,Blackwell 是 NVL72 这台机器的"芯",没有它在单卡层面的强度,机柜级的全互联就失去了意义。这与下一节要讲的昇腾950 在昇腾 SuperPoD 里的角色是对称的——两条路线都需要先有一颗足够强的"芯",才能谈互联和集群。

思考与延伸

  1. 假设某天 AI 训练发现 FP4 精度在某些关键阶段会造成不可接受的损失,Blackwell 的算力优势会如何被削弱?这种风险对 GPU 路线意味着什么?
  2. 共享内存是 GPU 性能优化的关键。结合这点,你能解释为什么"会写 CUDA"和"会写高性能 CUDA"是两回事吗?
  3. 如果让你为一颗未来的 GPU 设计下一代张量核心,你会优先加哪种能力——更高吞吐、更低精度,还是更智能的稀疏支持?各自的代价是什么?

本节关键词:Blackwell、张量核心、Transformer 引擎、SM、低精度计算、结构化稀疏 返回:第 2 章支柱页 下一节:2.3 达芬奇架构与昇腾 AI Core


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U