6.2 高密度供电架构 一个 AI 机柜要消耗上百千瓦的电——这不是把家用插座放大一万倍就行的。从机房配电到芯片供电,中间是一套精密的多级供电架构。 6.2.1 供电的"三级跳" AI 集群的供电从机房到芯片,通常经历三级变换: 第一级是机房到机柜。机房的总配电(通常来自市电 + 不间断电源 UPS)通过专用配电柜,把高压电送到每个机柜。这一级关注的是大电流传输和总配电容量。 第二级是机柜到节点。机柜内的电源分配单元(PDU)或母线,把电分配到各个计算节点。这一级关注的是均衡分配和过流保护。 第三级是节点到芯片。节点主板上的电压调节模块(VRM),把较高电压精确变换成 GPU/NPU 所需的低电压(通常 1 伏上下)、大电流。这一级关注的是电压精度、瞬态响应和纹波控制。
一个 AI 机柜要消耗上百千瓦的电——这不是把家用插座放大一万倍就行的。从机房配电到芯片供电,中间是一套精密的多级供电架构。
AI 集群的供电从机房到芯片,通常经历三级变换:
第一级是机房到机柜。机房的总配电(通常来自市电 + 不间断电源 UPS)通过专用配电柜,把高压电送到每个机柜。这一级关注的是大电流传输和总配电容量。
第二级是机柜到节点。机柜内的电源分配单元(PDU)或母线,把电分配到各个计算节点。这一级关注的是均衡分配和过流保护。
第三级是节点到芯片。节点主板上的电压调节模块(VRM),把较高电压精确变换成 GPU/NPU 所需的低电压(通常 1 伏上下)、大电流。这一级关注的是电压精度、瞬态响应和纹波控制。
供电三级跳: 机房总配电(市电 + UPS) │ 高压、大容量 ▼ 机柜 PDU / 母线 │ 分配到各节点、过流保护 ▼ 节点 VRM(电压调节模块) │ 精确降压、稳压 ▼ GPU/NPU 芯片(1V 上下、数百安培)
每一级都有不同的工程挑战。机房级关注的是总容量和可靠性,机柜级关注的是均衡和保护,芯片级关注的是精度和动态响应。AI 集群因为功耗极高,这三级的每一级都比普通服务器严苛得多。
💡 为什么供电是三级而不是一级:直接把市电变成芯片用的 1V 是不现实的——电压变换比太大、电流太高,单级做不到。分级变换让每一级的变换比可控,且每一级可以独立优化(机房级重容量,芯片级重精度)。
在百千瓦级的 AI 机柜里,传统的"每节点一根电源线"做法根本行不通——电流太大,线缆又粗又重,且走线混乱。取而代之的是**柜顶母线(Busbar)**方案。
母线是一根粗大的铜或铝排,固定在机柜顶部或侧边,承担"主干配电"的角色。机房来的大电流先进入母线,再由母线通过短而粗的分支接到每个节点。母线的好处是载流量大、阻抗低、走线整洁,适合高密度配电。
柜顶母线配电(示意): 机房配电 │ ┌────┴─────┐ │ 柜顶母线 │ ←─ 粗大铜排,载流量大 └─┬──┬──┬──┘ │ │ │ 短分支到各节点 │ │ │ 节点1节点2节点3 ...
⚠️ 母线的物理挑战:百千瓦级电流通过母线,会产生显著的热量和电磁力。母线必须足够粗(否则过热)、支撑足够牢(否则电磁力导致变形震动)、绝缘足够好(否则短路)。这些都是 AI 机柜供电设计的硬骨头。
到了芯片级,挑战变成"如何在 1V 电压下提供数百安培的电流,且电压纹波极小"。GPU/NPU 满载时电流变化剧烈(瞬态),电压调节模块必须能在毫秒级时间内响应,把电压稳定在很窄的容差内——否则芯片会死机或性能下降。
为了应对这个挑战,芯片级供电普遍采用多相供电(Multiphase VRM)。它把多个并联的"相"(每相是一个小的降压变换器)协同工作,各相错开工作时序,使输出电流叠加后纹波大幅相互抵消。相数越多,能提供的电流越大、纹波越小、瞬态响应越好。
多相供电原理(简化): 单相:电流波动大、纹波高 ╱╲╱╲╱╲╱╲╱╲ ← 高纹波 多相错开叠加: 相1: ╱╲╱╲╱╲╱╲ 相2: ╱╲╱╲╱╲╱╲ ← 错开时序 相3: ╱╲╱╲╱╲╱╲ 叠加: ═════════ ← 纹波相互抵消,输出平滑
AI 芯片因为功耗极高,单颗芯片往往需要十几相甚至几十相供电。这对主板设计、元件布局、散热都提出了极高要求——这也是为什么 AI 服务器主板比普通服务器主板复杂得多。
💡 纹波为什么重要:GPU 在执行高精度计算时对电压极其敏感。电压纹波过大会导致计算错误(比特翻转),在大规模训练里这种错误会累积成模型发散。所以供电"干净"不只是稳定,更是正确性的保证。
机房级的不间断电源(UPS)能在市电中断时短暂供电,但对 AI 集群这种瞬时功耗巨大的负载,传统 UPS 响应速度和容量都不够。于是出现了 BBU(Battery Backup Unit,电池后备单元)——一种部署在机柜级或节点级的电池后备。
BBU 的作用是在电力异常(瞬断、跌落)的瞬间,立即顶上供电,保证芯片不掉电。它和机房级 UPS 形成两级后备——UPS 保证整体供电,BBU 保证关键瞬间不丢数据、不中断训练。
两级后备: 市电 ──► 机房 UPS(整体不间断) │ ▼ 机柜 BBU(瞬间顶上) │ ▼ GPU/NPU(不掉电) 任一级异常,另一级补上。
⚠️ AI 训练对供电稳定性的苛刻:一次持续几毫秒的电压跌落,可能让一轮训练迭代失败甚至崩溃,而大模型一次训练成本以百万美元计。所以 AI 集群对供电可靠性的要求远高于普通服务器——这不是"锦上添花",而是"成本必需"。
NVL72 和昇腾机柜在供电架构的基本原理上是一致的(都要三级供电、母线、多相、后备),但在具体实现和供应链上有差异:
这些差异不改变供电架构的基本原理,但影响了成本结构和供应链风险(详见第 9 章)。
本节关键词:高密度供电、柜顶母线、多相供电、VRM、BBU、纹波控制 返回:第 6 章支柱页 下一节:6.3 功率密度与机房配电约束