6.4 供电可靠性与能效


文档摘要

6.4 供电可靠性与能效 上百千瓦的电喂进一个机柜,光"喂得饱"还不够,还要"喂得稳、喂得省"。这一节收束到供电的两个质量维度——可靠性与能效。 6.4.1 可靠性:为什么 AI 集群比普通服务器更怕断电 供电可靠性的核心问题是"不掉电"。对普通服务器,一次短暂断电可能导致服务重启,影响有限;但对 AI 集群,一次断电的代价可能是灾难性的。 原因在于大模型训练的状态庞大且脆弱。训练过程中,模型参数、优化器状态、梯度、数据加载位置等信息分布在成百上千张卡上,这些状态需要持续保持。一旦断电,所有这些易失状态全部丢失——即使有 checkpoint(检查点)保存,恢复到最近检查点也要重新跑一段,浪费大量算力和时间。如果断电发生在两次检查点之间,损失可能高达数小时甚至数天的训练成果。

6.4 供电可靠性与能效

上百千瓦的电喂进一个机柜,光"喂得饱"还不够,还要"喂得稳、喂得省"。这一节收束到供电的两个质量维度——可靠性与能效。

6.4.1 可靠性:为什么 AI 集群比普通服务器更怕断电

供电可靠性的核心问题是"不掉电"。对普通服务器,一次短暂断电可能导致服务重启,影响有限;但对 AI 集群,一次断电的代价可能是灾难性的。

原因在于大模型训练的状态庞大且脆弱。训练过程中,模型参数、优化器状态、梯度、数据加载位置等信息分布在成百上千张卡上,这些状态需要持续保持。一旦断电,所有这些易失状态全部丢失——即使有 checkpoint(检查点)保存,恢复到最近检查点也要重新跑一段,浪费大量算力和时间。如果断电发生在两次检查点之间,损失可能高达数小时甚至数天的训练成果。

断电代价对比: 普通服务器断电:服务重启,影响有限 AI 集群断电: 训练状态全失,需回滚到检查点 代价 = 重训数小时~数天的算力成本 (大模型训练成本以百万美元计)

⚠️ 真实世界的代价:业内有估算,一次大规模训练的中断可能造成数十万甚至数百万美元的损失。所以 AI 集群对供电可靠性的投入(多重后备、双路市电、柴油发电机)不是奢侈,而是经济必需。

6.4.2 多重冗余:保证不断电

为保证供电可靠性,AI 数据中心普遍采用多重冗余设计:

  • 双路市电接入:从两个独立变电站引入市电,任一路故障另一路顶上。
  • UPS + BBU 两级后备:UPS 保证机房级整体供电,BBU 保证机柜级瞬间顶上(见 6.2 节)。
  • 柴油发电机:长时间市电中断时,柴发承担持续供电,直到市电恢复。
  • N+1 或 2N 冗余:关键设备(变压器、UPS、配电柜)都有冗余备份,任一设备故障不影响整体。

这套多重冗余的设计目标是"任何单一故障都不会导致训练中断"。它的代价是成本高昂——冗余设备的投入可能占数据中心总成本的相当比例。

供电可靠性金字塔: 柴油发电机(长时间后备) ↑ UPS(机房级不间断) ↑ BBU(机柜级瞬间顶上) ↑ 双路市电(互为备份) ↑ GPU/NPU(永不断电) 任一层故障,下层顶上,层层兜底。

6.4.3 能效:从芯片到机房的整体视角

供电的另一个质量维度是能效——"用最少的电,算最多的活"。能效要从芯片到机房整体看,包括三层:

  • 芯片能效:每瓦电每秒能做多少运算(算力/瓦)。这是芯片架构决定的,回顾第 2 章,达芬奇架构的高能效是其优势之一。
  • 供电变换能效:每一级电压变换(机房→机柜→芯片)都有损耗(主要是发热)。多级变换的累积损耗不容忽视。
  • 制冷能效:把芯片产生的热量搬出机房要耗电(PUE 的来源)。液冷相比风冷能显著降低这部分能耗。

这三层合起来,决定了一个 AI 集群的"总能耗效率"。优化能效需要三层协同——光优化芯片能效而忽略供电损耗和制冷能耗,整体未必更优。

能效三层: 芯片层: 算力/瓦(架构决定) 供电层: 变换损耗(VRM/PSU 效率) 制冷层: PUE(液冷 vs 风冷) 总能耗效率 = 三层相乘,任一层短板都拉低整体。

💡 能效优化的协同性:举例来说,把芯片功耗降低 10%,看似省了 10% 的电,但实际上还省了"用来散掉这 10% 热量"的制冷电——所以总节能可能超过 10%。反之,芯片能效差不仅多耗电,还多耗制冷电,损失是放大的。这就是为什么能效在 AI 集群里如此重要——它的影响是连锁的。

6.4.4 动态功耗管理

AI 集群的功耗不是恒定的——训练的不同阶段、不同算子,功耗波动很大。如果按峰值功耗设计供电,大部分时间供电设备利用率很低,浪费成本;如果按平均功耗设计,峰值时可能供电不足。

动态功耗管理(Dynamic Power Management)就是为平衡这对矛盾而设计的。它通过实时监测各节点的功耗,动态调节供电分配、CPU/GPU 频率、风扇/水泵转速等,在保证不超限的前提下最大化算力利用。

一个典型场景是"功率封顶"(Power Capping)——当机柜总功耗接近供电上限时,系统主动降低部分节点的频率,把功耗控制在安全范围内。这虽然牺牲了单节点性能,但避免了过载跳闸这种全局性灾难。

动态功耗管理的权衡: 峰值性能 ◄────────────────► 供电安全 ▲ ▲ │ 功率封顶 │ │ 动态调频 │ │ 智能调度 │ └───────────────────────────┘ 在两者之间找平衡

6.4.5 供电的产业意义

把本章的供电讨论上升到产业层面,能看到几个值得关注的点:

第一,供电是 AI 集群成本的重要组成。百千瓦级机柜的供配电设备(变压器、UPS、BBU、母线、电缆)成本高昂,且需要专业设计和施工。这部分成本在 AI 集群总成本里占比不容忽视。

第二,供配电的供应链对国产替代有意义。变压器、UPS、电缆、配电柜等设备,国内产业链相对成熟,是国产 AI 集群里自主化程度较高的环节。这与芯片(依赖先进制程)形成对比——昇腾路线在"体"层面的自主性,其实比"芯"层面更强。

第三,供电决定了 AI 算力的天花板。一个国家或地区的电力供应能力,最终限制了它能部署多少 AI 算力。这是比芯片更上游的"算力基础设施"约束,也是为什么 AI 算力竞赛背后,电力和能源政策如此重要。

💡 从"芯"到"电"的视角跃迁:前面五章我们都在讲芯片和网络,但本章提醒我们——AI 算力的最终约束可能不在芯片,而在电力。一个国家即使造得出最好的芯片,如果没有足够的电力去驱动它,也算不出算力。这是算力基础设施最底层的物理约束。

思考与延伸

  1. 大模型训练的检查点保存频率是个权衡——保存太频繁浪费算力,保存太稀疏断电损失大。你会如何设计一个动态检查点策略?
  2. 动态功耗管理会牺牲单节点峰值性能。在"功率封顶"场景下,应该优先封顶哪些节点(数据并行节点?张量并行节点?)?为什么?
  3. 假设某国电力供应紧张但芯片产能充足,它会优先发展 AI 算力的哪个方向——更高能效的芯片,还是更大规模的电力基础设施?

第 6 章小结

  • AI 集群机柜采用严格的物理分区(计算、交换、电源、液冷),是高度集成的"机架级计算机"。
  • 百千瓦级供电靠三级架构(机房→机柜→芯片)+ 柜顶母线 + 多相 VRM + BBU 后备实现,纹波控制关乎计算正确性。
  • 功率密度(百千瓦/柜)远超传统机房(千瓦/柜),对机房配电、PUE、选址都构成硬性反向约束。
  • 供电可靠性与能效通过多重冗余和动态功耗管理保障,断电代价极高使得可靠性投入是经济必需。

读完本章,你理解了"电"怎么进机柜、怎么分配、怎么保证可靠。但上百千瓦的电最终都会变成热——下一章我们就讲这些热怎么被液冷搬出机柜。

本节关键词:供电可靠性、多重冗余、能效、动态功耗管理、功率封顶、电力约束 返回:第 6 章支柱页 下一篇:第 7 章 · 体(二):液冷散热系统


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U