6.4 供电可靠性与能效 上百千瓦的电喂进一个机柜,光"喂得饱"还不够,还要"喂得稳、喂得省"。这一节收束到供电的两个质量维度——可靠性与能效。 6.4.1 可靠性:为什么 AI 集群比普通服务器更怕断电 供电可靠性的核心问题是"不掉电"。对普通服务器,一次短暂断电可能导致服务重启,影响有限;但对 AI 集群,一次断电的代价可能是灾难性的。 原因在于大模型训练的状态庞大且脆弱。训练过程中,模型参数、优化器状态、梯度、数据加载位置等信息分布在成百上千张卡上,这些状态需要持续保持。一旦断电,所有这些易失状态全部丢失——即使有 checkpoint(检查点)保存,恢复到最近检查点也要重新跑一段,浪费大量算力和时间。如果断电发生在两次检查点之间,损失可能高达数小时甚至数天的训练成果。
上百千瓦的电喂进一个机柜,光"喂得饱"还不够,还要"喂得稳、喂得省"。这一节收束到供电的两个质量维度——可靠性与能效。
供电可靠性的核心问题是"不掉电"。对普通服务器,一次短暂断电可能导致服务重启,影响有限;但对 AI 集群,一次断电的代价可能是灾难性的。
原因在于大模型训练的状态庞大且脆弱。训练过程中,模型参数、优化器状态、梯度、数据加载位置等信息分布在成百上千张卡上,这些状态需要持续保持。一旦断电,所有这些易失状态全部丢失——即使有 checkpoint(检查点)保存,恢复到最近检查点也要重新跑一段,浪费大量算力和时间。如果断电发生在两次检查点之间,损失可能高达数小时甚至数天的训练成果。
断电代价对比: 普通服务器断电:服务重启,影响有限 AI 集群断电: 训练状态全失,需回滚到检查点 代价 = 重训数小时~数天的算力成本 (大模型训练成本以百万美元计)
⚠️ 真实世界的代价:业内有估算,一次大规模训练的中断可能造成数十万甚至数百万美元的损失。所以 AI 集群对供电可靠性的投入(多重后备、双路市电、柴油发电机)不是奢侈,而是经济必需。
为保证供电可靠性,AI 数据中心普遍采用多重冗余设计:
这套多重冗余的设计目标是"任何单一故障都不会导致训练中断"。它的代价是成本高昂——冗余设备的投入可能占数据中心总成本的相当比例。
供电可靠性金字塔: 柴油发电机(长时间后备) ↑ UPS(机房级不间断) ↑ BBU(机柜级瞬间顶上) ↑ 双路市电(互为备份) ↑ GPU/NPU(永不断电) 任一层故障,下层顶上,层层兜底。
供电的另一个质量维度是能效——"用最少的电,算最多的活"。能效要从芯片到机房整体看,包括三层:
这三层合起来,决定了一个 AI 集群的"总能耗效率"。优化能效需要三层协同——光优化芯片能效而忽略供电损耗和制冷能耗,整体未必更优。
能效三层: 芯片层: 算力/瓦(架构决定) 供电层: 变换损耗(VRM/PSU 效率) 制冷层: PUE(液冷 vs 风冷) 总能耗效率 = 三层相乘,任一层短板都拉低整体。
💡 能效优化的协同性:举例来说,把芯片功耗降低 10%,看似省了 10% 的电,但实际上还省了"用来散掉这 10% 热量"的制冷电——所以总节能可能超过 10%。反之,芯片能效差不仅多耗电,还多耗制冷电,损失是放大的。这就是为什么能效在 AI 集群里如此重要——它的影响是连锁的。
AI 集群的功耗不是恒定的——训练的不同阶段、不同算子,功耗波动很大。如果按峰值功耗设计供电,大部分时间供电设备利用率很低,浪费成本;如果按平均功耗设计,峰值时可能供电不足。
动态功耗管理(Dynamic Power Management)就是为平衡这对矛盾而设计的。它通过实时监测各节点的功耗,动态调节供电分配、CPU/GPU 频率、风扇/水泵转速等,在保证不超限的前提下最大化算力利用。
一个典型场景是"功率封顶"(Power Capping)——当机柜总功耗接近供电上限时,系统主动降低部分节点的频率,把功耗控制在安全范围内。这虽然牺牲了单节点性能,但避免了过载跳闸这种全局性灾难。
动态功耗管理的权衡: 峰值性能 ◄────────────────► 供电安全 ▲ ▲ │ 功率封顶 │ │ 动态调频 │ │ 智能调度 │ └───────────────────────────┘ 在两者之间找平衡
把本章的供电讨论上升到产业层面,能看到几个值得关注的点:
第一,供电是 AI 集群成本的重要组成。百千瓦级机柜的供配电设备(变压器、UPS、BBU、母线、电缆)成本高昂,且需要专业设计和施工。这部分成本在 AI 集群总成本里占比不容忽视。
第二,供配电的供应链对国产替代有意义。变压器、UPS、电缆、配电柜等设备,国内产业链相对成熟,是国产 AI 集群里自主化程度较高的环节。这与芯片(依赖先进制程)形成对比——昇腾路线在"体"层面的自主性,其实比"芯"层面更强。
第三,供电决定了 AI 算力的天花板。一个国家或地区的电力供应能力,最终限制了它能部署多少 AI 算力。这是比芯片更上游的"算力基础设施"约束,也是为什么 AI 算力竞赛背后,电力和能源政策如此重要。
💡 从"芯"到"电"的视角跃迁:前面五章我们都在讲芯片和网络,但本章提醒我们——AI 算力的最终约束可能不在芯片,而在电力。一个国家即使造得出最好的芯片,如果没有足够的电力去驱动它,也算不出算力。这是算力基础设施最底层的物理约束。
读完本章,你理解了"电"怎么进机柜、怎么分配、怎么保证可靠。但上百千瓦的电最终都会变成热——下一章我们就讲这些热怎么被液冷搬出机柜。
本节关键词:供电可靠性、多重冗余、能效、动态功耗管理、功率封顶、电力约束 返回:第 6 章支柱页 下一篇:第 7 章 · 体(二):液冷散热系统