6.3 功率密度与机房配电约束


文档摘要

6.3 功率密度与机房配电约束 一个 AI 机柜要上百千瓦的电,但绝大多数现存机房单柜只能给到几千瓦到十几千瓦——这意味着,AI 集群不是"想装哪儿就装哪儿",它对机房有硬性的反向约束。 6.3.1 功率密度:机柜的"胃口" 功率密度指的是单位空间(通常以机柜为单位)的功耗。普通服务器机柜的功率密度大约在 5–15 kW/柜,一些高密度服务器机柜能到 20–30 kW/柜。而 AI 集群机柜的功率密度是另一个量级——单柜几十千瓦到上百千瓦。 这个差距意味着什么?意味着一个 AI 机柜的"胃口"相当于十几个甚至几十个普通机柜。如果一个现有机房按普通密度设计(比如每柜 10 kW),它根本喂不饱一个 AI 机柜——配电容量、电缆截面、UPS 容量都不够。

6.3 功率密度与机房配电约束

一个 AI 机柜要上百千瓦的电,但绝大多数现存机房单柜只能给到几千瓦到十几千瓦——这意味着,AI 集群不是"想装哪儿就装哪儿",它对机房有硬性的反向约束。

6.3.1 功率密度:机柜的"胃口"

功率密度指的是单位空间(通常以机柜为单位)的功耗。普通服务器机柜的功率密度大约在 5–15 kW/柜,一些高密度服务器机柜能到 20–30 kW/柜。而 AI 集群机柜的功率密度是另一个量级——单柜几十千瓦到上百千瓦。

这个差距意味着什么?意味着一个 AI 机柜的"胃口"相当于十几个甚至几十个普通机柜。如果一个现有机房按普通密度设计(比如每柜 10 kW),它根本喂不饱一个 AI 机柜——配电容量、电缆截面、UPS 容量都不够。

功率密度量级对比: 普通办公服务器: 5 kW/柜 ────── 高密度服务器: 20 kW/柜 ───────────── AI 集群机柜: 100+ kW/柜 ───────────────────────────── ↑ 量级跃迁,不是渐进升级

💡 认知要点:AI 集群和传统数据中心,在功率密度上是"量级差异"而非"程度差异"。这种差异决定了 AI 集群不能简单"塞进"现有机房,而需要专门设计的 AI 数据中心。

6.3.2 机房配电:从总量到分支

功率密度带来的第一个约束是机房配电容量。一个机房的配电总容量是有限的(由变压器、进线、UPS 决定),AI 机柜的大胃口意味着同样面积的机房能容纳的机柜数大大减少。

举一个直观的对比:一个配电总容量 1 MW 的机房,按 10 kW/柜能放 100 个普通机柜;按 100 kW/柜只能放 10 个 AI 机柜。同样面积的机房,AI 集群能放的"柜子数"只有传统的十分之一。这就是为什么 AI 算力竞赛背后,数据中心选址和配电扩容成了核心议题。

配电还要考虑分支电缆——每个 AI 机柜从机房配电盘到机柜的电缆,要承受上百千瓦的电流,电缆截面极大(可能比手臂还粗)、重量惊人、弯曲半径受限。这些都对机房的电缆桥架、走线通道提出了远超普通机房的要求。

配电差异(同样机房面积): 传统机房(10 kW/柜): 机柜机柜机柜机柜机柜机柜机柜机柜机柜机柜 ← 100 个机柜 AI 数据中心(100 kW/柜): 机柜 ──────── 机柜 ──────── 机柜 ← 10 个机柜 (每个柜配电粗电缆、专用通道)

6.3.3 PUE 与能效门槛

第 1.4 节提过 PUE(电源使用效率)——数据中心总能耗与 IT 设备能耗之比。PUE 越接近 1,说明制冷和辅助设施的额外开销越小。普通风冷机房的 PUE 常在 1.4–1.6 之间,即每 1 度电给 IT 设备,还要额外花 0.4–0.6 度电制冷和损耗。

AI 集群因为功耗密度极高,风冷几乎无法胜任(详见第 7 章),必须用液冷。液冷能显著降低制冷能耗,使 PUE 降到 1.1–1.2 甚至更低。这不仅是能效问题,更是经济问题——百千瓦级的集群,PUE 每降 0.1,每年节省的电费都是可观的数字。

机房类型 典型 PUE 制冷方式 适用密度
老旧风冷机房 1.5–1.8 房间级空调 低(<10 kW/柜)
现代风冷机房 1.3–1.5 行级/列间空调 中(10–30 kW/柜)
液冷机房 1.1–1.2 冷板/浸没液冷 高(30–100+ kW/柜)

⚠️ PUE 的局限:PUE 只反映"制冷和损耗的效率",不反映"芯片本身的能效"。一台 PUE 1.1 但芯片能效差的机房,可能比一台 PUE 1.3 但芯片能效优的机房更费电。评估 AI 数据中心的能效,要把 PUE 和芯片能效合在一起看(详见第 10 章)。

6.3.4 选址门槛:不是哪儿都能建

功率密度的约束最终落到选址上。AI 数据中心的选址有几个硬性门槛:

  • 电力供应:百千瓦级单柜、MW 级机房总功耗,需要充足的市电接入能力。很多地区电网根本供不起大型 AI 数据中心。
  • 散热条件:液冷虽然高效,但最终还要把热量排到外界(通过冷却塔、干冷器),需要水源或适宜的气候。
  • 网络与生态:AI 训练需要大规模集群互联,机房要有充足的网络带宽和到主干网的接入。
  • 政策与成本:电价、土地、税收、监管政策都影响选址,这往往决定了 AI 算力的地理分布。
AI 数据中心选址四要素: 电力供应(MW 级接入) │ 散热条件(水源/气候)──┼── 网络生态(带宽/主干) │ 政策成本(电价/土地/税收) 四者缺一不可,限制了 AI 算力的地理分布。

这就是为什么全球 AI 算力高度集中在少数地区——这些地区恰好同时满足电力、散热、网络、政策四要素。中国的西部(电力充足、气候凉爽)、美国的部分州、北欧国家等,都是 AI 数据中心选址的热点。

💡 算力竞赛的地理维度:AI 算力竞赛不只是芯片竞赛,更是"在哪建数据中心"的竞赛。一个国家或地区如果无法提供满足上述四要素的选址,即使有钱也建不起大规模 AI 集群。这是算力基础设施的地理硬约束。

6.3.5 两大平台面对的同样约束

需要强调的是,无论 NVL72 还是昇腾 SuperPod,它们面对的功率密度和机房约束是相同的——两者都是百千瓦级高密度机柜,都需要液冷和专门设计的机房。差异只在于具体方案和供应链来源(NVIDIA 依赖全球数据中心生态,华为依赖国内供配电和液冷生态),但物理规律面前两者一致。

这也解释了为什么本章和第 7 章的内容对两大平台都适用——"体"的物理学是通用的,平台差异主要体现在产业链层面(第 8、9 章)。

思考与延伸

  1. 假设你要为一个 1000 柜的 AI 数据中心选址,四要素里你最看重哪个?如果某地电力便宜但气候炎热(散热难),你会去吗?
  2. PUE 1.1 vs 1.5 的差距,对一个 100 MW 的 AI 数据中心意味着每年多少电费差异?这种差异会如何影响 AI 训练的成本结构?
  3. 功率密度不断提高的趋势下,未来是否会出现"单柜 MW 级"的机柜?如果能,它对机房配电和散热会提出什么全新挑战?

本节关键词:功率密度、机房配电、PUE、选址门槛、AI 数据中心 返回:第 6 章支柱页 下一节:6.4 供电可靠性与能效


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U