6.3 功率密度与机房配电约束 一个 AI 机柜要上百千瓦的电,但绝大多数现存机房单柜只能给到几千瓦到十几千瓦——这意味着,AI 集群不是"想装哪儿就装哪儿",它对机房有硬性的反向约束。 6.3.1 功率密度:机柜的"胃口" 功率密度指的是单位空间(通常以机柜为单位)的功耗。普通服务器机柜的功率密度大约在 5–15 kW/柜,一些高密度服务器机柜能到 20–30 kW/柜。而 AI 集群机柜的功率密度是另一个量级——单柜几十千瓦到上百千瓦。 这个差距意味着什么?意味着一个 AI 机柜的"胃口"相当于十几个甚至几十个普通机柜。如果一个现有机房按普通密度设计(比如每柜 10 kW),它根本喂不饱一个 AI 机柜——配电容量、电缆截面、UPS 容量都不够。
一个 AI 机柜要上百千瓦的电,但绝大多数现存机房单柜只能给到几千瓦到十几千瓦——这意味着,AI 集群不是"想装哪儿就装哪儿",它对机房有硬性的反向约束。
功率密度指的是单位空间(通常以机柜为单位)的功耗。普通服务器机柜的功率密度大约在 5–15 kW/柜,一些高密度服务器机柜能到 20–30 kW/柜。而 AI 集群机柜的功率密度是另一个量级——单柜几十千瓦到上百千瓦。
这个差距意味着什么?意味着一个 AI 机柜的"胃口"相当于十几个甚至几十个普通机柜。如果一个现有机房按普通密度设计(比如每柜 10 kW),它根本喂不饱一个 AI 机柜——配电容量、电缆截面、UPS 容量都不够。
功率密度量级对比: 普通办公服务器: 5 kW/柜 ────── 高密度服务器: 20 kW/柜 ───────────── AI 集群机柜: 100+ kW/柜 ───────────────────────────── ↑ 量级跃迁,不是渐进升级
💡 认知要点:AI 集群和传统数据中心,在功率密度上是"量级差异"而非"程度差异"。这种差异决定了 AI 集群不能简单"塞进"现有机房,而需要专门设计的 AI 数据中心。
功率密度带来的第一个约束是机房配电容量。一个机房的配电总容量是有限的(由变压器、进线、UPS 决定),AI 机柜的大胃口意味着同样面积的机房能容纳的机柜数大大减少。
举一个直观的对比:一个配电总容量 1 MW 的机房,按 10 kW/柜能放 100 个普通机柜;按 100 kW/柜只能放 10 个 AI 机柜。同样面积的机房,AI 集群能放的"柜子数"只有传统的十分之一。这就是为什么 AI 算力竞赛背后,数据中心选址和配电扩容成了核心议题。
配电还要考虑分支电缆——每个 AI 机柜从机房配电盘到机柜的电缆,要承受上百千瓦的电流,电缆截面极大(可能比手臂还粗)、重量惊人、弯曲半径受限。这些都对机房的电缆桥架、走线通道提出了远超普通机房的要求。
配电差异(同样机房面积): 传统机房(10 kW/柜): 机柜机柜机柜机柜机柜机柜机柜机柜机柜机柜 ← 100 个机柜 AI 数据中心(100 kW/柜): 机柜 ──────── 机柜 ──────── 机柜 ← 10 个机柜 (每个柜配电粗电缆、专用通道)
第 1.4 节提过 PUE(电源使用效率)——数据中心总能耗与 IT 设备能耗之比。PUE 越接近 1,说明制冷和辅助设施的额外开销越小。普通风冷机房的 PUE 常在 1.4–1.6 之间,即每 1 度电给 IT 设备,还要额外花 0.4–0.6 度电制冷和损耗。
AI 集群因为功耗密度极高,风冷几乎无法胜任(详见第 7 章),必须用液冷。液冷能显著降低制冷能耗,使 PUE 降到 1.1–1.2 甚至更低。这不仅是能效问题,更是经济问题——百千瓦级的集群,PUE 每降 0.1,每年节省的电费都是可观的数字。
| 机房类型 | 典型 PUE | 制冷方式 | 适用密度 |
|---|---|---|---|
| 老旧风冷机房 | 1.5–1.8 | 房间级空调 | 低(<10 kW/柜) |
| 现代风冷机房 | 1.3–1.5 | 行级/列间空调 | 中(10–30 kW/柜) |
| 液冷机房 | 1.1–1.2 | 冷板/浸没液冷 | 高(30–100+ kW/柜) |
⚠️ PUE 的局限:PUE 只反映"制冷和损耗的效率",不反映"芯片本身的能效"。一台 PUE 1.1 但芯片能效差的机房,可能比一台 PUE 1.3 但芯片能效优的机房更费电。评估 AI 数据中心的能效,要把 PUE 和芯片能效合在一起看(详见第 10 章)。
功率密度的约束最终落到选址上。AI 数据中心的选址有几个硬性门槛:
AI 数据中心选址四要素: 电力供应(MW 级接入) │ 散热条件(水源/气候)──┼── 网络生态(带宽/主干) │ 政策成本(电价/土地/税收) 四者缺一不可,限制了 AI 算力的地理分布。
这就是为什么全球 AI 算力高度集中在少数地区——这些地区恰好同时满足电力、散热、网络、政策四要素。中国的西部(电力充足、气候凉爽)、美国的部分州、北欧国家等,都是 AI 数据中心选址的热点。
💡 算力竞赛的地理维度:AI 算力竞赛不只是芯片竞赛,更是"在哪建数据中心"的竞赛。一个国家或地区如果无法提供满足上述四要素的选址,即使有钱也建不起大规模 AI 集群。这是算力基础设施的地理硬约束。
需要强调的是,无论 NVL72 还是昇腾 SuperPod,它们面对的功率密度和机房约束是相同的——两者都是百千瓦级高密度机柜,都需要液冷和专门设计的机房。差异只在于具体方案和供应链来源(NVIDIA 依赖全球数据中心生态,华为依赖国内供配电和液冷生态),但物理规律面前两者一致。
这也解释了为什么本章和第 7 章的内容对两大平台都适用——"体"的物理学是通用的,平台差异主要体现在产业链层面(第 8、9 章)。
本节关键词:功率密度、机房配电、PUE、选址门槛、AI 数据中心 返回:第 6 章支柱页 下一节:6.4 供电可靠性与能效