10.2 单位算力成本与能效视角 峰值算力数字谁高谁低,第 2 章已经讨论过口径问题。这一节换一个更务实的视角——每单位算力的成本和能耗。这才是真正决定"用得起、用得久"的指标。 10.2.1 为什么单位成本比峰值更重要 回顾第 1.4 节和第 2.4 节,峰值算力数字有多重口径陷阱,且峰值不等于有效算力。对实际部署 AI 集群的决策者来说,真正关心的是——花一块钱能买到多少有效算力,每度电能算多少有效运算。 这两个指标——单位算力成本和单位算力能耗——才是平台经济性的核心。一个峰值算力高但单位成本也高的平台,未必比峰值稍低但单位成本更优的平台划算;一个算力强但能效差的平台,长期运行电费会吞噬所有优势。
峰值算力数字谁高谁低,第 2 章已经讨论过口径问题。这一节换一个更务实的视角——每单位算力的成本和能耗。这才是真正决定"用得起、用得久"的指标。
回顾第 1.4 节和第 2.4 节,峰值算力数字有多重口径陷阱,且峰值不等于有效算力。对实际部署 AI 集群的决策者来说,真正关心的是——花一块钱能买到多少有效算力,每度电能算多少有效运算。
这两个指标——单位算力成本和单位算力能耗——才是平台经济性的核心。一个峰值算力高但单位成本也高的平台,未必比峰值稍低但单位成本更优的平台划算;一个算力强但能效差的平台,长期运行电费会吞噬所有优势。
经济性视角的两个核心指标: 单位算力成本 = 总成本 / 有效算力 越低越划算(花少钱买多算力) 单位算力能耗 = 总能耗 / 有效算力 越低越节能(少耗电多算力) 这两个指标比峰值算力更贴近真实决策。
💡 为什么强调"有效":两个平台在峰值算力上可能差几倍,但在有效算力(真实业务下的实测吞吐)上差距可能更小,也可能因生态和优化程度不同而放大。所以单位成本和能耗都要用"有效算力"做分母,而不是峰值。
单位算力成本不是一个单一数字,而是多重成本的叠加:
这些成本里,有些是一次性的(硬件购置),有些是经常性的(电力、运维)。一个完整的单位算力成本分析,应该把全生命周期的所有成本都算进去——这就是总拥有成本(Total Cost of Ownership, TCO)的视角。
单位算力成本的全生命周期构成: 一次性:硬件购置 + 基础设施 + 软件/迁移 经常性:电力 + 运维人力 + 持续优化 TCO = 一次性摊销 + 经常性累计 单位算力成本 = TCO / 有效算力总量
基于前面九章的分析,两大平台的成本特征有显著差异:
NVL72 的成本特征:硬件单卡成本高(先进制程 + CoWoS + HBM3e 都贵),但因为单卡算力强、单柜密度高,单位算力的硬件成本未必最高。CUDA 生态成熟,软件迁移和调优成本低。主要风险是供应链集中带来的价格波动和供应不确定性。
昇腾 SuperPoD 的成本特征:硬件单卡成本相对较低(成熟制程 + 国产供应链),但要达到同等总算力需要更多卡,网络和基础设施成本占比可能更高。软件生态仍在建设,早期用户的迁移和调优成本较高。优势是国产化带来的供应链可控和潜在的政策支持。
| 成本维度 | NVL72 | 昇腾 SuperPoD |
|---|---|---|
| 单卡硬件成本 | 高(先进制程+HBM) | 相对低 |
| 单位算力硬件成本 | 中(单卡强) | 中(需更多卡) |
| 网络/基础设施占比 | 中 | 较高(规模大) |
| 软件迁移成本 | 低(CUDA 成熟) | 较高(生态在建) |
| 供应链稳定性 | 集中,有波动风险 | 可控,但带差距 |
⚠️ 成本对比的动态性:单位算力成本不是静态的。NVIDIA 靠规模效应和学习曲线持续降价;昇腾靠国产替代推进和技术成熟也在降本。今天的成本对比,三五年后可能完全不同。所以成本分析要带时间维度。
类似地,能效也要算总账——总拥有能耗(Total Energy of Ownership)。一个集群的能耗不只是芯片功耗,还包括制冷(PUE)、网络设备、供电损耗等。
NVIDIA 的 Blackwell 单卡功耗高,但单卡算力也高,单位算力能耗有竞争力。昇腾的达芬奇架构以能效见长,单位算力能耗可能更优,但要算上更大规模集群带来的额外网络和基础设施能耗。
能效的完整视角: 单芯片能效(架构决定) ─── 第2章 + 制冷能耗(PUE)───────── 第6、7章 + 网络设备能耗 ─────────── 第5、9章 + 供电损耗 ────────────── 第6章 = 总拥有能耗 单位算力能耗 = 总拥有能耗 / 有效算力
能效不只是省钱,更是战略能力。一个国家或地区的电力供应有限,能效决定了同样电力能驱动多少算力。在 AI 算力竞赛里,能效高的平台能用同样电力多跑训练,这在电力受限的环境下是决定性优势。
这也是为什么达芬奇架构的高能效对华为有特殊战略意义——在单卡算力受制程限制的现实下,高能效意味着"同样的电、同样的集群规模,能算更多",这是用架构弥补制程差距的具体体现。
💡 能效与规模的辩证:能效高允许更大规模,但大规模又带来额外的基础设施能耗。所以能效优化是全栈的——单卡能效、网络能效、制冷能效都要一起优化,不能只看单点。这也是为什么本教程反复强调"系统观"。
把成本和能效合起来,两大平台的经济性对比没有一个简单的"谁更划算"结论,而是取决于具体场景:
下一节我们分析两大路线的天花板与突破口,看它们各自能走多远。
本节关键词:单位算力成本、能效、总拥有成本 TCO、总拥有能耗、经济性对比 返回:第 10 章支柱页 下一节:10.3 天花板与突破口