返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI服务器功耗对比

AI算力的每一次跃升都以功耗的指数级增长为代价。从H100的700W到GB200的2700W,NVIDIA芯片功率在短短两年内翻了近四倍。东北证券研究报告系统梳理了NVIDIA历代AI芯片与服务器的功耗演进曲线,量化分析了算力提升对数据中心电力基础设施的冲击,并拆解了AI服务器电源配置从通用服务器的2颗800W到AI服务器的4颗1800W的升级逻辑。

NVIDIA芯片功耗的演进曲线

NVIDIA芯片的迭代始终伴随着额定功率的持续攀升。通过对比2024年NVIDIA发布的基于Blackwell架构的B200/GB200芯片和先前的H100/H200/B100产品,功耗增长趋势十分显著。H100/H200/B100的功率均为700W,B200提升至1000W,而GB200更是达到2700W。

这一趋势在更长期的时间维度上更为明显。从H100的700W TDP,到B200的1000W,再到GB200的1200W(单GPU),直至2026年下半年登场的Vera Rubin(VR200)平台,其GPU最大TDP将飙升至2300W。芯片功率的持续突破对服务器电源的功率密度和转换效率提出了越来越高的要求。

芯片功耗的提升直接反映在服务器整机功率上。DGX A100服务器的额定功率为8个单元、每单元3KW、总计24KW;DGX H100/H200服务器为8个单元、每单元3.3KW、总计26.4KW。而基于GB200芯片的NVL72架构,机架功耗约120KW,考虑冗余后总功率达198KW,相较上一代产品提升了约6倍。

AI服务器vs普通服务器——6-8倍的功耗差距

AI服务器与普通服务器在功耗层面存在数量级的差距。相比于传统的普通服务器,AI服务器的功率高出将近6-8倍,电源的需求同步提升6-8倍。通用型服务器通常只需要2颗800W服务器电源,而AI服务器的电源需求为4颗1800W高功率电源,服务器能耗成本从3100元直接飙升到12400元,约为3倍。

从服务器内部能耗结构看,GPU是功耗增长的主要来源。在DGX A100中,GPU功耗占比约49%;DGX H100中提升至55%;NVL72中GPU功耗占比高达60%。随着GPU数量的增加和单颗GPU功耗的提升,GPU在整机功耗中的占比持续扩大,对电源的功率输出能力提出了更高要求。

除GPU外,冷却系统是数据中心第二大电力消耗来源,占数据中心总电力消耗的40%。AI和高性能计算的发展导致数据中心的芯片、服务器和机架配置越来越密集,这种高密集度需要更强大的冷却系统来确保设备在安全的温度范围内运行。服务器能耗结构中,IT设备和软件占42%,冷却系统占40%,电气系统占比较小。

电源配置的升级逻辑与冗余设计

AI服务器电源配置的升级体现在两个层面:单模块功率提升和模块数量增加。通用型服务器通常只需要2颗800W服务器电源,而AI服务器的电源需求为4颗1800W高功率电源。以NVL72为例,其电源需求为6组33KW的PowerShelf,总电源功率约198KW,而实际机架功耗约120KW。

冗余设计是AI服务器电源配置的关键特征。服务器电源通常采用N+1或N+N冗余设计,以确保系统的可靠性和容错能力。N+1冗余中“N”代表正常运行所需的电源模块数量,“+1”表示额外的备用电源模块,允许在其中一个电源模块发生故障时系统仍能正常运行。

冗余配置的另一重要考量是电源效率。根据台达公布的ORV3标准下3000W服务器电源效率测试,在50%-60%负载区间内电源效率达到最高水平。NVL72的电源负载比例约为61%,DGX H100约为52%,均处于高效运行区间。这种设计不仅保障了供电安全性,还在一定程度上提升了电源的效率表现。
NVIDIA不同芯片功率对比
芯片型号功率(W)架构
H100 / H200 / B100700Hopper / Blackwell
B2001000Blackwell
GB200(单GPU)1200Blackwell
GB200 Superchip2700Blackwell
VR200(预计)2300Vera Rubin
点击阅读报告原文: 通信行业:电力——AI的尽头-250205(56页)
相关报告