国金证券研究报告指出,人工智能算力正面临前所未有的挑战与机遇。EpochAI数据显示主流模型训练算力约每6个月翻倍,多模态大模型算力需求翻倍周期已缩短至不足6个月,远超摩尔定律支撑的硬件提升速度。英伟达Blackwell芯片因先进封装工艺问题延后,揭示了单卡性能升级趋缓的现实。与此同时,数据中心电力消耗呈指数增长,2028年云厂数据中心耗电量预计将占全球发电量近3%,核电或成解决局部供电压力的最优方案。算力瓶颈正催生新的产业机遇——AMD在推理市场崛起、云厂商自研芯片加速、核电产业链迎来增量需求。
算力需求的指数级增长与单卡升级的放缓
人工智能模型训练所消耗的算力正以惊人的速度增长。自2012年AlexNet问世以来,算力需求便持续攀升——AlexNet训练依赖于两块NVIDIA GTX 580 GPU,耗费约470 petaFLOP;2020年GPT-3拥有1750亿参数,训练消耗约3.14×10⁸ petaFLOP;GPT-4进一步升级至1.8万亿参数,依赖25000个A100 GPU,计算需求达2.1×10¹⁰ petaFLOP,耗时90至100天;Gemini Ultra的算力要求再度跃升至5×10¹⁰ petaFLOP。EpochAI数据表明,当前主流模型训练所需算力约每6个月实现翻倍,而多模态大模型(如Gemini Ultra和GPT-4)的算力需求翻倍时间已缩短到不足6个月。
与此形成鲜明对比的是传统摩尔定律定义的晶体管数量翻倍周期为18个月。这意味着大模型算力需求的增长速度已经显著超越了传统芯片晶体管数量的增长速度。英伟达最新的Blackwell架构正是为应对这一挑战而设计——其核心特性是多芯片模块(MCM)设计,B200芯片将两个接近光罩极限面积的芯片通过NV-HBI技术连接(基于NVLink 5.0协议,提供10TB/s带宽)。然而以芯片面积增益归一化后,空气冷却B200在FP16 FLOPs性能上每单位芯片面积仅提升了14%,大部分性能提升主要依赖更大的芯片面积和量化优化。
Blackwell因设计问题延迟出货揭示了数据中心高性能计算芯片在制造端继续迭代的瓶颈。Cerebras联合创始人指出,延后的核心原因是GPU之间以及HBM和GPU之间的局部硅桥位置校准出现偏差,尤其是在Blackwell所采用的接近两倍光罩极限面积的中介层上,工艺难度进一步增加。计算die、CoWoS-L中局部硅桥及中介层RDL部分三者的热膨胀系数差异导致封装结构弯曲,影响系统性能。尽管英伟达可通过节点内外互联提升总体系统性能,但单卡PPA(性能/功耗/面积)的提升仍是后续系统性能继续提升的关键。由于并行化带来的算力提升边际递减——节点内GPU间通信(NVLink)慢于片上通信,节点间通信(InfiniBand/Ethernet)又显著慢于节点内通信——单卡算力的持续升级不可或缺。
AI模型训练算力需求增长轨迹| 模型 | 发布时间 | 参数量 | 训练算力消耗 | 硬件配置 |
|---|
| AlexNet | 2012年 | 约6000万 | 470 petaFLOP | 2×GTX 580 |
| GPT-3 | 2020年 | 1750亿 | 3.14×10⁸ petaFLOP | — |
| GPT-4 | 2023年 | 1.8万亿 | 2.1×10¹⁰ petaFLOP | 25000×A100,90-100天 |
| Gemini Ultra | 2023年 | — | 5×10¹⁰ petaFLOP | TPUv4 SuperPod集群 |
数据中心供电危机与核电解决方案
数据中心的电力消耗正呈指数级增长,成为制约AI发展的关键短板。根据IDC数据,2024年云服务厂商数据中心容量达到28240兆瓦(MW),2028年预计将达到56756兆瓦,年复合增长率19%。2024年云服务厂商数据中心预计消耗电力约563亿千瓦时,按全球23年发电量29.92万亿千瓦时计算,云厂数据中心耗电量占比达0.2%;若按全部数据中心耗电量4170亿千瓦时计算,则比例达1.4%。预计2028年数据中心用电量将达8568亿千瓦时,占全球发电量的2.9%。全球主要数据中心集中在中国、美国、欧洲等地区,这些地区发电量仅为全球一半左右,但数据中心用电量并未减少,局部地区的用电压力还将进一步加剧。
为应对越来越高的能源需求,主要云服务厂商纷纷将能源供应转向核电站。核电站独立于居民、工业用电的特点具备多重优势:运营成本相对较低、发电过程零碳排放、持续稳定的发电能力完美契合数据中心全天候稳定用电需求。当数据中心与发电源直接连接时,可直接获取电力而无需经过更大的输电网络,降低整体电网成本。
主要云厂商已在积极布局核电:亚马逊斥资6.5亿美元从Talen Energy手中购买核电数据中心园区,数据中心紧邻核反应堆,并与Constellation Energy寻求更多合作;微软与Constellation Energy签署为期20年的购电协议(PPA),重启宾夕法尼亚州三哩岛核电站1号反应堆(835MW);谷歌与Kairos Power签署协议,计划本十年内开始使用首个核反应堆,2035年前引入6-7个小型SMR核反应堆(累计500MW)。此外,泰国于11月首次启动核能发展,以SMR小型模块化反应堆技术为核心,计划将核电纳入2037年清洁能源发展目标。
但核能并非毫无风险。除了反应堆安全问题之外,已建成的核电站通常与电网相连,数据中心过度供电依旧威胁电网可靠性,产生的额外费用目前没有规定由谁支付。这也是2024年11月美国联邦能源管理委员会否决亚马逊增供电提案的主要原因。尽管大国核电政策可能收紧,东南亚国家如越南、缅甸、马来西亚、泰国正在积极扩张核电,SMR技术的高安全性和小空间需求为数据中心核电供电提供了新思路。
算力系统瓶颈催生的产业机遇
算力瓶颈正催生多元化的产业机遇。在GPU领域,AMD Instinct系列凭借存储容量和价格优势在推理市场持续获益。MI325X相比H200在显存容量上具有1.8倍优势(288GB vs 192GB,MI355X与B200对比),带宽具备1.25倍优势,定价更为低廉(MI300X约1万美元 vs H100的3-4万美元)。AMD受制于软件生态和互联性能在训练领域尚难以与英伟达竞争,但随着推理算力需求大幅提升,AMD在该领域将持续受益。海外云厂商出于降低成本和寻找第二供应商的考虑,正在积极尝试使用AMD GPU集群。
在芯片制造端,Blackwell的延后暴露了先进封装的技术瓶颈,但也为CoWoS-L等相关封装技术的改进提供了方向。系统级创新(如NVLink节点内互联、InfiniBand/Ethernet节点间互联)正成为提升整体系统性能的重要路径。从时间线看,英伟达预计2026年发布Blackwell Ultra(HBM升级版本,难度相对较低)和Rubin GPU。市场对FY2026Q3毛利率回升的预期较为充分,但需警惕Rubin不能如期发布的风险——从单位面积晶体管缩放和先进封装角度,下一代产品实现大幅度性能提升的难度不容小觑。
在电力基础设施领域,核电产业链将直接受益于AI数据中心的供电需求。SMR小型模块化反应堆因其高安全性、空间需求小等优势,成为数据中心核电供电的最优解。谷歌与Kairos Power的合作、泰国等东南亚国家的SMR布局,预示着核电设备、核燃料循环、核电运营等细分领域将迎来增量需求。同时,核电与数据中心的直连模式也需要解决电网可靠性和费用分摊等制度问题,相关政策和商业模式创新同样值得关注。