返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

万卡集群建设趋势

东吴证券在报告中指出,虽然业内对大模型发展方向仍处于讨论中,但头部大模型厂商的万卡集群建设未曾停歇。xAI 2024年建成10万张H100集群,计划扩展至100万张;Meta 2024年底目标35万张H100;AWS正部署40万张Trainium。北美四大云厂商24Q4 CapEx合计增速约70%。东吴证券认为,GPT-5将引发新一轮AI热潮,万卡集群规模从十万卡向百万卡演进,算力基础设施产业链持续受益。

头部厂商万卡集群建设规模持续扩大

2023-2024年,各厂商陆续建成5万卡以下集群。Meta于2024年3月宣布两个24k GPU集群(共49152张H100),2024年底目标大幅增长至35万张H100。xAI 2024年建成10万张H100集群(当前市场最大单集群),2025年目标扩展至100万张。

AWS 2023年部署2万张H100,正部署40万张Trainium自研芯片集群。Google 2023年部署2.6万张H100及0.9万张TPU v5p。Microsoft 2020年建成1万张集群。头部厂商算力基础设施投入呈现指数级增长态势,从万卡向十万卡、百万卡规模演进。

北美四大云厂商CapEx增速回升,释放积极信号

23Q2以来四大云厂商CapEx增速持续上行,24Q2-Q3出现增速持平或放缓引发市场担忧。但24Q4合计增速进一步提升至约70%,释放积极信号。英伟达表示,云服务厂商(CSP)占数据中心业务近一半营收,其CapEx投入直接影响GPU出货量。

Google 24Q4 CapEx约143亿美元,AWS约263亿美元,Meta约148亿美元,Microsoft约226亿美元。四大云厂商合计季度CapEx首次突破700亿美元,显示AI基础设施投入仍在加速,市场对算力需求的担忧得到缓解。

OpenAI的标杆效应——引发国内AI新一轮竞赛

聚焦国内市场,从GPT-4能力的大模型发布时间表来看,普遍比GPT-4晚约一年的时间。腾讯混元、DeepSeek、Qwen、GLM等国产大模型参数量从千亿到万亿级不等,但训练算力集群规模与海外头部厂商仍有差距。

GPT-5若引发新一轮AI热潮,更多大集群的建设会提上日程。DeepSeek-V3训练成本约557万美元(在2048个H800集群上完成),其成功证明高效训练路径的可能性,但同时也验证了算力基础设施是AI竞赛的基础门槛。预计GPT-5发布后,国内大模型厂商将加速万卡集群布局。

万卡集群建设的产业链投资机会

万卡集群建设直接拉动AI服务器、高速PCB、光模块、交换机芯片、散热等产业链需求。GPT-5训练需要35万张H100级集群,意味着千亿级算力基础设施投资。

产业链相关公司:工业富联(AI服务器整机)、沪电股份(高多层PCB)、胜宏科技(HDI板)、寒武纪(AI训练芯片)、海光信息(DCU)、盛科通信(交换机芯片)等。万卡集群规模从10万卡向100万卡演进,算力基础设施建设周期持续3-5年,产业链相关公司有望持续受益。
表:主流科技公司公开宣布的万卡集群情况
厂商GPU类型GPU数量(万张)时间
Microsoft1.02020年
GoogleH1002.62023年5月
GoogleTPU v5p0.92023年5月
MetaA1001.62022年
MetaH1002.52024年初
MetaH10035.02024年底目标
AWSH1002.02023年7月
AWSTrainium40.0部署中
xAIH10010.02024年
xAI100.0计划
点击阅读报告原文: 【东吴证券】电子行业深度报告:如何展望GPT-5带来的算力增长?从参数量、时间表、影响力三重视角——算力需求看点系列-250318(13页)
相关报告