返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

华为昇腾384超节点

浙商证券在国产算力报告中指出,华为昇腾384超节点是国内超节点方案的标杆。2025年7月世界人工智能大会首次线下展出,通过UB总线技术实现384个NPU大带宽低时延全互联,单卡推理吞吐量达2300Tokens/s,计算效率超过英伟达H100/H800。本报告基于浙商证券研报,分析华为昇腾384超节点的技术架构、性能优势与产业影响。

UB总线统一协议——华为被制裁下的自研之路

2019年华为被美国加入实体清单,JEDEC、SDA、PCI-SIG等国际网络协议组织撤销了华为会员资格。华为无法继续参与PCIe协议更新和使用,于是自研开发“统一总线”(Unified Bus,UB),用于替代以太网和PCIe协议。2021年APNet大会谭煜博士公开展示UB网络架构。

与英伟达多样化互联技术(ScaleUp用NVLink、ScaleOut用IB)不同,UB采用统一总线技术实现所有组件互联。多样化互联需在不同协议间切换,而UB统一标准下通信效率提升,避免了转录成本。

2025年3月华为团队发表论文《UB-Mesh:一种层次化局部化的全连接数据中心网络架构》,核心解答如何利用UB网络多快好省地搭建支持万卡甚至十万卡AI芯片。UB架构使得超节点像一台计算机一样工作,实现资源高效调度。

昇腾384超节点——系统性能超H100,已在互联网企业部署

2025年7月26日,华为于世界人工智能大会首次线下展出昇腾384超节点(Atlas 900 A3 SuperPoD)。该产品基于超节点架构,通过总线技术实现384个NPU大带宽低时延互联,解决集群内计算、存储等各资源间通信瓶颈。

性能方面,昇腾384方案单卡推理吞吐量达2300Tokens/s,计算效率超过英伟达H100/H800。在计算机柜内部,以全互联拓扑连接所有NPU和CPU,每颗910C贡献超过392GB/s的单向带宽。该产品已在百度、美团、字节等企业使用。

昇腾384的核心创新在于:支持“一卡一专家”MoE推理,384个专家并行,极大提升效率;支持“一卡一算力任务”灵活分配资源,将算力有效使用率(MFU)提升50%以上。通过系统工程优化,实现资源高效调度,让超节点像一台计算机一样工作。

昇腾384开启国产超节点新纪元

英伟达GB200 NVL72于2024年开启超节点时代,华为昇腾384于2025年紧随其后,标志着国产算力正式进入超节点竞争新阶段。从单卡追赶向系统架构突破转变,国产算力正以超节点方案突破单卡算力瓶颈。

国内超节点方案渗透率有望加速追赶。我们预计2025-2028年国内超节点渗透率分别为5%、19%、45%、72%。昇腾384作为国内领先方案,有望在国产算力超节点浪潮中持续受益。

浙商证券认为,华为昇腾384超节点验证了国产算力从“单卡算力追赶”向“系统架构突破”的可行性。超节点方案是国产算力突破单卡瓶颈、提升集群效率的关键路径。建议关注昇腾产业链相关标的及交换网络核心环节(中兴通讯、盛科通信、锐捷网络等)。
表:华为昇腾384超节点核心性能参数
指标参数
NPU数量384个
互联技术UB统一总线
单卡推理吞吐量2300Tokens/s
单向带宽/颗>392GB/s
MFU提升50%以上
对标产品超H100/H800
部署客户百度、美团、字节等
点击阅读报告原文: 计算机行业:国产算力迎来GB200时刻AI交换网络是核心增量-250817(45页)
相关报告