浙商证券在国产算力报告中指出,华为昇腾384超节点是国内超节点方案的标杆。2025年7月世界人工智能大会首次线下展出,通过UB总线技术实现384个NPU大带宽低时延全互联,单卡推理吞吐量达2300Tokens/s,计算效率超过英伟达H100/H800。本报告基于浙商证券研报,分析华为昇腾384超节点的技术架构、性能优势与产业影响。
UB总线统一协议——华为被制裁下的自研之路
2019年华为被美国加入实体清单,JEDEC、SDA、PCI-SIG等国际网络协议组织撤销了华为会员资格。华为无法继续参与PCIe协议更新和使用,于是自研开发“统一总线”(Unified Bus,UB),用于替代以太网和PCIe协议。2021年APNet大会谭煜博士公开展示UB网络架构。
与英伟达多样化互联技术(ScaleUp用NVLink、ScaleOut用IB)不同,UB采用统一总线技术实现所有组件互联。多样化互联需在不同协议间切换,而UB统一标准下通信效率提升,避免了转录成本。
2025年3月华为团队发表论文《UB-Mesh:一种层次化局部化的全连接数据中心网络架构》,核心解答如何利用UB网络多快好省地搭建支持万卡甚至十万卡AI芯片。UB架构使得超节点像一台计算机一样工作,实现资源高效调度。
昇腾384超节点——系统性能超H100,已在互联网企业部署
2025年7月26日,华为于世界人工智能大会首次线下展出昇腾384超节点(Atlas 900 A3 SuperPoD)。该产品基于超节点架构,通过总线技术实现384个NPU大带宽低时延互联,解决集群内计算、存储等各资源间通信瓶颈。
性能方面,昇腾384方案单卡推理吞吐量达2300Tokens/s,计算效率超过英伟达H100/H800。在计算机柜内部,以全互联拓扑连接所有NPU和CPU,每颗910C贡献超过392GB/s的单向带宽。该产品已在百度、美团、字节等企业使用。
昇腾384的核心创新在于:支持“一卡一专家”MoE推理,384个专家并行,极大提升效率;支持“一卡一算力任务”灵活分配资源,将算力有效使用率(MFU)提升50%以上。通过系统工程优化,实现资源高效调度,让超节点像一台计算机一样工作。
昇腾384开启国产超节点新纪元
英伟达GB200 NVL72于2024年开启超节点时代,华为昇腾384于2025年紧随其后,标志着国产算力正式进入超节点竞争新阶段。从单卡追赶向系统架构突破转变,国产算力正以超节点方案突破单卡算力瓶颈。
国内超节点方案渗透率有望加速追赶。我们预计2025-2028年国内超节点渗透率分别为5%、19%、45%、72%。昇腾384作为国内领先方案,有望在国产算力超节点浪潮中持续受益。
浙商证券认为,华为昇腾384超节点验证了国产算力从“单卡算力追赶”向“系统架构突破”的可行性。超节点方案是国产算力突破单卡瓶颈、提升集群效率的关键路径。建议关注昇腾产业链相关标的及交换网络核心环节(中兴通讯、盛科通信、锐捷网络等)。
表:华为昇腾384超节点核心性能参数| 指标 | 参数 |
|---|
| NPU数量 | 384个 |
| 互联技术 | UB统一总线 |
| 单卡推理吞吐量 | 2300Tokens/s |
| 单向带宽/颗 | >392GB/s |
| MFU提升 | 50%以上 |
| 对标产品 | 超H100/H800 |
| 部署客户 | 百度、美团、字节等 |