在美国持续加码芯片出口管制的背景下,国产算力架构的自主突破成为AI产业链的核心命题。东方财富证券报告指出,华为CloudMatrix384超节点的发布标志着国产算力架构实现了从单卡追赶到超节点超越的关键跨越。CM384通过384颗Ascend910C芯片的系统级创新,在总算力、内存带宽等关键指标上实现对NVL72的全面对标,国产算力架构正从“可用”迈向“好用”的新阶段。
国产算力架构突破的总览与战略意义
国产算力架构的突破不仅是技术问题,更是战略问题。2025年5月美国商务部工业和安全局废除了拜登时期的《人工智能扩散规则》,并宣布在全球任何地方使用华为昇腾芯片均违反美国出口管制规定。美国意图通过制裁封堵中国AI芯片生态扩张路径,但只会加速国产算力架构的替代进程。华为CM384超节点的发布是国产算力架构的标志性事件——通过全面的架构创新,在算力、互联带宽、内存带宽方面实现领先。硅基流动已基于CM384推理DeepSeek-R1,单卡Decode吞吐突破1920Tokens/s,达H100同等性能水平,证明了国产算力架构在实际应用场景中的可行性。
NVL72与CM384关键性能指标对比| 指标 | 单位 | GB200 NVL72 | 910C CM384 |
|---|
| 计算性能(BF16) | Pflops | 180 | 300 |
| HBM容量 | TB | 13.8 | 49.2 |
| HBM带宽 | TB/s | 576 | 1229 |
单卡性能与超节点架构——从910C到CM384的跨越
国产算力架构的突破路径是“单卡追赶+超节点超越”。昇腾910C是910B的升级版本,将两颗910B芯片分别放置在各自硅中介层上再通过有机基板连接,计算和内存性能较910B翻倍。单卡算力0.78Pflops(BF16),计算性能已接近H100,显存容量128GB优于H100的80GB。但与GB200的单卡算力相比仍有较大差距。CM384的突破在于用384颗910C芯片实现了系统级超越——300Pflops密集BF16计算较NVL72的180Pflops提升67%,总内存容量49.2TB较NVL72提升257%,内存带宽1229TB/s较NVL72提升113%。国产算力架构的竞争策略已从“单卡对标”转向“系统取胜”。
HCCS高速互联——突破8卡限制的关键技术
国产算力架构中HCCS技术是关键突破口。超节点需要通过高带宽、低时延互联技术实现GPU间通信带宽达数百GB/s至数TB/s,使单超节点集成数十至数百颗GPU。NVLink相较于传统PCle提供了更高效、低延迟的互联解决方案,而HCCS是华为自研的高速互联接口。通过HCCS实现八个910C互联互通,每个910C提供56GB/s的HCCS双向带宽,整体互联带宽接近400GB/s。虽与NVLink5.0双向互联总带宽1.8TB/s存在差距,但与NVLink3.0提供的600GB/s总带宽差距已不明显。HCCS使国产算力架构突破了单机8卡的限制,为CM384的384卡集群提供了互联基础。
Scale-up网络架构演进与交换机容量约束
国产算力架构的未来演进方向是Scale-up域从384卡向千卡、万卡扩展。CM384采用4台CloudEngine16800交换机,每台拥有16个业务槽位、单槽位19.2Tbps转发能力,合计307.2Tbps,最多接入768个400G光模块,双向连接下支持384张GPU。Scale-up网络支持的最大GPU节点数量取决于交换机容量。当前国内三家头部CSP均已发布自研51.2T交换机——阿里“白虎”、腾讯TCS9500、字节跳动B5020,最多可连接1024张400G光模块。字节自主研发的EthLink协议已支持同一Scale-up网络域最大1024个GPU节点。随着交换机容量的持续提升和HCCS等互联技术的迭代,国产算力架构有望在2-3年内实现千卡级超节点的商业化部署,进一步缩小与NVIDIA的集群级差距。