Scale Up是超节点的核心增量环节,对国内算力参与方来说,单卡算力差距或可部分由“运力”(网络)进行弥补,对比华为 CM384 和英伟达 NVL72,前者 Scale up 交换芯片与GPU配比高于后者(25%)。根据冯诺依曼计算机体系架构,计算、存储、网络三要素必须保持系统级平衡,即国产超节点不能仅堆 GPU算力卡而不增强网络。我们认为,基于国产卡与海外卡的算力差距,若需在网络上进行补齐,则国产超节点中 Scale up交换芯片与GPU 的比例或高于海外。举例来看,海外方面,英伟达推出的 GB200 NVL72 内使用 18颗 NVSwitch4 ASIC将 72颗 B200 GPU进行 Scale up 互联,即交换芯片:GPU=18:72=1:4。国内方面,华为 CM384的单节点中 8颗 NPU通过 7颗 UB Switch 实现卡间互联,因此交换芯片:NPU=7:8。从二者算力比较来看,尽管昇腾 910C的单芯片算力仅为 GB200的 1/3,但 CM384、GB200 NVL72的 BF16稠密算力分别为 300、180PFLOPS,前者几乎是后者的两倍,可见单卡算力的差距可以通过 Scale up等网络进行弥补,随着机柜式服务器成为未来发展趋势,机柜内部的 Scale up交换网络格外重要。