当Scale-Out集群在应对AI大模型“紧耦合、同步并行”计算特征时面临通信瓶颈与效率衰减,Scale-Up计算系统通过全局统一内存地址空间、内存语义跨节点访问、超高带宽与超低时延互联,将分散的物理计算单元融合为逻辑一体的“超级计算机”。鹏城云脑Ⅲ用千卡扩展效率98.4%、NPU间通信带宽超650GB/s、时延低至1.2微秒的数据,验证了Scale-Up架构在AI大模型时代的工程可行性。
Scale-Up vs Scale-Out——架构范式的根本差异
为什么Scale-Out无法承载“紧耦合”计算
传统集群架构在应对AI大模型“紧耦合、同步并行”的计算特征时,面临通信瓶颈与效率衰减的双重挑战。Scale-Out计算系统各计算节点运行于相互隔离的独立地址空间,节点间的数据同步须依赖软件协议栈和网络报文交换。即便配置较高链路带宽与较低传输时延,其数据移动路径中仍不可避免地址映射、消息组装、中断处理等软件介入层次。
该方式在有效带宽、端到端时延及同步效率上存在数倍乃至一个数量级的结构性劣势,导致计算资源在通信等待中闲置,有效算力规模被I/O瓶颈钳制,系统整体可扩展性在架构层面即受到根本限制。
Scale-Up的架构优势
Scale-Up计算系统通过“统一内存地址空间”与“超节点总线”共同定义“统一执行环境”。在此结构下,跨处理器Core的数据同步在机制层面与芯片内部一致,均表现为内存语义访存。系统可充分利用处理器微架构中的预取、乱序执行、多硬件线程等机制,由硬件、编译器和程序算法设计协同完成访存调度与同步隐藏,无需在软件层引入额外的格式编码或协议栈。
Scale-Up的核心技术特征
统一内存编址——跨节点内存语义访问的前提
统一内存编址是实现跨节点内存语义访问的前提——只有当不同节点的内存被纳入统一编址,Load/Store等内存语义操作才能够访问远端内存地址。超节点通过系统总线对内存语义操作的可达域进行扩展,使得任一处理器Core能够直接对超节点内存地址执行Load/Store操作。
超低时延——从微秒级到百纳秒级
超低时延互联是超节点支持大模型低时延推理的关键。在具备“统一内存编址”和“内存语义访问”核心架构后,超低时延总线也是超节点的关键特征。相较于传统服务器架构,超节点RTT通信时延降至微秒级,降低了50%以上。在高性能计算场景中,内存语义通信使小包时延从微秒级降至百纳秒级。
超大带宽——TB/s级别的同步流量承载
AI大模型的激活值相比原始字符输入数据量被放大成千上万倍;模型由数十至上百层神经网络堆叠,一次完整前向计算整体数据负载可增加数十万乃至上百万倍。超节点总线必须具备TB/s级别的高带宽,才能有效承载这些海量同步流量。鹏城云脑Ⅲ超节点内NPU间的双向通信带宽超过650GB/s,较传统网络提升了一个数量级。
Scale-Up的实践验证——鹏城云脑Ⅲ
国内首个超节点架构国产智算集群
鹏城云脑Ⅲ是国内首个采用超节点架构的国产智算集群,将64颗NPU通过总线互联为一个高度耦合的计算单元。系统采用计算刀片与交换刀片直接正交盲插的全电交换架构,三维浮动全盲插设计将电源连接器、液冷快接头及信号连接器集成于机柜内部,实现即插即用。
关键性能指标
在通信协议层面,交换芯片和xPU可直接携带目的及源内存地址进行交互。超节点内NPU间的双向通信带宽超过650GB/s,点对点最小通信时延降低至1.2微秒以内。在千亿级参数模型的千卡并行训练中,MFU达43%。从128卡扩展至1024卡的过程中,扩展效率达98.4%。