当单芯片性能提升的边际成本持续攀升,AI算力基础设施正从“单点芯片竞争”转向“系统级架构重构”。鹏城实验室与全球计算联盟联合发布的这份白皮书,首次系统定义了“超节点”——一种将多个计算单元通过高速互联融合为逻辑上“一台计算机”的Scale-Up架构。白皮书汇聚了华为、百度、商汤、壁仞等30余家机构的研究成果,为AI算力基础设施的下一代演进提供了系统的理论框架与实践指南。
超节点的诞生背景——从单点芯片到系统级架构
AI“奇点”临近催生的算力挑战
万亿甚至十万亿参数模型、超长上下文、多模态融合与世界模型等大规模应用,将算力需求推向指数级增长。以DeepSeek V4为标志,技术边界正被快速推高——模型总规模达1.6T,集成384个MoE专家,支持1M超长序列,并追求10ms级别的token输出时延。
过去AI基础设施竞争主要围绕xPU、CPU、HBM、网卡等单点硬件展开。然而目前行业重心正逐步转向“整机柜即计算机”的系统级架构。超节点的核心任务不再是简单叠加更多xPU,而是围绕xPU间通信、HBM容量、机柜功率密度、散热效率和可维护性等系统瓶颈进行协同优化。
超节点的四阶段演进路径
超节点发展分为四个阶段:第一阶段单机多卡,以8xPU服务器为典型;第二阶段整机柜超节点,重点是将部分通信从Scale-Out网络前移至更高带宽更低延迟的互联域;第三阶段Pod级和多机柜超节点,实现几百xPU的统一域;第四阶段超节点集群化,通过Scale-Out将多个超节点聚合为统一算力资源池。
超节点的核心定义与六大特征
核心定义——逻辑上“一台计算机”
超节点是物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。其架构特征为跨物理节点的统一内存编址,核心技术特征包括内存语义、统一内存编址、超低时延、超大带宽。
Scale-Up架构——垂直扩展的紧耦合系统
“统一内存地址空间”与“超节点总线”共同定义了超节点计算系统的“统一执行环境”,这是Scale-Up计算系统架构的核心特征。与Scale-Out架构不同,Scale-Up通过系统级的地址统一、Load/Store内存语义操作与访存直通,实现有效算力规模的增长。
内存语义——跨节点Load/Store直通访问
超节点通过系统总线对内存语义操作的可达域进行扩展,使得任一处理器Core能够直接对超节点内存地址执行Load/Store操作。反观不支持内存语义的节点间互联,数据交换必须依赖软件封装和通信协议栈,有效带宽和延迟均受限于软件开销。
超低时延与超大带宽
相较于传统服务器架构,超节点RTT通信时延降至微秒级,降低了50%以上。超节点总线必须具备TB/s级别的高带宽,并能随算力增长持续提升。在千亿级参数模型的千卡并行训练中,鹏城云脑Ⅲ的MFU达43%,从128卡扩展至1024卡扩展效率达98.4%。
超节点架构——五层总线协议框架
物理层到功能层的完整能力体系
白皮书构建了从物理层到功能层的五层协议能力框架。物理层通过可变速率机制(支持112G/224G等多种速率)、极低时延编码和动态轻量化FEC,对比传统以太降低百ns级别。链路层采用Flit数据结构,优化纠错时延和重传效率。
网络层支持网络地址编址和转发、拥塞标记和IPv4/IPv6格式,支持超大规模部署。传输层原生多路径Group机制、连接共享和拥塞控制,保障多流量公平调度。事务层提供内存操作、消息操作、维护操作和管理操作四大类事务。功能层同时提供同步Load/Store/Atomic访问和异步DMA访问。
资源与内存管理——全局统一编址
通过资源和内存管理,实现超节点的全局统一编址,支持多样性XPU平等互连、池化共享。采用分区方式支持多用户,属于不同Partition的设备之间访问隔离,提供高性能的多租户部署方案。通过总线虚拟地址实现大规模的内存统一编址映射和部署。