当DeepSeek V3每Token推理需经58层MoE、58轮跨节点动态通信,每次通信最小粒度仅7KB——传统网络的消息封装与软件协议栈开销成为不可承受之重。内存语义互联的解决方案是:让任一处理器Core直接对超节点内任意内存地址执行Load/Store操作,如同访问本地内存一般。鹏城实验室白皮书系统解析了这一关键技术的原理、实现与性能优势。
内存语义的技术本质
从软件通信到硬件直通
现代处理器均遵循冯·诺依曼计算架构,数据存取指令(Load和Store)由处理器Core的硬件单元直接发起对指定地址的读写。超节点通过系统总线对内存语义操作的可达域进行扩展,使得任一处理器Core能够直接对超节点内存地址执行Load/Store操作。该扩展伴随统一内存地址空间的建立,在编程模型和执行模型上获得与单系统一致的语义。
反观不支持内存语义的节点间互联,其数据交换必须依赖软件对信息进行TLV、KV等格式封装,并通过通信协议栈收发消息。此类路径无法融入处理器的微架构优化流程,有效带宽和延迟均受限于软件开销,且无法利用硬件自动预取和乱序执行等机制来掩盖通信延迟。
统一内存编址——内存语义的前提
统一内存编址是实现跨节点内存语义访问的前提——只有当不同节点的内存被纳入统一编址,Load/Store等内存语义操作才能够访问远端内存地址。因此,统一内存编址与内存语义访问构成超节点的核心架构特征。缺失这些特征,即便互联链路提供高带宽和低时延,系统在并行计算中的性能与延迟收益仍将显著受限。
内存语义在AI场景中的价值
MoE模型中的Dispatch/Combine通信
DeepSeek V3每Token推理需经58层MoE、58轮跨节点Dispatch与Combine动态通信,最小粒度仅7KB。内存语义互联消除了软件封装开销,使小包通信效率大幅提升。在超节点方案中,EP64可实现ALL2ALL通信全掩盖,单步耗时49.2s,而相同配置使用RoCE网卡需103s。
KV Cache跨节点访问
在RL后训练场景中,Agent进行多轮对话,KV Cache命中率超过90%。超节点内存池架构实现Prefill与Decoding节点的KV Cache共享,借助内存语义rH2D/rD2H跨节点低时延访问,TTFT最大降幅达75%。
内存语义的技术实现——总线协议五层框架
事务层——四大类事务操作
事务层提供内存操作(Ld/St/Atomic等)、消息操作(Read/Write/Send等)、维护操作以及管理操作四大类事务,实现计算单元间高效交互。支持多种可靠性和序模式,如可靠保序、目标保序、可靠乱序、不可靠乱序等。
功能层——同步与异步访问统一接口
功能层同时提供同步Load/Store/Atomic访问和异步DMA访问,单报文MTU长度可支持1kB~8kB,数据访问单事务长度最大可支持MB~GB级。提供基于用户态内存指针引用的过程调用,大幅简化传统过程调用的复杂协议栈功能接口。
资源与内存管理——全局统一编址
通过资源和内存管理,实现超节点的全局统一编址。内存使用方通过地址映射单元完成本地PA地址到总线虚拟地址的映射;提供方通过地址翻译单元完成总线虚拟地址到本地PA的映射。基于设备MMU、页表管理、缺页处理和权限管理等机制实现Shared Virtual Memory Address、non-pinned内存、zero-copy等能力。