返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

第三颗主力芯片

继CPU、GPU之后,DPU正被业界公认为“第三颗主力芯片”。中国信通院这份白皮书揭示了DPU如何从“降本增效”的工具演变为AI算力底座的“全局数据中枢”:NVIDIA BlueField-4在GPU HBM与冷存储之间创建“温数据层”、腾讯云星脉网络在万卡集群中实现微秒级通信、天翼云紫金DPU将网络时延降至原来的四分之一。当大模型训练遭遇“数据搬运墙”和“I/O墙”的致命瓶颈,DPU正在通过重构内存层次与通信路径,释放被禁锢的GPU算力。

为什么是“第三颗主力芯片”——从降本增效到全局数据中枢

随着算力需求的多元化与高性能计算的快速迭代,传统CPU+GPU的双核架构已难以适配高带宽、低时延、强安全的需求。DPU通过在硬件层面实现网络协议栈、低时延RDMA传输、存储I/O、加密解密等功能的专用加速,并在AI集群中承担构建推理上下文内存存储平台、卸载非计算任务释放GPU算力、承担机架内数据神经中枢等功能,提供可编程的算力中心基础设施软件栈,实现对算力资源的细粒度调度与动态优化。

NVIDIA多次在GTC技术大会上强调DPU的重要性,并已在DGX AI超级计算机和Spectrum-X网络平台中规模化部署。DPU已超越基础的“降本增效”,在AI推理与超大模型训练场景中,其核心作用演变为重构数据路径与内存层级,以系统级优化直接释放算力红利。

破解“数据搬运墙”——DPU重构内存层次

在超大规模AI训练集群中,互联瓶颈的本质正从单纯的“网络带宽”问题,演进为复杂的“数据供给与协同效率”挑战。NVIDIA BlueField-4 DPU不再仅优化数据流动,而是主动重构内存层次,通过驱动池化NAND存储资源,在GPU HBM(热数据)与远端冷存储之间创建一个由DPU统一调度的“温数据层”中间层,为检查点、激活值等海量临时数据提供近计算侧的高速存取空间。

DPU通过构建池化的“推理上下文内存”,将海量KV Cache从GPU-HBM卸载至由其统一管理的大容量NAND资源池,解决了上下文长度快速扩张带来的KV Cache容量爆炸、访存压力剧增与算力效率急剧下降的问题,降低单次推理的数据搬运与预处理功耗,缩短训练周期并降低Token推理成本。全新架构下,DPU已演化为智算集群的“全局数据中枢”。

万卡集群通信——DPU将延迟降至微秒级

在Scale-Out层面,DPU集成400G/800G高速网络接口,通过硬件加速实现TCP/IP、RDMA等协议的全栈卸载,将节点间数据传输的协议处理、流量调度等开销从CPU剥离,大幅提升网络吞吐、降低端到端时延,为AI集群提供高带宽、低延迟、高可靠的通信能力。

腾讯云星脉网络结合DPU通过硬件级RDMA卸载与自研流量调度算法,在万卡级AI集群中实现微秒级节点通信。百度智能云通过百舸异构计算平台与DPU协同,优化大规模参数服务器架构下的梯度同步效率,提升分布式训练吞吐。在Scale-Up层面,业界正积极基于CXL协议探索异构内存池化技术,以构建统一地址空间,降低跨芯片数据访问延迟。中科驭数等国内DPU厂商聚焦于低时延网络与可编程数据平面,在金融、AI推理等场景中实现高性能数据处理。

释放CPU与GPU——DPU如何成为算力加速器

DPU通过硬件级卸载网络、存储及安全任务,有效释放CPU与加速器的算力。在云计算领域,DPU将虚拟交换机、存储控制器、安全策略执行等基础设施服务从服务器主机CPU卸载至DPU,大幅提升主机资源利用率。天翼云紫金DPU采用SOC+FPGA设计,网络时延降低至原来的四分之一。百度智能云基于太行DPU2.0打造新一代太行弹性计算产品。

在AI大模型推理中,DPU通过高效数据搬运与安全加密,将部分KV Cache卸载至低成本存储介质,显著降低推理成本。DPU通过硬件级RDMA卸载,将端到端通信延迟降至微秒级,上层软件定义网络拓扑、通信规则与QoS策略,由DPU硬件完成高速转发、流量隔离、拥塞控制等操作,使跨节点通信效率提升,为万卡级AI集群提供稳定无损的高速互联通道。
点击阅读报告原文: 中国信通院:DPU发展分析报告(2026年)(31页)
相关报告