返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

GPU算力效率提升

方正证券在报告中深入分析了DeepSeek开源周在GPU算力效率提升方面的技术创新。DeepSeek通过FlashMLA、DeepEP、DualPipe等一系列底层工程优化,在单GPU计算速度、GPU间传输速度及GPU利用率三个维度实现质的飞跃。FlashMLA在H800上实现3000GB/s内存带宽及580TFLOPS计算峰值,DeepEP将解码延迟压缩40%以上,DualPipe将设备等待时间从常规35%降到<5%。算力效率的提升正在重塑算力需求的底层逻辑。

单GPU计算速度——FlashMLA与DeepGEMM的双重突破

FlashMLA融合了Flash Attention和MLA架构,在H800上实现3000GB/s的内存带宽及580TFLOPS的计算峰值,相比传统方案提升2-3倍性能。MLA(Multi-Head Latent Attention)通过引入一组Latent Variable潜变量,在较低维度上存储和传递信息,显著减少KV Cache对内存的占用;Flash Attention将输入序列拆分成小块,分块进行中间计算,避免一次性加载完整的大矩阵带来的瞬时内存峰值。两者结合实现了计算效率的质变。

DeepGEMM针对矩阵乘法运算进行优化,采用FP8乘法+FP32累加的两级架构结合低精度速度优势和高精度数值稳定性优势;细粒度量化将数据划分成多个小块,使每个小块有自己的量化参数减少数值误差;JIT动态编译在运行时根据具体需求动态生成最优内核。对于普通矩阵计算来说,DeepGEMM相对CUTLASS性能提升1.4-2.7倍。

GPU间传输速度——DeepEP的通信效率革命

在MoE架构下,Dispatch和Combine过程中需要在不同专家(或不同GPU之间)进行All-to-All通信。传统GPU间通信通常依赖基于CUDA的NCCL,专为单次启动、大批量且连续的数据传输场景设计,因此在通信模式相对简单和连续的Dense架构中表现很好。而在MoE架构下,由于Dispatch和Combine过程中需要频繁进行小批量数据交换,每调用一次NCCL,都需要一定的固定时间用于初始化、数据准备与同步,而这些固定开销在小数据量下无法被充分摊薄,影响带宽的利用率,成为MoE扩展到超大参数规模的关键瓶颈。

DeepEP使用NVSHMEM(NVIDIA Shared Memory)允许一个GPU直接访问另一个GPU的内存,无需经过复杂的启动和同步过程,在处理小批量数据和不规则交换的场景下能够实现更高的带宽利用率和通信效率,更加适配MoE架构的需求。DeepEP能在H800上通过NVLink实现153-158 GB/s带宽,相比传统方案的解码延迟压缩40%以上。

GPU利用率提升——DualPipe将流水线气泡从35%降至<5%

大模型训练会同时用到多种并行策略来减少GPU的空闲时间。流水线并行(PP)指将模型按层次切分到多张GPU上,让前向或后向的计算在不同设备上分段进行。1F1B是最常见的PP方式,先在第1、2、...、n个GPU上跑完前向计算,再依次在n、n-1、...、1个GPU上做反向传播,强调按顺序算完正向之后才开始做反向,导致前向或后向某一端常常处于“等对方案无寸轮到我”的状态,出现大段的GPU空闲时间(流水线气泡)。

DualPipe让正向和逆向的计算和通信在时间轴上交错重叠,在第一个批次的正向计算还在往后传时,另一个批次的逆向计算已经在前传,避免顺序执行导致的空闲。此外DualPipe尽可能让计算与通信同时发生,即某张GPU做完某个批次的计算之后,可以立即发起通信并处理其他计算任务。DualPipe帮助大幅减少GPU气泡损耗,将设备等待时间从常规的35%降到<5%。针对MoE架构,EPLB通过复制“热门”专家并将副本分配到其他空闲GPU上,避免单卡过载,进一步提升了GPU整体利用率。

算力效率提升的产业影响——从堆料到提效

DeepSeek开源周揭示的算力效率提升对AI产业具有深远影响。训练侧,算力使用效率的提升不代表Scaling Law失效,而是将算力需求从“简单堆料”转向“精细提效”。R1在V3的基础上进行了两次强化学习,获得性能的明显提升,再次验证Post-Training Scaling Law的有效性。

推理侧,极致工程优化带来的成本下降将加速AI应用的商业化落地。DeepSeek开源的技术完全针对NV Hopper架构进行深度优化,技术迁移/国产适配需芯片厂商完善对FP8等特性的支持并相应优化推理侧解决方案。算力效率的持续提升将降低AI应用的开发与部署门槛,推理算力需求加速兑现,形成“效率提升→成本下降→应用普及→需求增长”的正向循环。
表:DeepSeek开源周GPU算力效率核心提升指标
优化维度项目核心指标提升幅度
单GPU计算速度FlashMLA580TFLOPS计算峰值比传统方案快2-3倍
单GPU计算速度DeepGEMMFP8+FP32两级精度比CUTLASS快1.4-2.7倍
GPU间传输速度DeepEP153-158GB/s带宽解码延迟压缩40%+
GPU利用率DualPipe流水线气泡从35%降至<5%
点击阅读报告原文: 海外科技行业解码DeepSeek开源周:超预期的开源程度与低成本属性-250316(27页)
相关报告