财通证券研究报告深入分析了DeepSeek开源周首日发布的FlashMLA技术。作为专为英伟达Hopper GPU架构设计的高效MLA解码内核,FlashMLA在H800 SXM5平台上实现了惊人的性能——内存受限配置下3000GB/s带宽、计算受限配置下580TFLOPS峰值性能。这一优化建立在DeepSeek独创的MLA(多头潜在注意力)技术基础之上,该技术将KV缓存减少了约93.3%。FlashMLA已投入生产使用,是目前大模型推理效率提升最具代表性的技术突破之一。
MLA技术原理:KV缓存压缩93.3%的创新
MLA(多头潜在注意力)是DeepSeek在DeepSeek-V2及后续模型中引入的核心技术创新。在标准的Transformer架构中,KV缓存是一种内存机制,用于存储表示对话上下文的数据以减少不必要的计算开销。随着序列长度增加和批处理规模扩大,KV缓存占用的内存呈线性增长,成为推理效率的主要瓶颈。
MLA通过低秩近似方法对KV缓存进行压缩。具体而言,它将高维的Key和Value向量通过低秩矩阵投影到潜在空间,大幅减少了存储维度。这一创新使每次查询所需的KV缓存减少了约93.3%。更小的KV缓存意味着更高的内存效率、更大的批处理规模和更快的推理速度。MLA已成为DeepSeek-V2、V3和R1系列模型的核心技术基座,为其高效推理奠定了基础。
FlashMLA的技术实现与Hopper GPU优化
FlashMLA是MLA技术针对Hopper GPU架构的工程化实现。它专为处理可变长度序列设计——在同时处理长文本和短文本时,可以精准地为不同长度的文本分配恰当的算力。这种动态资源分配能力对于真实世界的大模型应用至关重要,因为用户输入的序列长度差异极大。
FlashMLA的核心优化包括BF16精度支持和块大小为64的分页KV缓存。BF16(bfloat16)在保留关键精度的同时兼顾了计算速度,是AI训练和推理中广泛采用的精度格式。分页KV缓存将KV缓存按64的块大小进行分页管理,优化了内存分配和回收效率,特别适合变长序列场景。FlashMLA的设计参考了FlashAttention-2、FlashAttention-3以及CUTLASS的技术实现。
实测性能数据与硬件利用率分析
经DeepSeek实测,FlashMLA在H800 SXM5平台(CUDA 12.8)上展现出卓越的性能。在内存受限配置下,可达到最高3000GB/s的内存带宽;在计算受限配置下,可达到580TFLOPS的峰值性能。
作为参照,NVIDIA H800 SXM5 GPU的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。这意味着FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。对于大模型推理这类通常受内存带宽限制的工作负载而言,3000GB/s的带宽表现意味着推理吞吐量的大幅提升。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。
表3:FlashMLA在H800 SXM5上的性能表现| 性能指标 | FlashMLA实测 | H800 SXM5峰值 | 利用率 |
|---|
| 内存带宽 | 3000 GB/s | 3.35 TB/s | ~89.6% |
| 计算性能 | 580 TFLOPS | 990 TFLOPS | ~58.6% |
| KV缓存压缩 | 减少93.3% | — | — |
FlashMLA的产业影响与应用前景
FlashMLA的开源对AI产业具有多重意义。首先,它证明了大模型推理效率仍有巨大的优化空间——通过算法创新(MLA)和工程优化(PTX级调优)的结合,可以在现有硬件上实现数倍的性能提升。其次,开源模式使全球开发者都能受益于这一优化成果,降低了AI应用的门槛。
长江证券研报认为,此次DeepSeek开源代码库将围绕降本增效这一核心,通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑。FlashMLA已投入生产使用,其在实际部署中的效果验证了MLA技术路线的可行性。对于希望部署大模型的企业和开发者而言,FlashMLA提供了一个可直接使用的、经过生产验证的高效解码方案。