方正证券在《超预期的开源程度与低成本属性——解码DeepSeek开源周》报告中系统解析了DeepSeek开源周六天发布的关键技术组件。如果将模型训练和推理简化为计算和通信两大任务,FlashMLA和DeepGEMM专注提升计算效率,DeepEP面向通信任务,DualPipe和EPLB负责计算与通信子任务的灵活调度,3FS为数据读取提供支持。开源周揭示DeepSeek在单GPU计算速度、GPU间传输速度及GPU利用率方面的极致提效。
开源周概览——六天技术矩阵完整覆盖模型推理全链路
DeepSeek于2025年2月24日至28日通过连续五天(+DAY6推理系统概览)的“开源周”活动,开源了Infra关键组件的代码库。开源项目主要围绕神经网络隐藏层开展工程创新,创新方向是减少每一环节在时间和空间维度上的冗余:DAY1 FlashMLA减少自注意力层缓存占用;DAY2 DeepEP减少FFN层通信启动成本;DAY3 DeepGEMM提高矩阵运算效率;DAY4 DualPipe/EPLB提高流水线并行与专家并行效率;DAY5 3FS加速输入层文件读取;DAY6将前五天开源的各项底层组件整合到推理流程中。
从任务维度看,FlashMLA和DeepGEMM主要专注于提升计算效率,即通过映射向量的降维以及运算位数的下降来减少计算过程中的缓存空间占用,从而提高单位GPU能实现的计算速度上限。DeepEP则面向通信任务,在MoE架构下采用NVSHMEM来适配频繁的小规模传输需求。DualPipe和EPLB负责不同计算与通信子任务之间的灵活调度,通过流水线双向交错执行和热门专家复制等方法来避免子任务分配不当带来的GPU空置。3FS则是在正式进行计算和通信前,为数据的读取与准备工作提供支持。
计算效率革命——FlashMLA与DeepGEMM的双重突破
FlashMLA融合了Flash Attention和MLA架构,通过Latent Variable潜变量在较低维度上存储和传递信息,显著减少KV Cache对内存的占用;同时将输入序列拆分成小块分块计算,避免一次性加载完整大矩阵。在H800上实现3000GB/s的内存带宽及580TFLOPS的计算峰值,相比传统方案提升2-3倍性能。
DeepGEMM针对矩阵乘法运算进行优化,采用FP8乘法+FP32累加的两级架构结合低精度的速度优势和高精度的数值稳定性优势;细粒度量化将数据划分成多个小块,使每个小块有自己的量化参数,减少数值误差;JIT动态编译在运行时根据具体需求动态生成最优内核,不受预构建的代码限制;分组计算将多组小矩阵乘法合并到一次GPU调用中。对于普通矩阵计算来说,DeepGEMM相对CUTLASS性能提升1.4-2.7倍。
通信与调度优化——DeepEP、DualPipe与EPLB
DeepEP使用NVSHMEM优化MoE架构下的GPU通信。传统GPU间通信依赖基于CUDA的NCCL,专为单次启动、大批量且连续的数据传输场景设计。而在MoE架构下,Dispatch和Combine过程中需要频繁进行小批量数据交换,每调用一次NCCL都需要一定的固定时间用于初始化,在小数据量下无法被充分摊薄。NVSHMEM允许一个GPU直接访问另一个GPU的内存,无需经过复杂的启动和同步过程,在处理小批量数据和不规则交换的场景下能够实现更高的带宽利用率和通信效率。DeepEP能在H800上通过NVLink实现153-158 GB/s带宽,相比传统方案的解码延迟压缩40%以上。
DualPipe让正向和逆向的计算和通信在时间轴上交错重叠,在第一个批次的正向计算还在往后传时,另一个批次的逆向计算已经在前传,避免顺序执行导致的空闲。同时尽可能让计算与通信同时发生,帮助大幅减少GPU气泡损耗,将设备等待时间从常规的35%降到<5%。EPLB(Expert Parallelism Load Balancer)通过复制“热门”专家并将副本分配到其他空闲GPU上,从而避免单卡过载。
推理系统概览——理论利润率545%的工程奇迹
DAY6将前五天开源的各项底层组件整理到推理流程中:首先将推理划分为Prefill和Decode两个阶段,通过两个Load Balancer动态分配请求与GPU资源;同时在MoE场景下继续运用EPLB做热门专家的复制与迁移,并结合DualPipe的双向并行调度思路减少GPU空转。通信层面则依托DeepEP优化多机多卡的All-to-All数据交换,算子级运算由FlashMLA与DeepGEMM提供高效低精度支持。最后,3FS负责高并发数据加载与强一致的文件访问。
基于所有Token(包括Web、App及API端)都按照R1的标准收费、仅考虑2美元/小时GPU租赁成本(未计入折旧、运维、能耗与租金)的假设,公司称其模型服务的理论利润率达到545%。该数值主要是反映“GPU租赁成本”对照“按R1计费方式的理想收入”计算的直接毛利率上限,并非是全面财务核算后的实际利润率,但充分展示了极致工程优化下AI模型服务的巨大经济潜力。
表:DeepSeek开源周核心技术组件与性能提升| 开源日 | 项目名称 | 核心功能 | 性能提升 |
|---|
| DAY1 | FlashMLA | 减少自注意力层KV缓存 | 3000GB/s带宽,580TFLOPS峰值 |
| DAY2 | DeepEP | MoE架构GPU间通信 | 153-158GB/s带宽,延迟-40% |
| DAY3 | DeepGEMM | 矩阵乘法运算优化 | 比CUTLASS快1.4-2.7倍 |
| DAY4 | DualPipe+EPLB | 流水线并行+专家并行 | 气泡从35%降至<5% |
| DAY5 | 3FS | 高并发文件读取 | 6.6 TiB/s读取吞吐量 |
| DAY6 | 推理系统概览 | 全链路整合优化 | 理论利润率545% |