2025年2月24日至3月1日,DeepSeek以“完全公开透明”的方式开源5个经过生产验证的代码库,从注意力机制、通信库、矩阵计算、并行优化到数据存储系统,全面展示了其极致压榨算卡性能的工程能力。中泰证券认为,DeepSeek开源周标志着中国AI从技术追随者迈向开源引领者,其工程优化成果不仅验证了从算法到商业的全链路突破,更将通过云厂商部署、私有云部署与端侧部署三类模式加速AI全场景渗透。
FlashMLA:Hopper架构解码性能提升8倍
Day1发布的FlashMLA解码内核专为Hopper架构H800 GPU优化,基于多层注意力机制(MLA)并行化设计,实测达3000GB/s内存带宽与580TFLOPS算力,计算速度达行业平均8倍,内存带宽超H800原生1681GB/s峰值。该技术使单卡推理效率大幅提升,支撑高并发实时生成任务,为AI规模化应用降低算力瓶颈。其通过重构内存带宽利用与并行计算逻辑,突破硬件理论性能上限,在同等任务量下大幅减少GPU服务器需求,实现降本增效。
DeepEP:全球首个MoE专用通信库
Day2发布的DeepEP是全球首个MoE(混合专家)模型专用通信库,深度融合NVLink与RDMA技术,节点内GPU采用NVLink直连(150GB/s带宽),跨节点通过RDMA网络构建直达通道,节点间通信延迟降至微秒级。“专家小组分工”机制按任务类型动态分组GPU资源,配合FP8调度与计算-通信重叠策略,填补了分布式训练工具链空白。
DeepGEMM:300行代码实现1350TFLOPS
Day3开源的DeepGEMM以仅300行核心代码实现FP8精度通用矩阵运算,JIT编译动态适配Hopper张量核心,峰值算力达1350TFLOPS。采用CUDA核心两级累加策略控制误差——先以FP8快速执行批量乘法,再以FP32高精度累加校正。轻量化设计验证FP8商用可行性,为边缘AI、低耗训练提供标准化工具。
DualPipe+EPLB+3FS:训练与数据基础设施全面开源
Day4开源DualPipe双向流水线并行算法(前向/反向计算100%重叠)与EPLB负载均衡器(动态平衡MoE专家负载),V3模型预训练仅耗278.8万H800 GPU小时(成本557万美元)。Day5开源3FS并行文件系统,180节点集群读取吞吐量达6.6TiB/s,单客户端KVCache查询峰值40+GiB/s,配合Smallpond分布式排序方案110.5TiB数据排序耗时30分14秒(3.66TiB/分钟)。
表:DeepSeek开源周5天核心内容| Day | 项目 | 核心指标 | 技术意义 |
|---|
| Day1 | FlashMLA | 3000GB/s带宽、580TFLOPS | Hopper架构解码8倍效率 |
| Day2 | DeepEP | 微秒级通信延迟 | 全球首个MoE专用通信库 |
| Day3 | DeepGEMM | 1350TFLOPS、300行代码 | FP8矩阵计算轻量化 |
| Day4 | DualPipe/EPLB | 100%计算-通信重叠 | V3训练成本557万美元 |
| Day5 | 3FS/Smallpond | 6.6TiB/s吞吐 | 110.5TiB排序30分钟 |