返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

DeepSeek开源周

2025年2月24日至3月1日,DeepSeek以“完全公开透明”的方式开源5个经过生产验证的代码库,从注意力机制、通信库、矩阵计算、并行优化到数据存储系统,全面展示了其极致压榨算卡性能的工程能力。中泰证券认为,DeepSeek开源周标志着中国AI从技术追随者迈向开源引领者,其工程优化成果不仅验证了从算法到商业的全链路突破,更将通过云厂商部署、私有云部署与端侧部署三类模式加速AI全场景渗透。

FlashMLA:Hopper架构解码性能提升8倍

Day1发布的FlashMLA解码内核专为Hopper架构H800 GPU优化,基于多层注意力机制(MLA)并行化设计,实测达3000GB/s内存带宽与580TFLOPS算力,计算速度达行业平均8倍,内存带宽超H800原生1681GB/s峰值。该技术使单卡推理效率大幅提升,支撑高并发实时生成任务,为AI规模化应用降低算力瓶颈。其通过重构内存带宽利用与并行计算逻辑,突破硬件理论性能上限,在同等任务量下大幅减少GPU服务器需求,实现降本增效。

DeepEP:全球首个MoE专用通信库

Day2发布的DeepEP是全球首个MoE(混合专家)模型专用通信库,深度融合NVLink与RDMA技术,节点内GPU采用NVLink直连(150GB/s带宽),跨节点通过RDMA网络构建直达通道,节点间通信延迟降至微秒级。“专家小组分工”机制按任务类型动态分组GPU资源,配合FP8调度与计算-通信重叠策略,填补了分布式训练工具链空白。

DeepGEMM:300行代码实现1350TFLOPS

Day3开源的DeepGEMM以仅300行核心代码实现FP8精度通用矩阵运算,JIT编译动态适配Hopper张量核心,峰值算力达1350TFLOPS。采用CUDA核心两级累加策略控制误差——先以FP8快速执行批量乘法,再以FP32高精度累加校正。轻量化设计验证FP8商用可行性,为边缘AI、低耗训练提供标准化工具。

DualPipe+EPLB+3FS:训练与数据基础设施全面开源

Day4开源DualPipe双向流水线并行算法(前向/反向计算100%重叠)与EPLB负载均衡器(动态平衡MoE专家负载),V3模型预训练仅耗278.8万H800 GPU小时(成本557万美元)。Day5开源3FS并行文件系统,180节点集群读取吞吐量达6.6TiB/s,单客户端KVCache查询峰值40+GiB/s,配合Smallpond分布式排序方案110.5TiB数据排序耗时30分14秒(3.66TiB/分钟)。
表:DeepSeek开源周5天核心内容
Day项目核心指标技术意义
Day1FlashMLA3000GB/s带宽、580TFLOPSHopper架构解码8倍效率
Day2DeepEP微秒级通信延迟全球首个MoE专用通信库
Day3DeepGEMM1350TFLOPS、300行代码FP8矩阵计算轻量化
Day4DualPipe/EPLB100%计算-通信重叠V3训练成本557万美元
Day53FS/Smallpond6.6TiB/s吞吐110.5TiB排序30分钟
点击阅读报告原文: 计算机行业:DeepSeek开启盈利新时代!关注应用、云厂及国产算力、数据库投资机遇-250303(16页)
相关报告