2025年1月,DeepSeek-R1的发布在全球AI界引发震动——这款由中国初创公司深度求索开发的开源大模型,在数学、代码、自然语言推理等任务上性能比肩OpenAI-o1正式版,而训练成本仅为国际领先模型的数十分之一。国信证券研报指出,DeepSeek通过多头潜在注意力(MLA)、DeepSeekMoE架构及FP8混合精度训练等技术创新,实现了高效的推理和低成本训练,正在重塑开源大模型的技术与生态格局。
DeepSeek模型迭代与技术架构创新
DeepSeek公司成立于2023年7月,是一家致力于实现通用人工智能(AGI)的创新型科技公司。2024年12月,DeepSeek-V3发布,性能对齐海外领军闭源模型。2025年1月,DeepSeek-R1发布,性能对标OpenAI-o1正式版。2月1日,DeepSeek人工智能助手在140个市场下载量排行榜名列前茅。
DeepSeek-V3以Transformer框架为基石,创新性地融入多头潜在注意力(MLA)和DeepSeekMoE架构。MLA通过低秩联合压缩技术,大幅削减注意力键和值的存储空间,仅需缓存压缩后的潜在向量,显著降低内存需求。DeepSeekMoE架构采用更精细粒度的专家设置,将部分专家设定为共享专家,由共享专家处理所有token的基础输入,路由专家依据亲和度分数决定是否激活,实现资源的高效灵活调配。
低成本训练的核心技术路径
DeepSeek-V3的训练总成本仅为557.6万美元,对比GPT-4o等模型的训练成本约1亿美元,成本优势超过一个数量级。这一突破得益于三大技术创新:
对跨节点的全对全通信机制进行优化,充分利用InfiniBand和NVLink提供的高带宽。DeepSeek-V3在拥有2048个NVIDIA H800 GPU的大规模集群上训练,每个节点配置8个GPU,通过NVLink与NVSwitch实现内部高速互联。
创新性提出DualPipe算法,通过优化计算与通信的重叠,有效减少了流水线中的空闲时间。针对跨节点专家并行引入的通信开销,DualPipe采用双向管道并行方法,在独立的前向和后向处理块中实现了计算与通信的重叠,加速训练过程并降低气泡效应。
采用FP8混合精度训练技术,不仅极大加快训练速度,还大幅降低GPU内存消耗。开发人员构建了适用于FP8训练的混合精度框架,大部分计算密集型任务以FP8精度执行,关键操作保持原有精度,确保数值稳定性和训练效率之间的平衡。
DeepSeek-R1的强化学习突破
DeepSeek-R1在后训练阶段大规模使用强化学习技术,在仅有极少标注数据的情况下,极大提升了模型推理能力。R1-Zero版本突破性地采用强化学习方法,未经传统监督式微调即达成卓越性能,在特定任务基准测试中实现对OpenAI-o1的超越。
核心技术创新体现在三个维度:训练效能优化策略——创新性采用GRPO(群体相对策略优化)算法,通过群体反馈数据分析替代独立评估模型,有效降低计算资源消耗;双维度评价体系——建立“准确性验证+格式规范”的复合奖励机制,前者通过数学符号解析与代码编译测试进行精确度验证,后者要求模型将推理过程严格置于结构化标签内;结构化训练范式——设计标准化指令模板,分离推理过程与最终结论,保证知识表达清晰度的同时保留内容创作自主性。
DeepSeek-R1采用分阶段强化学习架构演进:冷启动阶段通过少量高质量思维链示范数据初始化模型;面向推理的强化学习引入语言一致性奖励;拒绝采样与监督式微调提升通用能力;全场景强化学习平衡推理能力和通用能力。
全球部署与生态影响
国外大型科技公司已率先上线部署DeepSeek-R1模型。1月30日,微软宣布DeepSeek-R1已在Azure AI Foundry和GitHub上提供。1月31日,英伟达宣布DeepSeek-R1作为NVIDIA NIM微服务预览版发布;同日亚马逊宣布可在Amazon Bedrock和Amazon SageMaker AI中部署DeepSeek-R1。
2月1日,硅基流动和华为云团队联合首发并上线基于华为云昇腾云服务的DeepSeek-R1/V3推理服务。该服务具备自研推理加速引擎加持,可获得持平全球高端GPU部署模型的效果,提供稳定的生产级服务能力。
DeepSeek API采用开创性硬盘缓存技术实现价格指数级下降。对于输入内容长且重复部分多的请求,首token延迟从13秒锐减至500毫秒,最高可节省90%费用。DeepSeek可能是全球首家在API服务中大规模应用硬盘缓存的大模型厂商,得益于MLA结构极大压缩了上下文KV Cache大小。
表:DeepSeek模型性能与成本对比| 模型 | 发布时间 | 训练成本 | AIME 2024 | MATH-500 |
|---|
| DeepSeek-V3 | 2024年12月 | 557.6万美元 | — | — |
| DeepSeek-R1 | 2025年1月 | — | 79.8% | 97.3% |
| OpenAI-o1-mini | 2024年9月 | 约1亿美元 | 63.6% | 90.0% |
| GPT-4o | 2024年5月 | 约1亿美元 | 13.4% | 74.6% |