DeepSeek R1的发布在全球科技行业引发“DeepSeek Shock”,其核心价值在于验证了通过技术创新可以以更低的硬件成本和更短的时间成本实现市场领先性能的新路径。MoE(专家混合模型)与MLA(元学习算法)两大技术突破,使DeepSeek-V3训练成本仅558万美元,为GPT-4o的约二十分之一。金元证券认为,DeepSeek的成功打破了中国AI产业发展困境,适配16家国产芯片,国产供应链迎来价值重估。
MoE技术突破:动态专家选择+稀疏专家激活
DeepSeek在MoE(Mixture of Experts)上的突破主要体现在三方面。动态专家选择:传统MoE每次推理调用多个专家,DeepSeek实现更智能的选择机制,仅选择最相关专家计算,降低计算开销。稀疏专家激活:通过稀疏激活技术(每次输入只激活少数专家),大幅减少计算资源消耗,不增加计算负担下处理更多复杂任务。专家权重调整:使某些专家在不同数据场景下更加突出,提高模型适应性和泛化能力。总参数量671B,每次处理激活37B参数。
MLA元学习算法:快速适应+自我优化
MLA(Meta Learning Algorithm)是“学习的学习”,使模型能从多个任务中学习并优化学习策略。任务适应性:从少量样本中学习并快速适应新任务;优化策略:开发新的元优化算法,模型在学习过程中自我调整、自动选择最优策略;快速迁移和泛化:从已学习任务迁移知识快速应用于新任务,无需大量训练数据。MoE与MLA结合后,在多任务学习和大规模数据集上表现出极大优势。
成本优势颠覆行业认知,训练成本仅558万美元
DeepSeek-V3完整训练仅需2.788M H800 GPU小时,按2美元/小时计算仅558万美元。预训练占95.5%(532.8万美元),上下文扩展占4.3%(23.8万美元),后训练占0.2%(1万美元)。实际总成本超4000万美元(含前期研发、试错成本),单位token成本约$260/M,而Llama3-405B约2.5亿美元(成本效能比3.2倍),GPT-4o推测超1亿美元(成本效能比超21倍)。DeepSeek成本效能比大幅领先。
适配16家国产芯片,国产供应链迎价值重估
截至2月7日,华为昇腾、沐曦、天数智芯、摩尔线程、海光信息、壁仞科技等16家国产AI芯片企业相继宣布适配或上架DeepSeek模型服务。华为云、腾讯云、阿里云等10家云计算巨头和至少12家独立云及智算企业宣布支持DeepSeek。DeepSeek和国产算力芯片的适配不仅给予我国AI发展弯道超车机会,也将进一步提升我国半导体制造产业链天花板。AI产业步入良性循环,迎来国产供应链的价值重估。
表:DeepSeek-V3与同类模型成本对比| 模型 | 参数规模 | 实际成本 | 单位token成本 | 成本效能比 |
|---|
| DeepSeek-V3 | 671B | >4000万美元 | 约$260/M | 1x |
| Llama3-405B | 405B | 约2.5亿美元 | 约$833/M | 3.2x |
| GPT-4o | ~1.8T | 推测>1亿美元 | >$5400/M | >21x |