华龙证券发布的《DeepSeek重塑AI产业格局,助力AI端侧落地》报告指出,DeepSeek-V3作为自研MoE模型,以671B总参数、37B激活参数在14.8T token上完成预训练,多项评测成绩超越Qwen2.5-72B和Llama-3.1-405B等开源模型,性能与GPT-4o及Claude-3.5-Sonnet不分伯仲。训练成本仅266.4万H800 GPU小时,API定价每百万输出tokens仅8元,性价比极为突出。
DeepSeek-V3性能全面领先,比肩全球顶尖闭源模型
DeepSeek-V3在知识类任务、长文本处理、代码、数学和中文能力上均实现显著领先。知识类任务MMLU达88.5%、MMLU-Pro达75.9%,相比前代DeepSeek-V2.5显著提升,接近Claude-3.5-Sonnet-1022。长文本测评中平均表现超越其他模型。算法类代码场景Codeforces达51.6%,远远领先于市面上已有的全部非o1类模型;工程类代码场景SWE-Bench Verified达42%,逼近Claude-3.5-Sonnet-1022。美国数学竞赛AIME 2024达39.2%,全国高中数学联赛CNMO 2024达43.2%,大幅超过所有开源闭源模型。
MoE架构与671B参数打造最强开源基础模型
DeepSeek-V3为自研MoE(Mixture of Experts)模型,总参数达671B,激活参数仅37B,在14.8T token上完成预训练【1†L4-L5】。通过算法和工程上的创新,生成吐字速度从20TPS大幅提高至60TPS,相比V2.5模型实现3倍提升,带来更加流畅的用户使用体验【1†L4-L5】。DeepSeek-V3在继承DeepSeek-V2高效架构的基础上,率先采用无需辅助损失的负载均衡策略,将因鼓励负载均衡导致的性能下降降至最低【2†L5-L6】。
FP8混合精度训练与266万GPU小时成本突破
DeepSeek设计FP8混合精度训练框架,首次在超大规模模型上验证了FP8训练的可行性和有效性【2†L5-L6】。通过算法、框架和硬件的协同设计,克服了跨节点MoE训练中的通信瓶颈,实现了近乎完全的计算与通信重叠【2†L5-L6】。以仅266.4万H800 GPU小时的经济成本,完成了DeepSeek-V3在14.8万亿标记上的预训练,打造了目前最强的开源基础模型【2†L5-L6】。
表1:DeepSeek-V3核心性能指标与对比| 测试集 | DeepSeek-V3 | Qwen2.5 72B | Llama3.1 405B | Claude-3.5-Sonnet |
|---|
| MMLU (EM) | 88.5 | 85.3 | 88.6 | 88.3 |
| MMLU-Pro (EM) | 75.9 | 71.6 | 73.3 | 78.0 |
| Codeforces (Percentile) | 51.6 | 24.8 | 25.3 | 20.3 |
| AIME 2024 (Pass@1) | 39.2 | 23.3 | 23.3 | 16.0 |
| MATH-500 (EM) | 90.2 | 80.0 | 73.8 | 78.4 |
多标记预测(MTP)与推理加速创新
DeepSeek-V3研究了一种多标记预测(Multi-Token Prediction, MTP)目标,证明其对模型性能有益,并可用于推理加速中的推测性解码【2†L5-L6】。MTP目标不仅提升了模型性能,还支持推理加速中的推测性解码【1†L4-L5】。在后训练阶段,DeepSeek引入创新方法,将长链推理(Chain-of-Thought, CoT)模型中的推理能力蒸馏到标准大语言模型中【2†L5-L6】。该模型将R1的验证和反思模式融入DeepSeek-V3,显著提升了推理性能,同时控制了输出风格和长度【2†L5-L6】。
API定价极具性价比,推动AI应用普及
DeepSeek-V3 API服务定价为每百万输入tokens 0.5元(缓存命中)/2元(缓存未命中),每百万输出tokens 8元【1†L4-L5】。在性能上实现显著领先的同时,定价远低于市场上其他同类产品【1†L4-L5】。DeepSeek-R1 API服务定价为每百万输入tokens 1元(缓存命中)/4元(缓存未命中),每百万输出tokens 16元【1†L4-L5】。极低的API调用成本将大幅降低AI应用开发的门槛,推动AI技术在更多场景中的落地与普及。
Meta Description见标题下方。
导语见正文起始。