广发证券计算机报告显示,DeepSeek-V3总参数量671B,但通过MoE架构每token仅激活37B参数,预训练仅需266.4万H800 GPU小时,总训练成本约557.6万美元,远低于同规模模型。其采用FP8混合精度训练、DualPipe流水线并行、无辅助损失负载均衡等创新,将算力利用效率推至新高度。本报告拆解DeepSeek-V3的成本构成与技术降本逻辑。
671B参数仅需557万美元:DeepSeek-V3成本拆解
据DeepSeek技术报告,V3在14.8T token上完成预训练,每训练万亿token耗费18万H800 GPU小时。在配备2048块H800的集群上,预训练阶段耗时3.7天,总计266.4万GPU小时;加上上下文扩展11.9万GPU小时和后训练0.5万GPU小时,总训练时间278.8万GPU小时。以H800每小时2美元市价计算,总成本约557.6万美元。相比之下,Llama 3 405B的训练成本据估算约3084万美元,DeepSeek-V3仅为其18%。
这一成本优势主要源自三个方面:一是MoE架构的稀疏激活,总参数671B但每token仅激活37B,计算量大幅缩减;二是FP8混合精度训练框架首次在超大规模模型上验证有效,通过分组量化和提高累积精度减少显存占用和计算量;三是DualPipe算法实现计算与通信重叠,结合InfiniBand和NVLink带宽优化,显著降低跨节点MoE通信瓶颈。
表:DeepSeek-V3训练成本明细| 训练阶段 | H800 GPU小时 | 折合美元(@$2/小时) |
|---|
| 预训练 | 2,664,000 | $5,328,000 |
| 上下文扩展 | 119,000 | $238,000 |
| 后训练 | 5,000 | $10,000 |
| 总计 | 2,788,000 | $5,576,000 |
MoE架构与MLA机制:算法层面的算力节约
DeepSeek-V3沿用了自研的DeepSeekMoE架构,引入256个专家(前代V2为236B总参、21B激活),通过专用和共享专家设计提升稀疏程度。无辅助损失负载均衡策略避免了传统负载均衡对模型性能的负面影响,多token预测(MTP)目标增强了预测效率。MLA(多头潜在注意力)对键值进行低秩联合压缩,大幅降低推理时的KV缓存开销,同时减少训练激活内存,使单卡可承载更大批次。
FP8混合精度与通信优化:硬件效率的工程突破
DeepSeek-V3首次在超大规模模型上验证了FP8训练的可行性,通过细粒度量化策略在保证精度的同时减少显存带宽消耗。DualPipe算法将前向与后向计算重叠,隐藏通信延迟,结合IB和NVLink的高带宽互联,跨节点MoE专家通信不再是瓶颈。这些工程创新使2048卡集群的线性加速比接近理想值,训练时间从数周压缩至数天。
低成本训练验证后,推理成本亦有下降空间
DeepSeek-V3的推理速度从V2.5的20 TPS提升至60 TPS,3倍加速意味着单位推理任务的计算资源消耗大幅降低。尽管API定价较V2有所上调(输入缓存命中0.5元、未命中2元、输出8元/百万tokens),但相对GPT-4o仍具备显著性价比。广发证券认为,该技术路线验证成功后,更多中小团队可效仿,通过算法优化在有限算力下训练高质量模型,行业算力门槛将结构性下移。