返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

DeepSeek模型创新

国金证券2025年2月发布的DeepSeek专题报告指出,DeepSeek-V3/R1系列模型的突破标志着国产大模型技术迈入全球领先行列。V3正式训练成本仅557.6万美元,约为GPT-4预算的1/20;R1在数学、代码、自然语言推理等任务上性能比肩OpenAI o1正式版,但API定价仅为其1/30-1/50。模型架构创新(MLA/FP8/DualPipe)实现了训练成本的极致压缩,Janus-Pro多模态框架在图像生成和理解领域双双超越主流选手。

V3:671B参数仅557万美元训练成本,性价比最优

DeepSeek-V3采用MoE架构,总参数671B(每个token激活37B),在14.8T token上完成预训练。正式训练成本仅557.6万美元(含预训练532.8万、上下文扩展23.8万、后训练1万),约为GPT-4预算6300万美元的1/20,远低于Llama 3.1 405B约5800万美元的训练成本。

性能方面,V3在知识类任务(MMLU达88.5分、MMLU-Pro 75.9分、GPQA 59.1分)接近Claude-3.5-Sonnet-1022;长文本测评、代码生成、数学方面平均表现超过其他模型;中文能力与Qwen2.5-72B相近。API定价为每百万输入tokens 0.1元(缓存命中)/1元(缓存未命中),每百万输出2元,在性能-成本坐标系中处于最优范围。

R1:纯强化学习复现o1推理,成本降一个数量级

DeepSeek-R1是继OpenAI o1之后推理的第二个里程碑。在V3基础模型上通过SFT微调+大规模强化学习训练:SFT阶段使用中间推理模型生成的60万个长思维链推理示例(推理能力已与o1相近)+20万个非推理训练样本,并引入数千条冷启动数据提升可读性;强化学习阶段引入实用性奖励模型和安全性奖励模型,确保输出有效性与安全伦理。

R1在AIME 2024达79.8%(超o1-1217的74.4%)、MATH-500达97.3%(与o1相当)、Codeforces Elo评分2029(超96.3%人类参与者)。API定价为每百万输入tokens 1元(缓存命中)/4元(缓存未命中),每百万输出16元,而OpenAI o1为每百万输入约109元、输出约436元,价差达30-50倍。R1还蒸馏了6个开源小模型(32B/70B在多项能力上对标o1-mini),7B小模型在MATH-500达92.8%。

技术创新的四重压缩:MLA+FP8+DualPipe+负载均衡

DeepSeek通过四重技术创新实现训练成本极致压缩。模型压缩层面:MLA通过Key/Value低秩压缩减少训练内存20-30%,Query低秩压缩降低激活内存占用;FP8混合精度训练在8/16/32位间切换,计算速度提升一倍,精度损失<0.25%。并行计算层面:DualPipe算法减少50%流水线气泡,通信开销隐藏于计算过程中;无辅助损失负载均衡提升训练稳定性,跨节点通信优化支持大规模部署。系统效率的提升使V3生成吐字速度从20TPS提升至60TPS(+200%)。

Janus-Pro:多模态统一的“双头”创新

Janus-Pro是统一多模态理解与生成框架(1.5B和7B),通过双头编码器分别负责理解和创作,成功突破训练瓶颈。规避ImageNet不真实问题,直接使用真实文生图数据训练,训练时间减少40%、生成质量提升35%。在图像生成基准测试中优于DALL-E 3和Stable Diffusion 3 Medium;多模态理解MMBench评分超过此前最佳水平。JanusFlow-1.3B参数量仅1.3B,在视觉理解和生成任务上均超过同规模统一多模态模型。DeepSeek从纯文本大模型向多模态延伸的速度和效果均超预期。
表:DeepSeek模型关键性能与成本对比
模型训练成本推理成本(输出/百万tokens)核心性能
DeepSeek-V3557.6万美元2元MMLU 88.5,对齐GPT-4o
DeepSeek-R1基于V3微调16元AIME 79.8%,比肩o1
GPT-4o约6300万美元约109元行业标杆
Claude 3.5 Sonnet3000-5000万美元约100元代码能力强
点击阅读报告原文: 计算机行业专题研究报告:DeepSeek推动“算力平权”关注端侧AI和Agent投资机会-250207(20页)
相关报告