华西证券报告指出,DeepSeek通过算法架构、训练方法及开源生态协同的优化,首次实现了大模型性能与成本之间的“剪刀差式突破”。DeepSeek-R1训练费用仅557.6万美元,是GPT-4o的十分之一,API调用成本为OpenAI o1的三十分之一。DeepSeek通过PTX架构优化和FP8精度训练,在算力受限条件下实现了GPU效率最大化。开源生态构建了“开发者越多→模型越好→吸引力越强”的正向循环,正推动AI+消费走向普惠化。
DeepSeek的三大创新,从模型架构到训练方法到开源生态
DeepSeek的创新体现在三个层面。第一,模型架构创新,V3引入MTP(多token预测)机制使同时生成的多个token间产生联系,提高数据利用率;原生采用FP8精度训练,效率是BF16精度的约1.6倍。第二,训练方法创新,R1采用强化学习替代监督学习,让模型自己生成过程并检查结果,证明基础模型能力够强时可自我进化。第三,开源生态创新,DeepSeek不仅开源模型权重,还将核心代码和训练方法悉数公开。
DeepSeek-R1在MATH基准测试达77.5%准确率,与o1的77.3%相近;AIME2024达71.3%超过o1的71.0%;Codeforces评测达2441分,高于96.3%人类参与者。DeepSeek用R1对Llama和Qwen系列开源大模型蒸馏,DeepSeek-R1-Distill-Qwen-32B在AIME 2024测试中达72.6%,超越o1-mini的63.6%。
算力受限下的极致优化,H800 GPU效率最大化
早在2023年底美国商务部就限制A100、A800、H100、H800出口中国。DeepSeek团队在稳定算力极其有限的条件下让V3和R1以很低成本获得比肩OpenAI的性能。DeepSeek仅在两个月内,在2048个H800 GPU集群上测试了6710亿参数的MoE语言模型,效率比其他顶尖AI高10倍。
DeepSeek对H800 GPU进行了重新配置:在132个处理器多核中划分出20个用于服务器间通信,主要用于数据压缩和解压缩,以突破处理器连接限制。DeepSeek还通过额外的细粒度线程调整实现先进流水线算法。这些优化远超常规CUDA开发水平,但维护难度极高。DeepSeek这种级别的优化使得GPU效率最大化、成本大幅降低。
推理成本降至1元/百万tokens,AI应用门槛大幅降低
DeepSeek-R1输入价格仅1元/百万tokens,而初代GPT-4输入价格为30美元/百万tokens。DeepSeek-V3训练成本仅557.6万美元,是GPT-4o的十分之一。随着DeepSeek突破,AI将进一步进入大众市场,推动更多应用场景实现成本效益显著的AI转型。
元宝与微信接入DeepSeek进一步降低使用门槛。2月15日,微信搜索开始灰度测试“AI搜索”功能,接入DeepSeek-R1满血版模型。被灰测用户可在微信搜索框中点击“AI搜索”免费使用。腾讯表示用户对DeepSeek模型的使用热情远超预期。通过与微信等超级应用的深度集成,DeepSeek使AI从专业领域走向大众日常生活。
开源生态带来乘数效应,AI+消费加速普惠
DeepSeek的开源策略形成了“开发者越多→模型越好→吸引力越强”的正向循环。海内外云厂商快速接入DeepSeek并提供MaaS服务,英伟达、亚马逊、微软三大云巨头在1月31日同步上线。国产芯片(昇腾、昆仑芯、寒武纪、飞腾、海光)均完成适配。
DeepSeek的开源也刺激了大模型厂商的开源力度。百度宣布6月30日开源文心大模型4.5;OpenAI考虑加大开源策略;火山引擎开源“大模型应用实验室”。推理成本降低使许多算力密集型场景有了落地可能——AI眼镜、AI玩具、AI教育、AI电商等消费场景正从中受益。AI将从“帮人类查找资料”走向“改变消费行业运行逻辑”。
DeepSeek与主流模型成本对比| 模型 | 训练成本 | API调用价格(输入/百万tokens) | 开源/闭源 |
|---|
| DeepSeek-R1 | 557.6万美元 | 约1元(缓存命中) | 开源(MIT) |
| GPT-4o | 约1亿美元 | 约30美元 | 闭源 |
| OpenAI o1 | — | 约30美元 | 闭源 |