中原证券报告对DeepSeek推理成本进行了详细测算。数据显示,DeepSeek用278台H800服务器(2224张GPU)提供推理服务,日均处理输入Token 6080亿、输出Token 1680亿。按R1价格测算,每日推理服务理论收入56.2万美元,理论毛利率高达84.5%。API调用成本仅为OpenAI o1的三十分之一。DeepSeek通过MLA架构和MoE架构大幅降低算力消耗,为AI应用的规模化落地提供了经济可行性。
DeepSeek推理成本详解,理论毛利率高达84.5%
根据DeepSeek在3月1日发布的《DeepSeek-V3/R1推理系统概览》,其线上系统实际统计数据揭示了原厂在性能优化后提供MaaS服务的真实盈利水平。
在硬件配置方面,DeepSeek用278台H800服务器提供推理服务,对应GPU数量2224张。由于夜间需求减少,DeepSeek会减少推理节点,用剩余算力满足研究和训练需求,平均占用GPU数量为1814张,这一数量远低于市场预期。大约在每日9点到24点时段所有节点提供推理服务,低谷阶段仍有约四分之一节点提供推理。
在业务数据方面,日输入Token为6080亿(其中缓存命中3420亿,命中率56.25%),日输出Token为1680亿。每节点平均输入吞吐量73.7k tokens/s,平均输出吞吐量14.8k tokens/s。并发请求数约8.8-9.7万次/秒,平均输出速度20-22 tps。
在财务数据方面,按R1价格(缓存命中0.14美元/百万token,缓存未命中0.55美元/百万token,输出2.19美元/百万token)测算,每日推理服务理论收入56.2万美元。日成本方面,H800租赁成本按2美元/卡/小时计算,日成本8.7万美元。理论毛利率高达84.5%。
DeepSeek与OpenAI成本对比,效率差距悬殊
2024年10月TheInformation报道,根据OpenAI财务文件,预计2023年到2028年OpenAI将蒙受440亿美元损失,其中2024年损失50亿美元,到2026年年度损失可能高达140亿美元,到2029年或才能扭亏为盈。
对比来看,DeepSeek凭借强大的成本控制能力,已可实现MaaS服务盈利,理论毛利率高达84.5%。OpenAI推理成本约占总成本的27%,而DeepSeek通过MLA和MoE架构将推理成本降至闭源模型的数十分之一。
在模型训练成本方面,DeepSeek-V3仅用278.8万GPU小时完成训练,而Grok-3累计训练时长达2亿GPU小时,是DeepSeek-V3的约72倍。但DeepSeek-V3在ChatbotArena等评测中成绩比肩GPT-4o,证明了精细化训练路径的有效性。
算力节省的关键技术解析
DeepSeek实现算力节省的两个关键点来自模型架构创新。一是多头潜注意力机制,通过对传统多头注意力机制的改进,将低秩近似方法引入键值缓存压缩,贡献约2-4倍计算效率提升。二是DeepSeekMoE架构,V3总参数6710亿,但每个Token仅激活370亿参数,贡献4倍以上计算效率提升,通过无辅助损失的负载平衡策略提高训练稳定性。
在训练架构层面,DeepSeek展现出强大的软硬协同优化能力。FP8混合精度训练框架使其成为首个成功使用FP8训练超大规模模型的公司,将大多数计算密集型操作在FP8中进行,关键操作保持原有数据格式,兼顾训练效率和稳定性。DualPipe算法实现高效的流水线并行,通过计算和通信重叠隐藏大部分通信开销。跨节点All-to-All通信内核使用PTX编程,充分利用InfiniBand和NVLink带宽,无需张量并行即可完成训练。
DeepSeek推理服务日运营数据测算| 指标 | 数值 |
|---|
| 推理服务服务器总数 | 278台(8×H800/台) |
| 平均占用GPU数量 | 1814张 |
| 日输入Token | 6080亿(缓存命中56.25%) |
| 日输出Token | 1680亿 |
| 日推理服务理论收入 | 56.2万美元 |
| 日推理服务成本 | 8.7万美元 |
| 理论毛利率 | 84.5% |
推理成本下降对AI应用爆发的意义
DeepSeek高达84.5%的理论毛利率成为MaaS服务的效率标杆,将吸引更多厂商加大在DeepSeek相关服务的投入。虽然大模型推理成本在下降,但由此带来的应用爆发有望催生更多需求,成为下一阶段拉动算力增长的主要驱动力。
从模型单次调用到Agent通过一系列调用产生结果,服务请求密度将几何级增长;从App搜索提问到手机终端日常调用,模型调用需求在种类和频次上将获得极大提升。2025年中国科技圈DeepSeek、QwQ到Manus等亮点频现,正在完成从量变到质变的过程。