返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

大模型推理成本下降趋势

大模型推理成本正以惊人的速度下降,为AI应用层的繁荣扫清成本障碍。国元证券2025年AI行业深度报告指出,OpenAI GPT-4o输入输出价格较GPT-4-Turbo再降75%/67%,GPT-4o mini降至0.15/0.6美元/1M tokens。国内模型降价更为激进——阿里Qwen-Long API输入价格降至0.0005元/千tokens(降幅97%),现阶段国内模型价格普遍仅为OpenAI的20%-50%。推理成本的指数级下降直接催化了应用端创新:2024年1-11月国内大模型中标项目达1144个,11月单月披露金额10.62亿元创历史新高。成本下行与能力向上的剪刀差,正在打开AI应用百花齐放的时代窗口。

海外推理成本——从GPT-4到GPT-4o的75%降幅

海外大模型推理成本在2024年经历了多轮大幅下调。4月,OpenAI将GPT-4升级至GPT-4-Turbo,输入输出价格分别下降67%和50%;5月13日发布GPT-4o,模型性能全面升级但输入输出价格较Turbo再降75%和67%;7月18日推出轻量级模型GPT-4o mini,输入输出价格进一步降至0.15和0.6美元/1M tokens。Anthropic同步跟进降价,Claude系列调用成本同样大幅下移。

国元证券报告指出,推理成本的下降并非简单的价格竞争,而是模型效率提升和架构优化的结果。GPT-4o作为原生多模态模型,在推理效率上较GPT-4-Turbo有显著提升;GPT-4o mini则通过更小的参数量在保持接近旗舰模型能力的同时大幅降低推理成本。这一趋势有望在2025年延续——随着o系列推理模型架构的成熟和工程优化的深入,推理成本仍有进一步下降空间,为应用开发者提供更宽松的成本预算。

国内推理成本——仅为OpenAI的20%-50%,降价更激进

国内大模型厂商的降价幅度更为激进。5月21日,阿里云宣布通义千问9款商业化及开源系列模型降价,主力模型Qwen-Long API输入价格降至0.0005元/千tokens,降幅达97%。9月19日,阿里云在云栖大会上宣布通义千问三款主力模型再降价。百度、腾讯、字节跳动等互联网大厂同样跟进降价策略,国内大模型API调用价格进入“厘时代”。

国元证券统计显示,现阶段国内模型价格普遍仅为OpenAI的20%-50%。这意味着在同等推理效果下,国内开发者的推理成本仅为海外开发者的五分之一到一半。更低的成本门槛有望带来两个直接效应:存量应用的推理成本大幅降低提升毛利空间;增量应用的探索门槛显著下降,更多开发者和创业团队可以“试错”式创新。国内AI应用生态有望在低成本驱动下加速繁荣。

成本下降催化中标项目爆发——1-11月1144个项目验证需求

推理成本下降的直接结果是AI应用需求的释放。根据智能超参数公众号统计,2024年11月公开渠道统计到大模型相关中标项目301个,披露金额约10.62亿元,创2024年以来单月新高。1-11月累计中标项目达1144个,全年超千个项目标志着大模型从“概念验证”进入“规模化落地”阶段。

行业分布上,前三季度项目数量排名前五的行业为教科(157个,占24%)、通信(150个,23%)、能源(83个,12.7%)、金融(66个,10.1%)、政务(62个,9.5%)。按金额计,技术服务(5.43亿元)、政务(4.84亿元)、能源(3.10亿元)、通信(2.00亿元)、教科(1.98亿元)排名前五。中标企业方面,科大讯飞、百度、智谱AI、腾讯云、阿里云、火山引擎表现领先。国元证券报告认为,B端大模型投入预算有望持续提升,企业主对大模型投入ROI日益重视,大模型在企业端的落地正从“锦上添花”转向“降本增效”的刚性需求。
表1:大模型推理成本下降关键数据对比
模型/事件时间价格变化降幅
GPT-4 → GPT-4-Turbo2024年4月输入-67%/输出-50%大幅下降
GPT-4-Turbo → GPT-4o2024年5月输入-75%/输出-67%进一步下降
GPT-4o → GPT-4o mini2024年7月0.15/0.6美元/1M tokens降至新低
阿里Qwen-Long2024年5月0.0005元/千tokens-97%
国内模型价格 vs OpenAI2024年仅为OpenAI的20%-50%
国内大模型中标项目1-11月1144个项目11月单月301个
点击阅读报告原文: AI行业深度报告:模型能力向上价格向下应用繁荣-241231(30页)
相关报告