返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

开源模型推理效率

国信证券AI云深度报告通过多个真实案例验证了开源模型推理效率的经济性。Revolut因成本失控从顶尖闭源模型全面迁移至Token Factory上的Kimi 2.5,三年内用户从3000万增长至7000万。Shopify微调Qwen3-32B后推理速度提升2.2倍、成本下降68%,已承载生产流量。Coinbase形成“开源模型承接常规调用、闭源模型处理复杂任务”的分层架构,AI支出接近减半。Cosine因数据合规要求通过后训练将Llama 3.3 70B调教至OpenAI o3水平。开源模型替代闭源模型的趋势正在加速。

Revolut——成本推动从闭源全面迁移至开源

Revolut是总部位于伦敦的全球金融科技公司,提供基于应用程序的银行与金融服务,涵盖支付、储蓄、投资、外汇及对公账户等业务。三年内用户规模从3000万增长至7000万,年度营收达31亿英镑、净利润7.9亿英镑。AI应用涵盖FinCrime(9个AI Agent月处理200万任务,拦截数百万欺诈交易)和Chat编排(月处理120万工单,80%无人工,即将达到90%)。随着业务规模扩大,Token消耗量暴涨,成本不升反降。挑战已从单纯的模型质量转向编排、评估、可观测性、延迟、可靠性与控制力。Revolut从顶尖闭源模型全面迁移至Token Factory上的Kimi 2.5,通过开源模型替代闭源前沿模型实现了成本结构的根本性改善。

Cosine——数据合规驱动开源模型微调

Cosine是做企业级AI编程Agent的公司,客户是银行/国防/核工业,代码不能出墙,闭源API的黑盒+数据出境在法律和操作上都不被允许。若想用客户数据微调模型行为,但闭源API不开放权重、不支持深度定制。Nebius用Token Factory的后训练能力(Paypray框架+SFT+RL)把Llama 3.3 70B和GPT-OSS-120B调教到OpenAI o3水平的SWE性能,让Cosine能在完全私有环境里交付企业级编程Agent。这展示了开源模型在合规敏感场景中的核心优势——企业可以拥有完整的模型权重,在私有环境中进行微调和部署,无需将敏感数据上传至闭源API。

Shopify——自有数据微调Qwen3-32B,成本降68%

Shopify此前依赖闭源前沿模型为AI电商助手Sidekick生成Shopify Flow自动化流程。随着商户调用规模扩大,通用闭源模型在成本、响应速度及业务适配度方面逐渐受到限制,公司开始尝试以自有数据微调开源模型,提升核心AI功能的成本效率及技术可控性。2026年4月,Shopify基于数千条商户实际创建的自动化流程构建训练数据,将开源模型Qwen3-32B微调为具备工具调用能力的专用Agent。同时将复杂的Flow JSON格式转换为模型更熟悉的Python表达,并建立基于真实商户反馈的周度训练机制,使模型能够持续学习新增业务场景、修正生产环境中的能力缺口。上线后,微调模型相较原闭源前沿模型推理速度提升至2.2倍、成本下降68%,实际效果亦实现超越,已承载Shopify Flow Agent的大部分生产流量。

Coinbase——分层架构使AI支出接近减半

随着内部Token使用量持续增长,Coinbase并未限制工程师使用AI,而是通过统一LLM Gateway优化模型调用结构,将GLM-5.2、Kimi2.7等开放权重模型逐步设为高频日常任务的默认选项,并结合自动模型路由、缓存优化、上下文精简及成本可视化等手段控制整体支出。Coinbase并非全面替换OpenAI、Anthropic等闭源前沿模型,而是形成“低成本开放模型承接大规模常规调用、前沿闭源模型处理复杂任务”的分层架构。实践表明,该策略在Token使用量持续增长的同时,使AI支出下降近50%。开源模型替代闭源模型并非完全替换,而是形成分层架构——开源模型处理70-80%的常规调用,闭源模型保留在需要深度推理、复杂多步推理的少数任务上。
开源模型替代闭源模型案例汇总
企业替代方案效果驱动因素
RevolutKimi2.5替代闭源前沿模型成本可控,处理规模扩大Token成本暴涨
Shopify微调Qwen3-32B速度2.2倍,成本降68%成本+响应速度
CoinbaseGLM-5.2/Kimi2.7分层架构AI支出接近减半Token使用量增长
CosineLlama3.3调教至o3水平私有环境部署数据合规
点击阅读报告原文: 人工智能行业专题(19):从Nebius看新兴云与开源模型Token优化-260724(36页)
相关报告