国信证券AI云深度报告通过多个真实案例验证了开源模型推理效率的经济性。Revolut因成本失控从顶尖闭源模型全面迁移至Token Factory上的Kimi 2.5,三年内用户从3000万增长至7000万。Shopify微调Qwen3-32B后推理速度提升2.2倍、成本下降68%,已承载生产流量。Coinbase形成“开源模型承接常规调用、闭源模型处理复杂任务”的分层架构,AI支出接近减半。Cosine因数据合规要求通过后训练将Llama 3.3 70B调教至OpenAI o3水平。开源模型替代闭源模型的趋势正在加速。
Revolut——成本推动从闭源全面迁移至开源
Revolut是总部位于伦敦的全球金融科技公司,提供基于应用程序的银行与金融服务,涵盖支付、储蓄、投资、外汇及对公账户等业务。三年内用户规模从3000万增长至7000万,年度营收达31亿英镑、净利润7.9亿英镑。AI应用涵盖FinCrime(9个AI Agent月处理200万任务,拦截数百万欺诈交易)和Chat编排(月处理120万工单,80%无人工,即将达到90%)。随着业务规模扩大,Token消耗量暴涨,成本不升反降。挑战已从单纯的模型质量转向编排、评估、可观测性、延迟、可靠性与控制力。Revolut从顶尖闭源模型全面迁移至Token Factory上的Kimi 2.5,通过开源模型替代闭源前沿模型实现了成本结构的根本性改善。
Cosine——数据合规驱动开源模型微调
Cosine是做企业级AI编程Agent的公司,客户是银行/国防/核工业,代码不能出墙,闭源API的黑盒+数据出境在法律和操作上都不被允许。若想用客户数据微调模型行为,但闭源API不开放权重、不支持深度定制。Nebius用Token Factory的后训练能力(Paypray框架+SFT+RL)把Llama 3.3 70B和GPT-OSS-120B调教到OpenAI o3水平的SWE性能,让Cosine能在完全私有环境里交付企业级编程Agent。这展示了开源模型在合规敏感场景中的核心优势——企业可以拥有完整的模型权重,在私有环境中进行微调和部署,无需将敏感数据上传至闭源API。
Shopify——自有数据微调Qwen3-32B,成本降68%
Shopify此前依赖闭源前沿模型为AI电商助手Sidekick生成Shopify Flow自动化流程。随着商户调用规模扩大,通用闭源模型在成本、响应速度及业务适配度方面逐渐受到限制,公司开始尝试以自有数据微调开源模型,提升核心AI功能的成本效率及技术可控性。2026年4月,Shopify基于数千条商户实际创建的自动化流程构建训练数据,将开源模型Qwen3-32B微调为具备工具调用能力的专用Agent。同时将复杂的Flow JSON格式转换为模型更熟悉的Python表达,并建立基于真实商户反馈的周度训练机制,使模型能够持续学习新增业务场景、修正生产环境中的能力缺口。上线后,微调模型相较原闭源前沿模型推理速度提升至2.2倍、成本下降68%,实际效果亦实现超越,已承载Shopify Flow Agent的大部分生产流量。
Coinbase——分层架构使AI支出接近减半
随着内部Token使用量持续增长,Coinbase并未限制工程师使用AI,而是通过统一LLM Gateway优化模型调用结构,将GLM-5.2、Kimi2.7等开放权重模型逐步设为高频日常任务的默认选项,并结合自动模型路由、缓存优化、上下文精简及成本可视化等手段控制整体支出。Coinbase并非全面替换OpenAI、Anthropic等闭源前沿模型,而是形成“低成本开放模型承接大规模常规调用、前沿闭源模型处理复杂任务”的分层架构。实践表明,该策略在Token使用量持续增长的同时,使AI支出下降近50%。开源模型替代闭源模型并非完全替换,而是形成分层架构——开源模型处理70-80%的常规调用,闭源模型保留在需要深度推理、复杂多步推理的少数任务上。
开源模型替代闭源模型案例汇总| 企业 | 替代方案 | 效果 | 驱动因素 |
|---|
| Revolut | Kimi2.5替代闭源前沿模型 | 成本可控,处理规模扩大 | Token成本暴涨 |
| Shopify | 微调Qwen3-32B | 速度2.2倍,成本降68% | 成本+响应速度 |
| Coinbase | GLM-5.2/Kimi2.7分层架构 | AI支出接近减半 | Token使用量增长 |
| Cosine | Llama3.3调教至o3水平 | 私有环境部署 | 数据合规 |