返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

2026年AI训练成本趋势

财通证券计算机行业报告指出,斯坦福大学李飞飞团队以低于50美元的训练成本开发出高性能AI推理模型s1-32B,在数学推理和编程测试中与OpenAI o1及DeepSeek R1性能相当。训练仅用16块英伟达H100 GPU进行26分钟,基于Qwen2.5-32B-Instruct基座模型和1000条高质量数据。这一突破性成果揭示了高性价比AI开发路径的可能性,正在深刻改变行业对算力投入与模型性能之间关系的认知。

s1-32B——50美元训练成本背后的技术突破

2025年2月5日,TechCrunch报道了斯坦福大学与华盛顿大学联合研究团队在李飞飞带领下开发的s1-32B推理模型。研究团队选择开源预训练模型Qwen2.5-32B-Instruct作为基座,使用包含1000个样本的s1K数据集进行监督微调,训练过程仅用16块英伟达H100 GPU进行26分钟。据论文通讯作者Niklas Muennighoff估算,按云计算市场价复现s1模型仅需约20美元。s1-32B在竞赛数学问题(MATH和AIME24)上的表现比o1-preview高出多达27%,在AIME24测试中准确率从50%提升至57%。财通证券认为,这一成果证明了高效能AI模型开发路径的可行性,将对行业算力投资逻辑产生深远影响。

s1K数据集构建——从59,029个样本到1,000个精华的三重筛选

s1-32B的成功离不开s1K高质量数据集的构建。研究团队从16个不同来源收集59,029个样本,利用Google Gemini Flash Thinking API为每个问题生成推理痕迹和解决方案,获得问题、推理痕迹、解决方案三元组。随后进行三重筛选:质量筛选——去除API错误和低质量样本(含格式问题字符串),从59,029个降至51,581个;难度筛选——用Qwen2.5-7B和Qwen2.5-32B评估,去除两个模型都能正确解决的问题,降至24,496个;多样性筛选——按数学学科分类,从所有领域随机均匀选样,最终获得1,000个涵盖50个不同领域的样本。财通证券认为,高质量数据集是模型训练的基石,s1K蕴含的丰富推理信息为Qwen2.5-32B-Instruct的微调提供了有力支撑,验证了“小样本高质量数据”路线的可行性。

预算强制策略——用“等待”激活模型自我修正能力

预算强制是s1-32B实现测试时缩放的核心策略。当模型生成的思考token数达到设定的最大限制时,自动添加结束思考令牌分隔符,促使模型输出当前最佳答案;当希望模型投入更多计算量深入思考时,抑制结束思考令牌的生成,并添加“Wait”字符串,鼓励模型对当前推理进行反思和改进。在实际案例中,s1-32B在计算过程中试图过早结束时被强制加入“Wait”,随后自我纠正了错误答案并给出正确结论。这一策略有效优化了测试时计算效率,使模型能在更短时间内完成复杂推理任务且保持高准确性。财通证券指出,预算强制策略的本质是通过测试阶段的“思考引导”弥补训练阶段数据量的不足,为低成本模型追赶大型模型提供了方法论支撑。

开源基座模型的不可替代性——Qwen2.5-32B-Instruct的基石作用

s1-32B的成功充分证明了强大开源基座模型的重要性。Qwen2.5-32B-Instruct在代码能力上表现卓越,多个代码生成基准测试中成绩突出,甚至超越部分闭源模型。其开源特性使得研究团队可自由改进和优化,在基座基础上使用s1K数据集进行监督微调和预算强制,成功获得s1-32B。若没有Qwen2.5-32B的强劲性能作为前提,s1K数据集的优势也无法充分释放。财通证券认为,基座模型能力的持续提升将反向推动各类研究和产业应用的繁荣,我们在看到s1-32B带来高性价比路径的同时,不可忽视基座模型能力上的前期投入,AI产业的长期发展依然离不开大算力支撑。
表1:s1-32B模型训练成本与性能核心数据
指标数据/描述对比基准
训练成本约20-50美元(云计算租赁)OpenAI o1训练成本预估数千万美元
训练时长26分钟(16块H100 GPU)-
基座模型Qwen2.5-32B-Instruct开源模型
训练数据量1,000个样本(s1K数据集)传统模型通常需数十万至百万级样本
数据来源16个来源,从59,029个样本中筛选-
AIME24准确率57%(预算强制后提升27%)o1-preview约44.6%
核心创新预算强制策略(测试时缩放)-
点击阅读报告原文: 计算机行业:s1和LIMO带来的产业启示-250208(15页)
相关报告