返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

s1-32B模型分析

财通证券报告深入分析了s1-32B模型的技术架构与创新机制。s1-32B的核心突破在于“预算强制”策略——通过在测试阶段精确控制模型思考token的最大和最小数量,实现测试时计算量与推理性能的正向缩放。在AIME24测试中,该策略使准确率从50%提升至57%。研究还发现顺序缩放策略效果远优于并行缩放,为推理模型优化提供了明确方向。财通证券认为测试时缩放范式正在成为AI模型性能提升的新核心驱动力。

测试时缩放——从训练计算向推理计算的范式转移

当前语言模型性能提升主要依赖训练阶段大规模计算投入,而“测试时缩放”作为新兴范式,通过增加测试阶段计算量增强模型性能。OpenAI o1即为典型案例,但其技术细节未公开,学界多次复现失败。李飞飞团队发布的s1论文聚焦于探索实现测试时缩放的最优路径,并发现s1-32B准确率随平均思考时间增加而提高,验证了测试时缩放的有效性。财通证券指出,测试时缩放范式将推动行业从“盲目扩大训练算力”转向“优化推理计算分配”,为算力投资逻辑带来结构性变化。

预算强制策略的实现机制——最大与最小token的双向控制

预算强制策略通过双向控制实现精确的测试时计算管理。当模型生成的思考token数达到或超过设定的最大限制时,自动添加结束思考令牌分隔符,促使模型在合理时间内输出当前最佳答案。当希望模型深入思考时,抑制结束思考令牌的生成并添加“Wait”字符串,鼓励模型对当前推理进行反思和改进。这种方法有效解决了推理模型的两个核心痛点:推理时间不可控和过早停止导致错误。财通证券认为,预算强制本质上是将训练阶段的“监督信号”后置到测试阶段,通过外部干预引导模型自我修正,代表了推理优化思路的根本性转变。

顺序缩放优于并行缩放——推理时间连续性的重要性

s1团队对比了顺序和并行两种测试时缩放策略。顺序缩放(预算强制)在AIME24中展现出明显的缩放趋势且可进行一定程度外推,准确率从50%升至57%。并行缩放虽整体也呈现一定准确率提升趋势,但相比顺序缩放提升幅度较小且在输出tokens数量增加时趋于平稳。这一发现表明:推理能力的提升不仅依赖于计算量增加,更依赖于推理过程的连续性和有序性——让模型沿着一条思考路径持续深入,比让模型并行探索多条路径更有效。财通证券认为,这一结论对推理模型的工程设计具有直接指导意义,顺序缩放策略应成为当前推理优化的优先选择。

蒸馏数据的质量维度——Gemini API生成的推理痕迹价值

s1K数据集中的推理痕迹和解决方案均通过Google Gemini Flash Thinking API生成,而非人工标注。这种方法被验证有效的前提是:Gemini自身具备较强的推理能力,能够生成高质量的推理链。研究团队从59,029个初始三元组中通过质量、难度、多样性三重筛选最终获得1,000个样本。其中质量筛选的关键在于剔除含格式问题的低质量推理痕迹,难度筛选的关键在于选择两个Qwen模型都无法正确解答的问题,多样性筛选的关键在于覆盖50个不同的数学领域。财通证券认为,蒸馏数据的质量远重于数量,s1的成功证明了高质量推理链作为训练信号的价值,这一发现将对AI数据工程方法论产生广泛影响。
表2:s1-32B预算强制策略核心机制与效果
策略组件技术细节效果
最大token控制达到设定上限时自动添加结束令牌防止推理无限延长,控制响应时间
最小token控制抑制结束令牌并添加“Wait”强制模型继续思考,激活自我修正
顺序缩放沿单一思考路径延长推理时间AIME24准确率从50%升至57%
并行缩放同时探索多条推理路径提升幅度较小,趋于平稳
数据蒸馏Gemini Flash Thinking API生成推理痕迹低成本获取高质量推理链
点击阅读报告原文: 计算机行业:s1和LIMO带来的产业启示-250208(15页)
相关报告