Scaling Law并未失效,而是正在向后训练和推理阶段转移。财通证券研报显示,o3模型在FrontierMath基准测试中将准确率从<2%提升至25.2%,证明了推理阶段Scaling Law的巨大潜力。DeepSeek-R1-Zero成为首个完全摒弃监督微调、完全依赖强化学习训练的大模型,AIME 2024成绩随RL训练持续提升。强化学习与测试时间缩放正在成为Scaling Law的新方向,AI产业正从“更大模型”转向“更聪明模型”的探索。
Scaling Law向后训练和推理阶段转移
英伟达CEO黄仁勋在CES 2025提出大模型三阶段框架:预训练、后训练和推理。此前业界讨论的Scaling Law主要指向预训练阶段——随着计算量、数据和参数增加模型性能幂律提升。OpenAI o1模型的推出带来LLM推理能力的重大飞跃,让研究者关注到新阶段同样存在Scaling Law。
OpenAI的公开课提出,不同任务的觉醒时间不同,存在快慢之分。部分任务对于高质量数据或算法的需求更高,但这并不意味着Scaling Law失效。Scaling Law更像指数衰减——随着时间的推移,研发人员将不得不更加努力才能获得进一步性能提升,这是Scaling Law的自然特征。
o3模型在Epoch AI FrontierMath基准测试中展现出突破性表现。所有现有产品在该测试中准确率均低于2%,而o3在激进测试时间设置下能达到25.2%的准确率。o3相较o1的巨大提升证明推理阶段Scaling Law仍有充足空间,LLM推理能力存在巨大的待挖掘潜力。
AI三阶段Scaling Law对比| 阶段 | 核心变量 | Scaling Law表现 | 代表模型 |
|---|
| 预训练 | 计算量、数据量、参数规模 | 边际放缓 | GPT-4 |
| 后训练 | 强化学习训练时间 | 持续提升 | DeepSeek-R1-Zero |
| 推理 | 测试时间计算(思考时间) | 巨大潜力 | o3(FrontierMath 25.2%) |
DeepSeek-R1-Zero:纯强化学习训练验证新路径
DeepSeek-R1-Zero在技术路线上实现了突破性创新,成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。传统上,SFT作为大模型训练的核心环节,需要先通过人工标注数据进行监督训练,再结合强化学习优化。DeepSeek-R1-Zero创新性地采用纯强化学习训练框架,以DeepSeek-V3-Base为基础,通过群组相对策略优化算法实现训练效率与模型性能的双重提升。
随着RL训练推进,DeepSeek-R1-Zero的AIME 2024基准测试成绩稳定且持续提升。这证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,验证了后训练阶段强化学习Scaling Law的有效性。
DeepSeek团队进一步探索了将R1推理能力蒸馏到更小模型中的潜力。利用DeepSeek-R1生成的800K数据对Qwen和Llama系列小模型进行微调,发现经R1蒸馏的Qwen-32B在AIME 2024达72.6%,远超直接强化学习的版本(47.0%)。对小模型而言,蒸馏优于直接强化学习,大模型学到的推理模式在蒸馏中得到了有效传递。
测试时间缩放:s1-32B以50美元成本验证新范式
斯坦福大学与华盛顿大学联合研究团队在李飞飞带领下,成功以低于50美元的训练成本开发出高性能AI推理模型s1-32B。团队运用“测试时缩放”技术,选择开源预训练模型Qwen2.5-32B-Instruct作为基座模型,使用仅1000个样本的蒸馏数据进行监督微调,最终获得s1-32B模型。
同日,上海交大团队提出LIMO“少即是多”观点,认为大模型的推理能力本质上是“潜伏”于预训练模型中的,关键在于如何通过精确的认知模板来“激活”这些内在能力。LIMO直接挑战了“监督式微调主要导致记忆而非泛化”的传统观点,证明高质量、小规模的数据远比低效的海量数据训练更能激发LLM的真正推理能力。
s1-32B与LIMO的共同启示:利用高质量数据集微调预训练模型,在小样本条件下可实现高性能的模型推理能力。研究重点正从“更多数据”转向“更高质量数据”和“更聪明的训练方法”,这是Scaling Law新范式探索的核心方向。