这一“RL-SFT 数据闭环”本质是自动化能力蒸馏。通过 RL 模型自产数据反哺基座模型,再以增强后的基座模型生成更高阶训练数据,形成“数据质量-模型能力”的螺旋上升。其创新点在于摆脱传统 RLHF 对人类标注的强依赖,通过基座模型(V3)与 RL 模型的动态协同,实现低成本自主进化,为AGI 工程化提供了可复用的技术范式。实验表明,基于 V3 的强化训练使模型自主习得复杂推理能力(如数学解题、代码纠错),在 RL 推理过程中模型自然地发展出了一些复杂的推理行为,如反思和验证,这些行为不是预先编程的,而是模型在训练过程中自发产生的。模型在中间版本中出现”顿悟时刻”(aha moment),它学会了重新评估初始方法,分配更多的思考时间来解决问题。这表明模型可能已经具备了某种程度的“元认知”能力,能够对自身的思维过程进行监控和调整。支撑这些突破的核心是团队开发的 GRPO(Group Relative Policy Optimization)算法框架。这种自我优化的能力展示了 RL 的强大潜力。