DeepSeek-R1-Zero 采用组相对策略优化(GRPO)算法进行强化学习。DeepSeek-R1-Zero以 DeepSeek-V3为基础模型,直接应用强化学习(RL),通过 Group Relative Policy Optimization(GRPO)算法优化模型策略,采用基于规则的奖励模型引导训练。DeepSeek-R1-Zero直接基于基础模型(如 DeepSeek-V3-Base)通过大规模强化学习(RL)训练,无需任何监督微调(SFT)数据,仅依赖规则化奖励(如答案正确性、格式规范性)驱动模型自我进化。采用 GRPO(Group Relative Policy Optimization)算法,通过组内样本的奖励相对比优化策略模型,降低计算成本。