2024年12月20日,OpenAI在12天直播发布会的最后一天投下“重磅炸弹”——o3模型在ARC-AGI基准测试中以87.5%的得分首次超越人类表现阈值(85%),而仅仅半年前,GPT-4o在该测试中仅获得5%的成绩。财通证券在其AI行业研究报告中指出,从o1到o3的跨越意味着大模型推理能力正在经历指数级跃升,思维链(CoT)与过程奖励模型(PRM)的后训练方法为模型扩展(scaling)开辟了全新范式。
从o1到o3——推理能力的代际跨越
2024年9月,OpenAI推出o1 preview模型,首次将“推理模型”这一概念推向市场。三个月后的12月,o1正式版发布,在数学、编程和科学三大领域的基准测试中全面超越预览版。然而真正让业界震动的是12月20日预告的o3模型。
在ARC-AGI基准测试中,o3模型在低计算设置下得分75.7%,高计算设置下得分87.5%。这一成绩的里程碑意义在于:ARC-AGI自2019年开发以来,五年间未被任何AI模型突破,人类表现阈值为85%,o3成为首个超越人类的AI系统。相比之下,2020年的GPT-3在该测试中得分0%,2024年的GPT-4o也仅为5%。从5%到87.5%,OpenAI仅用了半年时间。
o3-mini作为o3系列中更具性价比的高效模型同步预告,支持低、中、高三种推理努力程度,用户可根据不同用例自由调整模型思考时间,以实现最佳性能与资源利用的平衡。
思维链+过程奖励模型——推理能力跃升的技术密码
o系列模型推理能力跃升的核心技术路径,可归结为思维链(CoT)与过程奖励模型(PRM)的结合。
思维链方法要求模型在输出最终答案之前,生成一系列中间的推理步骤。这种方法使模型的思考过程更接近人类解决问题的方式——将复杂问题拆解为多个子步骤,逐步推进。OpenAI在其“OpenAI o1 System Card”论文中详细阐述了这一训练机制:o1模型利用CoT优化推理过程,确保推理思维链的逻辑性和连贯性。
过程奖励模型则对推理过程中的每一步进行评分。对于符合要求或正确的回答步骤,PRM给予奖励并反馈给模型;模型学习后会强化此类回答策略,在后续问答中有更大概率做出正确回答。PRM不仅用于提升准确性,还可避免涉及安全或伦理的敏感回答,实现对模型回答的规范化引导。
OpenAI的对比实验数据显示,在Best-of-1860采样设置下,使用PRM的问题解答率达到78.2%,显著高于ORM(72.4%)和多数投票(69.6%),验证了PRM在推理训练中的有效性。
o3突破极限——从语言模型到任务自适应推理
o3之所以能够在ARC-AGI测试中实现从5%到87.5%的跃升,其根本突破在于超越了传统大语言模型的局限。
传统大语言模型缺乏适应新任务或即时学习新技能的能力。o3则能够在自然语言程序内进行搜索和执行操作,以生成并执行自身程序的方式来应对新任务。简而言之,o3可以凭借搜索已掌握的内容,构建针对新任务的CoT思维链,进而解决复杂任务难题。
在编码领域,o3在SWE-bench Verified真实世界软件任务基准测试中准确率约71.7%,比o1高出20个百分点以上;在Codeforces竞赛编码中,o1的ELO约为1891,而o3在最激进的高级测试时间计算设置下ELO达到近2727,达到International Grandmaster水平,相当于位列全球第175位的人类选手,甚至超过OpenAI研究高级副总裁。
在数学领域,o3在AIME 2024数学竞赛基准测试中准确率达96.7%,o1为83.3%;在衡量博士水平科学问题的GPQA Diamond基准测试中,o3准确率达87.7%,较o1的78%高出约10个百分点。在EpochAI Frontier Math基准测试中,所有现有产品准确率均低于2%,而o3在激进测试时间设置下能达到25.2%。
o1与o3系列推理模型性能对比
表:OpenAI o1与o3系列推理模型核心性能基准对比| 基准测试 | o1 preview | o1正式版 | o3 | 提升幅度(o1→o3) |
|---|
| AIME 2024数学竞赛 | — | 83.3% | 96.7% | +13.4pct |
| Codeforces编程ELO | — | 约1891 | 约2727 | +836 ELO |
| GPQA Diamond科学 | — | 78.0% | 87.7% | +9.7pct |
| SWE-bench Verified编码 | — | 约50% | 71.7% | +20pct以上 |
| ARC-AGI通用推理 | — | — | 87.5% | 首超人类(85%) |