返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

OpenAI推理模型演进

2024年12月20日,OpenAI在12天直播发布会的最后一天投下“重磅炸弹”——o3模型在ARC-AGI基准测试中以87.5%的得分首次超越人类表现阈值(85%),而仅仅半年前,GPT-4o在该测试中仅获得5%的成绩。财通证券在其AI行业研究报告中指出,从o1到o3的跨越意味着大模型推理能力正在经历指数级跃升,思维链(CoT)与过程奖励模型(PRM)的后训练方法为模型扩展(scaling)开辟了全新范式。

从o1到o3——推理能力的代际跨越

2024年9月,OpenAI推出o1 preview模型,首次将“推理模型”这一概念推向市场。三个月后的12月,o1正式版发布,在数学、编程和科学三大领域的基准测试中全面超越预览版。然而真正让业界震动的是12月20日预告的o3模型。

在ARC-AGI基准测试中,o3模型在低计算设置下得分75.7%,高计算设置下得分87.5%。这一成绩的里程碑意义在于:ARC-AGI自2019年开发以来,五年间未被任何AI模型突破,人类表现阈值为85%,o3成为首个超越人类的AI系统。相比之下,2020年的GPT-3在该测试中得分0%,2024年的GPT-4o也仅为5%。从5%到87.5%,OpenAI仅用了半年时间。

o3-mini作为o3系列中更具性价比的高效模型同步预告,支持低、中、高三种推理努力程度,用户可根据不同用例自由调整模型思考时间,以实现最佳性能与资源利用的平衡。

思维链+过程奖励模型——推理能力跃升的技术密码

o系列模型推理能力跃升的核心技术路径,可归结为思维链(CoT)与过程奖励模型(PRM)的结合。

思维链方法要求模型在输出最终答案之前,生成一系列中间的推理步骤。这种方法使模型的思考过程更接近人类解决问题的方式——将复杂问题拆解为多个子步骤,逐步推进。OpenAI在其“OpenAI o1 System Card”论文中详细阐述了这一训练机制:o1模型利用CoT优化推理过程,确保推理思维链的逻辑性和连贯性。

过程奖励模型则对推理过程中的每一步进行评分。对于符合要求或正确的回答步骤,PRM给予奖励并反馈给模型;模型学习后会强化此类回答策略,在后续问答中有更大概率做出正确回答。PRM不仅用于提升准确性,还可避免涉及安全或伦理的敏感回答,实现对模型回答的规范化引导。

OpenAI的对比实验数据显示,在Best-of-1860采样设置下,使用PRM的问题解答率达到78.2%,显著高于ORM(72.4%)和多数投票(69.6%),验证了PRM在推理训练中的有效性。

o3突破极限——从语言模型到任务自适应推理

o3之所以能够在ARC-AGI测试中实现从5%到87.5%的跃升,其根本突破在于超越了传统大语言模型的局限。

传统大语言模型缺乏适应新任务或即时学习新技能的能力。o3则能够在自然语言程序内进行搜索和执行操作,以生成并执行自身程序的方式来应对新任务。简而言之,o3可以凭借搜索已掌握的内容,构建针对新任务的CoT思维链,进而解决复杂任务难题。

在编码领域,o3在SWE-bench Verified真实世界软件任务基准测试中准确率约71.7%,比o1高出20个百分点以上;在Codeforces竞赛编码中,o1的ELO约为1891,而o3在最激进的高级测试时间计算设置下ELO达到近2727,达到International Grandmaster水平,相当于位列全球第175位的人类选手,甚至超过OpenAI研究高级副总裁。

在数学领域,o3在AIME 2024数学竞赛基准测试中准确率达96.7%,o1为83.3%;在衡量博士水平科学问题的GPQA Diamond基准测试中,o3准确率达87.7%,较o1的78%高出约10个百分点。在EpochAI Frontier Math基准测试中,所有现有产品准确率均低于2%,而o3在激进测试时间设置下能达到25.2%。

o1与o3系列推理模型性能对比

表:OpenAI o1与o3系列推理模型核心性能基准对比
基准测试o1 previewo1正式版o3提升幅度(o1→o3)
AIME 2024数学竞赛83.3%96.7%+13.4pct
Codeforces编程ELO约1891约2727+836 ELO
GPQA Diamond科学78.0%87.7%+9.7pct
SWE-bench Verified编码约50%71.7%+20pct以上
ARC-AGI通用推理87.5%首超人类(85%)
点击阅读报告原文: 财通证券:OpenAI12天直播带来的几点产业思考(18页)
相关报告