AI编程能力的飞跃正由“推理模型”驱动。财通证券报告指出,OpenAI o1在2024年9月开启大模型推理时代后,推理模型通过强化学习实现Codeforces编程竞赛得分显著跃升——相比基础通用模型提升2-3倍。2025年1月,DeepSeek R1发布,作为首个通过纯强化学习训练且无需监督微调的推理模型,性能比肩o1且成本显著更低。在BigCodeBench代码能力评估中,DeepSeek R1(第4)、DeepSeek V3(第8)等三家中国开源模型跻身前十,开源生态正加速追赶闭源前沿。
推理时代开启——从预训练到后训练的范式转移
大模型技术发展正进入“预训练放缓、后训练加速”的新阶段。2024年9月,OpenAI发布o1-preview与o1-mini,首次验证了强化学习(RL)与思维链(CoT)在大模型推理能力提升上的巨大潜力。模型厂商更重视思维链的延长、强化学习算法的创新、以及通过算法优化降低推理成本。
2024年12月,OpenAI发布o1正式版,比o1-preview更擅长编码、数学和写作,新增多模态功能(支持图片上传)。2025年1月,DeepSeek发布R1-Zero和R1,其中R1-Zero是首个通过纯强化学习训练且无需任何监督微调数据的模型,验证了强化学习Scaling在模型训练中的潜力。DeepSeek R1在问题解决能力上与OpenAI o1正式版相当,但API成本显著更低——输入token约o1的4%、输出token约o1的25%。
2025年1-2月,阿里Qwen2.5-Max在11项基准测试中优于DeepSeek V3和Meta Llama 3.1,OpenAI o3-mini比o1-mini响应速度提升24%、答案准确性也有所提高。推理模型已成为大模型迭代的主基调。
Codeforces得分验证——推理模型编程能力质的提升
Codeforces是全球程序员的在线编程竞赛平台,大模型在该平台的得分能直观反映算法设计、数据结构运用、代码实现等编程核心技能水平。数据显示,推理模型(通过强化学习实现推理能力提升)的Codeforces得分相比基础通用模型有显著跃升。
OpenAI o1系列模型的Codeforces得分约为前代GPT-4o的2-3倍,DeepSeek R1得分与o1系列接近。推理模型在编程竞赛中的优异表现,意味着其在复杂算法问题理解、多步骤逻辑推理、代码实现准确性等关键维度上实现了质的突破。推理性能的提升直接转化为AI编程产品的基座能力优化。
这一能力跃升的产业含义深远——AI编程工具从“代码补全”走向“智能编程”。o1系列在物理、化学和生物学基准任务上的表现超过人类博士生水平,Claude 3.5 Sonnet更新版新增“computer control”功能使AI能像人类一样与计算机交互,DeepSeek R1在数学、编码、逻辑能力上显著提升。AI编程产品正从辅助代码生成走向自主任务执行。
开源生态追赶——DeepSeek带动开源上限跃升
BigCodeBench是评估LLMs解决实际编程任务能力的权威基准,包含1140个函数级任务,考察LLMs遵循指令并将多个函数调用作为工具组合的能力。截至2025年2月4日,排名前十的模型中,DeepSeek R1(第4)、DeepSeek V3-Chat(第8)、Athene-V2-Chat(第10)均为开源大模型且来自中国,其余主要为o1、o3系列闭源模型。
当前闭源模型整体性能仍优于开源,基于闭源模型的产品优先实现了商业化。但DeepSeek R1遵循MIT开源协议(授予所有人免费使用、修改、再发布的权力),带动了开源能力上限的跃升。更多参与者加入生态将加速开源能力迭代,国内AI编程有望借开源生态实现弯道超车。
国内在软件生态融合与场景丰富度相比海外仍有差距,当前的软件生态需进行大量融合工作以提升对不同工程场景的适应力。但DeepSeek等开源模型的兴起可能改变AI编程产品格局——开源模型分离了底层模型训练与产品开发两个阶段,垂直行业公司与创业公司有望在AI编码市场获得更多机会。
推理模型的投资含义
推理模型的编程能力提升有两个层面的投资含义:第一,推理模型成本降低加速AI应用落地——o3-mini比o1-mini响应速度提升24%,DeepSeek R1 API定价仅为o1的4%,成本下降将推动AI编程工具在更广泛的场景中普及;第二,中长期推理算力需求持续增长——强化学习阶段Scaling继续演绎,推理任务对算力的消耗远高于训练阶段,国产算力链将持续受益。
BigCodeBench模型代码能力排名(2025.02.04)| 排名 | 模型名称 | 代码完成得分 | 指令调整得分 | 平均得分 | 模型类型 |
|---|
| 1 | o1-2024-12-17 (high) | 38.5 | 32.4 | 35.5 | 闭源 |
| 2 | o3-mini-2025-01-31 (high) | 37.8 | 33.1 | 35.5 | 闭源 |
| 4 | DeepSeek-R1 | 40.5 | 29.7 | 35.1 | 开源(中国) |
| 8 | DeepSeek-V3-Chat | 39.9 | 27.7 | 33.8 | 开源(中国) |
| 10 | Athene-V2-Chat | 37.2 | 27.0 | 32.1 | 开源(中国) |