返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

强化微调技术应用

国信证券报告聚焦OpenAI Day2发布的强化微调技术(Reinforcement Fine-Tuning),该技术允许开发者使用极小数据集创建特定领域的专家模型。在罕见遗传疾病预测实验中,仅用1100个病例报告对o1 mini进行强化微调后,其一次答对准确率跃升180%达到31%,全面超越o1完整版。Day9的o1 API和Day13的偏好微调进一步拓展了定制化AI的能力边界。本报告解析强化微调技术的工作原理与行业应用前景。

强化微调:小数据集训练专家模型,o1 mini超越o1

强化微调(RFT)的核心创新在于:不仅教模型模仿输入,更让模型学会在特定领域以新的方式进行推理。与传统监督微调(SFT)不同,RFT会让模型在面对问题时先进行思考,然后对响应进行评分,通过强化学习强化正确的思维模式并抑制错误的思维模式。这一方法使开发者能够通过更快、成本更低的o1 mini模型获得超越o1的专业性能。

在官方演示中,OpenAI设置了罕见遗传疾病基因预测任务:给定症状列表,模型需预测可能导致疾病的基因并解释原因。仅汇集约1100个病例报告作为训练和验证数据集(确保验证集与训练集没有重叠基因),经过强化微调的o1 mini一次答对准确率跃升180%达到31%,在“前五次预测中有正确答案”和“预测中有正确答案”等指标上全面超越o1完整版。RFT极大地降低了企业构建定制化AI模型的门槛。
表:强化微调o1 mini vs o1完整版性能对比
评估指标o1 mini(基础)o1 mini(RFT)o1完整版提升幅度
一次答对准确率约11%31%约20%+180%
前五次预测含正确答案全面超越基准显著
预测中有正确答案全面超越基准显著

o1 API全面开放,推理tokens降60%+视觉能力加持

Day9发布的o1 API向第三方开发者全面开放,核心功能包括:Function calling(连接外部API和数据库)、Structured Outputs(JSON格式输出确保解析一致性)、Developer messages(定义语气/风格/行为规范)、Vision capabilities(支持图像推理,解锁科学/制造/编码等领域视觉输入应用)、更低延迟(每请求比o1-preview少用60%推理tokens)、reasoning_effort参数(控制模型思考时间)。

现场测试显示,o1在函数调用、内部结构化输出、数学、编程等领域均达到目前所有模型的最高准确度。即使经过自定义输出结构调整,o1仍能保持极高准确度。o1 API的开放将使开发者能够将o1的推理能力集成到各类应用中,从智能客服到科研辅助,场景广泛。

偏好微调:让模型学习用户偏好,准确率从75%升至80%+

偏好微调(Preference Fine-Tuning)允许开发者通过提供成对的响应来训练模型——其中一个响应比另一个更受欢迎,模型自行学习并减少不受欢迎的输出结果。与监督微调(提供确切的输入和输出)不同,偏好微调侧重于优化模型以捕获用户偏好中的细微差别。

在官方演示中,Rogo AI正通过偏好微调构建面向金融分析师的AI助手。偏好微调使模型能够更准确地响应金融领域专业问题,准确率从75%提升至80%以上,而传统监督微调无法达到同样的准确性提升效果。偏好微调特别适用于需要主观判断的领域(如内容审核、个性化推荐、专业咨询等),为AI应用的精细调优提供了新路径。

定制化AI加速落地,三大技术路线对比

OpenAI推出了三种模型定制技术:强化微调(RFT,Day2)、o1 API(Day9)、偏好微调(Day13)。RFT适用于需要深度推理的专业领域(如医疗诊断、科研分析),用小数据集即可训练超越通用模型的专家模型;o1 API适用于将推理能力集成到现有应用(如智能助理、代码工具);偏好微调适用于需要主观判断的场景(如内容筛选、个性化服务)。三者的共同指向是:AI正从“通用模型”走向“专业定制”,企业构建专属AI助手的门槛正在大幅降低。
点击阅读报告原文: 人工智能行业专题:Openai发布会梳理-241223(35页)
相关报告