在预训练大模型能力趋于收敛的背景下,后训练技术正在成为决定AI模型商业价值的关键变量。OpenAI在12天发布会的第二天展示了强化微调(Reinforcement Fine-Tuning, RFT)技术——仅使用少量高质量数据,o1-mini模型在特定领域的回答正确率就能得到显著提升。财通证券在AI行业研究报告中指出,后训练技术将大模型的通用能力与垂直领域的专业Know-how相连接,是推动AI在医疗、法律、金融等高价值行业落地的核心工具。
后训练——从通用模型到专业Agent的桥梁
大语言模型基于概率运作的底层原理,在面对数理化类或逻辑类问题时正确率仍有较大提升空间。预训练模型提供的是“通识教育”,而后训练则是对模型进行“专业深造”。
OpenAI将后训练定义为“使用任务相关的标注数据进行监督学习或微调”,其目标是学习特定任务的能力,计算需求相对轻量,输出适配特定任务的模型。发布会中,OpenAI展示了三种主流后训练方法:有监督微调(SFT)、强化学习(RL)和偏好微调(PFT),并发布了强化微调(RFT)这一创新技术。
财通证券认为,当前大模型仍然存在幻觉现象,但后训练可使模型增加思考步骤,提高特定领域的回答正确率。从商业化角度看,未来生态合作模式或为:OpenAI等大模型厂商专注于研发预训练基座模型,后训练微调工作通过API由不同领域的研究人员实现,公开研究成果可反馈给大模型强化其相关领域的知识理解,形成正循环。
强化微调RFT——少量数据的四两拨千斤
在第二天的直播中,OpenAI展示了RFT的核心机制。具体步骤包括:输入训练数据集,模型根据数据集输出一系列回答,用户则根据正确答案在系列回答中的位置顺序进行打分。如果正确答案在所有回答中第一个出现,则获得最高分数;如果正确答案完全没有出现,则没有分数。
实验结果证明:仅使用少量高质量数据进行微调后,模型的回答正确率就能得到显著提升。这一发现在法律、医学、金融等专业知识繁杂的领域具有极高的实践价值——研究人员不再需要数十万级别的标注数据,仅需数十到数百条高质量专业数据,即可让通用模型在特定领域达到接近专家水准。
RFT与传统有监督微调(SFT)的本质区别在于:SFT让模型学习“什么是正确答案”,RFT让模型学习“如何推理出正确答案”。前者侧重结果,后者侧重过程。在复杂推理任务中,过程导向的训练往往比结果导向的训练更有效。
三种后训练方法对比——SFT、RL与PFT
本次发布会系统性地介绍了三种后训练方法,各有适用场景。
有监督微调(SFT)是最基础的后训练方法。通过输入成对的(问题,正确答案)训练数据,模型学习从输入到输出的映射关系。SFT适用于任务边界清晰、正确答案明确的场景,如文本分类、信息抽取、代码生成等。
强化学习(RL)是RFT技术的理论基础。模型在某个环境中采取行动,根据环境的反馈(奖励或惩罚)调整行为策略。在RFT中,模型输出一系列回答,用户根据答案质量给予评分作为反馈,模型据此优化推理策略。RL适用于需要多步推理、答案质量难以用单一标签衡量的复杂任务。
偏好微调(PFT)在第九天的直播中展示。通过输入成对的回答,选择更符合要求的答案作为反馈提供给模型,模型学习加强符合偏好的回答。PFT适用于答案质量存在主观差异的场景,如创意写作、对话风格调整、代码风格优化等。
三种方法可组合使用:用SFT构建基础能力,用RL优化推理过程,用PFT微调输出风格,形成从“能做”到“会做”再到“做好”的递进式提升。
大模型后训练技术对比与适用场景
表:OpenAI主流后训练方法对比分析| 方法 | 原理 | 训练数据需求 | 适用场景 | 发布日 |
|---|
| 有监督微调(SFT) | 输入(问题,正确答案)对,学习映射 | 中到大规模标注数据 | 分类、抽取、生成等任务边界清晰场景 | — |
| 强化微调(RFT) | 模型输出系列回答,按正确位置评分反馈 | 少量高质量数据(数十到数百条) | 法律、医学、金融等专业知识密集型领域 | Day 2 |
| 偏好微调(PFT) | 输入成对回答,选择符合偏好的答案 | 偏好标注数据 | 创意写作、对话风格、代码风格优化 | Day 9 |
| 思维链训练(CoT) | 要求模型生成中间推理步骤并优化 | 推理过程标注数据 | 数理推理、逻辑问题、多步决策 | o1论文 |