方正证券研究所报告指出,OpenAI o1模型标志着AI产业从pre-training预训练转向post-training推理重心,self-play强化学习成为通向AGI的新范式。结合预训练大模型的通用性和强化学习的思考能力,“学”与“思”的结合将打开模型能力上限。奖励目标清晰的应用场景率先受益——程序化广告投放(奖励=ROI)和军事作战方案(奖励=作战取胜)成为典型,AppLovin和Palantir已验证这一范式。
self-play强化学习——AI产业新范式
OpenAI o1模型的推出可视为AGI发展的重要转折点。2023年以来,AI产业主要强调pre-training预训练的Scaling Law,但2024年产业开始转向以post-training推理为重心。self-play强化学习让AI在没有外部监督的情况下,通过不断与自己或模拟对手交互,学习如何在环境中取得最大回报。过去AlphaGo使用自我对弈提高围棋水平,但局限于细分领域。现在,在经过预训练的大模型基础上进行self-play强化学习,能将大模型的通用性和强化学习的思考能力结合,大幅提升泛化能力。强化学习“需要设定奖励模型”的属性,指出了现阶段AI应用的方向——某项任务的reward value越清晰,Agent为了获得奖励而选择的动作也更精准。
奖励目标清晰的应用场景率先受益
程序化广告投放是self-play RL最典型的受益场景。奖励机制是提高广告投放的精准度或ROI,不同的广告主、媒体平台等是AI面对的不同环境,AI需要在不同环境下自学摸索最佳的投放策略。AppLovin通过AXON引擎的持续Self-learning形成正向飞轮效应,24Q3软件平台收入同增66%。Palantir的AIP平台在军事领域提供敌情探测、目标识别、生成和评估作战方案等功能,如同AI军事顾问,作战取胜是明确的奖励目标,面对新战役时AI根据实际情况制定最优策略。此外,AI教育(提升用户外语水平或考试成绩为奖励)、AI Agent(完成任务为奖励)等场景同样受益于self-play RL范式。
决策式AI与生成式AI的分化——谁先受益?
self-play强化学习对决策式AI的提升更为直接。决策式AI的核心是“选择最优动作”,天然适配强化学习框架。因此,决策式AI的相关应用有望率先受益于self-play RL的产业趋势。生成式AI的核心是“生成内容”,self-play RL的赋能相对间接,更多体现在通过强化学习优化生成策略。同时,决策式AI与生成式AI结合的应用(如广告营销中的投放+素材、教育中的解题思路+内容生成)也值得关注;多模态生成式AI的赋能则主要在影视、游戏等内容创意场景。各应用场景受益节奏不同,但self-play RL已成为判断AI应用投资价值的重要框架。
投资启示——关注具备清晰奖励机制的应用场景
self-play RL范式的投资启示:优先关注reward value清晰、可通过试错反馈持续优化的AI应用场景。AppLovin(广告投放ROI)和Palantir(军事作战)已验证这一范式的商业化可行性。国内映射方向包括:AI营销程序化投放(易点天下zMaticoo、蓝色光标BlueX)、AI教育应试类(豆神教育语文/数学/英语)、AI电商AI Agent(焦点科技AI麦可、值得买小值)。随着post-training技术持续迭代,更多具备清晰奖励机制的应用场景将迎来AI赋能拐点。
self-play强化学习受益场景分类| 应用类型 | 奖励目标(reward value) | 代表公司 | 受益程度 |
|---|
| AI营销(程序化投放) | ROI、广告精准度 | AppLovin、汇量科技、易点天下 | 率先受益 |
| AI军事(作战方案) | 作战取胜 | Palantir | 率先受益 |
| AI教育(应试类) | 考试成绩、语言掌握程度 | 多邻国、豆神教育 | 双重受益 |
| AI Agent(电商/办公) | 任务完成效率 | 焦点科技、Shopify | 直接受益 |