返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

AI模型Scaling Law新方向

国金证券研究报告指出,AI大模型的预训练Scaling Law正面临放缓挑战。2024年11月OpenAI前首席科学家Ilya在公开场合表示,简单地增加数据和计算能力来扩大当前模型规模的时代已经结束。但Scaling Law放缓并不代表大模型发展减速——OpenAI o1将计算资源从预训练重分配至推理阶段,以“用推理代替思考”开辟新范式;MIT的测试时训练(TTT)、合成数据技术、感知量化训练等新方向正快速兴起。如同芯片的广义摩尔定律,大模型正在寻找更高投入回报比的新方向,推理算力需求有望加速增长。

预训练Scaling Law放缓与新方向涌现

2024年,AI大模型预训练的Scaling Law放缓成为行业关注的焦点。从年初开始陆续有论文提出模型能力提升速度随参数规模扩大而放缓,到11月OpenAI前首席科学家Ilya在公开场合表示“简单地增加数据和计算能力来扩大当前模型规模的时代已经结束”。预训练的scaling law放缓不意味着大模型发展速度和算力需求的放缓——就像是芯片gate的实际尺寸停滞在20nm并不影响等效gate密度达到目前的3nm,广义的摩尔定律甚至比20年前更快,大模型也需要找到具有更高投入回报比的新方向。

大模型厂商推出模型的速度仍在加快,大小模型共存的格局持续强化。各大模型厂商同时推出几B到TB级别的模型,以应对云端高难度推理和端侧轻量化推理的不同需求。随着大型模型训练成本不断提升,且Meta、Mixtral、阿里通义等公司的开源模型日益成熟,模型预训练市场的玩家将快速缩小。针对特定任务的微调或Agent业务将是更多中小模型厂商发展的重点,预训练市场的收敛趋势将更加明显。

在Scaling Law放缓的背景下,四个新方向正在快速涌现:1)用推理代替思考(o1为代表);2)测试时训练(Test-Time Training,MIT 2024年11月提出);3)合成数据在预训练到微调各阶段的广泛应用;4)感知量化训练技术替代传统模型量化。这些新方向的核心共同点是将计算资源从大规模预训练数据集重新分配到训练和推理阶段,增强模型的复杂推理能力,同时也在费用和成本结构上进行了重新分配。

OpenAI o1开启“推理代替思考”新范式

2024年9月12日OpenAI发布o1系列模型,这是OpenAI首个具有“逻辑推理”能力的模型系列。o1特别擅长处理复杂推理任务,尤其是在科学、技术、工程和数学(STEM)领域——在这些领域的评测分数远远超过GPT-4o。o1模型将计算资源从大规模预训练数据集重新分配到训练和推理阶段,增强了复杂推理能力,同时也对费用和成本进行了重分配:使用o1-preview的API输入token价格是GPT-4o的5倍(每百万tokens $15.00 vs $3.00),输出token价格是GPT-4o的6倍(每百万tokens $60.00 vs $10.00)。

在OpenAI发布o1之后,其他大模型公司也迅速跟进。DeepSeek推出DeepSeek-R1,采用“思维链”(CoT)技术将复杂任务分解为多个步骤逐一解决,在AIME美国数学竞赛(52.5 vs OpenAI o1-preview 44.6)和Codeforces编程竞赛(1450 Rating vs o1-preview 1428)等基准测试中表现与o1相当或更优。阿里通义发布Marco-o1,由思维链微调、蒙特卡洛树搜索(MCTS)、自反机制和创新性推理策略驱动,专门针对复杂现实世界问题解决任务进行优化。阿里在Open-o1数据集基础上筛选并利用合成数据方法创建了新的Marco-o1数据库用于监督微调,在应用蒙特卡洛树微调后,评测成绩大幅超过基底模型Qwen2-7B。

这些模型验证了“用推理代替思考”路线的可行性。大模型厂商正从单纯的预训练规模竞赛转向推理阶段计算资源的优化配置,推理算力需求将持续增长。OpenAI发布的“Work with Apps”功能(MacOS客户端读取屏幕代码提供编程建议)和Anthropic发布的“Computer USE”API(Claude通过分析屏幕截图理解UI布局和内容,计算光标移动像素距离进行操作)标志着大模型服务已从聊天机器人进化为严肃生产力工具,单位Prompt所需的推理算力将进一步显著增长。
推理增强模型与基线模型对比
模型核心方法AIME(美国数学竞赛)Codeforces Rating推理成本(输入/输出)
OpenAI o1-preview思维链推理增强44.61428$15/$60 per M tokens
GPT-4o传统预训练9.3759$3/$10 per M tokens
DeepSeek-R1思维链(CoT)52.51450
Qwen2-7B(基底)传统预训练

测试时训练、合成数据与多模态融合的前沿探索

MIT在2024年11月提出的测试时训练(Test-Time Training)是另一条突破Scaling Law限制的路径。TTT是一种在推理过程中根据测试输入动态更新模型参数的技术,与标准微调不同,它在极低数据情况下运行(通常对单个输入或一两个上下文中的标记示例使用无监督或监督目标)。MIT团队在Llama 3 8B模型上使用TTT后,相比1B基础微调模型准确率提高了6倍;在ARC公共验证集上实现45%准确率,比8B基础模型提高近157%。该方法仍在初期试验阶段,对计算资源要求高,但验证了推理阶段动态更新参数的有效性。

合成数据在大模型开发中的应用正迅速扩大。合成数据不仅解决了数据获取和隐私问题,还能针对性增强模型在特定任务上的表现。OpenAI的模型训练大量使用合成数据;Anthropic在Claude系列采用Constitutional AI方法提升稳健性;阿里通义Qwen系列利用早期版本模型生成合成数据增强预训练数据集质量;Apple的AFM模型在预训练阶段使用合成数据延长上下文长度,特别关注数学和代码任务的高质量合成数据生成。Gartner预测到2030年,合成数据将在AI模型中完全超过真实数据的使用。合成数据生成过程消耗大量计算资源——使用GPT-4生成十万个JSON合成数据元素预计成本高达506美元,随着现实世界数据被发掘用尽,合成数据消耗的推理资源将快速上升。

多模态融合模型仍有巨大发展空间。Meta Llama 3.2和阿里通义Qwen-VL在图像推理等能力上取得显著进展,但整体架构和性能相比OpenAI GPT-4o仍存在明显差距。GPT-4o的核心优势包括:支持文本/图像/音频/视频理解及文本/图像/音频生成;使用单一神经网络处理所有模态;跨文本/视觉/音频端到端联合训练;音频输入响应时间平均320毫秒(接近人类反应速度),支持近实时语音对话和翻译。多模态模型的发展为AI应用和AI硬件落地带来更大想象空间——根据上下文理解和生成不同语气语调的音频、语音直接进行图片编辑、AI硬件实时对话与翻译、实时逐步解答题目等。当视频模型和实时交互模型走向成熟,AI硬件(尤其是AI眼镜)的体验将迎来质的飞跃。
点击阅读报告原文: 2025AI行业前瞻报告:Al行业关键时刻:瓶颈与机遇并存-241127(33页)
相关报告