2024年,AI大模型的技术演进从单一的文本生成全面迈向多模态理解与生成的新阶段。华安证券2026年科技策略报告指出,大模型能力正沿着"文本→图像→视频→物理世界"的路径加速迭代,视频生成、复杂推理与AI Agent成为三大核心突破方向。从年初Sora的惊艳亮相到年末Google Gemini 2.0的发布,大模型正从"信息处理工具"进化为"任务执行智能体"。本文系统梳理了2024年海内外大模型的核心迭代与2025年的技术演进方向。
视频生成——从Sora引爆到DiT技术路线收敛
2024年视频生成领域迎来爆发式增长。2月OpenAI首次发布Sora文生视频模型,引爆全球关注,12月Sora成为独立产品并专门开设Sora.com网站。Sora采用DiT(Diffusion Transformer)架构,将视频离散化为时空块进行处理,DiT原始论文2023年被引约200次,而2024年至今已被引用近800次,技术路线实现快速收敛。国内厂商同样加速布局,快手可灵V1.5模型在画质、动态质量、美学表现等方面显著提升,引入"运动笔刷"功能,视频延长支持多次续写最长3分钟;字节跳动推出豆包视频生成-PixelDance和Seaweed两款模型。视频生成技术的成熟正在深刻改变影视、广告、短剧等内容创作行业的成本结构,OpenAI、Meta、Stability AI等厂商的持续迭代预计将在2025年进一步降低视频生成门槛。
推理能力跃升——OpenAI o1与复杂思维链时代
大模型的推理能力在2024年实现了质的飞跃。OpenAI于9月发布ChatGPT-o1系列(o1-preview、o1-mini),首次在模型中引入思维链(Chain of Thought)推理机制,在科学、编程、数学等复杂推理任务中表现出色,已超越人类博士水平。12月,OpenAI正式发布o1完整版,并同步推出ChatGPT Pro订阅服务。谷歌12月发布Gemini 2.0,显著增强了思维链推理能力、多模态理解能力和上下文窗口。昆仑万维在国内率先跟进,发布天工4.0 O1版,具备自我反思和思考链技术,Skywork O1 Lite特别优化中文支持并提升推理速度,Skywork O1 Preview提供更深入、多样化的思考过程。月之暗面Kimi数学版(K0-Math)数学能力可对标OpenAI o1系列。推理能力的跃升使大模型从"知识检索器"进化为"逻辑推理器",极大拓展了其在科研、编程、金融分析等高价值场景的应用空间。
2024年海外主要大模型核心迭代汇总| 厂商 | 核心模型 | 发布时间 | 关键突破 |
|---|
| OpenAI | GPT-4o | 2024年5月 | 实时音频/视觉/文本推理,情感交互 |
| OpenAI | o1-preview/o1 | 2024年9月/12月 | 思维链推理,科学/编程/数学超越博士水平 |
| OpenAI | Sora | 2024年12月独立上线 | 文生视频DiT架构,独立产品化 |
| Google | Gemini 1.5 Pro | 2024年5月 | 100万tokens上下文,原生音频理解 |
| Google | Gemini 2.0 | 2024年12月 | Agent时代准备,多模态+推理增强 |
| Anthropic | Claude 3.5 | 2024年6月/10月 | 计算机操作能力,自动执行多步骤任务 |
| Meta | Llama 3.1/3.2/3.3 | 2024年7-12月 | 128K上下文,多语言,图像编码器 |
国内大模型——多模态、Agent、视频生成三线并进
2024年国内大模型在功能迭代上明显加速,重点方向包括多模态信息处理、长文本理解、角色扮演与Agent能力构建。字节跳动豆包系列密集迭代,9月推出视频生成模型PixelDance和Seaweed,以及音乐模型、同声传译模型;腾讯混元发布hunyuan-large,为业界参数规模最大、效果最好的Transformer结构MoE模型之一,并推出7K分辨率视觉模型;阿里通义千问Qwen2.5系列开源从0.5B到72B全尺寸模型,代码模型Qwen2.5-Coder在多项基准评测取得开源最佳;快手可灵API升级引入v1.5高品质模型;智谱GLM-4-9B集成了All Tools功能;月之暗面Kimi探索版具备AI自主搜索能力,Kimi数学版对标o1系列。