Transformer架构是人工智能发展的分水岭。国信证券报告指出,2017年谷歌《Attention Is All You Need》提出的Transformer架构,使GPT参数从1.17亿(2018)增至1.76万亿(2023)。GPT-4在2.5万个A100 GPU上训练90-100天,成本约4亿美元。千亿参数级别首次展现“涌现”现象,证明“大力出奇迹”路线可行。Sora文生视频1分钟、DALL-E 3文生图,多模态AI正从实验室走向商用。
Transformer架构:取代RNN,统治NLP领域
Transformer基于多头注意力机制,将文本转为“token”后通过计算Query、Key、Value向量相似度放大关键信号。优势包括:并行处理(无需RNN的顺序处理)、长距离依赖捕捉、灵活可扩展、通用性(不仅用于NLP,还可用于计算机视觉、音频、多模态)、迁移学习和预训练。
2023年《Attention Is All You Need》论文8位作者全部离开谷歌创办AI初创企业。Transformer架构对算力的高效利用(相对RNN)和“大力出奇迹”的可扩展性(参数越多效果越好),使其成为大模型时代的标准架构。
GPT从1亿到1.7万亿参数的飞跃
GPT-1(2018.6)1.17亿参数,GPT-2(2019.2)15亿参数(训练数据40GB),GPT-3(2020.5)1750亿参数(训练数据570GB),GPT-3.5(2022.11)通过RLHF优化,GPT-4(2023.4)1.76万亿参数(混合专家模型MoE构建)。
GPT-3是分水岭——1750亿参数首次展现“涌现”现象(数学运算、代码生成、自动推理、跨语言翻译等),研究者称之为“模型展现出未曾明确编程的新能力的现象”。GPT-4训练成本是GPT-3的10倍(2.5万A100×90-100天≈4亿美元),大企业开启AI军备竞赛。
从ChatGPT发布后竞争产品快速涌现:谷歌Gemini、Anthropic Claude、Meta Llama、百度文心一言、xAI Grok。ChatGPT成为历史上增长最快消费软件(2个月达1亿用户),并首次被广泛认可通过图灵测试。
Sora与DALL-E:多模态AI的“理解”能力
2022年3月Midjourney面世,AI绘画工具快速进步。2024年2月OpenAI发布Sora——扩散模型+Transformer的结合体,能生成1分钟左右视频(以往仅3-4秒)。Sora将视频/图像表示为“patches”(类似GPT的token),统一数据方式训练扩散transformer模型。
Stable Diffusion(2022)是扩散模型文生图的标杆,扩散模型包括前向加噪和反向去噪两个过程。DALL-E 3参数规模远小于GPT(约350亿),文生图对参数需求低于文生文,可较早商用。Sora仍存在缺陷——跑步机案例、生日蜡烛案例显示,在没有足够训练数据时,模型对空间、时间“理解”会出现“错乱”。
业界普遍认为Transformer模型代表未来——通过增加模型规模、使用更大数据集、更多计算资源提高性能,而不去计较增益水平是否值得,“先干了再说”已成行业共识。
模型参数与AGI:100万亿参数的“最终答案”
数字神经网络概念上类似生物大脑。人类大脑突触数量最常见的引用约100万亿(860亿神经元×约1000个神经突触)。当大模型参数量达到100万亿时,能力可能将达到AGI水平。
按OpenAI五级路径:GPT-4在Level 1(聊天机器人),即将迈入Level 2(推理者)。Sora为“理解和模拟现实世界的模型”奠定基础,OpenAI相信这一能力将成为AGI的重要里程碑。
算力与算法效率每年约0.5个数量级发展(约3倍),再加上技术突破释放模型性能。按此推算,2025-2026年模型参数将达10万亿级,2027-2028年达100万亿级。人工智能已在多种语言理解和视觉理解基准上超越人类,但基础模型仍然缺乏高级推理和规划能力,预计会取得快速进展。