通用人工智能(AGI)的时间表正从“遥远未来”变为“近期可期”。国信证券报告指出,特斯拉CEO马斯克预测2025年AI可能比任何一个人类都要聪明,2029年比所有人类加起来还要聪明。英伟达CEO黄仁勋认为5年内AI可通过人类测试。OpenAI前员工预测2027年实现AGI。GPT-4参数已达1.76万亿,当大模型参数量达到100万亿(类比人类神经突触数量)时,AGI可能成为现实。
AlphaGo:神经网络担起机器学习重任
2015年10月,分布式AlphaGo以5比0战胜欧洲围棋冠军樊麾。2016年3月,AlphaGo在首尔以4:1战胜李世石。2017年5月,AlphaGo Master仅用2块TPU(单块280W)以60:0战胜职业选手。AlphaGo Zero用3块TPU(ELO 5185)以100:0战胜AlphaGo(李世石版)。AlphaGo验证了神经网络+并行计算的路线的有效性,是AI发展的里程碑。
TPU是谷歌为神经网络机器学习开发的专用集成电路,每焦耳I/O操作更多。GPU适合CNN和部分全连接神经网络,CPU适合RNN。AlphaGo各种版本进化史,本质上是并行运算为机器学习更深层探索提供条件的证明。2-4块TPU就能完成176个GPU的AlphaGo(2016版)更好的成绩,硬件优化可行性得到验证。
大模型规模飞跃:从1亿到1万亿参数的10年
2017年谷歌《Attention Is All You Need》提出Transformer架构,多头注意力机制使并行处理、长距离依赖、灵活可扩展成为可能。该论文截至2023年,8位作者全部离开谷歌创办AI初创企业。
GPT-1(2018)1.17亿参数,GPT-2(2019)15亿,GPT-3(2020)1750亿参数(训练数据570GB纯文本)。GPT-3首次展现“涌现”现象——数学运算、代码生成、文本改写、自动推理、跨语言翻译等能力,模型展现出未曾明确编程的新能力。GPT-3.5(2022)通过RLHF优化,是ChatGPT爆发的版本。GPT-4(2023)1.76万亿参数,在2.5万A100 GPU上训练90-100天,成本约4亿美元。
Transformer架构的统治地位确立后,大企业开启AI军备竞赛。若2008年想获得GPT-3.5所需算力,成本高达4千亿美元,总成本或超万亿美元——算法受制于算力基础能力,直到算力成本降到足够低,Transformer路线才变得可行。
AGI时间表:2027-2029年成为共识窗口
将大模型参数类比生物神经突触(神经元之间的连接),人类大脑约860亿神经元、约100万亿-1000万亿神经突触。当大模型参数量达100万亿时,可能达到AGI水平。
马斯克2024年3月预测:“明年(2025年),AI可能会比任何一个人类都要聪明。到2029年,它可能比所有人类加起来还要聪明。”英伟达CEO黄仁勋认为:“如果你对AGI的定义是通过人类的测试,那么5年就可以实现。”OpenAI前员工Leopold Aschenbrenner认为有很大概率将在2027年实现AGI系统,并测算GPT-2≈学龄前儿童、GPT-3≈小学生、GPT-4≈聪明高中生,算力和算法效率都以每年0.5个数量级速度发展。
OpenAI将AGI路径分五级:聊天机器人(ChatGPT当前水平)、推理者(解决博士级问题,即将到来)、智能体(自主执行任务)、创新者(协助新发明)、组织者(管理组织)。斯坦福“小镇”25个AI Agent仅凭预设身份和初始记忆,自主产生类人社交行为——策划派对、讨论竞选、邀约约会,是Agent能力的早期验证。
AI Agent:下一个风口,2032年881亿美元市场
AI Agent = LLM + 记忆 + 规划 + 工具。规划将大型任务分割为子任务并反思执行;记忆包括短期(上下文)和长期(外部知识库);工具包括API(网页搜索、代码执行、数据库查询等)。当前数十个平台支持用户零代码构建Agent,创作门槛大幅降低。
AI Agent类比历史不同科技时代:计算机时代(80年代)平台是IBM兼容机/DOS,应用是软件;互联网时代(90年代)平台是WWW联盟/浏览器,应用是网页网站;移动互联网时代(10年代)平台是iPhone/安卓,应用是移动APP;通用人工智能时代(20年代)平台是大模型/GPT,应用是AI Agent。每个时代平台之外都走出了巨头,AI Agent时代将走出下一批大公司。
Gminsights预测自主AI市场2022年42亿美元,2032年达881亿美元(CAGR 36.5%)。Agent将逐渐从“单个执行工具”走向“Agent团队”协同完成任务。