在“人类最后一场闭卷考试”中,Grok-4以44.4%的准确率将历史纪录大幅刷新——这不仅是数字的突破,更意味着AI在理工科和编程领域已具备博士级研究能力。华创证券指出,Grok-4的多智能体协作版(Heavy)正在开启AI从单一大模型向多智能体系统演进的新范式。
Grok-4概述——马斯克旗下xAI的巅峰之作
2025年7月10日,马斯克通过X平台发布Grok-4,宣称系统综合性能全球领先,学术研究能力已达博士级别专业水准。Grok-4由Colossus超级计算机训练,API模式下支持256K tokens上下文窗口,远超前代处理能力。
xAI推出普通单智能体“Grok-4”与会员版多智能体“Grok-4 Heavy”双版本。Grok-4 Heavy支持多个智能体并行工作,通过小组协作思考选取最优解决方案,代表了AI从单一大模型向多智能体系统演进的重要方向。
HLE基准测试——44.4%刷新历史纪录
“人类最后一场闭卷考试”(Humanity's Last Exam, HLE)由全球多领域权威专家联合制定,涵盖数学、生物、计算机等学科2500个高阶专业问题,对标博士级科研难度,是评估模型跨学科推理与复杂系统分析能力的权威测试。
Grok-4以44.4%准确率刷新历史得分记录。在AIME 2024国际数学竞赛、SAT及GRE等传统测试中均取得最高分,在复杂知识表征、跨域推理及高阶认知测试中全面优于OpenAI o3、Gemini 2.5 Pro及Claude 4。
多场景落地能力——从物理模拟到商业优化
体育赛事预测:Grok-4融合Polymarket平台数据与FanGraphs赛事信息,完成2025年MLB世界大赛冠军的实时赔率分析与预测。
物理模拟:通过代码指引生成双黑洞碰撞并产生引力波的HTML动画,展现物理建模能力。
商业优化:在“自动售货机基准测试”(Vending-Bench)中,通过智能库存管理、供应链优化和动态定价策略创造极高净利润。
主观理解:在X平台准确找出“xAI员工最古怪的头像”,展现对主观概念的精准理解及图片搜索分析能力,还可从社交媒体提取关键事件进行时间排序。
Grok-4 Heavy——多智能体协作新范式
Grok-4 Heavy通过多智能体并行工作、小组协作思考,在各项基准测试中均优于普通版Grok-4。多智能体协同模式尤其适用于需要多角度分析、交叉验证的复杂任务场景,包括复杂科学研究、大规模商业决策及跨领域问题求解。
AI伴侣与车载助手——C端场景拓展
“AI伴侣”功能仅向SuperGrok用户(每月30美元)开放,支持语音同步与3D动画表情,用户可通过提升“亲密度等级”解锁更多功能。
特斯拉车载系统于7月12日正式推送Grok集成,支持自然语音指令免提交互,覆盖导航路径规划、多媒体控制、实时信息查询及旅途陪伴式对话。新出厂车辆预装,存量市场分批次更新。
Grok-4后续更新计划
Grok-4基础模型仍处持续训练阶段,将投入十一万颗GB200强化学习优化。产品路线图:8月推出编程专用版本,9月发布多模态智能体版本,10月正式上线视频模型。已开放API,后续新增视频理解并强化工具调用。
算力基建——五年5000万H100等效蓝图
马斯克公布xAI算力规划:五年内达5000万块H100等效算力规模。Colossus 2超算集群首批搭载GB200/GB300架构,全部液冷技术。Grok系列从Grok-1到Grok-4计算资源增加100倍。