返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

VLA模型智驾

国盛证券智能驾驶深度报告指出,VLA(视觉-语言-动作)模型正成为智能驾驶从“聋哑司机”向“司机助理”升级的关键技术。谷歌Waymo推出EMMA多模态模型,英国Wayve推出LINGO-2闭环驾驶模型,清华大学与理想合作DriveVLM,理想自研32B参数VL基座模型,小鹏推进720亿参数VLA模型。本报告从VLA技术演进、头部玩家探索、量产落地三个维度,系统分析VLA模型在智能驾驶领域的应用趋势。

VLA模型:让智驾从“聋哑司机”变“司机助理”

传统智能驾驶系统只能执行驾驶任务,无法理解环境、无法解释决策,是典型的“聋哑司机”。VLA(视觉-语言-动作)模型通过引入大语言模型和多模态模型的能力,让智驾系统不仅能“看”和“开”,还能“说”和“解释”。

2023年7月,谷歌DeepMind推出全球首个控制机器人的VLA模型RT-2。2024年10月,谷歌旗下Waymo推出端到端自动驾驶多模态模型EMMA。2024年4月,英国Wayve推出闭环驾驶模型LINGO-2,将视觉、语言和动作联系起来,帮助解释和确定驾驶行为。当用户问“交通灯是什么颜色?”LINGO-2正确回答:“交通灯是绿色的。”VLA模型使自动驾驶体验获得全新的控制和定制维度,人类与智驾系统的交互方式从“单向指令”升级为“双向对话”。

DriveVLM:清华+理想的VLA实践

清华大学与理想汽车合作的DriveVLM在传统自动驾驶系统上增加了大视觉语言模型(VLM)能力。摄像头输入的图像序列由视觉编码器处理生成图像tokens,通过自注意力机制捕捉重要特征,与VLM的大语言模型进行对齐。随后大语言模型通过思维链(CoT)进行推理,包含场景描述、场景分析和分层规划三个模块。

在复杂场景中,DriveVLM展现出强大的场景理解能力。场景一中车辆遇到无车道线的城市道路、对向车辆拥挤、前方三轮车和交警指挥,DriveVLM识别出交警在指挥左边交通、三轮车缓慢行驶,作出“缓慢直线行驶”决策。场景二中阴雨天道路上有行人骑电动车迎面而来,DriveVLM作出“先减速、右转、缓慢直行”决策。场景三中前方有自行车倒在路上、交警和行人站立,DriveVLM作出“先减速、再向右变道、缓慢直行”决策并解释原因。SENNA(华中科技大学+地平线)是目前开环测试端到端智能驾驶全球第一名,结合多模态大模型和模块化端到端模型。
VLA模型在智能驾驶领域的关键应用
模型/项目研发方核心能力
EMMA谷歌Waymo端到端自动驾驶多模态模型
LINGO-2Wayve视觉-语言-动作闭环驾驶
DriveVLM清华+理想场景描述-分析-规划思维链
SENNA华中科技+地平线开环测试全球第一
MindVLA理想汽车32B VL基座→VLA


VLA模型已从学术研究走向产业落地。

头部玩家VLA布局:理想/小鹏/元戎/吉利

理想汽车VLA训练分四步。预训练VL基座模型(32B参数,即320亿)。后训练将其变成VLA,模型规模从3.2B扩大到近4B。强化训练(RLHF+纯RL)。搭建司机agent:简单短指令由端侧VLA直接处理,复杂指令由云端VL基座模型解析后交VLA处理。

小鹏汽车正在云上训练72B参数的超大规模VLA模型(世界基座模型),参数量是主流VLA模型的35倍。通过蒸馏方法将云端大模型能力“推云入端”,生产小尺寸车端模型。元戎启行2025年1月宣布与某头部车企合作,基于英伟达Thor芯片推出VLA量产车型,计划年内交付消费者。吉利在AI智能科技发布会上推出千里浩瀚高阶智驾系统:H7级别加入VLM大模型(2025年推送);H9级别加入VLA大模型和数字先觉网络,为L3智驾准备。

VLA量产挑战与云端算力竞赛

VLA模型上车面临多重挑战。车端挑战:VLA车端模型参数更大,既要有高效实时推理能力,同时要有大模型认识复杂世界并给出建议的能力,对车端芯片硬件要求极高。理想VLA从3.2B到4B,小鹏72B基座模型通过蒸馏后部署车端。云端挑战:多模态模型训练的主要瓶颈不仅是GPU,也需要解决数据访问效率。小鹏自主开发数据基础设施,使数据上传规模提升22倍、训练中数据带宽提升15倍、模型训练速度提升5倍。

各头部玩家在云端算力上展开竞赛。特斯拉致力于成为“计算领域世界领导者”。小鹏在10亿到720亿参数模型上均看到规模法则效应:参数越大、数据越多,模型能力越强。VLA模型从云端训练到车端部署的全链条能力,将成为智能驾驶头部玩家的核心竞争壁垒。
点击阅读报告原文: 计算机行业智能驾驶技术的当下与未来:头部玩家的探索与启示-250524(55页)
相关报告