西南证券研报将VLA(视觉-语言-动作模型)定位为自动驾驶端到端2.0版本的终极形态【20†L4-L6】。随着VLM技术逐渐量产上车,VLA正成为2025年头部车企竞逐的焦点【20†L4-L5】。小鹏计划2025年Q3在G7等新车型交付全车端VLA【20†L18-L19】;理想MindVLA计划2025年Q3发布【20†L19-L20】;长城汽车搭载元戎启行VLA方案的5款车型2025年Q3交付【20†L21-L22】。Waymo于2024年10月推出了首个基于端到端的自动驾驶多模态模型EMMA【20†L6-L7】。
VLA模型:从VLM到VLA的进化
VLA(Vision-Language-Action Model,视觉-语言-动作模型)是多模态模型的最新演进形态。VLM(视觉语言模型)能够理解和处理视频、图像和文本等多模态输入并转化为语言输出,但无法执行动作【19†L6-L8】。VLA可视为VLM的升级版,相较于VLM能够执行动作且拥有更强的推理能力与泛化能力【20†L4-L6】。
VLA模型最早见于机器人行业——2023年7月28日,谷歌DeepMind推出了全球首个控制机器人的VLA模型RT-2【20†L6-L7】。2024年10月底,Waymo推出了首个基于端到端的自动驾驶多模态模型EMMA【20†L7】。VLA模型将感知、决策、规划整合为单一的多模态基础模型,是端到端算法的重要升级方向。
技术原理:生成式AI+端到端算法的融合
VLA模型的诞生源于传统端到端算法的固有缺陷【17†L16-L18】。传统端到端面临两大问题:一是未知的长尾场景无法避免——并非所有长尾场景都在历史上发生过,未发生的事件无法作为数据训练模型【17†L8-L10】;二是规则不明确的长尾场景无法解决,如潮汐车道、模糊的交通指示牌等【17†L11-L12】。
为解决这些问题,头部企业开始推进“生成式AI技术+端到端算法”的升级路线【17†L6-L7】。特斯拉的World Model本质是视频生成模型,通过预测未来场景辅助决策【17†L8-L9】。VLM(如理想DriveVLM)是多模态模型,理解交通语言但无法生成动作【17†L9-L10】。VLA在此基础上进一步融合了动作执行能力,使模型能够直接输出控制信号【20†L4-L6】。
2025年VLA量产时间表
2025年,VLA模型从实验室走向量产车,头部车企的量产时间表已经明确【20†L18-L23】:
小鹏汽车:全车端VLA(自研),搭载于G7等新车型,2025年Q3交付,6月已发布【20†L18-L19】。
理想汽车:MindVLA(自研),搭载于理想i8,2025年Q3发布,7月发布【20†L19-L20】。
长城汽车:元戎启行VLA方案,5款车型搭载VLA模型(包括长城“猎鹰900”、Smart精灵等),2025年Q3交付【20†L21-L22】。
吉利极氪:Waymo EMMA模型,Robotaxi专属车型,2025年下半年【20†L22-L23】。
奇瑞汽车:华为ADS 4.0+VLA方案,星途ET,2025年底交付【20†L23】。
VLA对自动驾驶行业的影响
VLA模型的量产落地将对自动驾驶行业产生深远影响。从技术层面看,VLA模型拥有更强的推理能力与泛化能力,能够更好地应对未知的长尾场景【20†L4-L6】。从产业层面看,VLA模型的竞争将加速行业洗牌——具备全栈自研能力的车企(如小鹏、理想)和技术方案供应商(如华为、元戎启行)将在VLA时代占据先机【20†L18-L23】。
从投资角度看,VLA模型的量产落地将利好三类企业:全栈自研车企(掌握VLA核心算法)、技术方案供应商(向车企提供VLA解决方案)、算力基础设施(VLA模型训练需要大量算力支持)。西南证券认为,当AI发展到通用人工智能的时候,完全无人的L5级别自动驾驶也将能够实现【21†L16】。
表4:2025年VLA技术方案主要玩家及量产时间| 车企 | VLA技术方案 | 供应商 | 量产车型 | 预计交付时间 |
|---|
| 小鹏汽车 | 全车端VLA | 自研 | G7等新车型 | 2025年Q3 |
| 理想汽车 | MindVLA | 自研 | 理想i8 | 2025年Q3 |
| 长城汽车 | 元戎启行VLA方案 | 元戎启行 | 猎鹰900、Smart精灵等5款 | 2025年Q3 |
| 吉利极氪 | Waymo EMMA模型 | Waymo | Robotaxi专属车型 | 2025年下半年 |
| 奇瑞汽车 | 华为ADS 4.0+VLA方案 | 华为 | 星途ET | 2025年底 |