返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

理想汽车VLA智驾模型

理想汽车的智能驾驶技术架构正从端到端+VLM快慢系统向VLA(视觉语言动作)大模型全面进化。东吴证券报告详细拆解VLA模型的四大训练阶段与六大核心技术:从云端VL基座预训练(32B模型蒸馏为3.6B MoE)、到辅助驾驶后训练(加入action形成4B VLA司机大模型)、再到RLHF+纯RL强化学习、最终融合为司机Agent智能体。

理想智驾软件架构迭代路径——从分段式E2E到VLA

理想汽车的智驾软件架构经历了清晰的迭代路径。OTA5.0(2023/12)为分段式端到端架构(One Model感知+端到端决策网络);OTA6.0-6.4(2024/7-10)升级为一段式端到端+VLM快慢系统;OTA7.0(2025/1)进一步升级为全场景端到端+VLM,训练数据从400万Clips提升至800万Clips;OTA7.3(2025/4-5)达到1000万Clips,MPI从十几公里提升至100公里。

VLA是端到端+VLM的下一代架构。端到端+VLM阶段,快系统(端到端网络)模仿人类司机行为,慢系统(22亿参数VLM)负责逻辑推理场景通过思维链CoT决策分析。VLA将快慢系统统一为单一大模型,从根本上解决了异构联合训练和优化的困难,实现从视觉输入到驾驶动作输出的端到端生成。
理想汽车智驾OTA迭代关键节点
版本发布时间软件架构训练数据核心功能突破
OTA5.02023/12分段式端到端高速NOA全覆盖、城市NOA开放
OTA6.0-6.42024/7-10一段式端到端+VLM400万Clips无图城市NOA全量推送
OTA7.02025/1全场景端到端+VLM800万Clips车位到车位
OTA7.32025/4-5全场景端到端+VLM1000万ClipsAI推理可视化
2025H2规划中VLA模型司机Agent智能体

VLA模型六大核心技术——3D高斯+MoE稀疏化+Diffusion+ODE

VLA模型通过六大核心技术解决当前智驾系统的根本痛点。技术1为自监督3D高斯表征,替代传统依赖人工标注的2D-3D-BEV-占用网络路径,大幅减少标注成本,支持海量数据处理和复杂场景理解。技术2为模型稀疏化,采用MoE架构(多个专家模型实现模型扩容但激活参数不增加)和Sparse Attention(只计算部分键向量的相似度),解决模型参数大幅扩容时的推理负担。

技术3为简化思维链CoT模板,快系统不需要思维链,慢系统也仅保留简短CoT,降低决策延迟。技术4提供两套推理模式:语言推理用因果注意力逐字输出,Action token用双向注意力一次性输出(纵观全局再行动)。技术5利用Diffusion扩散模型将指令转换成驾驶行为轨迹,并预测周边车和人轨迹,可响应"开慢点"等外部指令。技术6为ODE采样器,相比SDE无随机性、收敛更快,解决Diffusion模型生成效率低的问题。

VLA训练四阶段——VL基座预训练到司机Agent

VLA训练分为四个递进阶段。第一阶段为VL(视觉语言)基座预训练,在云端训练视觉语言基座模型,V维度放入更多3D vision和高清2D vision(图像分辨率较VLM提升10倍),L维度放入交通驾驶相关语料,VL维度放入视觉语言联合语料(导航地图+车辆理解同步),让模型掌握道路物理规律与人类驾驶常识,将32B模型蒸馏为3.6B 8专家MoE模型。

第二阶段为辅助驾驶后训练,将action部分加入形成VLA司机大模型,模型规模从3.2B扩大至4B,模型可直接从视觉到理解到输出,CoT仅2-3步以解决延时问题,action加入后做Diffusion扩散模型预测生成4-8秒轨迹与环境。

第三阶段为辅助驾驶强化学习,RLHF(基于人类反馈的强化学习)加入人类接管/习惯数据,纯RL(强化学习)在世界模型中训练三大指标:G值(舒适性)、碰撞反馈、交通规则反馈。

第四阶段为司机Agent(智能体),将司机大模型和Agent融合,打造具有专业能力、职业能力、构建信任能力的产品,计划2025年下半年上车。

硬件预埋与云端算力——Thor-U+ATL+8.1EFlops支撑VLA

VLA大模型对车端算力和云端训练算力提出极高要求。2025年5月,理想L系列发布智能焕新版,AD Max芯片从双英伟达Orin-X(508TOPS)升级为单英伟达Thor-U芯片(700TOPS),相比双Orin-X的分散式计算,单Thor-U通过集成化架构降低功耗30%。但双Orin-X和Thor-U仍跑不动VLA的完整token输出率,硬件与算法的协同优化仍在进行。

激光雷达同步升级为禾赛ATL(第四代芯片架构+双核MCU),相比AT128体积减小60%、重量轻60%,最佳角分辨率0.08°(H)×0.1°(V),优于公版ATX的0.1°×0.1°,可开启光学变焦,30°收缩视野下最远测距200米。云端算力从2024年7月的2.4EFlops提升至2024年12月的8.1EFlops,为VLA模型的云端训练和仿真验证提供算力支撑。
点击阅读报告原文: 【东吴证券】AI+汽车智能化系列之十二:理想汽车核心竞争力剖析-250610(72页)
相关报告