理想汽车的智能驾驶技术架构正从端到端+VLM快慢系统向VLA(视觉语言动作)大模型全面进化。东吴证券报告详细拆解VLA模型的四大训练阶段与六大核心技术:从云端VL基座预训练(32B模型蒸馏为3.6B MoE)、到辅助驾驶后训练(加入action形成4B VLA司机大模型)、再到RLHF+纯RL强化学习、最终融合为司机Agent智能体。
理想智驾软件架构迭代路径——从分段式E2E到VLA
理想汽车的智驾软件架构经历了清晰的迭代路径。OTA5.0(2023/12)为分段式端到端架构(One Model感知+端到端决策网络);OTA6.0-6.4(2024/7-10)升级为一段式端到端+VLM快慢系统;OTA7.0(2025/1)进一步升级为全场景端到端+VLM,训练数据从400万Clips提升至800万Clips;OTA7.3(2025/4-5)达到1000万Clips,MPI从十几公里提升至100公里。
VLA是端到端+VLM的下一代架构。端到端+VLM阶段,快系统(端到端网络)模仿人类司机行为,慢系统(22亿参数VLM)负责逻辑推理场景通过思维链CoT决策分析。VLA将快慢系统统一为单一大模型,从根本上解决了异构联合训练和优化的困难,实现从视觉输入到驾驶动作输出的端到端生成。
理想汽车智驾OTA迭代关键节点| 版本 | 发布时间 | 软件架构 | 训练数据 | 核心功能突破 |
|---|
| OTA5.0 | 2023/12 | 分段式端到端 | — | 高速NOA全覆盖、城市NOA开放 |
| OTA6.0-6.4 | 2024/7-10 | 一段式端到端+VLM | 400万Clips | 无图城市NOA全量推送 |
| OTA7.0 | 2025/1 | 全场景端到端+VLM | 800万Clips | 车位到车位 |
| OTA7.3 | 2025/4-5 | 全场景端到端+VLM | 1000万Clips | AI推理可视化 |
| 2025H2 | 规划中 | VLA模型 | — | 司机Agent智能体 |
VLA模型六大核心技术——3D高斯+MoE稀疏化+Diffusion+ODE
VLA模型通过六大核心技术解决当前智驾系统的根本痛点。技术1为自监督3D高斯表征,替代传统依赖人工标注的2D-3D-BEV-占用网络路径,大幅减少标注成本,支持海量数据处理和复杂场景理解。技术2为模型稀疏化,采用MoE架构(多个专家模型实现模型扩容但激活参数不增加)和Sparse Attention(只计算部分键向量的相似度),解决模型参数大幅扩容时的推理负担。
技术3为简化思维链CoT模板,快系统不需要思维链,慢系统也仅保留简短CoT,降低决策延迟。技术4提供两套推理模式:语言推理用因果注意力逐字输出,Action token用双向注意力一次性输出(纵观全局再行动)。技术5利用Diffusion扩散模型将指令转换成驾驶行为轨迹,并预测周边车和人轨迹,可响应"开慢点"等外部指令。技术6为ODE采样器,相比SDE无随机性、收敛更快,解决Diffusion模型生成效率低的问题。
VLA训练四阶段——VL基座预训练到司机Agent
VLA训练分为四个递进阶段。第一阶段为VL(视觉语言)基座预训练,在云端训练视觉语言基座模型,V维度放入更多3D vision和高清2D vision(图像分辨率较VLM提升10倍),L维度放入交通驾驶相关语料,VL维度放入视觉语言联合语料(导航地图+车辆理解同步),让模型掌握道路物理规律与人类驾驶常识,将32B模型蒸馏为3.6B 8专家MoE模型。
第二阶段为辅助驾驶后训练,将action部分加入形成VLA司机大模型,模型规模从3.2B扩大至4B,模型可直接从视觉到理解到输出,CoT仅2-3步以解决延时问题,action加入后做Diffusion扩散模型预测生成4-8秒轨迹与环境。
第三阶段为辅助驾驶强化学习,RLHF(基于人类反馈的强化学习)加入人类接管/习惯数据,纯RL(强化学习)在世界模型中训练三大指标:G值(舒适性)、碰撞反馈、交通规则反馈。
第四阶段为司机Agent(智能体),将司机大模型和Agent融合,打造具有专业能力、职业能力、构建信任能力的产品,计划2025年下半年上车。
硬件预埋与云端算力——Thor-U+ATL+8.1EFlops支撑VLA
VLA大模型对车端算力和云端训练算力提出极高要求。2025年5月,理想L系列发布智能焕新版,AD Max芯片从双英伟达Orin-X(508TOPS)升级为单英伟达Thor-U芯片(700TOPS),相比双Orin-X的分散式计算,单Thor-U通过集成化架构降低功耗30%。但双Orin-X和Thor-U仍跑不动VLA的完整token输出率,硬件与算法的协同优化仍在进行。
激光雷达同步升级为禾赛ATL(第四代芯片架构+双核MCU),相比AT128体积减小60%、重量轻60%,最佳角分辨率0.08°(H)×0.1°(V),优于公版ATX的0.1°×0.1°,可开启光学变焦,30°收缩视野下最远测距200米。云端算力从2024年7月的2.4EFlops提升至2024年12月的8.1EFlops,为VLA模型的云端训练和仿真验证提供算力支撑。