东吴证券深度报告指出,理想汽车智能化战略正从“端到端+VLM”向“VLA(视觉-语言-动作)大模型”全面进化。理想智驾经历了从分段式E2E到一段式E2E+VLM再到全场景E2E+VLM的迭代,2025年下半年将正式推出VLA模型上车。VLA模型通过自监督3D高斯表征、MoE模型稀疏化、ShortCoT简化思维链、Diffusion扩散模型预测轨迹、ODE采样器加速等六大核心技术,解决人车博弈、交通文字识别、推理决策等复杂场景,并通过“VL基座预训练→辅助驾驶后训练→强化学习→司机Agent”四步训练,目标是让机器比人类开得更好。同时,理想同学MindGPT3.0已上线深度思考能力,性能对标DeepSeek-R1。
智驾软件架构的进化——从端到端到VLA的必经之路
理想智驾架构经历了四个阶段:阶段一(OTA5.0,2023.12)分段式端到端,One Model感知+端到端决策;阶段二(OTA6.0,2024.7)一段式端到端+VLM快慢系统,快系统模仿人类司机行为做轨迹输出,慢系统(22亿参数VLM)负责复杂场景的逻辑推理;阶段三(OTA6.4-7.3,2024.10-2025.5)全场景端到端+VLM,实现无图城市NOA、车位到车位,MPI(每次干预行驶里程)从十几公里提升至100公里;阶段四(2025H2)VLA大模型上车。VLA相较于端到端+VLM的核心突破在于:解决快慢系统频率不一致导致的异构联合训练困难;用自监督3D高斯替代人工标注,大幅降低数据成本;引入MoE架构实现模型参数大幅扩容而不增加推理负担。云端训练32B VL基座模型,蒸馏为3.6B/8专家MoE,加入Action后变为4B VLA司机大模型。
理想智驾OTA迭代关键节点| 版本 | 发布时间 | 核心升级 | 关键指标 |
|---|
| OTA5.0 | 2023.12 | 分段式端到端架构 | 高速NOA全覆盖 |
| OTA6.0 | 2024.7 | 一段式端到端+VLM | 无图城市NOA |
| OTA6.5-7.1 | 2024.11-2025.2 | 车位到车位、AI推理可视化 | MPI 100公里 |
| OTA7.3 | 2025.4-5 | VLA模型上车 | Thor-U芯片+ATL激光雷达 |
VLA六大核心技术——从感知到决策的全链路革新
VLA模型包含六大核心技术:①自监督3D高斯表征,用“蓬松的3D云团”概括散乱点云,减少人工标注成本,支持海量数据处理,较传统NeRF渲染速度更快;②模型稀疏化,采用MoE架构(“智能秘书”动态筛选专家)和Sparse Attention(只计算部分键向量相似度),实现模型扩容同时推理负担不增加;③ShortCoT简化思维链,快系统无需思维链,慢系统简化CoT,解决长CoT时间成本高、决策延迟大的问题;④两套推理模式,语言推理用因果注意力(逐字输出),Action token用双向注意力(纵观全局再行动);⑤Diffusion扩散模型预测轨迹,整体生成完整优化轨迹,不依赖牛顿力学前向模型;⑥ODE采样器替代SDE,无随机性、收敛更快,提升采样速度。六项技术协同解决了VLA从“看懂世界”到“做出最优驾驶决策”的全链路问题。
四步训练——从基座预训练到司机Agent
VLA模型的训练分四步:Step1 VL基座预训练——云端训练32B VL模型,放入更多3D Vision和高清2D Vision(分辨率提升10倍)、交通驾驶语料,让模型掌握道路物理规律与人类驾驶常识,蒸馏为3.6B/8专家MoE模型;Step2辅助驾驶后训练——加入Action部分变为VLA司机大模型(3.2B→4B),采用模仿学习,CoT缩短至2-3步解决延时问题,用Diffusion生成4-8秒预测轨迹;Step3强化学习——先RLHF(加入人类接管/习惯反馈),后纯RL(基于G值舒适性、碰撞反馈、交通规则三大指标训练),在世界模型中训练让机器比人类开得更好;Step4司机Agent——将司机大模型与Agent融合,打造专业能力+职业能力+信任构建的用户产品。VLA最终目标是实现“可理解、可沟通、可信任”的智能驾驶体验。
MindGPT3.0与星环OS——座舱与操作系统的AI协同
2025年4月理想同学MindGPT3.0上线深度思考能力。长思维链评测中,指令遵循83.3%(DeepSeek-R1为78.1%)、逻辑推理87.5%(R1 86.2%)、数学AIME2024 86.7%(R1 79.8%)。工具能力上,RAG搜索重排使搜索丰富度+35%、专业术语识别+47%、首次搜索满足率+28%。工程能力上,P-D分离式部署使Decode解码速度提升3倍,MoE算子性能提升2.8倍,实现秒级故障自愈。操作系统层面,理想自主研发星环OS已开源,面向AI设计,降低虚拟化开销80%、设备访问延迟90%,支持主流车规级芯片,验证周期从3-6个月缩短至4周。AI能力已从智驾延伸至座舱交互和底层操作系统,理想在“AI+汽车”的全面布局正在构建更深层的技术护城河。