国盛证券智能驾驶深度报告指出,端到端自动驾驶正从“模仿学习”向“强化学习”演进。狭义端到端是行为克隆(模仿学习),通过传感器数据与人类驾驶轨迹的对照训练模型;但模仿学习只能让模型达到人类平均水平。广义端到端包含在线强化学习框架,通过世界模型生成训练环境,让车端系统自我进化。特斯拉、小鹏、理想、地平线、小马智行、Momenta等头部玩家纷纷布局。本报告从端到端范式演变、强化学习价值、头部玩家进展三个维度,系统解析端到端强化学习趋势。
端到端的三种范式:从行为克隆到在线强化学习
“端到端”自动驾驶系统包含三种范式。行为克隆是模仿学习框架,通过学习传感器数据与人类驾驶轨迹的对照,让车端模型输入传感器后输出合理轨迹。逆最优控制同样是模仿学习框架,通过学习奖励函数来推断人类驾驶行为的潜在目标。在线强化学习是强化学习框架,让模型在与环境交互中通过试错学习最优策略。
传统rule-base方案下,智驾只能推理1秒钟路况然后做出决策。端到端1.0阶段系统能推理出未来7秒路况,而引入世界模型和强化学习后,系统能对更长时间尺度进行推理和规划。模仿学习只能达到人类平均水平,无法实现“超越人类”。2017年AlphaGo通过强化学习战胜围棋冠军,证明了强化学习具备超越人类的潜力。自动驾驶领域同样需要强化学习来实现超越人类的驾驶水平。
强化学习的价值:超越人类的必经之路
地平线是最早提出采用强化学习的智能驾驶公司之一。地平线通过强化学习实现了训练数据量需求降低80%,碰撞率降低3倍,规划准确率提升25.5%的效果。小马智行联合创始人、CTO楼天城表示,世界模型是车端模型的factory(工厂),L4自动驾驶的真正差别在“工厂”的精度,决定车端模型的上限。通过AI生成技术构造训练环境,用强化学习方法让车端系统在这个环境里自己进化。
Momenta在2024年实现量产的一段式端到端基于模仿学习,2025年的目标是实现基于强化学习的一段式端到端大模型(第六代飞轮大模型)。李想在AI Talk上分享强化学习分两部分:第一部分是RLHF(带有人类反馈的强化学习),完成安全对齐和驾驶习惯融入;第二部分是纯RL,用世界模型生成数据训练,通过舒适性、交通规则和碰撞事故三个维度做强化训练,目的是开得比人类更好。
强化学习在智能驾驶领域的核心价值| 玩家 | 强化学习应用 | 核心效果 |
|---|
| 地平线 | 交互式博弈 | 训练数据需求降80%,碰撞率降3倍 |
| 理想 | RLHF+纯RL | 舒适性/交通规则/碰撞三维训练 |
| Momenta | 第六代飞轮大模型 | 从模仿学习升级到强化学习 |
| 小马智行 | 世界模型+虚拟司机 | 每周生成超100亿英里数据集 |
强化学习已成为头部玩家的共识性选择。
世界模型:强化学习的训练场
强化学习的核心挑战是如何构建高质量的训练环境。世界模型通过生成逼真的驾驶场景,为强化学习提供了训练场。小鹏的“世界基座模型”已推进72B参数规模,通过“云端模型工厂”实现基座模型预训练和后训练(强化学习训练)、模型蒸馏、车端模型部署的完整链路。小鹏自主开发的数据基础设施使数据上传规模提升22倍、训练中数据带宽提升15倍,模型训练速度提升5倍。
小马智行自研“世界模型(PonyWorld)+虚拟司机(VirtualDriver)”是全无人驾驶实现规模部署的关键技术。世界模型每周可生成超过100亿英里的自动驾驶数据集,虚拟司机系统在世界模型中持续自我进化,已实现在更小算力、量产化硬件下超越人类水准的驾驶表现。世界模型的数据生成能力从根本上解决了自动驾驶训练数据不足的问题,为强化学习的规模应用奠定了基础。
从端到端到VLA:语言模型+强化学习的融合
端到端强化学习的最新演进方向是引入语言模型和多模态模型,形成VLA(视觉-语言-动作)架构。理想的MindVLA基于自研的重建+生成云端统一世界模型,深度融合重建模型的三维场景还原能力与生成模型的新视角补全。元戎启行宣布基于英伟达Thor芯片推出VLA量产车型,计划年内交付。吉利千里浩瀚H7级别加入VLM大模型,H9级别加入VLA大模型和数字先觉网络。
VLA模型的上车难度不小,车端模型参数变得更大,既要有高效实时推理能力,同时要有大模型认识复杂世界并给出建议的能力,对车端芯片硬件有相当高要求。但VLA能让智驾系统从“聋哑司机”变成能理解环境、能解释决策的“司机助理”,这是从“及格”到“超越人类”的关键一步。