返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

自动驾驶世界模型

自动驾驶是感知、预测、规划、控制的复杂系统工程。信达证券世界模型专题报告指出,传统级联架构容易导致信息丢失和建模复杂,而基于扩散的视频生成模型作为世界模型可部分解决上述问题。随着多模态大模型和视觉生成模型的进展,世界模型在自动驾驶和机器人领域正受到广泛关注。本文基于信达证券报告,深度解析世界模型如何赋能自动驾驶与机器人智能化。

自动驾驶的级联困境——信息丢失与建模复杂

现代自动驾驶通常分为感知、预测、规划和控制四个模块。在汽车行驶场景中,汽车通过相机、雷达、高精度地图等方式获取数据来感知世界。在多模态大模型和视觉生成模型出现之前,交通场景的模拟通常以感知模块收集或手动构建,并进行进一步建模和渲染以产生适合车辆的输出。

信达证券指出,多个模块的级联容易导致信息丢失和建模复杂。感知模块输出的抽象表示可能丢失了原始数据中的部分细节,预测模块的误差会逐级传导到规划和控制模块,导致整体性能下降。此外,逼真的场景渲染需要耗费巨量的计算资源,限制了自动驾驶系统的效率和可扩展性。

视频生成模型作为世界模型——突破传统瓶颈

使用基于扩散的视频生成模型作为世界模型可以部分解决上述问题。视频生成模型直接从视觉数据中学习交通场景的动态演变,无需经过多级抽象和建模。模型可以端到端地接受传感器输入并生成未来帧的预测,减少了中间环节的信息损失。

近年来已有相关研究在不断进行。视频生成模型从早期的GAN-based模型(VGAN、MoCoGAN、VideoGPT)演进到扩散模型(VDM、LDM、Video LDM),再发展到DiT架构(Sora、Genie、Genie2)。信达证券认为,视频生成模型时间线的持续演进表明,基于扩散的方法在自动驾驶场景模拟方面具有显著潜力,可以更高效地生成逼真的训练数据并支持感知模型的优化。

机器人世界模型——从模拟学习到现实行走的突破

机器人的应用是世界模型另一主要方向。传统机器人关键组件会被建模,机器人在执行任务时无需理解世界。但当机器人被部署在新的场景中时,可能会手足无措。世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。

近年来机器人世界模型研究取得多项突破:BC-Z利用语言表示作为任务表示,增强了机器人的多任务性能;DayDreamer从离线数据中推广了一个世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM可以从人类视频中学习,并在没有任何任务监督的情况下对机器人设置进行微调;VIPER在专家视频上利用预训练自回归transformer,指导机器人正确执行;GR-2对机器人任务进行了微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。

AGI的实现路径——LLMs与世界模型的融合

信达证券指出,LLMs和世界模型被认为是实现通用人工智能(AGI)的可能途径之一,它们可以成为机器理解世界基本规律的起点。LLMs提供了语言理解和推理能力,而世界模型提供了对物理世界的感知和预测能力,两者互补可形成更完整的智能系统。

o3-mini可模拟生成小球在四维超立方体内弹射的Python代码,Grok3可模拟航天器任务并准确描述飞船、地球、太阳、火星的位置关系——这些成果表明大模型正在学习如何理解物理世界和空间关系。世界模型有望迎来快速迭代时期,推动AI从2D像素层面走向3D空间智能,为自动驾驶、机器人、复杂系统模拟等场景提供新的技术基础。
自动驾驶级联架构问题与视频生成模型解决方案
传统级联架构问题视频生成模型解决方案
模块间信息丢失端到端视频生成,直接从视觉输入预测未来帧
多级建模复杂单一模型替代多级建模流程
场景渲染计算资源巨量基于扩散的高效生成
误差逐级传导统一架构减少累积误差
点击阅读报告原文: 【信达证券】电子:世界模型探索空间智能,AI复杂场景落地可期-250305(16页)
相关报告