返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

VLA大模型突破

VLA(视觉-语言-动作)模型是具身智能领域最具突破性的技术方向。中泰证券研究报告指出,谷歌RT-2(2023年)在VLM预训练基础上用机器人数据微调,使模型获得“涌现能力”——可理解训练数据中从未出现的命令并推理决策。Figure AI的Helix(2025年)首创“系统1、系统2”双系统VLA架构,系统2(7B参数)慢思考场景理解,系统1(8000万参数)快思考200Hz实时控制,仅用500小时监督数据训练(此前VLA数据集的<5%),实现了强大的对象泛化能力。VLA模型结合了视觉识别、语言理解和动作控制三种能力,是端到端具身智能的核心技术架构。从RT-1到RT-2再到Helix,VLA模型的进化正在加速具身智能从“实验室演示”走向“真实场景应用”。

VLA模型——视觉-语言-动作的深度融合

VLA模型是在VLM(视觉-语言模型)基础上发展而来的关键技术突破。传统VLM只能理解图像和文本,无法产生物理动作。VLA在VLM基础上利用机器人运动轨迹数据进行进一步训练,使模型能够输出可用于机器人或汽车控制的动作序列。VLA模型的核心优势是三种能力的深度融合:视觉能力识别物体、场景和空间关系;语言能力理解指令含义和任务目标;动作能力将理解转化为精确的机械臂/机器人控制信号。与模块化方法(感知模块→规划模块→控制模块依次传递信息)不同,VLA在同一个模型中协同优化三种能力,避免了信息传递损耗,实现了从“看到”到“理解”到“行动”的无缝衔接。

谷歌RT系列——从RT-1到RT-2的进化

谷歌RT系列代表了VLA模型的演进路径。RT-1(2022年)是端到端机器人模型的先驱,基于130k episodes、700+任务、17个月的机器人操作数据训练,输入图片序列+自然语言指令,输出机械臂运动目标位姿。RT-1证明了端到端学习在机器人操作中的可行性。RT-2(2023年)实现质的飞跃:在互联网规模VLM预训练的基础上用机器人数据进行微调,使模型获得“涌现能力”——可理解训练数据中从未出现的新物体、新背景、新指令,并基于底层语言模型提供的思路链进行推理决策。在谷歌厨房环境中RT-1成功率高达97%,但一旦离开厨房环境,成功率骤降到30%左右,泛化性成为端到端模型的核心挑战。RT-2通过大规模预训练部分解决了这一问题,但推理速度仅1-3Hz(反射弧长达0.3-1秒),制约了实际应用。

H3:Figure Helix——双系统架构的工程化突破

Figure AI的Helix是VLA模型工程化的最新里程碑。Helix是首个“系统1、系统2”双系统VLA模型:系统2(7B参数)是经过互联网训练的板载VLM,工作频率7-9Hz,负责场景理解和语言理解,可广泛应用于各种物体和环境;系统1(8000万参数)是快速反应视觉运动策略,将系统2生成的潜在语义表征转化为200Hz的精确连续机器人动作。解耦架构允许每个系统以其最佳时间尺度运行——系统2“慢思考”高层次目标,系统1“快思考”实时执行和调整动作。Helix仅用约500小时高质量监督数据训练(此前VLA数据集的<5%),无需多机器人具身收集多阶段训练,实现了强大的对象泛化能力,展示了从“实验室模型”到“工业级产品”的工程化能力。

H4:VLA模型的挑战与未来方向

VLA模型仍面临三大挑战。数据稀缺:机器人模态仅240万个数据片段,远逊于文本15T tokens,数据采集成本高、效率低。推理速度:RT-2仅1-3Hz,无法满足实时控制需求(需要100Hz+),Helix通过双系统架构部分解决(系统1 200Hz)。泛化性与专用性的平衡:泛化能力越强,特定任务的精准度可能下降。未来方向:世界模型辅助训练——NVIDIA Cosmos等世界模型可生成符合物理规律的逼真合成数据,大幅降低数据采集成本;One Model端到端——随着数据积累和算力提升,分层模型逐步融合为单一VLA模型;轻量化部署——模型蒸馏和量化技术使VLA能在边缘端实时运行。VLA模型的持续进化将决定具身智能从“实验室奇观”走向“工业级产品”的时间表。
表:VLA模型关键进展对比
模型发布时间核心创新数据量推理速度
谷歌RT-12022年端到端Transformer机器人模型130k episodes
谷歌RT-22023年VLM+机器人微调,涌现能力互联网规模+机器人数据1-3Hz
Figure Helix2025年系统1/系统2双VLA架构500小时(<5%此前VLA)200Hz(系统1)
点击阅读报告原文: 机器人行业系列报告一:具身智能——决定机器人泛化能力天花板的“大小脑”-250309(57页)
相关报告