人形机器人通用能力的突破正在加速。中邮证券研究所最新研报深度解析了Figure公司推出的Helix视觉-语言-动作(VLA)模型。Helix采用准分层式框架,实现了对从未训练过物品的零样本操作、全上半身精准控制以及双机器人协同作业,且完全在嵌入式GPU上运行。本文基于中邮证券研报,系统解读Helix模型的技术架构与突破性能力。
Helix模型架构——准分层式大小脑设计
Figure Helix模型在架构设计上做出了重大调整,摒弃了此前与OpenAI合作的多模态大模型,转而采用准分层式框架。模型分为System 1和System 2两个层级:System 1为8000万参数的轻量级操作模型,负责高频、连续的实时动作控制;System 2为70亿参数的多模态大模型,负责视觉理解与语言推理。
这一准分层架构借鉴了人类“快思考与慢思考”的双系统认知原理。System 2负责理解指令和环境,System 1负责执行动作,两者协同工作。通过500多个小时的训练数据,Helix得出了精准的动作模型,最终展现出了令人惊喜的泛化能力。
零样本泛化——操作任何物体
Helix最核心的突破在于模型的泛化能力。Figure表示Helix可以操作任何物体,包括机器人从未遇到过的物品。这一点对于家用和非结构化场景中的部署至关重要——家庭环境中物品千差万别,不可能为每一种物品单独训练模型。
与传统模仿学习需要为每个特定任务单独训练数据不同,Helix通过端到端的VLA架构,将视觉语言模型中捕获的丰富语义知识直接转化为机器人动作。家用场景测试中,机器人可以操作训练集中从未包含的番茄酱等物品,验证了零样本泛化的可行性。
表1:Helix模型与传统模仿学习对比| 维度 | 传统模仿学习 | Helix VLA模型 |
|---|
| 训练方式 | 每个任务单独训练 | 统一供给单个VLA模型 |
| 泛化能力 | 仅能执行预训练任务 | 零样本操作新物体 |
| 控制范围 | 单一部件控制 | 全上半身端到端控制 |
| 协作能力 | 单台机器人 | 多机器人协同合作 |
| 部署方式 | 云端与机载混合 | 完全在板载GPU运行 |
全上半身精准控制与双机协作
Helix通过VLA模型实现了对躯干、手臂、手腕、头部及手指的端到端训练与协调控制。Figure 02全身多达35个自由度,多部位的协同控制会实时改变机器人的视野范围和操作可达空间,形成传统控制方法难以解决的动态反馈闭环。例如当机器人调整躯干姿态以扩大抓取范围时,头部需同步转动保持视觉追踪,同时手指仍需保持精细操作。
Helix还展示了两台机器人协同合作完成任务的场景,这在以往的机器人厂商中是绝无仅有的。系统设计中采用的分层结构使得语言指令能有效指导具体操作,多线程协调能力已预示了未来在多任务处理、多机器人协作方面的潜力。
业内首个完全在嵌入式GPU运行的VLA模型
Helix是业内首个完全在嵌入式GPU上运行分层式大小脑架构的机器人,无需依赖边缘部署或云端算力。这一特性极大地降低了部署门槛,为机器人的商业化应用铺平了道路。Figure CEO表示,鉴于Helix模型进步神速,公司对于机器人家用的时间轴提前了2年,2025年就会开始Alpha测试,部署家用。