返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

Figure Helix模型技术突破

人形机器人通用能力的突破正在加速。中邮证券研究所最新研报深度解析了Figure公司推出的Helix视觉-语言-动作(VLA)模型。Helix采用准分层式框架,实现了对从未训练过物品的零样本操作、全上半身精准控制以及双机器人协同作业,且完全在嵌入式GPU上运行。本文基于中邮证券研报,系统解读Helix模型的技术架构与突破性能力。

Helix模型架构——准分层式大小脑设计

Figure Helix模型在架构设计上做出了重大调整,摒弃了此前与OpenAI合作的多模态大模型,转而采用准分层式框架。模型分为System 1和System 2两个层级:System 1为8000万参数的轻量级操作模型,负责高频、连续的实时动作控制;System 2为70亿参数的多模态大模型,负责视觉理解与语言推理。

这一准分层架构借鉴了人类“快思考与慢思考”的双系统认知原理。System 2负责理解指令和环境,System 1负责执行动作,两者协同工作。通过500多个小时的训练数据,Helix得出了精准的动作模型,最终展现出了令人惊喜的泛化能力。

零样本泛化——操作任何物体

Helix最核心的突破在于模型的泛化能力。Figure表示Helix可以操作任何物体,包括机器人从未遇到过的物品。这一点对于家用和非结构化场景中的部署至关重要——家庭环境中物品千差万别,不可能为每一种物品单独训练模型。

与传统模仿学习需要为每个特定任务单独训练数据不同,Helix通过端到端的VLA架构,将视觉语言模型中捕获的丰富语义知识直接转化为机器人动作。家用场景测试中,机器人可以操作训练集中从未包含的番茄酱等物品,验证了零样本泛化的可行性。
表1:Helix模型与传统模仿学习对比
维度传统模仿学习Helix VLA模型
训练方式每个任务单独训练统一供给单个VLA模型
泛化能力仅能执行预训练任务零样本操作新物体
控制范围单一部件控制全上半身端到端控制
协作能力单台机器人多机器人协同合作
部署方式云端与机载混合完全在板载GPU运行

全上半身精准控制与双机协作

Helix通过VLA模型实现了对躯干、手臂、手腕、头部及手指的端到端训练与协调控制。Figure 02全身多达35个自由度,多部位的协同控制会实时改变机器人的视野范围和操作可达空间,形成传统控制方法难以解决的动态反馈闭环。例如当机器人调整躯干姿态以扩大抓取范围时,头部需同步转动保持视觉追踪,同时手指仍需保持精细操作。

Helix还展示了两台机器人协同合作完成任务的场景,这在以往的机器人厂商中是绝无仅有的。系统设计中采用的分层结构使得语言指令能有效指导具体操作,多线程协调能力已预示了未来在多任务处理、多机器人协作方面的潜力。

业内首个完全在嵌入式GPU运行的VLA模型

Helix是业内首个完全在嵌入式GPU上运行分层式大小脑架构的机器人,无需依赖边缘部署或云端算力。这一特性极大地降低了部署门槛,为机器人的商业化应用铺平了道路。Figure CEO表示,鉴于Helix模型进步神速,公司对于机器人家用的时间轴提前了2年,2025年就会开始Alpha测试,部署家用。
点击阅读报告原文: 【中邮证券】机械设备深度报告:深度解析Figure、1X-250314(16页)
相关报告