人形机器人从“预设动作”走向“智能交互”的关键突破正在发生。方正证券2025年3月发布的《人形机器人“醍醐灌顶”走向AGI》深度报告指出,Figure发布Helix——首个真正运行在人形机器人上的端到端VLA(视觉-语言-动作)大模型,以200Hz频率控制35自由度动作空间,实现多机器人协作、零样本泛化抓取等突破。本文从Helix架构、VLA范式、产业意义三个维度分析端到端大模型对人形机器人智能化水平的跃升。
Helix突破瓶颈:从单任务编程到零样本泛化的范式转换
家庭环境是机器人技术面临的最大挑战——与可控的工业环境不同,家庭场景中存在多类多性质的物品(易碎玻璃器皿、褶皱衣物、散落玩具),形状、尺寸、颜色和质地都具有不可预测性。传统机器人需要针对每个任务单独编程,无法泛化。Figure Helix通过VLA架构将互联网级语言理解与精准机器人控制相统一,标志着从“单任务行为克隆”到“零样本泛化”的范式转换。Helix的机器人能够仅仅依据自然语言指令,抓取任何小型家用物体,甚至包括数千种训练过程中从未出现的陌生物品——这种“零样本泛化”能力此前仅存在于大语言模型中,首次被迁移到人形机器人物理执行层面。在双机器人协作存储杂货的挑战场景中,两台Figure机器人使用相同Helix模型权重,通过自然语言提示(如“递饼干袋给右边机器人”)协同作业,无需针对个体训练或明确角色分配。
S1-S2分层架构:快思考+慢思考的机器人神经中枢
Helix的核心创新在于“S1-S2”分层架构,模拟人类的“快思考/慢思考”双系统。System 2(S2)是一个7B参数的视觉语言模型(VLM),以7-9Hz频率处理图像、机器人状态及自然语言指令,提取高层语义目标(如“将饼干递给右侧机器人”),利用大规模互联网预训练实现零样本跨物体/跨场景理解——“慢思考”。System 1(S1)是一个80M参数的跨注意力Transformer,以200Hz的高频接收来自S2的潜向量、实时图像及状态信息,输出涵盖手腕位姿、手指屈伸、躯干和头部姿态等35自由度的连续控制指令——“快思考”。S2低频更新语义目标,S1高频调整动作,形成“S2指导方向、S1实时执行”的闭环。Helix是首个能够以200Hz高频对人形机器人整个上半身进行连续控制的VLA,控制范围涵盖手腕、躯干、头部乃至每个手指的灵巧动作。Helix完全在嵌入式低功耗GPU上运行,无需昂贵设备即可直接投入商业应用。
VLA三种范式与端到端架构的产业意义
VLA模型整合视觉、语言与行动决策,极大提升机器人对复杂环境的理解适应能力。当前VLA主要分为三类范式:显式端到端VLA(将视觉语言信息压缩成联合表征再映射到动作空间,最常见)、隐式端到端VLA(利用video diffusion预测未来状态再生成动作,更注重可解释性)、分层端到端VLA(发挥大小模型特点,保持泛化性的同时维持高频执行,Helix属于此类)。端到端模型嵌入人形机器人是行业的重要突破。此前端到端大模型主要运用于自动驾驶,Figure Helix首次将其真正运行在人形机器人上。VLA可赋予机器人精准控制、灵活协作与强大抓取能力——以200Hz协调35自由度动作空间,能精准控制手指、末端执行器、头部及躯干动作,头部可追踪手部、调整躯干抓取,全程精确控制手指,这是先前VLA系统未做到的。VLA模型有望带领具身智能进入感知时代,让机器人可在多样场景自主决策,灵活应对未知环境。
从VLA走向AGI:人形机器人智能水平的阶梯式跃升
VLA模型的引入代表了人形机器人智能水平的阶梯式跃升。传统机器人依赖预设程序:工程师为每个动作编写代码,机器人只能在特定场景执行特定任务。VLA赋能后,机器人可理解自然语言指令、识别未见过的物体、自主规划动作序列、在多机器人系统中动态协调。这种能力的突破意味着人形机器人的应用边界将从“结构化工业场景”拓展至“非结构化家庭/服务场景”。Helix已证明VLA可让人形机器人在家庭环境中处理各类物品,未来随着VLA模型规模扩大、训练数据丰富、物理世界交互经验积累,人形机器人有望从工业场景走向通用场景,从“专用工具”进化为“通用助手”,真正走向AGI的物理世界入口。
Helix VLA核心技术参数| 模块 | 参数 | 功能 | 频率 |
|---|
| System 2(S2) | 7B参数VLM | 语义理解与高层规划(慢思考) | 7-9Hz |
| System 1(S1) | 80M参数Transformer | 实时动作生成(快思考) | 200Hz |
| 控制自由度 | 35自由度 | 手腕/手指/躯干/头部连续控制 | 200Hz |
| 部署硬件 | 双低功耗嵌入式GPU | 无需昂贵设备即可商业化 | — |