人形机器人产业化落地的核心瓶颈并非形态工程,而是通用智能的补足。东吴证券最新发布的机器人大模型深度报告指出,尽管人形形态早已实现工程可行,但过去长期停留在“仿形不仿智”阶段。多模态大模型的兴起为人形机器人提供了“初级大脑”,从SayCan的语言规划到Helix的200Hz快慢脑并行架构,机器人大模型正经历快速迭代。然而,当前主流产品智能水平普遍仅处于L2初级阶段,距离真正泛化仍有较远距离。数据端,训练场建设与光学动捕设备正加速放量,仿真与真实数据融合训练成为行业共识。本文将从智能化必要性、架构演进、数据端进展三个维度,解析机器人大模型的产业趋势与投资机遇。
人形机器人智能化分级——L2初级阶段到泛化智能的跨越
尽管人形机器人的形态早已实现工程落地(2000年本田ASIMO、2013年波士顿动力Atlas均具备出色运动能力),但执行逻辑高度依赖预设行为库,无法自主理解任务或适应环境变化,本质上是“人形的机器”而非“具备人类智能的机器人”。北京市人形机器人创新中心牵头制定的全球首个《人形机器人智能化分级》标准,从感知认知、决策学习、执行表现、协作交互四维度划分L1-L5五级。目前主流产品智能水平普遍仅在L2左右,尚未具备自主泛化与应变能力。多模态大模型的突破使机器人首次具备“感知—理解—决策”潜力——大语言模型验证了通过互联网文本训练推理能力的可行性;视觉语言模型进一步拓展模态边界。而动作模态的融入,才真正赋予机器人执行操作的能力。一旦具备初步智能化能力,机器人即可在特定场景落地应用,并通过“数据飞轮”(收集数据→改进模型→提升产品→吸引更多数据)开启迭代循环。然而,通往真正泛化智能仍需突破模型、数据与算力多重门槛。
架构演进——从SayCan到Helix,动作频率从1Hz到200Hz
机器人大模型发展由多模态、动作频率和泛化能力三条主线驱动。2022年SayCan将LLM与可行性评估结合,在厨房实验中规划成功率81%、执行成功率60%;2022年RT-1实现端到端Transformer控制(13万条轨迹、700+任务,成功率97%);2023年PaLM-E融合语言、视觉和传感器状态,实现多模态推理;2023年RT-2将动作信息纳入VLM模型,但动作输出仅1-5Hz;2024年π0引入动作专家(FlowMatch),输出50Hz动作轨迹;2025年Helix采用7B参数“慢脑”(高层思考)+80M参数“快脑”(实时执行)的并行架构,输出200Hz动作序列,实现零样本多机器人协同及拾取涌现能力。FiS-VLA进一步优化双系统融合,将VLM末端2层Transformer重构为执行模块嵌入“慢思考”内部,形成统一高效推理与控制模型。同时利用扩散建模增强动作生成能力。动作频率的提升直接决定了机器人操作的流畅性与响应速度,是衡量模型实用性的关键指标。
数据端——训练场建设加速,光学动捕成为关键基础设施
数据是大模型训练的基础,模型性能遵循Scaling Law,1亿条高质量行为轨迹数据是支撑具身智能大模型能力跃迁的关键门槛。数据金字塔中,海量互联网视频数据获取成本低但价值低;仿真数据性价比高(英伟达Cosmos世界模型平台提供合成数据);真实数据价值最高但采集效率低(双足机器人每小时仅3-4条有效数据)。行业主流按“仿真+真机”混合训练,不同机构路径分化——银河通用99%+合成数据,智元100%真机数据驱动,北京人形机器人创新中心仿真:真实=7:3。光学动捕与惯性动捕各有侧重:光学动捕亚毫米级精度、无累计误差,但造价贵、场地受限(8-10工位约300万元,海外系统为国产3-4倍);惯性动捕便携、成本低,但存在位置漂移和磁场干扰。训练场建设正打开动捕设备放量空间,优必选、Tesla、华为等正加速搭建“仿真-真机融合”数据训练场。可穿戴动捕设备有望提供新思路,但数据保存和质量把控尚未形成技术闭环。
未来方向——世界模型与多模态扩展
未来具身大模型将在三方面持续演进。模态扩展:当前主流模型仅涵盖视觉、语言、动作三模态,触觉或为下一个融入的模态(VTLA已有相关储备,戴盟、帕西尼等已有技术布局)。世界模型:以英伟达Cosmos为代表的架构通过学习状态转移规律,实现“感知—建模—预测—决策”闭环,赋予机器人“想象力”。训练数据融合:仿真与真实数据融合训练成为主流方向,高标准、可扩展的训练场正成为通用机器人训练体系的关键支撑。模型端建议关注银河通用(GraspVLA全仿真数据路线)、星动纪元(ERA-42双系统架构+世界模型)、智元机器人(ViLLA架构+EVAC世界模型);数据采集领域建议关注凌云光(动捕产品市占率第一,2025Q1营收+38.57%)、奥比中光(3D视觉五大技术路线布局);数据训练场领域建议关注天奇股份(与优必选、银河通用合作,精度≥99.2%)。
机器人大模型架构演进关键节点
表1:机器人大模型架构演进关键节点| 模型 | 发布时间 | 核心架构 | 动作频率 | 关键突破 |
|---|
| SayCan | 2022年4月 | LLM+可行性模型 | — | 语言规划+动作可行性评估 |
| RT-1 | 2022年12月 | 端到端Transformer | 实时 | 首个大规模型端到端控制 |
| PaLM-E | 2023年3月 | 多模态语言模型 | — | 感知-语言-行动自然耦合 |
| RT-2 | 2023年7月 | VLA(端到端) | 1-5Hz | 动作信息纳入VLM |
| π0 | 2024年10月 | VLM+动作专家 | 50Hz | FlowMatch适配Action Chunking |
| Helix | 2025年2月 | 快慢脑并行架构 | 200Hz | 零样本多机协同 |