返回顶部
返回首页 会员充值 我的足迹 返回上一页
跳转三个皮匠报告小程序
具身智能
情绪经济
商业航天
十五五
银发经济

端到端具身智能

华金证券在机器人系列报告中指出,端到端模型是具身智能的重要技术路线,它将“大脑”和“小脑”合为一体,通过单一神经网络直接将任务目标转化为控制信号。特斯拉Optimus机器人与谷歌RT-2是端到端路线的典型代表。2025年2月,Figure发布Helix VLA端到端模型,实现视觉和语言到动作的直接映射。本报告基于华金证券研报,分析端到端具身智能的技术原理、代表案例与算力需求。

端到端具身智能——从感知到动作的直接映射

端到端具身智能的核心思想是:通过单一的神经网络,直接从多模态感知输入(视觉、语言指令)生成输出动作,无需分层决策中的中间表示和人工规则设计。这种架构将传统“大脑+小脑”的分层结构合为一体,通过端到端训练实现从输入到输出的无缝衔接。

端到端的优势体现在三个方面。第一,减少误差传递,避免了分层架构中上层决策误差向下层传导的累积效应。第二,能力涌现,端到端模型在海量数据训练后可能展现出训练数据中未明确标注的泛化能力。第三,统一优化,整个系统可以通过统一的损失函数进行端到端优化,理论上能达到全局最优。

但端到端路线也面临显著挑战。该模式需要海量数据(机器人模态仅240万片段),全程调用大模型,资源消耗巨大,动作响应速度较慢。此外,端到端模型的“黑箱”特性使其可解释性较差,在安全关键场景中可能面临监管障碍。

代表案例——特斯拉Optimus、谷歌RT-2与Figure Helix

特斯拉Optimus机器人采用端到端模型路线,与特斯拉在自动驾驶领域的技术路径一脉相承。Optimus通过端到端神经网络直接将视觉感知转化为关节控制信号,无需传统机器人中的运动规划中间步骤。特斯拉计划2026年正式推出Optimus并已开始建设生产线。

谷歌RT-2是另一代表性项目。RT-2将大语言模型的知识迁移到机器人控制中,实现了从视觉输入和自然语言指令到机器人动作的端到端生成。RT-2展示了端到端路线在泛化能力上的优势——能够在未见过的场景中执行新指令。

2025年2月20日,Figure发布通用人形机器人控制的VLA端到端模型Helix。Helix实现了从视觉输入和自然语言指令到机器人动作的直接映射,克服了传统方法中需要大量任务特定训练的限制。其高效训练、强大泛化能力和多机器人协作功能,使其在人形机器人领域具有显著优势和广阔的应用前景。

算力需求——从L2到L5的指数级放大

端到端具身智能对算力的需求远高于分层决策模型。端到端模型需要在推理阶段全程调用大模型进行视觉理解、语言解析和动作生成,每个环节都需要大量计算资源。

自动驾驶的算力需求曲线提供了参照。从L2到L5,自动驾驶对算力的需求呈指数级放大。L2级别仅需数TOPS的算力,L3需要数十TOPS,L4需要数百TOPS,而L5全自动驾驶可能需要数千TOPS甚至更高。智算中心的建设已成为端到端自动驾驶的标配。

人形机器人作为物理AI的核心载体,对算力的需求趋势与自动驾驶类似但要求更高。机器人需要在三维物理空间中实时感知、理解和行动,涉及视觉、语音、触觉、力觉等多模态信息的融合处理,对算力密度和实时性提出了更高要求。英伟达Jetson Thor(2070 TFLOPs)正是针对这一需求而设计。
表:分层决策与端到端路线对比
维度分层决策端到端
架构大脑+小脑分离,层级处理单一神经网络,输入直接到输出
代表案例Figure 02(三层级)、智元El-Brain特斯拉Optimus、谷歌RT-2、Figure Helix
数据需求适中海量(机器人模态仅240万片段)
算力需求适中指数级放大,从L2到L5急剧增长
响应速度快(底层1khz)较慢(全程调用大模型)
可解释性好(层级明确)差(黑箱特性)
点击阅读报告原文: 电子行业机器人系列深度报告:具身智能大时代算力芯片筑底座-250825(39页)
相关报告