返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

具身智能技术进展

具身智能正从实验室走向现实应用,多项关键技术突破加速了这一进程。民生证券研报系统梳理了2022-2024年具身智能的核心进展:谷歌RT-2将视觉-语言模型与机器人控制结合,参数达55B;RoboCat实现自我改进循环,跨具身多任务泛化;英伟达MimicGen从少量演示生成5万条数据;李飞飞团队Rekep提出三任务闭环解决方案。这些突破共同指向一个方向——机器人正在获得更强的泛化能力、推理能力和自我学习能力。本文将深度解析具身智能的关键技术进展与产业化路径。

RT-2:视觉-语言-动作模型,55B参数实现开放词汇推理

谷歌RT-2是具身智能领域的里程碑。RT-2将机器人动作表示为文本token,与Web规模的视觉-语言数据集联合训练,输出低级机器人动作,同时解决其他互联网规模的视觉语言任务。RT-2基于PaLM-E和PaLI-X两种VLA模型,参数可达55B,远超RT-1的参数量级。核心方法是通过ViT提取图像特征,将动作token化为语言token,嵌入模型语言字典,通过大语言模型解析任务并转化为具体动作序列。RT-2展示了强大的泛化能力——能够推广到各种需要推理、符号理解和人类识别的现实世界情况,例如精准识别任务需求并以过往训练经验为基础完成拾取、移动、放置等具体任务。RT-2证明了VLM可以转变为强大的VLA模型,通过结合VLM预训练和机器人数据直接控制机器人,具有更好的泛化能力和涌现能力。
表:RT系列模型对比
模型参数量核心创新泛化能力
RT-1EfficientNet-B3机器人动作token化有限
RT-255BVLA+联合微调开放词汇推理

RoboCat:自我改进循环,跨具身多任务泛化

谷歌RoboCat是自我改进型多任务、多具身通才智能体。RoboCat基于Gato架构,使用VQ-GAN编码器,在涵盖多个领域和具身的广泛数据集上训练,通过视觉目标条件指定任务。自我改进流程:初始在多样化训练集训练→通过100-1000次演示微调适应新任务→部署在真实机器人生成数据→将生成轨迹加入下一次迭代训练数据→提高跨任务性能。RoboCat支持多种机器人具身和控制模式,在新任务上仅需少量示教样本即可快速泛化。随着训练数据增长和多样化,RoboCat不仅表现出跨任务迁移迹象,也能更有效适应新任务。RoboCat的核心价值在于构建了一个自主改进循环,为大规模利用异构机器人数据提供了可行方案。

MimicGen:从少量演示到大规模数据自动生成

英伟达MimicGen解决了机器人学习中最大的瓶颈——数据收集成本。MimicGen从少量人类演示数据(少于200个)中,通过数据分割与重组技术,自动生成超过50,000条高质量演示数据,覆盖18种任务。核心方法是将人类演示分割成以物体为中心的子任务片段,然后在新场景中通过空间变换和轨迹生成,自动重组为新的演示数据。测试结果显示,“Square”任务成功率从11.3%提升至90.7%,“Threading”任务从19.3%提升至98.0%,“Kitchen”任务从54.7%提升至100%。MimicGen适用于各种长时间、高精度任务,可适应不同机器人硬件和复杂操作环境,显著减少了人工干预。这一技术为Scaling Law在机器人领域的兑现提供了数据规模支撑。

李飞飞Rekep:三任务闭环解决方案

李飞飞团队Rekep提出了一种针对机器人操作任务的新型空间和时间约束表示方法。Rekep将操作任务表述为具有关系关键点约束的分层优化问题,使用DINOv2在场景中提取细粒度语义关键点,将叠加关键点的图像和指令输入GPT-4o生成Rekep约束(Python程序),通过分层优化程序求解末端执行器姿态序列。Rekep将操作任务分解为多个阶段,为每个阶段指定子目标约束和路径约束,以约10Hz频率实时求解,实现三任务闭环解决方案。在倒茶、摆放书本、叠衣服等任务中,Rekep无需特定任务数据或环境模型即可构建正确约束并执行。Rekep是李飞飞团队提出的“空间智能”概念的关键技术实现,通过结构化方式理解和操作三维空间,增强了机器人的空间感知和操作能力。
点击阅读报告原文: 机械行业星海系列:人形机器人与AI大模型之Robot+AI的Transformer之旅-241107(54页)
相关报告