机器人训练数据的匮乏是当前具身智能发展的最大瓶颈。中泰证券研究报告指出,对比不同模态的数据量,文本模态约15T tokens,图片6B图文配对,视频2.6B视听特征,而机器人模态仅有240万个数据片段,数据缺口高达5-6个数量级。为突破数据瓶颈,业界正并行探索四种数据积累方法:远程操作(质量高但采集效率低)、AR(降低采集门槛)、仿真(最有望规模化,但需巨大算力)、视频学习(利用海量互联网视频,但存在控制与感知Gap)。英伟达DexMimicGen可从5个源演示生成1000个灵巧手操作演示,策略成功率从源演示的0.7-62%大幅提升至69.3-97.3%。宇树、智元、特斯拉等厂商均通过开源或自建数据工厂加速数据积累。数据瓶颈的突破速度将直接决定具身智能产业化的时间表。
数据缺口——机器人模态仅为文本的1/6000万
机器人AI发展的最大瓶颈是训练数据的极度匮乏。对比不同模态的数据量:文本模态约15T tokens(用于训练GPT等大语言模型),图片模态有6B图文配对数据,视频模态有2.6B视听特征数据。而机器人模态仅有240万个数据片段——仅为文本数据的约1/6000万、图片数据的约1/2500、视频数据的约1/10000。数据缺口如此巨大,是因为机器人数据采集需要物理硬件、专业操作人员和大量时间成本。一个单臂机器人任务的数据采集通常需要多个操作员、数月人力投入;类人机器人的双臂+多指灵巧手控制更复杂,数据采集困难呈指数级上升。数据稀缺直接制约了具身大模型的训练效果和泛化能力。
四大数据采集方法——远程操作、AR、仿真、视频学习
业界正并行探索四种数据积累方法。远程操作:由实验人员操作机械手柄远程控制机器人积累数据,质量高但采集效率低,类人机器人遥操作界面成本高昂难以规模化。AR:通过增强现实提供视觉反馈和触觉警告,指导用户收集高质量演示,降低数据采集门槛。斯坦福ARCap系统使新手用户也能收集与机器人运动学匹配的可执行数据。仿真:通过海量算力模拟运算生成训练数据集,最有可能实现规模化数据生成。英伟达DexMimicGen从5个源演示生成1000个演示,策略成功率大幅提升。视频学习:通过多模态大模型让机器人直接从YouTube等视频中学习,可利用海量互联网数据,但面临控制Gap(无机器人本体运动数据)和感知Gap(人类视角vs机器人视角)的挑战。
H3:仿真突破——DexMimicGen的5→1000演示放大
英伟达等研究机构的DexMimicGen展示了仿真数据生成的巨大潜力。DexMimicGen基于少量人类演示(5个源演示生成1000个演示),通过物理仿真中的演示转换和重放,自动生成大量适用于双手灵巧操作场景的训练数据。研究团队从60个源演示中总共生成了21000个演示,涵盖9种不同任务。实验结果显示:仅依赖源演示训练的BC-RNN成功率在多种任务中仅为0.7-62%;而基于DexMimicGen数据集训练的机器人成功率大幅提升至69.3-97.3%,几乎所有任务中性能都实现了质的飞跃。且随着DexMimicGen数据量的增加,策略性能持续提升。仿真方法的规模化能力(可生成任意规模数据)使其成为最有可能突破数据瓶颈的路径。
H4:开源生态加速数据积累——宇树、智元、特斯拉
主要厂商正通过开源或自建数据工厂加速数据积累。宇树机器人2024年12月开源数据采集工具(Robot OS模拟包、Apple VisionPro遥操作、RLGYM仿真)和数据集(5种操作,640×480分辨率,手臂和灵巧手七维状态数据)。智元机器人在上海建设数据采集工厂(近百台机器人,日均采集3-5万条数据),开源AgilBotWorld数据集(超100万条真实操作数据,覆盖家居40%、餐饮20%、工业20%、商超10%、办公10%五大场景,80余种技能,3000多种物品),2025年2月开源仿真框架AgilBotDigitalWorld。特斯拉招募“数据收集操作员”穿戴动作捕捉服、VR头显模拟机器人动作。开源策略有助于降低行业数据采集门槛,加速整体数据积累。未来随着数据量从百万级向亿级跨越,具身智能的能力将迎来质的飞跃。
表:不同模态数据量对比| 模态 | 数据量 | 数据来源 |
|---|
| 文本 | 15T tokens | 互联网文本 |
| 图片 | 6B图文配对 | 互联网图像 |
| 视频 | 2.6B视听特征 | 互联网视频 |
| 机器人 | 240万片段 | 遥操作/仿真/视频 |