将模拟环境中训练的机器人策略迁移到真实世界,是机器人领域长期面临的“sim-to-real”难题。民生证券研报指出,英伟达Robocasa首次论证了real-sim-real的闭环可行性——通过在模拟环境中大规模训练,再将策略迁移到真实世界,实验结果证明模拟器的丰富多样性以及视觉和物理真实性显著改善了模拟效果。数字表亲(Digital Cousin)方法进一步实现了零样本迁移,真实厨房环境中任务成功率达90%。real-sim-real的验证意味着机器人训练可以从昂贵的真实数据采集转向高效的模拟数据生成,大幅降低训练成本。本文将深度解析real-sim-real技术路径的突破与产业意义。
Robocasa:首次论证real-sim-real可行
英伟达Robocasa是首个系统论证real-sim-real可行的研究框架。该框架专注于现实生活环境(尤其是厨房环境),提供超150个对象类别、数千个3D资产,通过现实物理模拟扩展环境、任务和数据集。Robocasa使用GPT-4生成20个高级厨房活动清单,再生成75个复合任务(如煮咖啡、洗碗等),并通过MimicGen自动生成10万条额外轨迹。在真实世界实验中,Robocasa团队比较了仅在真实数据训练(Real only)和真实+模拟共同训练(Real+Sim)的策略表现。结果显示,Real only在已知对象上平均成功率仅13.6%,而Real+Sim成功率提升至24.4%,最高提升达79%。在未知对象上,Real only仅2.6%,Real+Sim提升至9.3%。实验结果首次证明了模拟器的丰富多样性以及视觉和物理真实性能够显著改善sim-to-real迁移效果。
表:Real only vs Real+Sim成功率对比| 任务对象 | Real only | Real+Sim | 提升幅度 |
|---|
| 已知对象 | 13.6% | 24.4% | +79% |
| 未知对象 | 2.6% | 9.3% | +258% |
数字表亲:零样本迁移成功率90%的突破
数字表亲是real-sim-real路径的最新突破。与数字孪生(精确复制真实场景)不同,数字表亲没有直接模拟现实世界的特定对应物,而是模拟出类似几何形状和语义功能的虚拟场景,大幅降低生成成本的同时提供更好的泛化能力。研究团队提出的ACDC算法从单张RGB图像全自动生成完全交互式的虚拟场景,无需人工注释。在真实厨房环境中,经过在数字表亲环境专门训练后,机器人成功完成开启橱柜任务,从模拟到现实的零样本迁移成功率达90%。数字表亲方法在原始分布上性能与数字孪生相当,但在分布外场景中表现更稳定、鲁棒性更强。这为机器人学习在复杂、多变真实环境中的应用开辟了新可能性。
模拟数据生成的规模化效应
real-sim-real路径的核心优势在于模拟数据的规模化生成能力。Robocasa使用MimicGen自动生成10万条轨迹,仅需少量人类演示种子即可扩展为大规模数据集。Robocasa支持移动机械手和仿人机器人,拥有2509个高质量3D资产(涵盖153个类别),场景和任务可无限多样化。随着生成数据量的增加,模型性能稳步提高——在25个原子任务中,仅人类演示成功率20.8%,增加MimicGen生成数据后提升至47.6%。这种规模化效应意味着,一旦模拟框架建立,训练数据的边际成本极低,而模型性能持续提升。民生证券研报指出,数据生成工具使模型能够以相对较低的成本学习更多高性能策略,是未来机器人训练的核心范式。
real-sim-real对机器人产业的意义
real-sim-real路径的验证对机器人产业具有三重意义。第一,训练成本大幅降低——真实世界数据采集(动作捕捉、VR远程操作)成本高昂且难以规模化,模拟数据生成几乎零边际成本,机器人训练将从“真实数据依赖”转向“模拟为主、真实为辅”。第二,泛化能力提升——数字孪生仅覆盖有限场景,数字表亲可生成无限多样的训练场景,策略在分布外场景中表现更稳定,零样本迁移成为可能。第三,Scaling Law可兑现——Scaling Law要求海量训练数据,唯有通过模拟数据生成才能满足机器人领域的数据规模需求。Robocasa已提供超10万条轨迹,未来随着模拟框架扩展至更多场景和任务,数据规模有望达到百万甚至千万级别,推动机器人能力按Scaling Law持续提升。