2000万小时视频训练、开源许可、小中大三个模型规模——英伟达Cosmos的发布标志着物理AI从概念走向基础设施。黄仁勋将Cosmos与Omniverse的融合称为“物理AI时代的基座”,定义了从数字孪生到AI训练再到边缘部署的完整循环。这份报告深度拆解英伟达Cosmos平台的技术架构、生态布局与产业影响。
Cosmos——全球首个世界基础模型
英伟达在2025年CES上发布Cosmos模型,是全球首个专为理解物理世界打造的世界基础模型(World Foundation Model,WFM)。Cosmos在2000万小时的视频数据上训练而成,这些视频聚焦动态物理事物,包含自然主题、人类行走、手部动作、操控物体以及快速相机运动,核心目标是教会AI理解物理世界而非生成创意内容。
Cosmos模型具备物理AI的核心能力:通过多模态的模拟生成不同结论和结果,实现对复杂物理世界的实时理解和互动。其模型逻辑是通过对过去的视觉观测序列和当前的扰动,预测生成世界的物理状态。
英伟达同时宣布Cosmos开源许可,在GitHub上线小、中、大不同规模模型——快速模型(适合实时响应)、主流模型(平衡性能与效率)、知识转移模型(适合复杂任务迁移),赋能机器人和工业AI领域。
Cosmos+Omniverse融合——物理AI时代的基座
英伟达将Cosmos与Omniverse深度融合,构建物理AI时代的核心基础设施:
- Omniverse:基于算法物理、原理物理、模拟构建的系统,提供高保真3D场景创建和物理仿真能力
- Cosmos:作为基于真实场景物理规律的多元宇宙生成器,为Omniverse生成内容提供多样化的世界状态
- 融合价值:Omniverse为Cosmos提供基准事实、控制调节生成结果;Cosmos为Omniverse注入生成式AI能力,实现物理场景的快速扩展
基于Cosmos和Omniverse,英伟达定义了未来物理AI领域的全新生产方式:数字孪生(Omniverse)+ AI训练(DGX)+ AI部署(Jetson)三者构成的循环。这一循环覆盖了从虚拟环境构建、合成数据生成、模型训练验证到边缘部署的全链条。
技术架构——从WFM到合成数据工厂
Cosmos Transfer——结构化生成与物理一致性
Cosmos Transfer WFM根据结构化输入生成高保真世界场景,确保精确的空间对齐和场景构成。通过采用ControlNet架构,Cosmos Transfer可保留预训练知识,利用时空控制图动态对齐合成和真实世界的表示,实现对场景构图、对象位置和运动动力学的精细控制。
开发者使用基于OpenUSD构建的NVIDIA Omniverse创建3D场景以模拟现实环境,这些模拟可作为Cosmos Transfer的真值视频输入,与标注和文本指令相结合。Cosmos Transfer可在改变环境、照明和视觉条件的同时增强逼真度,生成可扩展的多样化世界状态。
合成数据生成管线——弥补真实数据不足
借助NVIDIA NIM微服务和Omniverse Replicator等工具,开发者能够加速创建可靠、多样化的数据集来训练物理AI。Replicator具有域随机化内置功能,允许在3D仿真过程中更改许多物理参数,结合采用ControlNet的扩散模型进一步增强生成图像。
此前自动驾驶汽车可能需要行驶数百万英里才能遇到足够多的边缘场景,但在Omniverse中通过Cosmos能力可快速生成和验证场景以供训练,大幅降低数据采集成本和时间。
GROOT模型家族——通用人形机器人基础模型
英伟达开源的GROOT N1是全球首个通用人形机器人开放基础模型,标志着机器人和AI领域的重大突破。GROOT N1基于受人类认知启发而构建的双系统架构,统一了视觉、语言和动作,使机器人能够理解指令、感知环境并执行复杂的多步骤任务。
GROOT N1.5模型支持自然语言指令和环境自适应,仅需36小时即可完成训练(传统方法需3个月),在工业物料分拣中任务成功率提升至85%。模型通过多模态大模型融合视觉、语言、触觉数据,使机器人在工业分拣、家庭服务等场景中实现“学一次,用百次”的跨场景泛化能力。
三台计算机方案——从云端到边缘的完整算力部署
英伟达提出人形机器人“三台计算机”解决方案:
- 第一台(训练) :NVIDIA DGX超级计算机,搭载H100或B100处理器,用于训练生成式AI模型和机器人基础模型,提供FP1ops级算力
- 第二台(仿真) :NVIDIA OVX计算机,搭载RTX GPU,用于合成数据生成、机器学习和仿真测试,基于Omniverse构建的Isaac Sim和Isaac Lab框架
- 第三台(部署) :安装在机器人本体的实时计算机Jetson Thor,基于Blackwell架构,运行低延迟和高吞吐量推理
Jetson Orin系列提供7个具有相同架构的模组,算力高达275 TOPS。软件堆栈包含预训练的AI模型、参考AI工作流和垂直应用框架,可加速生成式AI的端到端开发以及边缘AI和机器人应用。
生态影响——从工具到平台
英伟达通过Cosmos+Omniverse+DGX+Jetson构建了覆盖硬件、算法、开发工具及应用的完整物理AI生态。短期来看,Jetson Thor作为端侧“超级大脑”,将推动机器人从执行端向具备环境认知与自主决策的智能体跃迁;中长期来看,开源生态的壮大将降低物理AI开发门槛、促进社区协作和创新。
英伟达高管Rev Lebaredian指出,物理AI有望撬动万亿美元级市场。凭借其全栈技术方案,英伟达在物理AI时代正从“GPU供应商”演变为“物理AI基础设施平台”提供商。