跳到正文

借助 NVIDIA Cosmos 世界基础模型扩展合成数据与物理 AI 推理

NVIDIA 介绍了 Cosmos 世界基础模型的最新进展,重点包括 Cosmos Transfer 如何基于结构化输入生成符合物理规律的高保真、可控合成视频,以支持机器人和自动驾驶训练。

功思 AI 编辑部

约 2 分钟读完

借助 NVIDIA Cosmos 世界基础模型扩展合成数据与物理 AI 推理

下一代由 AI 驱动的机器人,如人形机器人和自动驾驶车辆,依赖高保真、具备物理感知能力的训练数据。如果缺少多样且具有代表性的数据集,这些系统就无法得到充分训练,并会因泛化能力不足、接触真实世界变化有限,以及在边缘场景中出现不可预测行为而面临测试风险。为训练而采集海量真实世界数据成本高、耗时长,而且往往受限于现实条件。

NVIDIA Cosmos 通过加速世界基础模型(WFM)的开发来应对这一挑战。在其平台核心,Cosmos WFM 可加快合成数据生成,并作为后训练的基础,用于开发下游领域或任务专用的物理 AI 模型,以解决这些问题。本文将介绍最新的 Cosmos WFM、它们推动物理 AI 发展的关键能力,以及如何使用它们。

Cosmos 世界基础模型更新:

NVIDIA Cosmos 世界基础模型持续快速演进,并取得了显著进展,进一步加快了合成数据生成和物理 AI 开发。在推出一年后,主要更新包括:

用于生成符合物理规律的逼真视频的 Cosmos Transfer

Cosmos Transfer 可根据结构化输入生成高保真的世界场景,确保精确的空间对齐和场景构图。

Cosmos Transfer 采用 ControlNet 架构,在保留预训练知识的同时,实现结构化且一致的输出。它利用时空控制图,动态对齐合成表示与真实世界表示,从而对场景构图、物体摆放和运动动态进行细粒度控制。

输出:具有受控布局、物体摆放和运动的逼真视频序列。

图 1:左侧是在 NVIDIA Omniverse 中创建的虚拟仿真或“真值”;右侧是使用 Cosmos Transfer 进行逼真化转换后的结果。

使用 Cosmos Transfer 生成可控的合成数据

借助生成式 AI API 和 SDK,NVIDIA Omniverse 加快了物理 AI 仿真。开发者使用基于 OpenUSD 构建的 NVIDIA Omniverse 创建 3D 场景,以准确模拟真实世界环境,用于训练和测试机器人与自动驾驶车辆。这些仿真可作为 Cosmos Transfer 的真值视频输入,并结合标注和文本指令。Cosmos Transfer 在提升逼真度的同时,还可改变环境、光照和视觉条件,以生成可扩展且多样化的世界状态。

这一工作流加快了高质量训练数据集的创建,确保 AI 智能体能够从仿真有效泛化到真实世界部署。

Cosmos Transfer 通过在用于合成操作动作生成的 Isaac GR00T Blueprint,以及用于在不同环境和天气条件下进行训练的 Omniverse Blueprint for Autonomous Vehicle Simulation 中提供更真实的光照、颜色和纹理,增强了机器人开发能力。这类逼真数据对后训练策略模型至关重要,能够确保从仿真到现实的平滑迁移,并支持感知 AI 和 GR00T N1 等专用机器人模型的训练。

参与讨论

正在确认登录状态…