SimFoundry:让机器人拥有无限经验的“仿真工厂”
统计 阅读时间大约7分钟(2589字)

1天前 SimFoundry:让机器人拥有无限经验的“仿真工厂”

来源:豆包
从一个真实视频,到可以训练机器人的虚拟世界

出品:具身释界

近年来,机器人领域正在经历一次重要变化。

随着 Vision-Language-Action(VLA)模型的发展,机器人已经开始具备理解视觉信息、语言指令,并执行复杂任务的能力。但与此同时,一个核心问题仍然没有被完全解决:

机器人需要大量高质量数据,而真实世界的数据采集成本极高。

训练一个机器人完成简单的抓取任务,可能需要大量人工遥操作;而对于更加复杂的任务,例如整理桌面、打开抽屉、双臂协作等,仅依靠真实机器人采集数据往往需要数月甚至更长时间。

因此,机器人研究者一直希望建立这样一个闭环:

真实世界提供少量经验;

仿真环境自动扩展数据;

机器人在仿真中学习;

最后回到真实世界执行任务。

但过去的问题在于:

如何快速、自动地创建一个足够真实的机器人仿真环境?

传统仿真环境通常需要人工建模,包括:

创建物体模型;

设置物体位置;

调整物理参数;

编写任务逻辑。

这使得仿真本身成为一个新的瓶颈。

SimFoundry提出的核心思想是:

只需要输入一个真实环境的视频,就可以自动构建一个可交互的数字孪生,并进一步生成大量新的训练环境。

论文标题为:

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

该工作由 NVIDIA、Stanford University、Georgia Tech 等机构共同完成。论文提出了一套完整的 Real-to-Sim 系统,将真实世界、仿真环境以及机器人策略训练连接起来。

7859c892290ca4e129b030262e8759f9.png

图1展示了 SimFoundry 的整体目标。左侧是真实世界场景,中间是系统生成的数字孪生(digital twin),右侧则是基于数字孪生扩展出的 object cousins、scene cousins 和 task cousins。通过这些变化,单个真实环境可以扩展成为大量用于机器人训练和评估的模拟环境。

从真实视频自动构建数字孪生

SimFoundry 的输入非常简单:

一个 RGB 视频。

系统首先需要理解视频中的环境。

例如,一个桌面场景:

机器人需要知道:

桌面在哪里;

有哪些物体;

每个物体的位置;

物体之间的空间关系。

为此,SimFoundry 首先进行场景解析(Extraction)。

它利用视觉基础模型完成:

深度估计;

目标检测;

图像分割;

点云生成。

最终得到每个物体对应的信息,包括:

RGB 图像;

depth 信息;

segmentation mask;

三维位置。

简单来说,这一步相当于让 AI 先“看懂”真实世界。

9fe39d2ad62720f9c4516c83efc316fc.png

图2展示了 SimFoundry 的完整 pipeline。整个系统分为三个阶段:Extraction、Generation 和 Augmentation。第一阶段从真实视频中提取物体和场景信息;第二阶段生成具有物理属性的仿真环境;第三阶段进一步创造不同类型的数字表亲,用于扩大训练数据。

完成场景理解后,SimFoundry 会进入第二阶段:

Simulation Generation(仿真生成)。

对于每个真实物体,系统会生成对应的三维模型。

例如:

一个真实杯子:

二维图片

3D mesh

姿态对齐

物理属性估计

最终得到一个机器人可以交互的对象。

除了视觉外,机器人操作还需要考虑物理世界。

因此 SimFoundry 会进一步加入:

碰撞模型;

质量;

摩擦系数;

关节结构。

例如,对于一个抽屉:

系统不仅生成抽屉外观,还需要知道:

抽屉可以移动;

移动方向;

关节限制。

这样机器人才能真正与环境交互,而不是只是在“看图片”。

从一个环境生成无限可能:Digital Cousins

如果 SimFoundry 只能复制真实环境,那么它只是一个自动建模工具。

真正让它具有价值的是:

Digital Cousins(数字表亲)。

论文提出:

一个真实场景可以扩展成大量保持任务能力、但外观和布局不同的新环境。

这些变化主要分为三个方向。

Object Cousins:改变物体

第一类变化是物体级别。

例如:

原始环境:

一个白色杯子。

系统可以生成:

不同颜色的杯子;

不同形状的杯子;

不同大小的杯子。

但是这些变化不会破坏功能。

对于机器人来说:

它们仍然都是“可以抓取的杯子”。

这种方式可以帮助机器人学习:

不要记住某一个具体物体,而是理解物体背后的功能。

97e7f71b7d316daf1a7dd12b284cba6c.png

图3展示了真实场景、重建出的 digital twin,以及生成出的 digital cousins。可以看到,SimFoundry 不仅能够改变物体外观,还可以同时改变场景布局,使机器人面对更加丰富的环境变化。

Scene Cousins:改变场景布局

第二类变化是空间变化。

现实中,一个任务失败经常不是因为机器人不会操作,而是因为:

物体换了位置。

例如:

训练时:

杯子在桌子左侧。

测试时:

杯子移动到了右侧。

如果机器人只学习固定位置,它很容易失败。

Scene Cousins 可以自动生成:

不同物体排列;

不同空间关系;

不同干扰物。

这样机器人学习的是:

“寻找并操作目标物体”

而不是:

“记住某个位置”。

Task Cousins:创造新的任务

第三类变化更加进一步。

SimFoundry 可以根据场景中的物体和 affordance自动提出新的任务。

例如,一个桌面环境中:

原任务:

拿起杯子。

系统可以生成:

移动杯子;

将杯子放入容器;

整理桌面;

操作多个物体。

这意味着:

一个真实场景不再只对应一个任务,而可以成为一个任务生成平台。

仿真真的能够预测现实吗?

SimFoundry 首先验证了一个关键问题:

仿真环境中的机器人表现,是否能够代表真实世界表现?

作者测试了多个机器人策略,包括:

π0;

π0.5;

GR00T N1.6;

GR00T N1.7;

DreamZero。

测试任务覆盖:

抓取;

放置;

多步骤操作;

双臂协作。

1d698a531a602111212c8eb1615c3408.png

图4左侧展示了 SimFoundry 测试的机器人任务,包括 DROID 单臂任务和 YAM 双臂任务;右侧展示了仿真成功率和真实成功率之间的关系。可以看到,两者高度一致,说明 SimFoundry 生成的环境能够有效预测机器人真实表现。

实验结果显示:

SimFoundry 仿真评估与真实机器人表现之间达到:

Pearson correlation = 0.911

同时平均最大排名误差:

MMRV = 0.018

这意味着:

如果一个模型在 SimFoundry 中表现更好,它通常也会在真实机器人中表现更好。

相比已有方法 PolaRiS,SimFoundry 的相关性提升超过 0.59。

用仿真数据训练机器人,能迁移到现实吗?

除了评估机器人,SimFoundry 更重要的目标是:

直接生成训练数据。

作者测试:

机器人是否可以只利用 SimFoundry 生成的数据训练,然后直接部署到现实环境。

结果非常令人印象深刻。

例如:

YAM 机器人:

Pot on Stove 任务:

成功率达到 99%。

DROID:

Stack Dishware:

成功率达到 100%。

这说明:

高质量的仿真数据确实可以支持真实机器人学习。

数据多样性决定机器人泛化能力

论文进一步研究:

不同类型的 Digital Cousins 是否真的有效。

9285c25e869ccae919f3014d29012c76.png

图5展示了 object cousins、scene cousins 和 task cousins 对机器人性能提升的影响。实验表明,不同类型的数据扩展分别提升了机器人面对新物体、新布局以及新任务时的泛化能力。

实验发现:

Object Cousins:

提升机器人面对未知物体的能力。

Scene Cousins:

提升机器人适应不同空间布局的能力。

Task Cousins:

提升机器人迁移到相关任务的能力。

这说明:

机器人需要的不只是更多数据,

而是:

更多有意义变化的数据。

SimFoundry 对未来机器人学习的意义

过去几十年,机器人发展的最大限制之一就是:

数据规模不足。

人类可以通过观察世界快速学习,因为我们拥有大量经验。

而机器人需要:

真实机器人;

真实环境;

真实交互。

SimFoundry 提供了一种新的思路:

未来机器人训练可能不再完全依赖人工采集数据,而是:

少量真实世界观察

自动生成数字孪生

创造大量虚拟经验

训练机器人模型

部署到真实世界

这和大语言模型的发展非常类似。

语言模型依靠互联网产生海量文本经验;

机器人模型则可能依靠仿真世界产生海量交互经验。

局限与未来方向

虽然 SimFoundry 展示了非常强的能力,但它仍然存在一些限制。

首先,系统高度依赖现有视觉基础模型。

如果:

物体识别错误;

三维生成失败;

物理属性估计不准确;

都会影响最终效果。

其次,目前系统主要针对 tabletop 场景。

例如:

桌面上的杯子、盘子、抽屉等。

对于:

大规模房间环境;

移动机器人;

复杂动态世界;

仍然需要进一步研究。

总结

SimFoundry 提出了一个新的机器人数据生成范式:

从真实世界视频自动构建仿真环境,并利用数字表亲生成无限训练经验。

它连接了:

真实世界

数字孪生

自动生成数据

机器人训练

真实部署

对于未来机器人基础模型来说,数据规模和数据多样性将成为决定模型能力的关键因素。

SimFoundry 提供了一种可能:

未来机器人或许不需要人类不断示范每一个动作,而是可以拥有一个自动创造经验的“虚拟世界”。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×