阅读时间大约7分钟(2589字)
出品:具身释界
近年来,机器人领域正在经历一次重要变化。
随着 Vision-Language-Action(VLA)模型的发展,机器人已经开始具备理解视觉信息、语言指令,并执行复杂任务的能力。但与此同时,一个核心问题仍然没有被完全解决:
机器人需要大量高质量数据,而真实世界的数据采集成本极高。
训练一个机器人完成简单的抓取任务,可能需要大量人工遥操作;而对于更加复杂的任务,例如整理桌面、打开抽屉、双臂协作等,仅依靠真实机器人采集数据往往需要数月甚至更长时间。
因此,机器人研究者一直希望建立这样一个闭环:
真实世界提供少量经验;
仿真环境自动扩展数据;
机器人在仿真中学习;
最后回到真实世界执行任务。
但过去的问题在于:
如何快速、自动地创建一个足够真实的机器人仿真环境?
传统仿真环境通常需要人工建模,包括:
创建物体模型;
设置物体位置;
调整物理参数;
编写任务逻辑。
这使得仿真本身成为一个新的瓶颈。
SimFoundry提出的核心思想是:
只需要输入一个真实环境的视频,就可以自动构建一个可交互的数字孪生,并进一步生成大量新的训练环境。
论文标题为:
SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation
该工作由 NVIDIA、Stanford University、Georgia Tech 等机构共同完成。论文提出了一套完整的 Real-to-Sim 系统,将真实世界、仿真环境以及机器人策略训练连接起来。

图1展示了 SimFoundry 的整体目标。左侧是真实世界场景,中间是系统生成的数字孪生(digital twin),右侧则是基于数字孪生扩展出的 object cousins、scene cousins 和 task cousins。通过这些变化,单个真实环境可以扩展成为大量用于机器人训练和评估的模拟环境。
从真实视频自动构建数字孪生
SimFoundry 的输入非常简单:
一个 RGB 视频。
系统首先需要理解视频中的环境。
例如,一个桌面场景:
机器人需要知道:
桌面在哪里;
有哪些物体;
每个物体的位置;
物体之间的空间关系。
为此,SimFoundry 首先进行场景解析(Extraction)。
它利用视觉基础模型完成:
深度估计;
目标检测;
图像分割;
点云生成。
最终得到每个物体对应的信息,包括:
RGB 图像;
depth 信息;
segmentation mask;
三维位置。
简单来说,这一步相当于让 AI 先“看懂”真实世界。

图2展示了 SimFoundry 的完整 pipeline。整个系统分为三个阶段:Extraction、Generation 和 Augmentation。第一阶段从真实视频中提取物体和场景信息;第二阶段生成具有物理属性的仿真环境;第三阶段进一步创造不同类型的数字表亲,用于扩大训练数据。
完成场景理解后,SimFoundry 会进入第二阶段:
Simulation Generation(仿真生成)。
对于每个真实物体,系统会生成对应的三维模型。
例如:
一个真实杯子:
二维图片
↓
3D mesh
↓
姿态对齐
↓
物理属性估计
最终得到一个机器人可以交互的对象。
除了视觉外,机器人操作还需要考虑物理世界。
因此 SimFoundry 会进一步加入:
碰撞模型;
质量;
摩擦系数;
关节结构。
例如,对于一个抽屉:
系统不仅生成抽屉外观,还需要知道:
抽屉可以移动;
移动方向;
关节限制。
这样机器人才能真正与环境交互,而不是只是在“看图片”。
从一个环境生成无限可能:Digital Cousins
如果 SimFoundry 只能复制真实环境,那么它只是一个自动建模工具。
真正让它具有价值的是:
Digital Cousins(数字表亲)。
论文提出:
一个真实场景可以扩展成大量保持任务能力、但外观和布局不同的新环境。
这些变化主要分为三个方向。
Object Cousins:改变物体
第一类变化是物体级别。
例如:
原始环境:
一个白色杯子。
系统可以生成:
不同颜色的杯子;
不同形状的杯子;
不同大小的杯子。
但是这些变化不会破坏功能。
对于机器人来说:
它们仍然都是“可以抓取的杯子”。
这种方式可以帮助机器人学习:
不要记住某一个具体物体,而是理解物体背后的功能。

图3展示了真实场景、重建出的 digital twin,以及生成出的 digital cousins。可以看到,SimFoundry 不仅能够改变物体外观,还可以同时改变场景布局,使机器人面对更加丰富的环境变化。
Scene Cousins:改变场景布局
第二类变化是空间变化。
现实中,一个任务失败经常不是因为机器人不会操作,而是因为:
物体换了位置。
例如:
训练时:
杯子在桌子左侧。
测试时:
杯子移动到了右侧。
如果机器人只学习固定位置,它很容易失败。
Scene Cousins 可以自动生成:
不同物体排列;
不同空间关系;
不同干扰物。
这样机器人学习的是:
“寻找并操作目标物体”
而不是:
“记住某个位置”。
Task Cousins:创造新的任务
第三类变化更加进一步。
SimFoundry 可以根据场景中的物体和 affordance自动提出新的任务。
例如,一个桌面环境中:
原任务:
拿起杯子。
系统可以生成:
移动杯子;
将杯子放入容器;
整理桌面;
操作多个物体。
这意味着:
一个真实场景不再只对应一个任务,而可以成为一个任务生成平台。
仿真真的能够预测现实吗?
SimFoundry 首先验证了一个关键问题:
仿真环境中的机器人表现,是否能够代表真实世界表现?
作者测试了多个机器人策略,包括:
π0;
π0.5;
GR00T N1.6;
GR00T N1.7;
DreamZero。
测试任务覆盖:
抓取;
放置;
多步骤操作;
双臂协作。

图4左侧展示了 SimFoundry 测试的机器人任务,包括 DROID 单臂任务和 YAM 双臂任务;右侧展示了仿真成功率和真实成功率之间的关系。可以看到,两者高度一致,说明 SimFoundry 生成的环境能够有效预测机器人真实表现。
实验结果显示:
SimFoundry 仿真评估与真实机器人表现之间达到:
Pearson correlation = 0.911
同时平均最大排名误差:
MMRV = 0.018
这意味着:
如果一个模型在 SimFoundry 中表现更好,它通常也会在真实机器人中表现更好。
相比已有方法 PolaRiS,SimFoundry 的相关性提升超过 0.59。
用仿真数据训练机器人,能迁移到现实吗?
除了评估机器人,SimFoundry 更重要的目标是:
直接生成训练数据。
作者测试:
机器人是否可以只利用 SimFoundry 生成的数据训练,然后直接部署到现实环境。
结果非常令人印象深刻。
例如:
YAM 机器人:
Pot on Stove 任务:
成功率达到 99%。
DROID:
Stack Dishware:
成功率达到 100%。
这说明:
高质量的仿真数据确实可以支持真实机器人学习。
数据多样性决定机器人泛化能力
论文进一步研究:
不同类型的 Digital Cousins 是否真的有效。

图5展示了 object cousins、scene cousins 和 task cousins 对机器人性能提升的影响。实验表明,不同类型的数据扩展分别提升了机器人面对新物体、新布局以及新任务时的泛化能力。
实验发现:
Object Cousins:
提升机器人面对未知物体的能力。
Scene Cousins:
提升机器人适应不同空间布局的能力。
Task Cousins:
提升机器人迁移到相关任务的能力。
这说明:
机器人需要的不只是更多数据,
而是:
更多有意义变化的数据。
SimFoundry 对未来机器人学习的意义
过去几十年,机器人发展的最大限制之一就是:
数据规模不足。
人类可以通过观察世界快速学习,因为我们拥有大量经验。
而机器人需要:
真实机器人;
真实环境;
真实交互。
SimFoundry 提供了一种新的思路:
未来机器人训练可能不再完全依赖人工采集数据,而是:
少量真实世界观察
↓
自动生成数字孪生
↓
创造大量虚拟经验
↓
训练机器人模型
↓
部署到真实世界
这和大语言模型的发展非常类似。
语言模型依靠互联网产生海量文本经验;
机器人模型则可能依靠仿真世界产生海量交互经验。
局限与未来方向
虽然 SimFoundry 展示了非常强的能力,但它仍然存在一些限制。
首先,系统高度依赖现有视觉基础模型。
如果:
物体识别错误;
三维生成失败;
物理属性估计不准确;
都会影响最终效果。
其次,目前系统主要针对 tabletop 场景。
例如:
桌面上的杯子、盘子、抽屉等。
对于:
大规模房间环境;
移动机器人;
复杂动态世界;
仍然需要进一步研究。
总结
SimFoundry 提出了一个新的机器人数据生成范式:
从真实世界视频自动构建仿真环境,并利用数字表亲生成无限训练经验。
它连接了:
真实世界
↓
数字孪生
↓
自动生成数据
↓
机器人训练
↓
真实部署
对于未来机器人基础模型来说,数据规模和数据多样性将成为决定模型能力的关键因素。
SimFoundry 提供了一种可能:
未来机器人或许不需要人类不断示范每一个动作,而是可以拥有一个自动创造经验的“虚拟世界”。
