阅读时间大约10分钟以上(4276字)
出品:具身纪元
李飞飞联合创立的 World Labs 在 2026 年 7 月 28 日发布博客《Building Worlds That Train Robots》,首次公开 real-to-sim-to-real(R2S2R)引擎的早期结果。他们把一个真实任务重建成可交互的对齐仿真世界,在里面完全不用真实训练数据训练出操作策略,然后直接迁移到 ALOHA、RB-Y1、YAM、Flexiv、xArm 五类真机上,多个任务连续自主运行一小时没有人为干预。同时,仿真里的评测结果能够预测这些策略在真机上的相对排名和失败区域。
这篇博客的直接背景是七天前的一桩收购。2026 年 7 月 21 日,机器人与仿真公司 SceniX 并入 World Labs,SceniX 此前一直在做的事情就是把真实机器人、环境和交互转成可用于策略训练与评测的仿真。
博客开篇讲的是方向。当空间智能落到物理世界,北极星目标就是推动机器人领域向前。今天很多实验室的机器人演示看上去进展喜人,真正的挑战是让它们在真实世界里稳定工作。那里物体会移位,杂物会堆积,光照会变化,每一次试验的物理交互都不完全相同。从一个漂亮的演示到可靠的运行,这中间的鸿沟是机器人系统规模化落地的主要障碍。
让机器人为真实世界做好准备,需要大量的数据采集和在物理硬件上的反复测试。每一个新任务或新环境都可能要求可观的人工投入,而故障发现得慢,恢复成本又高。想要填上这道沟,光靠更好的策略学习算法不够,必须发展出一种可规模化的、数据驱动的方式,在机器人进入现场之前和之后,去创造它们训练和评测所需要的经验。
7 月 21 日,机器人与仿真公司 SceniX 加入 World Labs。SceniX 一直在构建把真实机器人、环境和交互转成仿真以用于策略训练和评测的系统,他们开发的 real-to-sim-to-real(R2S2R)引擎能把一个物理任务变成许多个可控、可复用的世界,帮助机器人团队训练策略模型、更快地测试改动、更早地发现故障,并减少在硬件上做昂贵实验的次数。
SceniX 团队的工作深化了 World Labs 在空间智能上的技术积累,也把应用场景从虚拟环境拓宽到了物理环境。随着进展推进,World Labs 的生成式世界模型将不只是创造逼真的 3D 场景,还会越来越贴近机器人必须与之交互、从中学习、并在其中接受评测的现实与变化。 而这只是开始。
今天他们分享 R2S2R 引擎的一些早期结果。用自研技术,模型能生成与现实对齐的仿真,在这样的仿真里机器人做到了长期以来被认为遥不可及的事。它们在零真实世界训练数据的条件下学会了复杂的操作任务。仿真还能预测和评估哪些策略会在真实世界成功或失败,省掉昂贵漫长的物理试错。之后这些策略被放到真实场景的物理机器人上,稳定运行了数小时。

图注:一个真实任务,成千上万种变化。系统把真实任务重建为保留任务相关观测和动力学的可交互仿真,再系统性地改变外观、物体配置、杂乱程度、物理属性、机器人状态和相机视角,生成机器人泛化所需要的经验广度。
扩展机器人智能,靠的是扩展机器人学习所处的那些世界
扩展机器人学习是机器人领域最关键的瓶颈。视觉语言动作模型(VLA)和世界动作模型(WAM)这类机器人学习方法进展迅速,但关键瓶颈并不在架构本身,而在规模化的经验和评测。
和用来训练语言模型的互联网数据不同,机器人经验的采集代价高昂且难以控制。每一轮迭代都在消耗硬件时间,物体要复位,故障要恢复,系统要维护。即便是互联网规模的视频数据,也无法系统性地覆盖训练可靠、可部署的真实世界机器人所需要的环境、物体、外观、物理属性、机器人状态、机器人本体和失败条件。自动驾驶的发展已经给出过同样的教训,而自动驾驶的物理本体比通用机器人简单得多,任务环境也没那么复杂。
在《世界模型的功能分类法》中,World Labs 把世界模型分为渲染器、仿真器和规划器,并主张仿真器是关键环节,因为它把一个世界变成了智能体可以行动、学习、接受评测的地方。这次分享的工作就是在检验那个主张。
事实上,今天路上一些最成功的 L3、L4 级自动驾驶汽车,其模型正是用真实驾驶数据和仿真数据共同训练出来的。许多飞机、火箭、无人机和四足运动系统,也都是在能对不同条件和动作做出响应的仿真系统中开发和测试的。World Labs 相信,对于能执行范围广得多的复杂任务的各类本体机器人,情况也是一样。
给每一个真实任务单独做一套仿真,传统上成本很高。这条路也难以规模化,做出来的东西还容易在视觉、几何和动力学上与现实产生偏差。R2S2R 引擎走的是另一条路。它把世界模型生成的空间连贯环境与任务对齐的机器人仿真结合起来,通过同时保留世界看上去的样子和它在机器人交互时的行为方式,在规模上实现了高保真的仿真与现实对齐。
结果分成引擎的两部分来展示。
- Real-to-Sim,把物理机器人、传感器、环境、物体和交互转换成保留任务相关观测与动力学的仿真。
- Sim-to-Real,在仿真世界里训练和测试机器人策略,并判断它们在仿真中的表现是否能预测它们在现实中的表现。
这里的关键成果是把 real-to-sim(R2S)和 sim-to-real(S2R)之间的循环闭合了。机器人学习策略首次做到完全在仿真中训练,直接迁移到不同的机器人和任务上,同时仿真评测能够预测策略在硬件上的相对表现和失败区域。 这两项能力合起来,让 R2S2R 成为一台可重复使用的训练与评测引擎,迭代更快也更便宜。
Real-to-Sim:把真实机器人任务重建为对齐的仿真

图注:双臂装箱。仿真与现实执行同一段开环动作序列,产生高度吻合的观测、物体运动和结果。
传统仿真器做不到在不同环境和任务上稳定达成这种对齐。World Labs 开发了一套新的生成式世界建模系统,能够输出高保真的视觉外观、准确的几何以及真实的物理与动力学,从而达成所需要的实-仿对齐。 从一个物理任务出发,他们采集机器人、传感器、周围环境、物体和任务演示,然后把它们重建成一个可交互的世界,这个世界既保留机器人所感知到的内容,也保留决定成败的物理交互。
真实环境不会自带干净的测量值。物体的形状、重量和摩擦可能是不确定的,相机和机器人可能与规格书有出入,线缆、包装和工具的形变方式也不是简单模型能够完全刻画的。因此系统会根据每个任务真正要紧的因素,组合不同的表征和建模技术。
每一个重建出来的世界,都通过仿真与现实中配对的开环交互来验证,直接比较观测、物体响应和结果。
下面这些例子跨越刚体、铰接体和可形变物体,涉及不同的机器人、传感器、环境和接触密集的交互。这些结果为机器人操作的实-仿对齐立下了新的标准,在一批有挑战性的物体和任务上同时匹配了外观和动力学。 其意义不在于某一段配对视频,而在于一套可重复的系统,它能在那些传统上难以仿真的交互上稳定产出对齐的世界。
Sim-to-Real:为真实部署训练和评测策略
一个真实任务被重建之后,它的对齐仿真就成了可规模化的训练与评测引擎。训练产出新的策略,评测主动去搜索它们在哪里失败,而这些失败又指导下一步该生成什么样的经验。没有可靠的仿真环境,在真实物理世界里做这些事情往往昂贵到无法承受,也太耗时间。R2S2R 引擎支持一个闭环学习过程,找到弱点、生成对应的交互经验、改进策略,全都在仿真里完成,然后再回到硬件上。
训练

图注:ALOHA 上的双臂装箱。策略在零真实世界数据的条件下训练,从对齐仿真直接迁移到 ALOHA 机器人上完成双臂装箱。
物理数据采集受制于哪些场景能被搭建、能被重复、能在硬件上安全执行。在仿真里,物体配置、机器人状态、视角、外观、物理属性、速度和难度都可以系统性地改变,让策略接触到那些在现实中重现起来代价高昂或根本不现实的条件。
这让策略学习算法能够反复而有意地遭遇困难状态,并从成功和失败中同时学习,不必每试一次就去复位一遍物理环境。仿真还提供了硬件上难以获得的监督信号,包括精确的物体状态、接触、可见性、力,以及在其他动作下会出现的结果。
一个实-仿对齐的世界可以服务于许多策略和许多机器人。 由于 R2S2R 既与策略无关也与本体无关,同一套系统可以服务于使用不同机器人、传感器、策略栈和部署需求的客户。一个任务重建一次,就能在之后长期支撑新的模型和硬件,让每个世界都成为可复用的基础设施,而不是一次性的仿真。
这里展示的策略全部完全在仿真中训练,没有用任何真实世界训练数据,并直接迁移到多种真实机器人平台上。任务对象包括可形变线缆、铰接的纸箱和刚性物体,场景则延伸到杂乱环境下的抓放。
其意义不在于某一次成功的 sim-to-real 演示,而在于跨越多样的、源自客户场景的任务和有挑战性的物理交互所表现出的泛化能力。这些习得的策略在长时间内自主运行,没有出现失败,也没有人为干预。 这提供了一个证据,对齐仿真可以成为真实世界机器人部署的主要训练经验来源,而不只是硬件数据的补充。这项技术的经济含义是巨大的。
评测
机器人开发的迭代速度比语言模型开发慢好几个数量级,因为策略评测仍然重度绑定在物理硬件上。对于开发机器人系统和机器人基础模型的团队来说,这是一个根本性的瓶颈。
实-仿对齐的仿真让评测变得可规模化。 团队不必被动等待故障在硬件上浮现,而是可以在成千上万种受控条件下主动搜索故障,在真机测试之前筛掉相当一部分检查点,把昂贵的硬件评测留给最有希望的策略。结果是迭代更快、覆盖更广、成本显著更低。
一个有用的仿真不需要精确匹配真实世界的成功率。它必须支持与现实相同的决策,识别策略在哪里成功和失败,对策略孰优孰劣做出排序,并预测训练期间的改进能否延续到硬件上。
下面用 ALOHA 双臂立方体交接任务来展示这种可规模化的评测能力。本节的全部结果都来自仿真和现实中的闭环策略 rollout。
仿真复现真实世界的行为
R2S2R 引擎的一个关键成功指标,是仿真能否复现策略在成功与失败边界附近的行为方式,这是优化后续策略学习算法的必要条件。
这些例子合起来说明,仿真捕捉到的不只是任务设置或最终的成功标签,它复现了把策略推向成功或失败的那些条件。
仿真预测真实世界的表现
对于开发机器人系统和基础模型的团队,对齐仿真提供了一份贯穿策略与数据迭代的系统性评测画像。它揭示哪些检查点表现最好、它们在哪里成功或失败,以及下一步该生成什么训练数据。
下文中的 ID 指用于对策略做后训练的分布内立方体位置,OOD 指该区域之外的留出位置。
跨策略架构、跨训练配置、在 ID 和 OOD 两种设定下,在仿真中表现更好的策略,在硬件上也表现更好。仿真保住了它们的相对排名,跟踪了各检查点上的改进与平台期,并揭示出相似的成功与失败空间区域。
这是关键结果,任何机器人团队现在都可以用 R2S2R 引擎来筛选检查点、捕捉性能回退、指导策略与数据迭代,并决定哪些模型值得投入昂贵的硬件评测。 对齐仿真由此成为机器人开发中的高吞吐评测层。

图注:仿真预测真实世界的策略表现。跨策略架构、训练配置和检查点,仿真评测保住了策略排名,跟踪了训练过程中的进展,并揭示出相似的成功与失败空间分布。每个检查点在仿真中评测 2000 次试验,其中 1000 次 ID、1000 次 OOD,在真实世界中评测 100 次试验,其中 50 次 ID、50 次 OOD。图中对比的策略为 GR00T N1.6 与 π₀.₅。
闭合这个循环
从一个漂亮的演示到一台可部署的机器人,这中间的鸿沟不会仅靠更好的策略或更多真实世界数据来填平。它需要的经验,在多样性、可控性、可规模化程度和物理基础上,都远超硬件采集所能现实达到的水平。R2S2R 就是他们用来大规模创造这种经验的方式。
Real-to-Sim 把物理任务变成对齐的、可控的世界。Sim-to-Real 用这些世界以极少的真实训练数据训练策略,在其中发现故障,并预测硬件上的表现。
两者合起来构成一个闭合的学习循环,真实世界的结果反过来改进世界模型、数据和策略。
在他们的世界模型分类法里,仿真器被称为关键环节,是智能体能够行动、学习和接受评测的地方。这些结果开始展示原因何在。可信的仿真能把机器人开发从缓慢、昂贵、被硬件束缚的迭代,推向更可规模化也更便宜的训练与评测。
当可规模化的世界模型与真实机器人系统相遇,仓库、实验室和家庭里的可靠机器人才会出现。那是 World Labs 接下来要做的事。
要扩展机器人智能,就必须扩展机器人学习所处的那些世界。
