5分钟级扫描,把真实办公室变成机器人训练场:Niantic Spatial + Flexion + NVIDIA 打通 real2sim2real
统计 阅读时间大约9分钟(3285字)

23小时前 5分钟级扫描,把真实办公室变成机器人训练场:Niantic Spatial + Flexion + NVIDIA 打通 real2sim2real

来源:机器人产业应用
让每一个真实现场,都能拥有自己的训练世界。

作者:余柯     出品:机器人产业应用

7 月 20 日,Niantic Spatial 与苏黎世人形机器人软件公司 Flexion Robotics 公布了一套面向人形机器人的 Real2Sim2Real 管线,NVIDIA Isaac Sim、Isaac Lab 和 NuRec 则构成了它的仿真与训练底座。

3b905964dd66ea2d3c56a92af4fd95ae.png

先简单介绍一下这两家公司。

Niantic Spatial 可以理解为 Niantic 把过去十多年积累的地图、视觉定位和三维空间技术单独拆出来,做成的一家“空间智能”公司。2025 年 5 月,Niantic Spatial 正式独立运营,核心目标不是继续做游戏,而是让 AI 和机器人真正“看懂”物理世界。

它目前重点布局 3D 场景重建、视觉定位 VPS、空间理解以及面向 Physical AI 的数字孪生能力。其技术积累可以一路追溯到 Keyhole、Google Earth、Google Maps,以及后来《Pokémon GO》等位置服务产品背后的空间计算体系。

Flexion Robotics 则是一家总部位于苏黎世的人形机器人软件公司。和 Figure、Agility Robotics 这类既做机器人本体又做软件的公司不同,Flexion 的思路很明确:不造人形机器人的“身体”,而是做机器人的“大脑”。

它主要研发人形机器人的 autonomy stack,也就是从感知、决策、导航、操作到运动控制的一整套自主系统,并大量依赖强化学习和仿真训练来获得通用能力。公司联合创始团队有很强的 ETH Zurich 和 NVIDIA 背景,其中 CTO David Höller 此前就在 NVIDIA 参与过 Isaac Gym 和 Isaac Lab 的研发。

所以这次合作的分工其实非常清楚:Niantic Spatial 负责把真实世界快速“搬”进电脑,NVIDIA 提供仿真和训练底座,Flexion 则负责在这个数字世界里把人形机器人的导航策略训练出来三家公司拼在一起,才形成了这套完整的 Real2Sim2Real 管线。

工作人员拿普通 360° RGB 相机在办公室或仓库里走一遍,把几分钟视频交给 Niantic Spatial,生成两层互相对齐的数字世界——一层是负责“看起来像真的”3D Gaussian Splatting(3DGS)视觉场景,一层是负责碰撞和物理交互的网格;随后打包成符合 NVIDIA NuRec volume specification 的 USDZ,直接进入 Isaac Sim/Isaac Lab。Flexion 再在里面大规模并行跑强化学习,最终把 RGB 导航策略直接部署到真实机器人,不做现场策略微调。官方还表示,单 GPU 即可在同一数字孪生中支撑大规模并行训练和数百万次 rollout。

a8d766da31b4e9c57a8276b383233feb.png

01

Sim2Real 最难的,往往不是训练,而是把现场搬进仿真

传统机器人仿真有个长期矛盾:场景越便宜,往往越不像真实世界;场景越逼真,建模成本又越高。

程序化几何场景可以无限生成,但白墙、玻璃、反光材质、地毯纹理以及办公室里的各种杂物很难还原。人工按照真实工厂做 1:1 模型当然可以,可每换一家客户、一个仓库都重新建模,项目周期和交付成本很快就会失控。

Niantic Spatial 的思路,是不再“建”现场,而是直接“扫”现场。3DGS 在这里很关键。经典 NeRF 使用神经网络表示连续辐射场,通过沿相机射线采样并进行体渲染生成画面;3DGS 则直接用大量带位置、尺度、方向、颜色和透明度的三维高斯表示场景,可以实现高质量的实时渲染。对机器人强化学习而言,这意味着画面更流畅——在此之前同一块 GPU 需要同时给大量虚拟机器人生成相机观察,渲染吞吐量会直接影响训练效率。

但机器人不能踩在一团漂亮的像素上,它需要与物理世界真实交互。为此,Niantic Spatial 在生成三维高斯表示的同时,还会从同一次重建中生成碰撞网格(collision mesh),为机器人提供可触碰的几何基础。同时,他们还引入 MVSAnywhere 进行深度估计——这是一套支持不同场景和深度范围零样本泛化的多视图立体视觉模型。在机器人管线中,该模型可有效改善白墙等低纹理区域的表面质量,减少传统光度重建中常见的孔洞和噪声。

更重要的是,视觉层和碰撞层来自同一套重建。机器人“看到的墙”和“真正会撞上的墙”天然保持对齐,不需要再做一遍视觉场景与物理模型的人工配准。对于 Sim2Real,几厘米的错位都可能让机器人学到错误的避障距离。换句话说,这套方案真正有价值的地方,不只是“像照片”,而是尽可能让机器人看到的世界和它发生物理交互的世界保持一致。

6c29d3425a5a36da45020083d393ea94.png

02

RGB 超过深度基线,但别急着宣布“深度相机退役”

这次最容易被传播放大的,是两组数字。在 Flexion 办公室场景中,使用真实场地 3DGS 重建训练的 RGB 策略成功率达到 97.8%,深度基线为 93.8%;在难度更高的 Niantic Spatial 办公室中,两者分别为 75.0% 和 70.9%。

但是这组数据来自仿真中的 1,024 次 rollout 评测,并不是 1,024 次真机测试。真实机器人实验验证的是另一件事——完全在数字孪生中训练的 RGB 网络,可以 zero-shot 部署到真实办公室,不经过现场策略微调;官方称其在常规导航测试中与深度策略表现相当,而且能够应对一定程度的家具位置变化。

深度基线使用的是 ZED X 相机的 neural mode。官方还展示了几类深度视觉比较容易“看漏”的场景:比如地面上的薄垫,因为高度变化很小,在深度图里很容易和地面混在一起;三脚架、电缆、栏杆等物体结构细、轮廓复杂,也不容易获得稳定的深度信息;玻璃门窗则更是深度相机长期面对的难题。

相比之下,RGB 图像除了物体的空间轮廓,还保留了颜色、纹理、明暗和外观等视觉线索,因此即使一个障碍物在几何上并不显眼,导航策略仍有机会通过这些视觉特征把它识别出来并主动避让。

不过,这并不能推出工业和家用人形机器人以后可以普遍砍掉深度设备。首先,这次实验主要是两个办公室环境里的局部导航,无法代表楼梯、夜间、强逆光、粉尘、强反射、室外大尺度空间或者高速运动;其次,“RGB-only”主要是指导航策略的外部视觉模态,机器人依然使用本体感知、目标位姿,并由另一套预训练 locomotion policy 执行运动;再次,在安全冗余、精确抓取和近距离几何测量中,深度相机和 LiDAR 仍然有明确价值。

因此,更值得关注的趋势可能不是“RGB 替代深度”,而是机器人传感器从默认堆料,转向任务化配置:低成本室内导航可以越来越多依赖 RGB + 高质量空间数据,高风险、高精度任务则继续保留深度、LiDAR 或其他冗余感知。

8e316c3ac71565a2c3298fc50b146255.png

03

它不是凭空出现的新路线,而是把 real-to-sim 做成“现场数据工厂”

机器人行业一直缺数据,但不同数据解决的是不同问题。

01ce2de923080c443cad9fb1911aaa6c.jpg因此,“几分钟扫描建孪生”并不是学术上从零出现的一条全新范式。NeRF、摄影测量、神经重建以及 real-to-sim 都已有多年积累。真正值得注意的是工程闭环:普通相机采集、自动重建视觉与碰撞层、统一封装、直接进入主流机器人仿真平台,再接强化学习和真机部署。过去分散在多个团队、多个工具链里的工作,现在开始被压成一条接近产品化的流水线。

04

Flexion 为什么要和 Niantic、NVIDIA 把链路做到底?

Flexion 的定位很明确:它不造机器人的“身体”,而是做人形机器人的 autonomy stack(自主系统技术站),也就是“脑”。公司自己的说法就是,“We’re not building the body. We’re building the brain.” 它真正需要证明的,不是某个算法能不能在实验室的一台机器人上跑,而是这套软件能否跨硬件、跨客户现场重复部署。

Niantic Spatial 补的是“世界”。这家公司在 2025 年形成独立的 Niantic Spatial,如今定位为独立空间智能公司,业务重点包括真实环境重建、视觉定位和面向 Physical AI 的空间理解。NVIDIA 补的是“仿真与算力底座”:Isaac Sim 负责高保真物理仿真和传感器环境,Isaac Lab 则针对 GPU 加速的大规模机器人学习进行了优化。Flexion 则提供策略、强化学习和部署软件。

三方正好组成:真实世界数据 → 仿真世界 → 机器人策略。这也解释了 NVentures 投资 Flexion 的产业逻辑。Flexion 在 2025 年完成 5000 万美元 A 轮融资,投资方包括 NVIDIA 的风险投资部门 NVentures。对 NVIDIA 而言,更多机器人软件公司把训练流程建立在 Isaac Sim、Isaac Lab、NuRec 和 GPU 上,会增加整个 Physical AI 平台的使用深度;对 Flexion 而言,依靠成熟底座,则可以少造一层基础设施,把工程资源集中在策略和部署。

但协同也意味着依赖。如果未来接口、计算成本或生态规则变化,Flexion 会承担一定的平台依赖风险;而 NVIDIA 同时具有投资方和基础设施提供者两种身份,也会让合作伙伴更加关注平台中立性。所以,Flexion 最终能不能成为真正的“通用大脑”,除了看策略能力,还要看它能不能保持跨硬件、甚至跨仿真平台的可移植性。

491ff936bb569158dc341bc101e54bc2.png

05

真正被压缩的,可能不是传感器 BOM,而是项目交付周期

官方在这次发布里给出了一个相当明确的商业判断:一个机器人策略适配新环境,传统上可能需要数月现场工作,而 real2sim2real 有机会把这个周期压缩到天级。如果这条路径稳定下来,机器人商业化的交付方式会发生明显变化。
过去是机器人先到现场,工程师再采数据、调参数、反复试错;未来可能变成机器人到货之前,集成商先拿 360° 相机把现场扫一遍,在云端完成数字孪生、训练和压力测试。等机器人真正进入工厂时,已经带着针对这个场地训练过的策略,只把最后的安全验收留给现场。
这会改变整机厂和集成商的成本结构。驻场工程师减少,调试从“手艺活”逐渐变成计算任务;同一家客户新增第十个仓库时,也不必复制第一个仓库的整套人工调试团队。对 Niantic Spatial 来说,每一个准备部署机器人的场地都可能成为新的空间训练资产;对 NVIDIA 来说,需求不再只是“每台机器人需要算力”,而可能进一步变成“每个场地都需要重建、仿真和训练”。
当然,目前这套方案距离“扫一下就万事大吉”还很远。Niantic Spatial 自己也明确指出,当前重建记录的是某一个时间点:光照、反射和物体位置都会固化在扫描时刻;人、机器人和其他动态对象需要之后再加入仿真;漏扫区域的重建质量也会下降。Flexion 同样承认,RGB 策略更容易泛化到与训练经验语义相近的对象,距离训练分布太远的物体依然可能成为问题。
所以,这套方案真正改变的,并不是“仿真终于等于现实”。它给 Sim2Real 换了一个更务实的解法:与其努力让一个通用虚拟世界覆盖所有真实现场,不如让每一个真实现场,都能快速拥有自己的训练世界。
如果这条链路继续成熟,人形机器人未来最重要的基础设施之一,可能不再只是机器人本体、遥操作数据和 GPU 集群。
还会多出一个过去经常被低估的东西——真实世界本身的可训练副本。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×