看完李飞飞刚发布的Atlas,我觉得世界模型真正的竞争才刚刚开始
统计 阅读时间大约7分钟(2795字)

1天前 看完李飞飞刚发布的Atlas,我觉得世界模型真正的竞争才刚刚开始

来源:具身智能研究室
作者:Yuanxq   出品:具身智能研究室9月1日,李飞飞创办的WorldLabs发布了新一代世界模型Atlas。Atlas将单...

作者:Yuanxq     出品:具身智能研究室

9月1日,李飞飞创办的 World Labs 发布了新一代世界模型 Atlas。

b8297c265fa2af4292219ddc4f8021fd.jpg

Atlas 将单张图像展开为可以持续移动视角的三维世界。

官方放出的演示很抢眼。输入一张或几张图片,再给出摄像机的位置和运动路线,Atlas 可以生成最长一分钟、分辨率达到 1440p 的视频。给它几张照片,它能够补全没有拍到的区域,重建出一个可以从不同角度观看的三维场景。用几部普通手机拍摄同一个事件,Atlas 还能在拍摄完成后重新选择视角,做出类似“子弹时间”的效果。

我看完这些演示,最感兴趣的是 Atlas 处理空间的方式。

现在很多视频模型依靠文字理解镜头运动。用户输入“镜头向左平移”或者“围绕人物旋转”,模型生成一组视觉上连续的画面。Atlas 可以直接接收摄像机的具体位置、朝向和运动轨迹,每一张参考图片也能被放到相应的三维位置上。

摄像机参数由此进入模型的原生输入。Atlas 根据这些空间信息,计算摄像机移动到不同位置时应该看到什么。

这套方法指向了 World Labs 一直在讲的“空间智能”:模型需要形成相对稳定的空间表示,理解物体之间的位置关系,并在摄像机移动之后维持场景的一致性。

96850534b47ae5ebb49aa58a0d8da54a.jpg

Atlas 在显式三维结构上组织摄像机路径,再生成对应的新视角。

这条路线可以追溯到ImageNet

理解 Atlas,可以从李飞飞早年的 ImageNet 说起。

ImageNet 建立于计算机视觉发展的早期阶段。当时研究者已经提出了许多视觉算法,训练数据的规模和多样性仍然有限。李飞飞和团队建立了一个包含上千万张图片的数据集,并通过持续举办挑战赛,为整个领域提供共同的训练资源和评价标准。

2012年,深度卷积神经网络在 ImageNet 挑战赛上取得突破。此后,图像识别能力迅速提升,深度学习也开始进入大规模应用阶段。

ImageNet 帮助机器掌握了物体识别。模型可以判断图片中有没有猫、汽车、椅子和行人,也能定位部分物体在画面中的位置。

真实环境提出了更多问题。杯子距离桌边还有多远?门向哪个方向打开?一根电线被拉动以后会怎样弯曲?机器人应该从什么角度抓取物体?

这些问题涉及深度、遮挡、几何、运动和动作结果。单张图片里的类别标签无法提供完整答案。

李飞飞后来的研究逐渐向场景理解、机器人学习和环境智能延伸。2024年,她在 TED 演讲中系统阐述了“空间智能”:让 AI 感知三维环境、理解空间关系、预测变化,并在虚拟或现实世界中行动。

语言模型可以从文字中学习大量概念和知识,空间智能需要处理现实环境里的距离、方向、运动与相互作用。World Labs 就是在这一背景下进入公众视野的。

World Labs一直在沿着同一条路线推进

2024年12月,World Labs 首次公开展示从单张图片生成可探索三维世界的系统。

用户可以进入生成的场景,移动摄像机,观察原图没有拍到的区域。模型需要持续维护基本的空间关系,否则用户向前走几步或回头看时,建筑、道路和物体就会发生明显变化。

2025年,World Labs 推出 Marble。它可以接收文字、图片、视频和粗略的三维布局,生成可探索的三维场景。用户还可以扩展、编辑、组合并导出这些场景,用于游戏、影视、虚拟现实和设计工作。

Marble 让 World Labs 的研究有了清晰的产品形态。它也暴露出世界模型接下来需要解决的问题:三维场景需要具备更准确的结构和动态,才能真正服务机器人训练与工程仿真。

今年6月,李飞飞和 World Labs 团队把世界模型分成三类:渲染器负责生成图片和视频,模拟器负责表示世界状态并预测变化,规划器负责选择下一步动作。

在这套分类里,模拟器位于中间。它需要保存场景的几何和动态,让机器能够测试一个动作会产生什么结果。机器人可以借助模拟器反复尝试,比较不同策略,再把合适的动作带回现实。

今年7月,World Labs 收购机器人仿真公司 SceniX,随后公布了一套“真实—仿真—真实”的训练流程。

团队先记录真实机器人、物体和环境,再把任务重建到仿真系统中。在仿真世界里,物体位置、灯光、摄像机视角和部分物理条件都可以反复调整。机器人策略经过大量训练和测试,再部署到真实硬件。

1153813974ce1cf64cfa76864882e131.jpg

Atlas 根据少量实拍输入完成稀疏重建,把真实场景转换为机器人可以使用的三维环境。

这条路线针对的是机器人行业长期存在的数据问题。

语言模型可以利用互联网文本,机器人训练却需要大量动作、环境和反馈数据。在现实中重复练习插线、装箱或者整理物体,需要人工复位场景,也会带来时间和硬件成本。仿真环境能够快速制造大量变化,让机器人更频繁地经历成功和失败。

SceniX 为 World Labs 补充了机器人学习、硬件和仿真能力。World Labs 原有的三维生成与重建技术,也获得了更具体的应用场景。

Atlas把几条技术线放进了一个模型

Atlas 出现在这套路线继续推进的节点上。

根据 World Labs 的介绍,Atlas 是一个从头预训练的多模态自回归扩散 Transformer,可以统一处理文字、图片、视频、摄像机位置和深度信息。

它能够根据提示生成新场景,也能从照片和视频重建真实环境;输出形式包括图片、视频、深度、点云和 Gaussian Splatting 三维场景。未来版本的 Marble 以及 World Labs 的其他产品,都将使用 Atlas 提供的底层能力。Atlas 官方介绍

生成、重建和模拟在这里被组织成了相似的任务:模型接收一组带有空间关系的输入,再预测新的观察结果或三维结构。

例如,一张照片只能提供建筑正面的信息。Atlas 会调用训练中获得的先验知识,补出侧面、背面和周围环境。继续增加照片后,真实信息逐渐增多,模型需要自行补全的区域相应减少。

在机器人场景中,Atlas 可以根据少量录像重建环境,并生成机器人从不同位置观察到的 RGB 和深度信息。这样的环境可以接入 World Labs 已经搭建的 Real-to-Sim 流程,为机器人训练和测试提供数据。

Atlas 因此承担了一个更底层的角色。Marble 面向三维内容创作,SceniX 和仿真系统面向机器人,Atlas 为这些产品提供共享的空间模型。

世界模型的评价标准正在变化

过去两年,视频生成模型的进步很直观:画面越来越清晰,视频越来越长,人物动作更加自然,对提示词的执行也更准确。

世界模型需要接受另一组检验。

摄像机转到物体背后,空间结构能否保持一致?同一个场景生成多条镜头路线,建筑和物体会不会发生漂移?模型能否输出可计算的三维结构?仿真中的物体运动能否对应现实?机器人在仿真环境中取得的进步,迁移到真实硬件后能保留多少?

这些问题会逐渐拉开不同技术路线之间的差距。

数据也是关键变量。互联网上有大量图片和视频,其中很少包含精确的摄像机位姿、三维结构、材质、摩擦力和机器人动作。世界模型公司需要自行建立数据体系,也需要打通现实采集、仿真训练和真实反馈之间的循环。

这场竞争会同时发生在多个方向。视频模型公司掌握视觉生成能力,三维图形公司拥有成熟的建模工具,机器人公司积累了真实交互数据,自动驾驶公司长期使用仿真系统。Google DeepMind、英伟达和一批创业公司也在沿着各自路线进入世界模型。

World Labs 选择从计算机视觉和三维生成出发,先建立空间,再将机器人接入其中。Atlas 是这条路线目前最完整的一次展示。

它距离成熟还有相当长的路。

Atlas 目前只向少量合作伙伴开放,外界看到的主要是公司挑选的案例和自行公布的测试结果。从一张照片补出的区域属于模型生成,不能当作对现实的准确恢复。稳定的几何也无法直接证明模型掌握了重量、摩擦、碰撞和材料形变。

按照 World Labs 自己的分类,Atlas 已经覆盖渲染、三维重建和部分模拟能力,负责自主选择动作的规划能力仍在更远的位置。

这些限制没有削弱 Atlas 的研究价值,反而说明世界模型还处在路线探索期。行业尚未形成公认的模型架构、数据方法和评价体系,各家公司也没有找到稳定的产品边界。

ImageNet 曾经帮助机器识别世界,语言模型让机器掌握了描述世界的方式。Atlas 代表的下一步,是让机器建立一个可以观察、补全和推演的内部世界。

当模型开始处理空间结构、环境变化和动作结果,竞争也就离开了单纯的画面生成。谁能建立更稳定的世界,谁能让仿真与现实更加接近,谁能让机器人真正用上这些世界,将决定下一阶段的格局。

从这个角度看,Atlas 更像一个起点。世界模型真正的竞争,确实才刚刚开始。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×