近100余项工作调研!万字长文讲透具身世界模型的前世今生——从动力学预测到机器人应用闭环
统计 阅读时间大约10分钟以上(7593字)

1天前 近100余项工作调研!万字长文讲透具身世界模型的前世今生——从动力学预测到机器人应用闭环

来源:豆包
作者:Yuanxq   出品:具身智能研究室让机器人把桌上的杯子放进柜子,看起来只是一次抓取。真正执行时,它要连续处理一串问题:从...

作者:Yuanxq     出品:具身智能研究室

让机器人把桌上的杯子放进柜子,看起来只是一次抓取。真正执行时,它要连续处理一串问题:从杯口还是杯身下手?抬起后杯子会不会滑?柜门会不会挡住机器人的视线?如果抓偏了,应该继续调整,还是放下重来?这些问题无法只靠当前画面回答,机器人还要估计一个动作执行后,杯子、机器人和周围环境会变成什么样。

世界模型相当于让机器人在动手前先在内部试一遍。它不一定要生成视频,也可以只估计杯子的位姿、抓取风险或任务价值。不同研究的差别,主要在于这次推演的结果被拿去做什么:选动作、训练策略、直接控制、测试策略,还是保存环境状态。

4f571b3047d0d2da6012efbe285c818f.png

图 1:世界模型的通用闭环架构。 当前观测、历史记忆、任务目标和候选动作共同进入模型;预测结果服务规划、学习、行动与评估,真实反馈再修正下一轮决策。

过去十多年,研究重心大致经历了四次变化:先学习动力学,再让模型服务规划与想象学习;随后,视频生成把模型扩展为可交互的神经环境;今天,研究者又开始从互联网视频、机器人轨迹和多模态数据中预训练可复用的世界先验。

这些方法没有按照时间顺序依次退场。低维动力学仍适合精确控制,潜空间模型仍在服务规划,生成式模拟器和世界基础模型则把数据与任务范围继续向外推。把它们放在一起看,关键不在网络新不新,而在预测被用到了哪里,最后有没有改善机器人的真实行动。

f0e0d3c4160667a694bb8fb350f0b6b3.png

图 2:从动力学模型到世界基础模型的发展时间线。 图中展示多条技术支流如何并行演进,并逐渐汇入面向 Physical AI 的统一系统。

世界模型的概念和底层范式

概念

本文所说的世界模型,是智能体从数据中学到的内部环境模型:它根据当前状态、历史信息和可能的动作,预测未来状态、观测或任务结果,并把这些预测用于规划、学习、执行或评估。

世界模型不一定生成像素。潜在状态、对象关系、接触、奖励和价值都可以成为预测对象;判断重点在于,模型能否表达不同干预会带来什么后果。第六条“上下文主导型”是扩展口径下的 World Proxy:它不强调未来 rollout,而是维护可更新的空间状态与长期记忆。

底层范式

不论模型采用何种架构,一个面向行动的世界模型通常都要处理四个环节:状态与记忆、动作条件转移、结果评估、现实反馈。

状态与记忆

相机、点云、触觉和本体感知都只是局部观测。系统需要把它们组织成稳定的内部状态,并保留必要的对象身份、空间关系和历史事件。

动作条件转移

世界模型需要回答一个反事实问题:如果现在执行某个动作,世界会怎样变化?动作可以是关节指令、末端位姿、动作片段或高层技能,结果可以表示为状态、潜在表征或未来视频。

对 Physical AI 而言,动作不是附加在视频上的控制标签,而是对世界施加干预的变量。没有动作条件,模型可以学习世界怎样自然变化,却很难回答机器人怎样主动改变世界。

结果、奖励与风险

预测未来只是中间步骤。奖励、价值和风险模型还要判断它是否接近目标、违反约束或包含碰撞,从而把“会发生什么”连接到“应不应该做”。

现实反馈与纠错

世界模型永远只是现实的近似。动作执行后,系统需要比较预测与真实观测,并据此更新状态、重新规划或触发安全回退。

四个环节构成共同底座;六条路线的差别,来自模型输出由谁使用、何时使用。

六条技术路线

下面换一个更实用的视角:不看模型叫什么、用了什么网络,而看它最终在系统里做了哪件事。按这个标准,相关工作可以分成六条路线。

f57d1a04-8b0a-4dee-a3ef-2887db270179.png

模型构建型

模型构建型把预测器本身作为研究终点。 论文可以讨论规划或控制,但主要结果仍是预测精度、物理一致性、长时 rollout 和跨场景泛化。

从接触动力学到可见的视觉未来

早期工作多在结构化状态空间中学习动力学,其中最棘手的是碰撞、摩擦和非穿透约束。ContactNets 把接触几何与物理结构放进学习目标,再用多步轨迹误差和地面穿透检验模型。它没有继续完成规划或控制,却把接触这一小块世界建得更准。

当输入从低维状态扩展到相机画面,预测对象也随之变化。GAIA-1 将驾驶视频、文本和车辆动作统一编码,生成受自车动作与场景条件控制的未来视频;模型由此开始表达道路、车辆、天气和交通参与者共同形成的视觉世界。

0f9fbe6f49f5a816376980e3d29a43fe.png

图 3:GAIA-1 的多模态生成式世界模型。 历史视频、车辆动作和文本共同决定后续驾驶画面,动作由此成为控制视觉世界演化的条件。

从专用预测器到世界基础模型

近两年,研究重点又从专用预测器移向可复用的预训练底座。Cosmos Predict从大规模视频和 Physical AI 数据中学习时空先验,再通过后训练适配机器人、自动驾驶和数据生成。

Qwen-RobotWorld 把自然语言作为统一动作接口,用同一模型预测操作、驾驶、室内导航和人到机器人迁移中的视觉未来;Genie 则从无动作标签视频中发现可交互的潜在控制。二者首先证明的是世界生成与可控性,因此仍放在模型构建型。

Matrix-Game 3.5 又把生成世界推进到 720p 实时流式运行和分钟级场景记忆。它利用相机几何检索历史图像块,让模型走远后再回到原处时,仍能维持相对稳定的空间结构和主体外观。不过,它当前主要接收初始图像、相机轨迹和文本提示,还没有接入机器人动作空间或策略闭环,因此仍属于模型构建型。

把这些工作放在一起,可以看到一条清楚的变化:结构化物理状态 → 动作条件视觉未来 → 可持续交互、可后训练的世界先验。 说到底,模型再大也得过三关:动作一变,预测要跟着变;结果不能违背基本物理;换到没见过的场景,模型还得能用。

规划主导型

机械臂面前有几条看似可行的路径。规划主导型会先在模型中试走,再在现实中执行:模型预测每条路径的后果,规划器比较收益和风险,只执行当前的一小步,再根据新观测重新规划。

把一次决策摊开,就是:当前状态 → 候选动作 → 模型推演 → 比较结果 → 执行第一步 → 重新观测。

在潜空间世界模型出现之前,Visual Foresight 已把动作条件视频预测接入真实机器人的视觉 MPC;PETS 则用概率动力学集成和不确定性传播增强 CEM 规划。两者奠定了“预测后果—在线选择—持续重规划”的基本范式。

与环境预测并行发展的还有机器人本体自模型。Resilient Machines Through Continuous Self-Modeling 从动作—感觉关系中推断自身结构,并在损伤后搜索替代行为:对 Physical AI 而言,身体也是世界的一部分

规划模型经历的三次关键变化

搜索进入潜空间。 PlaNet 使用潜在状态模型压缩视觉观测,再在执行期间用 CEM搜索动作序列。高维画面不必被逐像素完整展开,只要紧凑状态能够保留影响控制的变化,规划就可以在内部完成。

只保留决策相关信息MuZero 不要求模型还原真实画面,而只学习树搜索需要的奖励、策略先验和价值。它把一个关键观点推到前台:对规划而言,最好的世界模型未必最像现实,而是最能保留决策相关信息。

视频先验进入真机规划。 V-JEPA 2 先从无动作视频学习未来表征,再用机器人轨迹训练动作条件模型 V-JEPA 2-AC。部署时,系统根据当前观测和目标图像,通过 CEM 与滚动时域 MPC 搜索动作,把视频中学到的时空先验连接到机械臂控制。

TD-MPC2 用短时域潜空间规划处理局部控制,再以终端价值补足远期回报;DINO-WM 则直接在视觉基础模型的特征空间中预测未来。

显式三维也开始成为规划空间:RoboCraft 用粒子图预测弹塑性物体,ParticleFormer 扩展到多物体、多材料交互,PointWorld 再把场景变化与跨本体动作统一为三维点流。它们保留的不是漂亮画面,而是在线优化需要的接触、形变与几何信息。

ee8e7e5f06e2729a6f17bc6367d565f3.png

图 4:PointWorld 的三维世界预测与真机操作。 中央的三维点流表示模型预测,左右两侧展示训练场景和真实机器人任务;同一个模型由 MPC 调用,处理刚体、柔性物体、关节物体和工具操作。

规划也在从连续动作上移到语言子任务。τ₀-VLA 只在高层决策不确定时启动测试时计算:VLM 提出候选子任务,世界模型预测各分支完成后的视觉结果,价值模型评分,再由 beam search 与反思模型决定下一子任务,最后交给低层 VLA 执行。

世界模型还可以充当执行时验证器。CheckVLA 持续比较动作后果的预测与真实观测,并在风险越界时改写后续动作;目前证据仍限于 RoboCasa365 仿真。

这一类的共同点很简单:模型预测具体动作的后果,模型之外的决策层裁决最终动作。 搜索、验证和安全过滤都可以承担这个角色。

学习主导型

真实机器人试错既慢又贵。学习主导型先用真实数据建立世界模型,再把策略训练搬到模型生成的经验中;部署时运行的是训练后的策略。

把策略放进“梦境”里学习

World Models 用视觉编码器压缩观测,用时序模型预测潜在状态,再让控制器在模型生成的“梦境”中训练:真实交互负责建立世界,想象经验负责训练控制器。

Dreamer 进一步在潜在想象轨迹中训练 actor 和 critic,把在线搜索压缩为快速策略。DreamerV3 又让同一套算法配置覆盖更丰富的任务;这里的“通用”指算法稳定性,并非一个共享所有知识的世界基础模型。

这套思路正在进入机器人基础策略后训练。RISE 让独立 VLA 在多视角想象环境中生成轨迹、估计优势并持续更新,最后回到真机验证。World4RL Robotic World Model 分别把相近方法扩展到扩散式操作策略、腿足与人形控制。

f41bb69f202ad581d31bda01b0aeff73.png

图 5:RISE 的机器人想象学习闭环。 左侧是真机强化学习的重置与监控成本,中间是世界模型中的失败预测、价值评估和策略更新,下方展示改进后的策略回到三项真实任务接受验证。

把世界模型变成数据工厂

生成式世界模型出现后,“想象”也开始变成可共享的数据产品。DreamGen 生成新任务和新场景中的机器人视频,再补充动作信息,用合成轨迹训练 Diffusion Policy、GR00T 等下游策略。

DayDreamer、UniSim、GigaWorld-0 和 GR00T-Dreams 的产物形态不同,消费者却相同:另一套机器人策略。

传统物理引擎仍属于常规仿真训练;这一类要求环境转移、视觉结果、物理参数或神经残差至少有一项由数据学习。最终价值要由策略增益、真实交互节省和真机迁移来证明。

行动主导型

能输出动作,不等于世界—动作模型。 ACT、Diffusion Policy、RT-2 π₀ 都能控制机器人;只有当动作明确利用未来状态、图像或潜在表征时,才进入这里讨论的范围。

这条路线有两个必要条件:

核心模型在部署时直接输出可执行动作;

动作生成与未来世界建模明确耦合

在线规划可以增强系统,但不是成立条件。目前大致有四种做法。

未来预测成为动作学习目标

Unified World Models 将未来观测扩散与动作扩散放进同一个 Transformer,使模型既能预测环境,也能直接充当策略;消融实验进一步表明,未来观测目标确实改善了动作表现。

未来、动作和价值共享同一潜在空间

Cosmos Policy 将动作块、未来视觉、本体状态和价值编码到同一潜在空间。它既能直接生成动作,也能想象多组未来再按价值排序;直接策略模式成立,因此主标签仍是行动主导型。

未来视频与动作在生成过程中共同出现

DreamZero 在同一生成过程中给出未来视频和机器人动作,再用执行后的真实观测修正下一轮预测。

b92ac1b53cf9b473a04d8f23f28543a3.png

图 6:DreamZero 的真实执行与生成未来。 上排展示机器人在真实世界中的动作,下排展示模型同步生成的视觉未来;视频预测与动作由同一模型联合产生。

先生成动作,再预测动作的视觉后果

Riemann-1.0 把真实机器人的交互顺序写进统一因果序列:历史观测和机器人状态先生成动作片段,动作再作为条件参与下一段视觉状态的预测。真机部署时,机器人不必等待未来视频,而是直接执行模型给出的动作,再用真实观测刷新上下文;同一模型也可以接收给定动作,预测相应的未来视觉结果。

截至 2026 年 8 月,学术界呈现出三种趋势:

训练期使用世界监督,推理期裁剪生成分支:World Tokens;

用 RGB、三维点图和语义共同塑造未来表征:FLEX-π;

从机械臂扩展到移动与全身控制:MobileWAM、MotionWAM。

判断这类模型是否成立,其实主要去看消融实验就可以有一个比较准确的判断:去掉未来建模目标或表征后,动作是否真的变差。

评估主导型

手里有四个策略 checkpoint,却只能承担一个版本的大规模真机测试。评估主导型的目标,是先让策略在学习世界中“考试”,淘汰明显失败的版本,再把少量候选送上机器人。

让外部策略先参加一场虚拟路考

WorldGym 给出了最直观的实现:外部策略读取模拟观测、输出动作,世界模型再根据动作生成下一段观测。两者跨多个决策块交替运行,最后统计任务结果。

模拟观测 → 外部策略动作 → 下一段模拟观测 → 同一策略继续决策。

WorldGym OpenVLA、Octo、RT-1-X 等策略放入这套流程。即使模拟成功率与真机存在偏差,只要相对排序稳定,它仍能减少一部分昂贵的真机筛选。

从策略排名走向分布外测试与安全红队

Veo World Simulator 把视频基础模型改造成机器人测试场:除比较 Gemini Robotics 策略 checkpoint,还能替换物体、背景和干扰项,观察分布外失效。GE-Sim 2.0 补充本体状态反馈,WorldEval 则代表更轻量的“策略条件评估”。

6a6e8559b815c88f4943a892dd5cc025.png

图 7:Veo 世界模拟器中的策略测试。 上排给出常规任务、分布外场景和安全场景,下排展示世界模型根据策略动作生成 rollout,并提前暴露关闭笔记本时剪刀造成的危险行为。

GigaWorld-1 对不同世界模型和动作表示进行系统比较,得到的结论很直接:短时画质不能单独决定评估可靠性,长时动作忠实性、记忆和真机一致性同样重要。

评估主导型要求被评策略进入循环,而不是只用一个 judge 给离线视频打分。可信度至少要回答四个问题:

真机相关性:

模拟结果与配对真机结果是否相关?

排序一致性:

不同策略的相对排序是否一致?

分布外校准:

换到新物体、新环境或异常动作时是否仍然可靠?

失败召回:

它能否识别真实失败,而不是把危险行为生成得“看起来成功”?

上下文主导型

机器人还要记住:自己在哪里,眼前的杯子是否刚才见过,哪个房间已经搜索过,上一次失败发生在什么位置。上下文主导型不展开动作条件未来,而是持续维护可查询的世界状态。

这项能力可以看成三层世界状态栈。

把空间组织成持续更新的结构

Hydra 从传感器数据中实时构建分层三维场景图,把对象、位置、房间和建筑组织起来;发生回环或地图修正时,相关关系也会更新。

让对象拥有开放语义和关系

ConceptGraphs 把视觉基础模型的语义能力融入三维对象图,让规划器直接查询“桌子旁边有哪些可拿取物体”或“目标可能在哪个房间”。

把世界状态接入记忆、技能与失败恢复

HoloAgent-0 进一步把空间和时间记忆连接到技能系统。三维记忆负责检索和任务定位,执行反馈则触发更新、澄清或重新规划,地图由此变成代理持续调用的工作记忆。

SayPlan 从大型场景图中检索任务子图,再用符号约束检查计划;RoboMemory 则并行维护时间、空间、语义和任务经历。长期任务需要的不是更长的文本窗口,而是能被现实校正、按任务检索的世界状态。

ec784d5fd90988151a66d3ff10c24e67.png

图 8:RoboMemory 的多类型具身记忆。 系统把空间、时间、语义和任务经历分别维护,再交给规划器、评议器和低层执行模块调用;下方展示同一套记忆框架连接真实机器人与仿真环境。

本文将这类工作视为扩展口径下的 World Proxy。它的价值要看对象身份是否连续、环境变化后能否更新,以及记忆是否真正改善任务表现。

后续发展方向和判断

把前面的工作放回同一张图里,我目前有五个判断。具体的模型名称和榜单很快会变,预测能否改善行动、又会以什么形态进入产品,才是更值得长期追踪的问题。

当前的一些判断

世界基础模型已经出现,但还不是通用物理引擎。 Cosmos 3 尝试在统一骨干中处理文本、图像、视频、音频和动作;V-JEPA 2 也展示了视频预训练向机器人规划迁移的可能性。可复用先验正在形成,具体本体、任务和控制频率仍需后训练或真实交互校准。

评价重心正在从画质转向行动效用。 WorldArena 对比视频质量与数据生成、策略评估和动作规划能力,显示视觉观感与下游效用仍有明显缺口;RoboWM-Bench 又把生成行为还原为机器人动作并在真机执行。动作跟随、物理一致性、闭环收益、真机相关性和失败召回,比单纯画质更接近机器人真正关心的结果。

评价可以分三层:固定基准测基础能力,成对比较看模型之间的相对差异,最后交给领域任务检验它是否真的改善了规划、策略训练和真机执行。对 Physical AI 来说,最后一层最重要,也最昂贵。

互联网视频解决“见过多少世界”,机器人数据回答“动作会造成什么后果”。 DreamDojo 从第一视角人类视频学习广泛的日常交互,再用少量目标机器人数据恢复动作可控性;PlayWorld 则通过自主玩耍采集漏抓、滑动、碰撞和形变。前者扩大观察规模,后者补足干预与失败长尾。

这里还要区分数据规模和信息密度。只有任务指令和最终成功画面的数据,很容易让模型学到从输入到结果的视觉捷径;动作前的判断、接触过程、失败原因、恢复路径,以及触觉、深度和力等信号,才更直接地揭示“这个动作为什么会产生这种后果”。未来真正稀缺的,可能不是更多相似的成功视频,而是能够暴露物理因果关系的高密度交互记录。

短时可靠预测和持续纠错,往往比一次生成很长的未来更实用。 遮挡、接触和执行误差会迅速放大开环偏差。真实系统更可能预测一小段、执行一小段,再根据观测重规划。DreamZero 等工作开始把大型视频模型推向实时闭环,但帧率之外,时间对齐、动作连续性、不确定性和低层安全回退仍然决定能否部署。

规划与策略会融合,但不会互相取代。 世界基础模型强调预训练与跨任务复用,世界—动作模型强调未来预测与动作生成的联合建模,两者是独立属性。Cosmos Policy UWM 已经展示了共享表示的可能性。真正可部署的系统更可能采用快慢双路:常规状态由轻量策略直接执行,只有在场景陌生、策略不确定或风险升高时,才调用成本更高的世界模型推演、测试时搜索和安全验证。

我的总体判断是,世界模型正在从“生成未来的内容模型”变成“管理行动后果和决策不确定性的系统组件”。它不必复制现实的每个细节,但要在影响行动的地方足够准确,也要知道自己什么时候不再可靠。

后续行业的发展

如果把时间拉到未来两三年,世界模型更可能先成为 Physical AI 的开发基础设施:生成数据、构造环境、训练和评估策略,然后再逐步进入动作模型与部署系统。

数据引擎与虚拟测试场,可能最先形成规模化价值。 GR00T-Dreams 用世界模型扩展机器人轨迹;Veo World Simulator WorldGym 则用于 checkpoint 比较、分布外测试和风险预演。它们不会取消真机实验,但能把明显较差的策略提前淘汰。

世界基础模型会从 checkpoint 发展为开发平台。 NVIDIA Cosmos 已把预训练、数据处理、后训练示例和工具链放在一起;World Labs 的 World API 则把可生成、可编辑的三维世界封装为服务。

这类平台向下游提供的东西,大致有三种:合成数据、可继续后训练的世界表征,以及能够交互和获得反馈的学习环境。前两种已经显出工程价值,第三种最难,对动作忠实性、长时稳定性和实时性都有更高要求。统一骨干可以降低维护与适配成本,却不会抹平使用角色:同一个基础模型,仍可能分别作为数据引擎、规划模型、评估器或直接策略进入闭环。

VLA 与世界—动作模型的边界会继续变薄。 共享骨干可以同时学习未来状态、动作和任务价值:简单任务直接输出 action chunk,复杂任务增加候选生成和价值排序。高层可能通过语言、子任务或技能 API 连接规划与执行,低层则把未来表征和动作生成直接耦合。二者更像层级协作,而不是谁替代谁。碰撞保护、平衡控制和紧急制动,仍需要快速、可验证的本地闭环。

神经世界模型与物理仿真会继续融合。 Newton 等引擎提供几何、接触和约束,PIN-WM 等方法再用真实数据识别参数、补充视觉与未建模残差。高风险应用需要精确数字孪生,大规模训练则更适合便宜的“数字近亲”。

云端训练、端侧执行和真实数据回流会逐渐分工。 数据中心承担世界生成、策略训练和大规模评估;机器人本地运行压缩后的状态模型、动作策略与安全模块。Foresight 开始用动作条件表征监测失败风险,Gemini Robotics On-Device 则反映了低延迟和断网可用的需求。长期壁垒在于能否持续完成执行、失败发现、数据回收、策略更新和真机复验。

世界模型不是能够凭空生产知识的数据永动机,而是数据闭环的放大器。真实交互负责提供新的物理事实与纠错信号,世界模型负责扩展轨迹、失败模式和长尾场景,评估器负责筛选生成经验,策略部署后的成功与失败再回流到下一轮训练。任何一环缺少真机或高可信仿真的校准,都可能让模型偏差在循环中不断放大。

一家世界模型公司怎样建立技术壁垒

先说结论:世界模型公司的壁垒,不在于“能不能生成一个世界”,而在于它是否占住了预测—决策—真实结果—模型更新这条链路。

如果模型只提供一段视频或一次 API 调用,客户随时可以换成另一个模型。只有当它持续参与策略训练、动作选择或风险评估,并能用真实结果校正自己的预测,模型才会在使用中积累别人拿不到的东西:什么状态下,什么动作会产生什么后果,模型又会在哪些地方判断错。

这类公司大致有两条路。

一条是做横向平台。 公司未必拥有机器人和应用,但要把数据处理、后训练、动作接口、评估和部署工具做成一套标准工作流。它的壁垒来自开发者覆盖、本体兼容性和工具链。一旦客户的训练与验证流程都围绕这套平台建立,更换底座就不再只是替换一个 checkpoint。

另一条是进入垂直场景。 自动驾驶、机器人操作和工业制造对世界模型的要求并不相同。公司如果能长期获得某个领域的真实动作、接触、失败和恢复数据,再把它们沉淀为数字孪生、评测集和回归测试,就会形成比通用视频数据更难复制的资产。

最尴尬的是停在两者之间:既没有足够大的开发者生态,也没有进入真实场景拿到动作—后果数据,只提供一个视觉效果不错的模型。这样的能力有展示价值,却很难形成长期定价权。

所以,判断一家世界模型公司有没有开始建立壁垒,我更看三个结果:它是否真的提高了客户策略的成功率或减少了真机试错;一次现场失败要多久才能变成新的训练数据和回归测试;适配一个新场景或新本体,需要多少数据、时间和算力。模型规模和榜单成绩可以带来一段时间的领先,真正会复利的,是闭环里不断积累的动作—后果证据,以及把这些证据变成下一版产品的速度。

世界模型最终不是为了让机器人拥有更漂亮的想象,而是为了让下一次真实行动更可靠。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×