阅读时间大约8分钟(3148字)
出品:机器之心
机器人实验室里,这样的画面总是反复出现:屏幕上模拟的机械臂正以完美轨迹移动,但真实世界的一边,玻璃杯还待在桌面上,甚至已被夹爪打翻。
今天的机器人世界模型都面临着这样的挑战:夹爪抓不起物体,机械臂无法与环境交互,经过了遮挡之后,预测的画面就完全错了。AI 生成的未来视频每一帧都清晰自然,但内容根本不靠谱。
这种现象背后,是具身智能领域的一大悖论:人人在卷的世界模型,物理逻辑却怎么也跟不上。
一家成立不到四个月的中国初创公司「莫刻机器人」(Muka Robotics)提出了新的解决思路。他们提出的 LJM(Latent Joint-conditional Model)世界模型,全程只用 32 张卡完成训练,就以匿名代号 SisyphusWorld 冲榜全球最权威的具身世界模型评测 WorldArena,拿到全球总榜第二,在 LIBERO 机器人操作基准上四项视觉指标全部刷新 SOTA。

分项结果中,LJM 达到 89.17 Motion Quality、92.60 3D Accuracy 和 85.93 Controllability,展示了模型不仅关注单帧外观,也能较好地保持运动、空间结构与动作控制的一致性。

LJM 重新定义了机器人世界模型的第一性原理:预测未来,先要在隐空间里想明白,「执行这个动作后,世界到底会发生什么」。
先理解交互,再生成预测,这可能是世界模型走向实用化的那个转折点。
为什么 99% 的生成结果
对机器人没用?
下一代通用机器人的探索方向是什么?具身智能专家十有八九会告诉你是世界模型。
目前的行业共识是:VLA(视觉 - 语言 - 动作模型)擅长建立从观察到动作的反应式映射,但缺乏对物理规律(重力、摩擦、惯性)的内在理解。引入世界模型(World Model),相当于给机器人一个「内心模拟器」,能让它们在执行动作前预测环境会如何变化。
如今,具身智能领域正在走向规模化部署,能不能持续稳定工作成为了人们关注的重点。WorldArena 榜单发布不到五个月,第一名已经易主十几次,一百多个团队前赴后继刷分,看起来一片热火朝天。但绝大多数世界模型生成的结果,对真正要落地的机器人来说也难以算得上实用。
最明显的陷阱在于大家都在做「画面党」。视频扩散模型从诞生那天起,优化目标就是在像素层面衡量生成的画面和真实图像不像,这从根上决定了它会优先拟合占画面绝大多数像素的内容:物体纹理的细腻、环境光照的反射、机器人运动的平滑…… 而具身智能需要关注的是真实世界中的物理交互:夹爪和物体接触的那十几个像素、物体被抓起时的微小形变、碰撞瞬间的状态变化,这些内容在整段视频里可能连 1% 的像素都不到。
为了把整体损失降到最低,世界模型会毫不犹豫地牺牲 1% 的物理正确性,去换 99% 的画面美观。这样,优化目标从一开始就跑偏了。最直观的证据就是 WorldArena 的公开分数:有电影级画面生成能力通用视频模型 Wan2.2 拿到了 62.35 分,CogVideoX 62.71 分,和榜单头部 73 分左右的机器人专用模型有着断层差距。
更深一层的误区在于「动作注入」。大家的默认思路是使用通用视频模型,再接入机器人的动作信号。于是有人用线性投影把动作向量接到输入层,用 FiLM 和 AdaLN 把动作做成调制参数,有人用 cross-attention 让模型去「注意」动作。这种构建思路的本质,是把动作当成了一串没有意义的低维数值信号,扔给模型自己去悟。
然而,动作的物理含义从来没有写在数值里。脱离了场景、接触状态、任务目标去谈动作,就像脱离了语境去谈一个字的含义,模型无法真正读懂,那么它思考出的动作自然也难以合理。
最后是世界模型都逃不开的记忆问题。如果世界模型的生成「转头就忘」,对于机器人的操作规划可能影响巨大。
这三个问题并不能靠 Scaling Laws 大力出奇迹的方法来解决,也不是工程能够补上的窟窿。当整个行业都在为「怎么把通用视频模型改成机器人能用的样子」而发愁的时候,很少有人停下来问一个最根本的问题:机器人真正需要的世界模型,应该是什么样子?
LJM 的思路
先把「交互」想明白
LJM 最大的改进,在于它重新拆分了世界模型的工作流,把「想清楚会发生什么」和「把结果画出来」这两件事,交给两个专门的专家各司其职。
该研究团队提出一套「双脑协作」的架构,这很像人们在开车时的工作模式:你的前额叶皮层负责推演预判,前面那辆车打了转向灯要变道,我得松油门减速;而你的视觉皮层负责处理眼前的画面、识别车道线和交通标志,大脑内部的分工明确。
LJM 也把模型拆成了两个互相配合的专家。一个是推理专家(latent reasoning expert),基于 Qwen3-VL-2B 改造,它的工作是在连续隐空间里推演剧本 —— 给定人类的语言指令、过去看到的视觉历史、接下来要执行的一整串动作,先在隐空间里把整个交互过程推演清楚 —— 机械臂接下来会移动到哪个坐标,第几帧会和物体发生接触,夹爪闭合后物体会不会被抓起,之后会被移动到什么位置;第二个是世界建模专家(world modeling expert),基于 Wan2.2-TI2V-5B 视频扩散模型改造,它需要把推理专家已经想明白的交互「剧本」渲染成一帧帧流畅真实的未来视频。
从「先生成再理解」到「先理解再生成」的变化,把之前世界模型的底层矛盾解开了。

LJM 整体架构与 CoT latent 构造。左侧展示双专家通过 shared attention 联合建模,右侧展示未来本体状态、光流与视觉 latent 的交错监督。
但仅有双段式架构还不够,LJM 还给隐空间里的每一个推理 token 都绑上了明确、可计算的物理目标。具体来说,推理专家输出的每一组 token,都必须同时对三个维度的未来负责:要精确预测未来每一步机械臂末端的三维位置(本体状态),未来场景中物体的视觉状态变化(视觉动态),未来画面里每个像素的运动方向(预计算的光流)。
这三个目标全部可以从真实训练数据中直接提取,精确到帧数、具体位置、运动的方向、幅度和具体速度等信息数字上,从训练机制上就杜绝了模型「想当然」,每步推理都对真实的物理结果负责。
两个专家之间的通信方式,是 LJM 另一个容易被忽略的核心设计。之前的双模块方案,大多是推理模块把结果算出来一次性扔给生成模块,LJM 则通过 Mixture-of-Transformers(MoT)共享注意力机制,让两个大脑在 Transformer 的每一层都能双向对话:推理 token 和视频 token 被映射到同一个注意力空间中,每计算一层注意力,视频 token 就能拿到最新的推理约束,推理 token 也能看到生成到一半的视频状态,随时调整推演结果,全程信息互通。同时,原始的低维动作信号也没有被丢掉,而是保留了两条直接通路控制生成模型:一条作为 cross-attention 的上下文,一条作为 AdaLN 调制参数。
这就形成了一套完整的双路控制系统:原始动作提供毫米级的精确数值约束(移动多少厘米、夹爪张开多少毫米),推理隐变量提供高层的物理解释(当前是在自由移动、还是在对齐位置、还是在执行抓取),二者结合,打通了从控制数值到动作物理语义,再到真实视觉结果的完整通路,从机制上避免了「动作数值对了,但物理结果错了」的问题。
还有解决记忆问题的价值驱动时序条件(VTC)机制。LJM 使用算法挑选最有价值的历史帧,提升了覆盖的场景状态范围,从而增加了机器人评估、预测的准确性。

VTC 对长时状态一致性的影响。 上、中、下三行分别为真实未来(GT)、不使用 VTC(No VTC)和使用 VTC(VTC)的生成结果,上方数字表示相对帧数。缺少关键历史信息时,模型难以稳定维护交互后的物体状态,容易出现物体消失或重复⽣成;引入 VTC 后,物体的数量与空间关系均更接近真实未来。
从双专家的架构职责拆分,到给推理装上物理监督,逐层双向通信,再到记忆机制,最终,世界模型获得了正确理解物理交互,能够预测未来画面的能力,给机器人的动作规划打下了基础。
除 WorldArena 外,该工作进一步基于知名机器人操作基准 LIBERO 进行了评估,LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果,全面超越对比方法。

实验结果进一步说明,强大的视频先验并不等于机器人世界模型。只有当动作被解释为与语言、场景和未来状态共同定义的交互变量时,视频生成骨干才能真正转化为可控的机器人动态模型。
成立不到四个月
冲榜全球第二
拿下 WorldArena 榜单第二名,仅与头名相差 0.58 分的莫刻机器人,是一家成立刚满三个月的初创公司。
本月,莫刻机器人联合创始人兼 CEO、香港科技大学博士池晓威在 WAIC 上聊了聊「世界模型如何赋能具身智能」。他表示,世界模型可通过生成训练数据、充当强化学习环境、学习物理表征三类路径赋能具身策略学习。这三种路径要求世界模型对状态的预测具备物理真实性。
这也决定了莫刻机器人在刚刚成立时,首先寻求解决的是让机器人理解世界这个瓶颈问题。
值得一提的是,LJM 从预训练到微调的全流程都跑在阿里云真武 810E 上,团队从写第一行代码开始,就同步做了分布式训练优化和国产算力适配,这也为未来的工程化与技术落地打好了基础。
LJM 的出现或许标志着具身智能行业正在跨过一个关键的临界点:我们终于开始走向「理解真正的物理因果」,AI 模型开始学习物理世界的运行逻辑。
当世界模型能够准确预测每一个动作的后果,有望为弥合机器人领域长期以来的 sim2real 鸿沟提供新的路径,未来的机器人可以在世界模型里预演几百万次,把所有可能的错误都犯一遍,再安全地部署到真机上。
到那个时候,准备好了的机器人,才会走进每个需要它们的真实场景。
