具身智能的世界模型之争:为什么越来越多团队放弃了像素生成?
统计 阅读时间大约6分钟(2304字)

2026-08-19 具身智能的世界模型之争:为什么越来越多团队放弃了像素生成?

来源:豆包
拿视频教机械臂做动作,模型学到的可能只是运镜晃动与光影噪点。

作者:毛不毛     出品:具身智能前沿

导读

真实机械臂轨迹采集成本高昂,而互联网上数以亿计的人类操作视频却充斥着镜头抖动与背景干扰。直接预测未来像素的视频世界模型容易被表面纹理牵着走,导致动作控制退化。VLA-JEPA 借鉴 Yann LeCun 主推的联合嵌入预测架构(JEPA),在抽象潜空间中预测物理状态演变,并在 Hugging Face 的 LeRobot v0.6.0 中正式落地。本文深度拆解其架构机理、抗噪实验与工程边界。

别再让机械臂在像素堆里做无用功了

教机械臂干活,现在最头疼的一堵墙就是数据。

采集一条高精度的真实机器人示教轨迹,从硬件标定、遥操作到人工清洗,成本居高不下。大家自然把目光投向了互联网上铺天盖地的人类第一视角视频。

但直接把视频喂给模型,坑比想象中多得多。

过去很多团队尝试用视频生成的方式做世界模型:让神经网络去猜下一帧画面的每一个像素。听起来很符合直觉,但在机械臂的实际控制场景里,这套逻辑极容易跑偏。

一段人类切菜或者拿杯子的日常录像,画面里变化最剧烈的是什么?往往是头戴相机的晃动、厨房背景里走过的人影、甚至仅仅是头顶日光灯的频闪。

这些视觉噪点在像素层面的变化幅度,常常几十倍于手指微小的抓握动作。

模型顺理成章地学会了偷懒。它把绝大部分算力用来拟合背景光影和镜头位移,所谓的“潜在动作变量”,最终只剩下一套对未来画面的粗糙压缩包。

画面变了,但环境里的物理状态究竟发生了什么变化?模型其实一无所知。

07f4b71e472974a01d0f4a500d61efd0.png

这种偏差直接导致动作策略极其脆弱。换个桌面颜色,或者把主光源调暗一点,机械臂就可能当场抓瞎。

机器人需要的不是在脑子里给未来世界画高清插画,它只需要搞清楚:自己这一把抓下去,桌上的杯子到底是被推倒了,还是稳稳立在原地。

拆解 VLA-JEPA:把未来当监督,而不是输入

要绕开像素级的无底洞,最直接的思路就是把预测扔进潜空间。

视觉-语言-动作模型(Vision-Language-Action,简称 VLA),简单说就是让大模型同时看懂图片、听懂人话、并直接输出机械臂关节轨迹的具身控制大脑。而联合嵌入预测架构(Joint-Embedding Predictive Architecture,简称 JEPA),则是 Yann LeCun等人提出的一套自监督学习路线——它不在像素空间做逐点重建,而是把输入映射到高维抽象特征后,在潜空间里预测被遮掩或未来的表征状态。

VLA-JEPA 的核心构造正是这两者的有机咬合:

52472e691975b9e740a9105b85eab6a5.png

图片来源:VLA-JEPA 论文及项目主页

拆开看,VLA-JEPA 由四块咬合而成:

Qwen-VL 多模态底座

:理解当前图像观测与自然语言任务指令,序列中插入可学习的潜在动作 token。

V-JEPA2 视觉编码器

:外部视频帧经过冻结或对齐的编码器,提取高维世界状态,而不是逐像素重建画面。

未来表征(只在损失端)

:目标编码器生成的未来表征挂在损失函数那一端做参考答案,输入端拿不到。

流匹配动作头

:下游控制阶段接入,把预训练学到的物理先验解码成连续末端位姿控制量。

整个训练流程中最关键的设计,在于它对“未来”的处理机制。

很多传统的潜动作预训练方案,在预测下一步转移时,会忍不住把下一时刻的观测同时塞进输入端。这就在计算图里撕开了一个致命的作弊后门:模型根本不需要理解动作因果,只要把未来帧的特征照抄过来就能降低损失。

VLA-JEPA 掐断了这条捷径。

在预训练阶段,模型只能看到当前状态和自身输出的潜在动作 token。目标编码器生成的未来表征只挂在损失函数那一端,作为衡量预测是否准确的参考答案。

未来是裁判,不是开卷考试的课本。

到了下游控制阶段,框架再接入一个基于流匹配(Flow Matching)的动作头。在大规模无标签人类视频上学到的“物理状态演变先验”,顺畅地过渡到下游几百条真实机器人演示中,直接解码出连续的末端位姿控制量。

没有像素生成的视觉炫技,整个网络的收敛曲线反而变得异常平稳。

数据与真实机械臂:抗噪性到底有多硬核?

抛弃像素重建到底能换来多少抗干扰收益?基准测试给出了一组足够硬朗的数字。

在仿真基准 LIBERO上,VLA-JEPA 拿到了 97.2% 的平均成功率。更具说服力的是针对环境扰动专门设计的 LIBERO-Plus 评测。

341033b582e352f5746d5f9defbd6d0b.png

图片来源:VLA-JEPA 论文

这个测试集在仿真环境里人为注入了 7 个维度的分布外(Out-of-Distribution,OOD)扰动,包括光照突变、背景贴图切换、相机位姿偏移和无关物体干扰等。模型在完全没见过这些极端场景的情况下,跑出了 78.1% 的平均成功率。

对比之下,同样使用优质预训练基座的 OpenVLA-OFT 得分为 69.6%,而 pi0-Fast 仅有 61.6%。

为什么差距拉得这么开?

原因就在于那些被 V-JEPA 编码器自动过滤掉的高频视觉垃圾。光线明暗如何跳动,桌布是纯白还是格子纹,在潜空间的状态向量里都被抽象归一化了。模型盯着的只有夹爪与目标物体之间的空间几何关系。

这种特性在真实机械臂硬件上也展现出了意料之外的韧性。

研究团队使用一台搭载 Robotiq 2F-85 夹爪的 Franka FR3 机械臂进行真机抓取测试。在 100 条真实演示微调后,出现了一个相当有意思的细节:

当机械臂因为偶发摩擦力不足导致初次抓取滑脱时,策略没有像普通模仿学习模型那样僵死在原处或继续盲目执行后续步骤,而是主动张开夹爪、微调位姿后尝试了二次抓取。

50356bca2e5a519195d3b9eb0eed8f9c.png

模型为什么会无师自通地学会“挽救动作”?

秘密藏在预训练用到的 22 万条 Something-Something-v2 人类操作视频里。人类在日常生活中拿放物品,手滑、没对准、重新拿捏是高频发生的真实动态。潜空间世界模型把这种“失败后如何恢复”的状态转移逻辑自然吸收了进去。

从学术到 LeRobot 0.6.0:具身世界模型的分工真相

今年 7 月 6 日,Hugging Face 官方发布了 LeRobot v0.6.0。

在这场以“想象、评估、改进”为主题的版本迭代中,VLA-JEPA 作为首批具身世界模型策略被正式合并进了代码主干。

这意味着潜空间世界模型不再仅仅停留在学术评测表的几个百分点里,而是成为了开源机器人开发者可以直接调用的标准构件。

但我们也要保持足够的清醒。

人类视频绝不是万能的灵药,更不可能彻底取代真实的机器人示教数据。

在 SimplerEnv 的部分特定任务评测中,消融实验显示,如果强行在某些强视觉匹配任务里塞入过多人类视频,模型的最终成功率反而出现了微弱下滑。

人类骨骼与机械连杆的自由度存在物理鸿沟,镜头视角与多目相机阵列也并非完美对齐。人类视频的真正价值,是为机器人补齐对物理世界动态演变的常识与容错直觉;而真正要把动作落到毫米级的执行精度上,高质量的机器人轨迹依然是唯一的硬通货。

具身智能的世界模型演进走到今天,争论的焦点已经不再是“要不要世界模型”,而是“要把世界模型放在哪个维度”。

放弃对像素级微观画面的执念,退一步在潜空间里看清状态因果,或许才是让机器人在混乱现实中稳健动手的第一步。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×