杨立昆联合作品AdaJEPA:世界模型从“训练后冻结”走向“执行中校准”,物理AI泛化真迎来解法了吗?
统计 阅读时间大约9分钟(3278字)

12小时前 杨立昆联合作品AdaJEPA:世界模型从“训练后冻结”走向“执行中校准”,物理AI泛化真迎来解法了吗?

来源:豆包
AdaJEPA破解世界模型"现实错:让机器人在行动中更新认知

作者:余柯     出品:机器人产业应用

前言

一台机器人在实验室里,能熟练地把T形积木推到目标位置。可一旦把积木换成方块、调暗灯光,或者改变物体质量,它原本有效的动作就可能突然失灵。

问题不一定出在机械臂,而在于机器人脑中的“世界”和现场已经不是同一个世界:模型仍然按照旧经验想象未来,规划器于是为一个错误的未来寻找“最优动作”。

AdaJEPA想解决的,正是这道“模型与现实脱节”的缝隙。它把世界模型从一次训练、长期使用的静态工具,改造成在执行任务时能够根据新反馈快速校准的动态系统。

不过,在讨论这一技术可能带来的产业变化之前,有必要先澄清几个被二手传播放大的说法。

01

先把三个容易被夸大的事实说清楚

AdaJEPA论文的首个arXiv版本提交于2026年6月30日。作者包括Ying Wang、Oumayma Bounou、Yann LeCun和Mengye Ren,作者单位为纽约大学与AMI Labs。更准确地说,它是杨立昆参与并共同指导的一项研究,而不是单独发布的新一代商业模型。

它也不是所谓的“V-JEPA 3”,更不是V-JEPA 2的简单升级,而是一套可应用于JEPA类潜空间世界模型的测试时自适应机制。

第二,AdaJEPA当前的实验验证集中在仿真环境,论文没有报告真实机械臂上的AdaJEPA部署结果。因此,“机器人通过真实物理反馈边跑边学”可以视为这套方法未来的应用方向,但不能写成该论文已经完成的真机验证。

第三,论文所说的“毫秒级”,指的是在一张NVIDIA H200 GPU上,在线参数更新为每次MPC重规划增加约0.01—0.03秒。这只是自适应步骤的额外开销,不是机器人从感知、规划到执行的完整端到端时延。论文表格显示,完整的单次重规划耗时会因模型和规划器不同而落在约0.24—9.56秒的范围内。

因此,更严谨的表述应当是:AdaJEPA在高端数据中心GPU上,以约10—30毫秒的额外计算成本完成一次轻量参数更新;其完整控制周期仍取决于模型规模、规划算法和部署硬件。

4b213ff2ba7921862892ec14eb76d320.png

02

为什么过去的世界模型通常“训练完就冻结”?

要理解AdaJEPA的变化,首先要知道传统世界模型如何工作。

一套典型的视觉世界模型,大致包含三个步骤:

首先,模型把摄像头采集到的高维画面编码成更紧凑的隐状态;其次,它根据当前状态和候选动作,预测执行动作后状态会如何变化;最后,模型预测控制器,也就是MPC,在模型构建的“想象空间”中测试多组动作序列,选出最可能到达目标的一组。

JEPA的特点,是不执着于逐像素复原下一帧,而是在潜空间中预测更抽象、与任务更相关的状态。可以把它理解为:与其费力画出杯子移动后每一处反光和阴影,不如抓住“杯子正在向桌边滑动”“杯子与障碍物即将接触”等对行动更有价值的信息。

世界模型训练完成后保持冻结,并不只是研究人员思维保守,而是出于非常现实的工程考虑。固定参数便于复现实验、比较版本、验证安全边界和排查故障;在线反向传播会增加算力需求、控制时延和系统复杂度;一旦传感器受到噪声、遮挡或故障影响,错误数据还可能把模型更新到更加危险的方向。

更关键的是,机器人一旦可以在运行中改写自身模型,部署前通过测试的行为边界就不再天然有效。今天验收通过的模型,经过若干次在线更新后,可能已经变成另一套系统。

不过,“运行中辨识环境”本身并不是全新的思想。经典自适应控制、在线系统辨识和部分模型式强化学习,早已允许控制器根据实际反馈调整动力学估计。

AdaJEPA 的价值,是把这一思想嵌入了高维视觉潜空间世界模型与闭环规划系统:它不是只调整预先定义好的质量或摩擦系数,而是直接利用新观测到的状态转移,对视觉编码和潜空间动力学预测进行轻量校准。

03

AdaJEPA 到底怎样“边跑边学”?

AdaJEPA的工作循环可以概括为:规划→执行→观测→适应→重新规划。

第一步,模型在潜空间中推演多组候选动作,判断哪一组更有可能把物体或智能体带到目标状态。

第二步,系统不会一次性执行完整计划,只执行第一个动作,或者一小段动作。

第三步,机器人获取新的观测,把“刚才看到的状态、执行的动作、实际到达的状态”记录下来。

第四步,模型比较自己此前预测的下一状态,与新观测编码得到的实际下一状态。两者之间的差异构成自监督训练信号,系统据此做一次轻量梯度更新。

更新后的模型随即进入下一轮规划。

这套机制不要求人工重新标注奖励,也不需要专家再次演示。机器人每一次正常行动产生的状态转移,本身就是适应数据。

论文的默认配置相当克制:

在线缓冲区只保留最近5个状态转移;

每次MPC重规划只进行1个梯度更新步骤;

只更新视觉编码器和预测器的少数末端层,而不是修改全部参数;

每个任务回合使用独立的模型副本和数据缓冲区。

最后一点尤其重要。AdaJEPA当前并不是一个会跨越数月、持续积累经验的“终身学习机器人”。论文实验中,每个回合都会从同一套预训练参数开始,在线适应的结果不会自动沉淀到下一个回合。

因此,与其称它为“模型持续进化”,不如称为:回合内快速适应,或者部署时即时校准。它解决的是“眼前这个环境已经和训练环境不同,怎样尽快恢复预测准确性”,尚未解决“怎样长期积累知识而不遗忘旧能力”。

04

“成功率接近翻倍”,究竟发生在哪些场景?

AdaJEPA的论文确实报告了显著提升,但并不是所有测试中的成功率都接近翻倍。

在PushObj任务中,模型需要推动训练阶段没有见过的新形状。论文报告,AdaJEPA在部分未见形状上的规划成功率接近冻结模型的两倍。其意义在于,模型不需要事先收集大量新形状数据重新训练,而是可以利用任务刚开始时产生的少量运动反馈,修正对物体几何和接触关系的预测。

在视觉变化测试中,研究人员加入了图像模糊、暗光和颜色变化。AdaJEPA在模糊、噪声和暗光条件下普遍改善明显,但当颜色承担关键语义时,收益更有限。

例如,如果训练数据一直用某种颜色区分“可以推动的物体”和“固定参照物”,测试时突然改变这种颜色,问题就不只是画面变暗,而是模型原有语义规则遭到了破坏。少量在线梯度更新未必足以重新建立整套对象语义。

b6e217aa5ae1f74fea21851dbbc0693c.png

PointMaze的结果,则更能说明“快速校准”和“彻底理解”之间的区别。

在未见过的迷宫布局中,使用梯度规划器时,冻结模型的成功率为53.3%;默认自适应配置将其提高到 66.0%;在选择不同更新层的实验配置中,最高可达到 78.7%。但在物体质量降低至原来的0.2倍、阻尼提高至原来的20倍等动力学变化中,冻结模型本身已经表现较强,在线适应带来的改善通常只有几个百分点。

所以,AdaJEPA的实验不能被概括成“所有陌生环境下成功率翻倍”。更准确的结论是:

当模型与现场之间的差异可以通过少量新状态转移加以修正时,在线校准可能显著提升规划表现;当预训练表示根本没有包含任务所需的关键特征时,轻量更新也无法凭空创造新能力。

论文自己也承认,自适应效果受预训练表征覆盖范围限制。如果测试环境需要模型此前从未形成的特征,AdaJEPA无法完全弥合这一差距。

05

自适应世界模型与因果世界模型,不是二选一

国内产业界也在探索另一条路线:因果世界模型。以晨昏线科技在2026年公开的GCWM1为例,其发布材料称,系统试图把物理因果先验、目标评估和多世界线搜索引入推演过程,涉及重力、摩擦力、刚体约束等物理机制。

但需要强调的是,这些信息目前主要来自公司发布和媒体转述。与AdaJEPA已公开的论文和仿真实验相比,GCWM1在同行评议论文、完整代码和统一公开基准方面的证据仍然有限。因此,两者暂时不能仅凭宣传材料直接比较性能高低。

从技术逻辑看,两条路线处理的是不同层面的问题。

AdaJEPA问的是:“模型在当前环境中预测错了什么,怎样利用刚刚发生的状态转移快速修正?”

因果世界模型问的是:“哪些变量真正导致结果,哪些机制在环境变化后依然稳定?”

b22a1791dffb613253553c58d5b9cddd.png

因果世界模型并不一定要把摩擦力、重心、形变等全部变量显式写成可读参数。有些方法学习的是潜在因果结构,而非传统物理方程。但它们共同追求的是:模型不仅发现“两个现象经常同时发生”,还尽可能识别“改变哪个因素会导致结果变化”。相关学术研究已经尝试将因果结构引入世界模型,以提高离线强化学习中的跨环境泛化。

更合理的工程终局,可能是“慢结构、快参数”:离线阶段学习相对稳定的对象、接触关系和因果结构;部署阶段快速估计当前物体的质量、摩擦、刚度、重心位置或传感器偏差。

换句话说,因果模型提供不易变化的“骨架”,AdaJEPA式在线适应负责现场标定。二者走向融合的可能性,远高于长期互斥。

06

结语:重要转向,但还不是终局答案

AdaJEPA的真正意义,不在于某一组成功率数字,而在于它重新划定了世界模型的职责边界。世界模型不再只是部署前训练好的预测器,而开始成为控制闭环中持续接受现实检验、及时修正自身的组成部分。它确实为物理AI的泛化难题提供了一条可行路径,却远非完整答案。

截至目前,AdaJEPA的证据仍限于仿真;额外更新时延来自NVIDIA H200;完整代码尚未全部公开,项目代码仓库仍表示将在ICML后发布完整实现;真实机器人上的长期稳定性、跨回合记忆和安全保证仍待验证。

但方向已经清晰,未来可靠的机器人,不会只靠更大的离线数据集“提前见过一切”,也不会只靠一个完美的因果模型“一次理解一切”。它更可能同时具备三种能力:从大规模数据中获得基本常识,用结构化机制理解环境变化,再在行动中依据现实反馈持续校准。

真正的突破,或许不是让机器永远不犯错,而是让它在发现自己错了以后,能在下一步行动之前完成一次可信、受控、可回滚的修正。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×