阅读时间大约9分钟(3278字)
作者:余柯 出品:机器人产业应用
前言
一台机器人在实验室里,能熟练地把T形积木推到目标位置。可一旦把积木换成方块、调暗灯光,或者改变物体质量,它原本有效的动作就可能突然失灵。
问题不一定出在机械臂,而在于机器人脑中的“世界”和现场已经不是同一个世界:模型仍然按照旧经验想象未来,规划器于是为一个错误的未来寻找“最优动作”。
AdaJEPA想解决的,正是这道“模型与现实脱节”的缝隙。它把世界模型从一次训练、长期使用的静态工具,改造成在执行任务时能够根据新反馈快速校准的动态系统。
不过,在讨论这一技术可能带来的产业变化之前,有必要先澄清几个被二手传播放大的说法。
01
先把三个容易被夸大的事实说清楚
AdaJEPA论文的首个arXiv版本提交于2026年6月30日。作者包括Ying Wang、Oumayma Bounou、Yann LeCun和Mengye Ren,作者单位为纽约大学与AMI Labs。更准确地说,它是杨立昆参与并共同指导的一项研究,而不是单独发布的新一代商业模型。
它也不是所谓的“V-JEPA 3”,更不是V-JEPA 2的简单升级,而是一套可应用于JEPA类潜空间世界模型的测试时自适应机制。
第二,AdaJEPA当前的实验验证集中在仿真环境,论文没有报告真实机械臂上的AdaJEPA部署结果。因此,“机器人通过真实物理反馈边跑边学”可以视为这套方法未来的应用方向,但不能写成该论文已经完成的真机验证。
第三,论文所说的“毫秒级”,指的是在一张NVIDIA H200 GPU上,在线参数更新为每次MPC重规划增加约0.01—0.03秒。这只是自适应步骤的额外开销,不是机器人从感知、规划到执行的完整端到端时延。论文表格显示,完整的单次重规划耗时会因模型和规划器不同而落在约0.24—9.56秒的范围内。
因此,更严谨的表述应当是:AdaJEPA在高端数据中心GPU上,以约10—30毫秒的额外计算成本完成一次轻量参数更新;其完整控制周期仍取决于模型规模、规划算法和部署硬件。

02
为什么过去的世界模型通常“训练完就冻结”?
要理解AdaJEPA的变化,首先要知道传统世界模型如何工作。
一套典型的视觉世界模型,大致包含三个步骤:
首先,模型把摄像头采集到的高维画面编码成更紧凑的隐状态;其次,它根据当前状态和候选动作,预测执行动作后状态会如何变化;最后,模型预测控制器,也就是MPC,在模型构建的“想象空间”中测试多组动作序列,选出最可能到达目标的一组。
JEPA的特点,是不执着于逐像素复原下一帧,而是在潜空间中预测更抽象、与任务更相关的状态。可以把它理解为:与其费力画出杯子移动后每一处反光和阴影,不如抓住“杯子正在向桌边滑动”“杯子与障碍物即将接触”等对行动更有价值的信息。
世界模型训练完成后保持冻结,并不只是研究人员思维保守,而是出于非常现实的工程考虑。固定参数便于复现实验、比较版本、验证安全边界和排查故障;在线反向传播会增加算力需求、控制时延和系统复杂度;一旦传感器受到噪声、遮挡或故障影响,错误数据还可能把模型更新到更加危险的方向。
更关键的是,机器人一旦可以在运行中改写自身模型,部署前通过测试的行为边界就不再天然有效。今天验收通过的模型,经过若干次在线更新后,可能已经变成另一套系统。
不过,“运行中辨识环境”本身并不是全新的思想。经典自适应控制、在线系统辨识和部分模型式强化学习,早已允许控制器根据实际反馈调整动力学估计。
AdaJEPA 的价值,是把这一思想嵌入了高维视觉潜空间世界模型与闭环规划系统:它不是只调整预先定义好的质量或摩擦系数,而是直接利用新观测到的状态转移,对视觉编码和潜空间动力学预测进行轻量校准。
03
AdaJEPA 到底怎样“边跑边学”?
AdaJEPA的工作循环可以概括为:规划→执行→观测→适应→重新规划。
第一步,模型在潜空间中推演多组候选动作,判断哪一组更有可能把物体或智能体带到目标状态。
第二步,系统不会一次性执行完整计划,只执行第一个动作,或者一小段动作。
第三步,机器人获取新的观测,把“刚才看到的状态、执行的动作、实际到达的状态”记录下来。
第四步,模型比较自己此前预测的下一状态,与新观测编码得到的实际下一状态。两者之间的差异构成自监督训练信号,系统据此做一次轻量梯度更新。
更新后的模型随即进入下一轮规划。
这套机制不要求人工重新标注奖励,也不需要专家再次演示。机器人每一次正常行动产生的状态转移,本身就是适应数据。
论文的默认配置相当克制:
在线缓冲区只保留最近5个状态转移;
每次MPC重规划只进行1个梯度更新步骤;
只更新视觉编码器和预测器的少数末端层,而不是修改全部参数;
每个任务回合使用独立的模型副本和数据缓冲区。
最后一点尤其重要。AdaJEPA当前并不是一个会跨越数月、持续积累经验的“终身学习机器人”。论文实验中,每个回合都会从同一套预训练参数开始,在线适应的结果不会自动沉淀到下一个回合。
因此,与其称它为“模型持续进化”,不如称为:回合内快速适应,或者部署时即时校准。它解决的是“眼前这个环境已经和训练环境不同,怎样尽快恢复预测准确性”,尚未解决“怎样长期积累知识而不遗忘旧能力”。
04
“成功率接近翻倍”,究竟发生在哪些场景?
AdaJEPA的论文确实报告了显著提升,但并不是所有测试中的成功率都接近翻倍。
在PushObj任务中,模型需要推动训练阶段没有见过的新形状。论文报告,AdaJEPA在部分未见形状上的规划成功率接近冻结模型的两倍。其意义在于,模型不需要事先收集大量新形状数据重新训练,而是可以利用任务刚开始时产生的少量运动反馈,修正对物体几何和接触关系的预测。
在视觉变化测试中,研究人员加入了图像模糊、暗光和颜色变化。AdaJEPA在模糊、噪声和暗光条件下普遍改善明显,但当颜色承担关键语义时,收益更有限。
例如,如果训练数据一直用某种颜色区分“可以推动的物体”和“固定参照物”,测试时突然改变这种颜色,问题就不只是画面变暗,而是模型原有语义规则遭到了破坏。少量在线梯度更新未必足以重新建立整套对象语义。

PointMaze的结果,则更能说明“快速校准”和“彻底理解”之间的区别。
在未见过的迷宫布局中,使用梯度规划器时,冻结模型的成功率为53.3%;默认自适应配置将其提高到 66.0%;在选择不同更新层的实验配置中,最高可达到 78.7%。但在物体质量降低至原来的0.2倍、阻尼提高至原来的20倍等动力学变化中,冻结模型本身已经表现较强,在线适应带来的改善通常只有几个百分点。
所以,AdaJEPA的实验不能被概括成“所有陌生环境下成功率翻倍”。更准确的结论是:
当模型与现场之间的差异可以通过少量新状态转移加以修正时,在线校准可能显著提升规划表现;当预训练表示根本没有包含任务所需的关键特征时,轻量更新也无法凭空创造新能力。
论文自己也承认,自适应效果受预训练表征覆盖范围限制。如果测试环境需要模型此前从未形成的特征,AdaJEPA无法完全弥合这一差距。
05
自适应世界模型与因果世界模型,不是二选一
国内产业界也在探索另一条路线:因果世界模型。以晨昏线科技在2026年公开的GCWM1为例,其发布材料称,系统试图把物理因果先验、目标评估和多世界线搜索引入推演过程,涉及重力、摩擦力、刚体约束等物理机制。
但需要强调的是,这些信息目前主要来自公司发布和媒体转述。与AdaJEPA已公开的论文和仿真实验相比,GCWM1在同行评议论文、完整代码和统一公开基准方面的证据仍然有限。因此,两者暂时不能仅凭宣传材料直接比较性能高低。
从技术逻辑看,两条路线处理的是不同层面的问题。
AdaJEPA问的是:“模型在当前环境中预测错了什么,怎样利用刚刚发生的状态转移快速修正?”
因果世界模型问的是:“哪些变量真正导致结果,哪些机制在环境变化后依然稳定?”

因果世界模型并不一定要把摩擦力、重心、形变等全部变量显式写成可读参数。有些方法学习的是潜在因果结构,而非传统物理方程。但它们共同追求的是:模型不仅发现“两个现象经常同时发生”,还尽可能识别“改变哪个因素会导致结果变化”。相关学术研究已经尝试将因果结构引入世界模型,以提高离线强化学习中的跨环境泛化。
更合理的工程终局,可能是“慢结构、快参数”:离线阶段学习相对稳定的对象、接触关系和因果结构;部署阶段快速估计当前物体的质量、摩擦、刚度、重心位置或传感器偏差。
换句话说,因果模型提供不易变化的“骨架”,AdaJEPA式在线适应负责现场标定。二者走向融合的可能性,远高于长期互斥。
06
结语:重要转向,但还不是终局答案
AdaJEPA的真正意义,不在于某一组成功率数字,而在于它重新划定了世界模型的职责边界。世界模型不再只是部署前训练好的预测器,而开始成为控制闭环中持续接受现实检验、及时修正自身的组成部分。它确实为物理AI的泛化难题提供了一条可行路径,却远非完整答案。
截至目前,AdaJEPA的证据仍限于仿真;额外更新时延来自NVIDIA H200;完整代码尚未全部公开,项目代码仓库仍表示将在ICML后发布完整实现;真实机器人上的长期稳定性、跨回合记忆和安全保证仍待验证。
但方向已经清晰,未来可靠的机器人,不会只靠更大的离线数据集“提前见过一切”,也不会只靠一个完美的因果模型“一次理解一切”。它更可能同时具备三种能力:从大规模数据中获得基本常识,用结构化机制理解环境变化,再在行动中依据现实反馈持续校准。
真正的突破,或许不是让机器永远不犯错,而是让它在发现自己错了以后,能在下一步行动之前完成一次可信、受控、可回滚的修正。
