阅读时间大约5分钟(1813字)
作者:Lingshu 出品:具身智能观察室
一、研究现状与动机
当前具身基础模型主要沿两条技术路线演进:一是以 OpenVLA、系列为代表的视觉-语言-动作模型(VLA),通过“观测—动作”的端到端映射习得操作策略;二是以 Cosmos3、Fast-WAM 为代表的世界-动作模型(WAM),将动作生成与未来视觉预测统一建模于扩散或自回归框架。
然而,这两类模型在部署后权重即被冻结,能力上限严格受限于预训练语料分布,难以应对真实物理环境中持续涌现的分布偏移。
为弥合这一鸿沟,学界提出了多种部署时自适应方案,但均存在结构性缺陷。
测试时训练(Test-Time Training)方法(如 RoboTTT、WAM-TTT)虽通过梯度更新快权重或自适应记忆模块实现适配,但其优化时间远超单次交互;且 WAM-TTT 依赖人类示教视频作为更新源,缺乏自主探索能力。
近期的上下文机器人学习器(如 GEN-1.5、Skild S1)虽在权重冻结前提下运行,但其上下文学习主要面向任务级泛化,而非即时闭环交互适应。
更关键的是,现有记忆增强方法(如 MemoryVLA、MEM)所存储的多为观测级或语义级历史片段,缺乏对"动作—状态迁移"因果结构的显式建模,难以支撑基于尝试反馈的策略修正。
Zeva 正是针对这一空白,提出将交互因果信号作为可检索、可注入的上下文证据,使冻结策略在零梯度更新条件下具备隐式系统辨识与自进化能力。
二、Zeva框架

1,问题形式化:上下文因果学习DD
Zeva 将具身动作泛化问题重新表述为上下文因果学习(ICCL)。考虑一个需在未见任务分布上泛化的具身智能体,其目标是在单次 episode 内、不更新权重的前提下,推断环境的因果结构——即动作与状态迁移之间的映射关系。
在第次尝试中,策略利用从历史交互中提取的因果上下文,通过最小化预测因果效应与实际因果效应之间的偏差来优化决策:


2,因果交互提取
为弥合原始像素与因果推理之间的语义鸿沟,Zeva 设计了因果转移编码器(Causal Transition Encoder),将交互序列映射至潜在因果空间。

3,双时间尺度因果记忆

该合并策略蕴含深刻的因果归纳偏置:仅当新经验在任务进度与物理动力学两个维度上同时匹配已有条目时方执行合并,否则作为新条目保留。
这一设计避免了不同物理情境下经验的错误融合,确保记忆库中每一条目均对应一个独特的“阶段—动力学”组合,为后续精确检索奠定基础。
4,上下文策略注入

值得强调的是,Zeva 的架构设计与现代基础策略的双路径结构深度耦合:自回归路径编码多模态上下文,扩散路径生成连续机器人动作。
CTE 提取的阶段token与因果信号分别供给两条路径——BIT 提供尝试内即时证据,PIM 检索跨尝试阶段匹配证据;最终形成的因果提示条件化扩散路径的全注意力块,使策略仅凭上下文即可调整动作生成,而所有模型参数保持冻结。
这种“参数冻结 + 记忆进化”范式,本质上是将传统强化学习中的“策略更新”转化为“上下文更新”,从而规避了梯度优化的高延迟与灾难性遗忘风险。
三、实验结果
1,真实世界ChemLab-Evo评估

Zeva 在三个复杂度级别上均取得最优平均成功率:Level 1 原子操作平均达 83.3%,较最强基线提升 6.6 个百分点;Level 2 短序列平均 70.0%,提升 5.0 个百分点;Level 3 复杂任务平均 7.5%,提升 5.0 个百分点。
在长程任务的 Process Score 上,Zeva 于 Balance Weighing 得 47.50、Extraction 得 67.14,均值 57.32,较最强基线平均提升 12.59 个百分点。这表明 Zeva 不仅在终端成功率上领先,更在长程多阶段任务的有序完成度上具备显著优势。
2,仿真基准RoboCasa365-Atomic5评估

Zeva 在五项任务上取得 76.8% 的宏平均成功率,超越 Fast-WAM 的 72.4% 达 4.4 个百分点,位列所有对比方法之首。
在 TurnOnMicrowave 与 OpenStandMixerHead 等任务上,Zeva 与最强基线持平或接近;但在 CloseToasterOvenDoor 与 TurnOnElectricKettle 上展现显著优势,验证了因果记忆对多样化操作技能的泛化能力。
3,消融研究:双时间尺度记忆的互补性

在五项 ChemLab-Evo 任务上的消融实验显示:移除 PIM 使成功率下降 10–20 个百分点;移除 BIT 导致更大幅度下降(15–30 个百分点),其中 Pour Water 与 Titration 下降最为显著;同时移除二者则在所有任务上取得最弱结果。
这一结果印证了跨尝试记忆与尝试内上下文的互补性:BIT 维持即时动力学感知,PIM 沉淀跨尝试策略修正证据,二者缺一不可。
4,部署后上下文扩展

在 Atomic5 的 100 个固定 episode 上,累积成功率从 Evolve 1 的 26% 升至 Evolve 2 的 45%、Evolve 3 的 70%,最终在 Evolve 4 收敛于 73%。

ChemLab-Evo 三项原子任务同样呈单调上升:Pick Up Test Tube 从 65% 升至 100%,Place Beaker 从 25% 升至 70%,Pour Water 从 30% 升至 80%。
这一结果直接印证了 Zeva 的核心主张——冻结策略可通过交互经验的记忆积累实现自进化,且无需任何梯度更新。
总结
Zeva 是首个在策略参数冻结条件下,从机器人自身物理交互经验中进行交互因果上下文学习的框架。
其核心创新在于:将动作干预与状态迁移的因果三元组形式化为可检索的上下文证据,经因果转移编码器解耦为阶段token与因果信号,并由双时间尺度记忆(BIT/PIM)组织为因果提示,注入冻结的 VLA/WAM 基础模型,实现零梯度更新的隐式系统辨识与自进化。
仿真与真实世界实验表明,其性能超越前沿 VLA 与 WAM 基线,且成功率随尝试次数持续提升。
然而,局限在于因果学习仅源于任务执行中被动产生的尝试,缺乏主动交互。未来工作将探索因果驱动的探索:智能体有目的地选择信息量最大的 rollout,以降低物理交互的不确定性,提升经验获取效率。
