反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
统计 阅读时间大约10分钟以上(4361字)

2小时前 反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%

来源:豆包
GSR重构VLA的语言信息流!

出品:机器之心

作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。

大部分论文展示的能力都在训练和测试集指令分布一致的数据上刷点,结果哪怕是像 LIBERO 这种现在看起来简单的数据,在简单改写指令后性能都会暴降。如下图所示,vla-adapter 在 LIBERO-para 上性能暴降 51%。对于具身 AGI 来说,这是一个不能接受的问题,我们期待的是一个在各种环境下能听懂人的各种表述形式的任务指令的机器人。

因此,VLA 真正难的,并不是在固定指令模板上再多拿几个点,而是让同一个任务在不同说法下,最终落到同一套机器人动作上。也就是目标物体没有变化、视觉场景没有变化、成功条件也没有变化,只是换了一种语言表达,机器人仍然应该完成原来的任务。

围绕 VLA 语言泛化的问题,来自上海交大和无界动力具身智能实验室的联合团队提出了一项极其简单但非常有效的解法。通过重新设计语言语义进入视觉与动作计算路径的方式,让模型不依赖大量 paraphrase 训练,也能更稳定地执行改写后的指令。

b75a2b01baff11b2e20d8332e6c29591.png

论文标题: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

论文地址:https://arxiv.org/abs/2608.02497

GitHub地址: https://github.com/AutoLab-SAI-SJTU/GSR-ParaVLA

指令只改几个词,VLA 的动作就可能完全不同

当前不少 VLA 工作都在 LIBERO、RoboTwin 等 benchmark 上不断刷新成功率。但标准 benchmark 中的语言通常较为固定,模型在训练和测试阶段看到的指令表达高度相似。

这会掩盖一个基础问题:模型究竟理解了 Instruction 所表达的任务含义,还是只把某种固定说法当成了 0,1,2 这样的任务标签?

例如:抓取较大的红色物体;改写为:拿起尺寸更大的红色方块。对人类而言,两句话对应的是同一个任务。但对 VLA 来说,这种看似微小的变化,可能让原本能够稳定完成的任务直接失败。

本文首先在 LIBERO-Para 上评估了 VLA-Adapter、SmolVLA 和 π0.5 三个模型。LIBERO-Para 是在 LIBERO-Goal 任务基础上构建的语言泛化 benchmark。它保持机器人面对的场景、物体、初始状态和成功标准不变,只改写任务指令中的动作表达、物体描述,或同时改写两者,用来测试模型在任务没变、只是换了一种等价表述的情况下能否继续正确执行任务。

773ec9c8c83dc333d31eca8610103dde.png

换个表述,VLA性能就会掉这么多

结果显示,SmolVLA 在原始指令上的成功率为 72.0%,面对改写指令时却只剩 4.47%;VLA-Adapter 从 98.2% 降至 46.82%。即便是经过大规模异构数据训练的 π0.5,也仍然存在语言改写带来的性能损失。

换句话说,在标准指令上取得高成功率,并不等于模型具备稳定的 Instruction 跟随能力。

但成功率下降只能说明问题存在,并不能解释问题出在哪里。

对于后训练微调来说,常见的解法是是继续收集更多等价表述,将改写语句加入训练。对于预训练来说,像 pi 一样经过大规模的数据训练,模型见多了语言任务形式,也能增强指令泛化的能力。但这个论文发现,或许还有一种更简单的解法。本文从模型结构中「L」的设计角度考虑重新思考这个问题。

分析 1:失败动作里,仍然保留着正确任务的结构

为了判断任务信息是否已经消失,论文首先设计了一个动作级检索实验。

对于同一个视觉 Observation,模型先接收当前任务的改写指令,生成一个 action chunk。随后,在完全相同的视觉输入下,再分别输入十个 LIBERO-Goal 任务的原始指令,得到十组候选动作。

接下来只需要判断:改写指令生成的动作,最接近正确任务的原始动作,还是更接近其他错误任务?假如模型已经完全误解了指令,那么改写指令产生的动作不应该稳定地指向正确任务。相反,如果其中仍然包含任务相关信息,它就应该比错误任务更靠近对应的原始动作。

cf081d1008d541ed5d9d5fdd209132e7.png

三个模型的 Retrieval@1 均显著高于随机水平 (0.1),Semantic Retention 也全部为正。π0.5 的改写动作尤其明显地靠近正确任务;VLA-Adapter 和 SmolVLA 虽然最终成功率下降较大,但其动作中仍然保留了一定的任务区分结构。

这组结果并不意味着每一个失败 episode 中,模型都已经完整理解了指令。但它至少说明,语言改写并没有让正确任务信息彻底消失。

任务相关信息仍然存在,问题更可能发生在这些信息被转换为连续动作的过程中。

分析 2:逐层替换:语言偏移如何变成动作偏移

上面的实验只能说明任务结构仍然存在。为了进一步判断内部语言特征是否真正控制动作,论文对模型进行了逐层特征干预。

以 VLA-Adapter 为例,同一个 episode 分别使用原始指令和改写指令运行,两次运行中的视觉输入、机器人状态、初始环境以及动作生成条件全部保持一致。在改写指令进入最后一个 Bridge-Attention block 前,实验不改变 image token,也不改变 state token,只将该位置接收到的语言特征替换为原始指令对应的语言特征。

结果显示:

预测动作之间的差异恢复了 96.8%;

配对闭环成功率从 60% 提升至 96%。

1a3f4544c41c099ff71b0249529fee00.png

替换具体层带来的恢复效果热力图

这说明,改写指令并没有让模型进入一个完全无关的状态。更接近实际情况的是:原始指令和改写指令之间产生了一定的语言表示偏移,而下游 Action Expert 对这种偏移非常敏感,最终将较小的特征差异放大成了不同的机器人动作。为了确认这一位置确实参与任务控制,论文还进行了 wrong-task intervention:将语言特征替换成另一个错误任务的特征后,模型生成的动作会向被注入的错误任务偏移。

不过,这并不是所有 VLA 的共同特征。

在 VLA-Adapter 中,最后一个 Bridge-Attention block 的单层替换就能恢复 96.8% 的动作差异;而在 SmolVLA 和 π0.5 中,对任意单层进行相同替换,最高只能分别恢复约 10.5% 和 31.3%。

这说明三类架构处理任务语义的方式并不相同:VLA-Adapter 将语言信息送入相对独立的 Bridge-Attention policy,控制位置较为集中;SmolVLA 和 π0.5 则在多层多模态计算中持续融合语言、视觉和状态,任务信息更加分散。

因此,语言泛化问题不能简单概括为「所有 VLA 的 Action Head 都在某一层失效」。不同架构的信息流不同,语义修复的位置也需要随之变化。

分析 3:两项控制实验:动态图像与措辞都会扰动语言表示

在确认语言特征差异会影响动作后,论文继续追踪这些差异是如何产生的。分析主要围绕 VLA-Adapter 的辅助 Qwen 分支展开。该分支同时接收当前图像和任务指令,因此语言 token 并不是由文本单独编码得到,而是在视觉 — 语言联合建模过程中产生。

第一项实验用于隔离动态视觉输入对语言表示的影响。模型进行两次前向。第一次前向中,Qwen 接收真实图像和任务指令;第二次前向中,Qwen 接收相同指令,但图像被替换为一张固定图像。随后,第二次前向产生的语言 token 被送回第一次前向的计算路径,而机器人的主视觉分支仍然使用真实 Observation。

也就是说,机器人依旧能够看到当前场景,只是不再让任务语言表示随着辅助 Qwen 分支中的动态图像共同变化。

5d7978432b5afae81bffe37b07b83df3.png

分析3概述图

仅通过这一处理,VLA-Adapter 在完整 LIBERO-Para 上的成功率就从 46.82% 提升至 61.58%。将 dummy image 换成固定的自然图像后,也能观察到相同趋势。

这一结果说明,在该结构中,任务描述与动态图像被共同编码时,可能会引入额外的特征波动。对于机器人动作而言,这些波动并不代表任务本身发生了变化,却仍然会改变后续控制结果。

分析 4:移除「措辞」方向,闭环成功率从 55% 提升到 90%

第二项实验用于分析原始指令和改写指令之间的措辞差异。

论文采用交叉验证,先使用八个任务估计 32 个能够区分原始指令和改写指令的特征方向,再将这些方向从剩余两个未见任务的改写指令特征中移除。

移除后:

原始指令与改写指令之间的动作差异从 0.4361 降至 0.2282;

20 个闭环 episode 上的成功率从 55% 提升至 90%;

移除相同数量、相同范数的随机方向,动作差异基本保持不变。

这说明,等价指令不一定会让模型彻底忘记任务,但可能在特征空间中引入系统性的措辞偏移。下游 Action Expert 没有学会忽略这些与任务无关的变化,反而将它们映射成了不同的动作。

这也构成了 GSR 的直接动机:与其通过大量改写数据不断覆盖不同说法,不如先提供一个更加稳定的任务语义源,再重新学习这部分语义如何影响动作。

854d190fdbd35e56bad34cd3f8664893.png

分析4概述图

解法:GSR——重建语言到动作的信息流

基于前面的分析,论文提出 Grounded Semantic Re-Binding,简称 GSR。GSR 的基本过程可以分成三步。

首先,使用冻结的 T5 编码器单独处理语言指令。T5 不接收图像,也不接收机器人状态,只负责提取任务本身的文本语义,从源头上减少动态图像与措辞变化带来的表示干扰。

随后,根据不同 VLA 原本的多模态计算方式,将投影后的 T5 语义重新注入模型用于融合任务、视觉和状态信息的位置。注意,像上文分析所述,不同模型的融合位置不一样,因此注入的位置也不一样。

最后,重新初始化并训练 Action Expert,使其从训练开始就学习如何使用新的语言条件,而不是继续沿用已经适配旧语言路径的动作映射。

1a9e201f9fe164fdb5ee37fd10bbe262.png

GSR整体架构

T5 提供「需要完成什么任务」,目标物体的位置、当前机器人状态以及具体动作轨迹,仍然由模型原有的视觉和状态路径决定。

因此,GSR 处理的不是单纯的文本编码问题,而是语言语义如何重新进入真实场景计算,并最终控制连续动作的问题。

结果:轻量模型指令泛化能力暴涨,

经过大规模机器人数据预训练的更大模型也能继续获得增益

所有 GSR 模型均只使用 LIBERO-Goal 中的原始指令训练,没有额外使用改写指令。

完整 LIBERO-Para 包含 4,092 个 episode,其中包括 870 个动作表达改写、259 个物体描述改写,以及 2,963 个组合改写。

31c74ea3786b3f3c2616cd673688ed9f.png

VLA-Adapter 的 Full Para 成功率从 46.82% 提升至 70.94%,增加 24.12 个百分点;SmolVLA 从 4.47% 提升至 49.12%,增加 44.65 个百分点。

π0.5 原本已经通过大规模异构数据获得了较强的语言泛化能力,但 GSR 仍将其 Full Para 成功率从 73.60% 推进到 75.59%,并取得论文中报告的最高 PRIDE 分数 70.4。此项分数高于近期发布的大规模预训练模型 Xiaomi-Robotics,证明了其进一步提升当前 VLA 模型指令泛化能力的潜力。

更重要的是,简单地在原生路径的 Action Expert 旁边增加一个 T5 并不能得到同样的结果。VLA-Adapter 的 Native + T5 只从 46.82% 提升至 47.31%;SmolVLA 的对应版本也只有 13.49%。真正产生提升的并不是「模型里多了一个语言编码器」,而是原生语言路径、稳定语义源、视觉 grounding 和 Action Expert 之间的信息流被重新组织。

分析:路径冲突:接入两个语言源后,谁真正控制动作

论文还设计了一组 language-route authority 实验,分别向原生语言路径和 T5 路径输入正确或错误任务。

C/C 表示两条路径都接收正确指令;W/C 表示原生路径接收错误指令、T5 接收正确指令;C/W 则相反。

7e9944b2cb65be657d394713131849fb.png

VLA-Adapter 在 C/C 下的成功率为 47.31%。当原生 Qwen 路径接收到错误任务时,成功率降至 5.11%;而当 T5 接收错误任务时,成功率仍为 44.0%。

这说明,即使 Qwen 对改写指令的泛化较差,它仍然掌握着主要动作控制权。只在旁边加入一个更稳定的语言编码器,并不能阻止原生路径继续主导机器人。SmolVLA 在两种冲突条件下都会严重下降,说明两条语言路径之间存在明显干扰。

π0.5 则主要依赖原生 PaliGemma,且该路径本身已经较为可靠,因此适合保留原生指令,并将 T5 作为辅助。

这组结果解释了为什么 GSR 必须采用架构相关的设计:语言特征是否存在是一回事,哪条路径真正拥有动作控制权是另一回事。

探索:ParaVLA:探索新 VLA 架构的可能性

在 GSR 之外,论文还尝试了一个更加彻底的实验性架构 ParaVLA。

ParaVLA 使用冻结的 T5 处理指令,使用 DINOv2 处理视觉。语言与图像在前端保持相对独立,最终在 Action Expert 中与机器人状态和动作信息融合。

33eb77330589805d728786160835dfae.png

ParaVLA 与经典 VLA 架构的对比

在 LIBERO-Goal 的原始指令和改写指令上,ParaVLA 分别取得了 92% 和 91% 的成功率,二者只相差 1 个百分点。

作为对照,在相同结构中将 T5 替换为 SmolVLM decoder 后,原始指令成功率仍有 85%,但改写指令成功率下降至 41%(多模态基模不能提供稳定的语义)。这组实验进一步支持了论文的核心观察:一个相对稳定、独立于当前视觉输入的语言条件,有助于降低等价措辞对动作生成的干扰。

不过,完全解耦也带来了新的问题。当视觉模型进一步扩大时,ParaVLA 没有表现出传统 VLM 常见的 scaling 能力。因此,本文未来工作会继续研究如何同时保留稳定的任务语义、充分的场景 grounding,以及大规模多模态模型的扩展能力。

结语:从增加语言数据,到重新设计语言如何控制动作

GSR 的重点,不是证明数据扩增没有价值,也不是简单地用 T5 替换现有 VLM。

它关注的是一条更容易被忽略的链路:语言模型是否保留了任务信息,这些信息在哪里与视觉和状态交互,以及它们最终通过哪条路径控制动作。

对 VLA 而言,语言泛化失败可能并不总是意味着模型彻底没有理解指令。任务相关信息可能仍然存在,只是在多模态融合和动作生成过程中,等价表达之间的特征偏移被不断放大。

因此,真正可靠的 VLA 需要解决的不只是模型规模和训练数据量,还包括:语言语义从哪里进入模型;它在什么阶段与视觉和机器人状态结合:多条语言路径发生冲突时,哪条路径拥有控制权;以及 Action Expert 能否对语义等价、表面不同的语言表示保持稳定。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×