阅读时间大约8分钟(3122字)
作者:Yuanxq 出品:具身智能研究室
让机器人打开抽屉、拿出一袋核桃、倒进空气炸锅,再把抽屉推回去。视频里看起来像一件连贯的小事,模型内部却常常是两套系统在接力:视觉语言模型负责认东西、读指令、整理上下文;后面再接一个动作专家,专门把这些信息变成连续控制量。
这类分工已经是近两年 VLA 的常见写法。它解决过一个很现实的问题:动作频率高起来以后,逐个 Token 生成关节命令太慢。可看多了以后,我总觉得还有一件事没有被认真讲清楚——大模型里那些语言、空间关系和任务顺序,到底离机器人的手有多远?
星海图的 G0.5 想把这段距离缩短。它先把动作压成 Token,再让同一个自回归 Decoder 接着写动作。读完论文,我注意到的并不是某一个成功率,而是一个被放下过的问题:机器人动作一定要交给另一套专家模型吗?
论文题目:G0.5: One Autoregressive Stream for Robot Reasoning and Action
作者:Galaxea Team
论文链接:https://arxiv.org/abs/2608.11739
项目主页:https://opengalaxea.github.io/G05/
代码仓库:https://github.com/OpenGalaxea/GalaxeaVLA
模型权重:https://huggingface.co/OpenGalaxea/G05
先别急着把 VLA 当成一个模型
最早那批 VLA,比如 RT-2、OpenVLA,会把连续控制离散成动作 Token,再让视觉语言模型像续写文字那样续写动作。指令、图像和机器人状态进来,模型一个 Token 一个 Token 地往后写,最后得到关节或末端的控制序列。
这种写法把理解和动作留在了同一个模型里。“把红色积木放到左边”这句话中的颜色、方位和操作关系,可以直接影响后面的动作 Token。
机器人真动起来,动作却远比文字密。双臂、夹爪、躯干、底盘一起参与,控制频率再往上提,后面跟着的就是很长一串相近数值。自回归模型逐个生成,推理延迟很快会变得难看。
所以,近来的很多路线把 VLM 放到前面当条件编码器,再接一个 flow-matching 动作头。π0、π0.5、GR00T-N1 系列都属于这一大方向:VLM 提供上下文,动作头把它变成一段连续动作。动作块可以成段生成,部署更容易做快。
这也让语言理解和电机命令之间隔了一层。VLM 看懂了“把抽屉拉到下把手”,后面的动作专家如何使用这层理解,仍由另一套参数、另一种目标函数决定。
G0.5 从动作表示入手。动作 Token 太长,就先把序列压短,再让 VLM 自己生成。

G0.5 把视觉、语言、本体状态、推理与动作放进同一条自回归序列
动作被压短以后,VLM 接着往下写
G0.5 从 Qwen3.5-2B 初始化。多视角 RGB、自然语言指令、本体标识、连续状态和一小段视觉历史进入模型后,它可以先输出一段 CoT,也可以不写推理,直接往后生成动作 Token。
论文里的 CoT 有四种形式:子任务描述 Subtask、物体框 BBox、二维末端轨迹 Trace,以及动作提示 ActionHint。训练时会从八种组合里抽一种,里面包括完全不输出 CoT 的情况。CoT 在这里是可选中间量,不是每个动作前都固定打印一段解释。
推理结束后,后面接的是动作 Token。整段序列由一个 Decoder 以 next-token prediction 的方式训练;预训练阶段没有再单独加动作回归损失,也没有让一个现成动作专家来蒸馏答案。动作不再只藏在 VLM 的隐状态里,最后交给别的网络完成,它成了语言模型直接要预测的内容。
“one autoregressive stream”也容易被说过头。G0.5 没有把所有模块融成一个黑盒。视觉编码器还在,离散动作码还要经过单独训练、随后冻结的 ActionCodec,才能还原为连续控制。论文也保留了一个参考 π0.5 写法的可选 flow-matching head,用同一 checkpoint 做对比和部署。
让 AR 重新有机会进入真机的关键,是 ActionCodec。
它先把不同机器人的动作放进一套 27 维槽位:左侧控制 9 维、左夹爪 1 维、右侧控制 9 维、右夹爪 1 维、下半身 7 维。预训练数据涉及 14 种真实和仿真本体。动作按左右控制、夹爪、下半身这些部件分组,再经残差向量量化压成离散码。

G0.5 先按身体部位拆开异构机器人动作,再由 ActionCodec 压缩和重建
假设这一刻只有右臂和右手爪要动,模型不必为下半身、左臂和左手爪生成一长串静止命令。在每一轮量化里,它先写一个部位标记,再写 8 个动作码;没参与动作的部位不发 Token,控制端让它维持不动。序列长度于是更多取决于“此刻有几个部位在动”,不再完全跟总自由度绑定。
论文图 1 给出的延迟是:flow matching 190 ms,开启 FlashRT 的 AR 加 CoT 为 192 ms,AR 不加 CoT 为 130 ms。至少从这组配置看,动作压缩以后,自回归没有慢到失去部署价值。
这几项数字还替代不了整条控制链路的时延。论文没有拆开测试硬件、视觉预处理、动作解码和低层控制各花了多久。新本体也仍要做动作归一化、通道处理、本体映射和后训练。ActionCodec 收拢了动作描述方式,机器人的物理差异还在。
成绩单很多,先看谁和谁在同一张桌子上比
G0.5 一口气做了 DROID、LIBERO、RoboTwin 2.0、SimplerEnv-Bridge、BEHAVIOR、PP Bench,还放了 R1 Lite 与 R1 Pro 的真机实验。每套基准的设置都不一样,单拎一个最高分很容易把信息读歪。
我会先看 R1 Lite、R1 Pro 的真机微调。三种模型用了相同训练数据、观测与动作空间、推理设置和低层控制;训练也都跑在 16 张 H20 上,用同样的 wall-clock 时间。六个“任务—本体”设置各做 15 次,G0.5 平均成功率 76.7%,π0.5 为 53.3%,GR00T-N1.7 为 24.4%。G0.5 赢了其中 5 组;搬箱堆叠是例外,π0.5 做到 93.3%,G0.5 是 80.0%。

论文在 R1 Lite 与 R1 Pro 的六组任务设置上测试:两种本体均做折毛巾和折纸箱,另分别测试笔袋整理与搬箱堆叠
这组对比的数据、训练时长和部署设置相对齐,自回归动作在两种星海图平台上确实跑出了竞争力。不过每组只有 15 次真机试验,一次成败就是约 6.7 个百分点,论文也没有给置信区间。
DROID 的结果是 82.5%,π0.5-DROID 为 57.5%,MolmoAct2-DROID 为 52.0%。这里的 zero-shot 有明确前提:三种模型都已经用 DROID 数据做过后训练,留出的是测试环境和实物实例;它不是一个从未接触过 DROID 的基础模型直接走到 Franka 旁边完成任务。
LIBERO 上的 98.9% 也要放在自己的背景里看。次优公开结果已经到 98.7%,这个基准非常接近顶;0.2 个百分点撑不起太大的叙事。RoboTwin 2.0 平均 93.3%,仍有任务明显偏弱。SimplerEnv-Bridge 为 87.3%,表里的部分基线来自其他论文,没有全部由本文在相同环境里重跑。
BEHAVIOR 更容易被误读。G0.5 的 0.3136 是 Task Success Score,按目标谓词完成比例计算,并不等于“31.36% 的复杂任务完整完成”。论文里不少任务仍然是 0。它在开阔空间的抓取、放置上表现更好,到了容器、抽屉、家电这类带状态变化的对象,波动就明显了。比如微波炉爆米花,π0.5 得分 0.95,G0.5 是 0.55。
我反而喜欢论文把这些反例留下来。它至少能让读者看到,架构变化并没有替模型补齐感知和数据分布里的缺口。
CoT 已经碰到动作,还没替机器人规划完整任务
同一个预训练 checkpoint,G0.5 可以切换 AR 或 FM,也能在运行时选择开不开 CoT。单步 PP Bench 里,CoT 带来的变化很小:AR 的语言遵循率从 65.6% 到 67.2%。
Air Fryer 和 Cook Bacon 两项五阶段任务的变化更明显。论文中,AR 加 CoT 后,前者的平均阶段进度从 2.4 到 3.8,后者从 1.5 到 3.4;FM 分别从 2.1 到 2.7、从 1.2 到 2.0。AR+CoT 的语言跟随率也更高。

在两项多阶段任务中,自回归动作加 CoT 的阶段进度和语言跟随率最高
作者的解释是,AR 动作 Token 可以直接看到同一序列前面的 CoT;FM 头接到的是隐藏状态摘要。这个解释听起来合理,论文没有对内部机制做直接验证。
这组实验每个设置只做 5 次,运行时还会给模型当前阶段的自然语言指令。它展示的是 CoT 开始参与动作生成,不是机器人只拿到一句总任务,就能自己拆出五步、检查状态、修正失败并一路做完。图中的若干进度均值也不是 5 次整数阶段分数简单平均应有的 0.2 步长,论文没有进一步说明聚合方式,适合把它当作探索性结果来看。
AR 在后训练上有一个很实际的便利。动作 Token 和文字 Token 一样,有明确的 log probability,可以直接接 GRPO 这类比率型强化学习。论文在 4 个初始水平接近的 LIBERO 任务上,用每项 1 条示范启动训练,AR 最后约 97.4%,FM 约 92.9%,收敛曲线也更快。图注写的是跨种子的均值和标准差,正文没有交代种子数和每个训练点的评测次数,暂时还只是一个小规模信号。
它指向的方向倒很具体:真机失败以后,奖励、修正和失败轨迹,有机会更直接地回到生成下一枚动作 Token 的那套参数里。
接下来更该看什么
G0.5 把一条一度显得不太适合高频控制的路线,重新拉回了可用范围。动作压缩得足够好,自回归 VLM 也能在真机、仿真和后训练里做出有竞争力的结果。
短板也摆在论文里。DROID 的毛巾放入半透明抽屉任务中,早期无标记测试只有 60%;主实验在抽屉上贴了高对比橙色标记后到了 100%。前后条件已经改变,这组数字更适合用来观察模型对视觉线索的依赖。
视觉历史只保留数秒。动作空间里预留了 lower_body 槽位,目前真机主要是轮式底盘和躯干,没有双足下肢专项评测。14 种本体的覆盖面不小,论文没有完整公开总数据规模与各来源比例;新机器人接入 ActionCodec,也还需要本体映射、数据和控制适配。
代码已经公开,多组权重也通过 gated 仓库发布。项目使用非商业社区许可证,商业使用需要另行授权。
我接下来会看三个很具体的问题:新本体要多少数据才能接进去;AR 在真实失败轨迹上的强化学习能否复现论文中的优势;任务变长以后,几秒的视觉历史够不够用。
这三件事都需要外部团队把代码跑起来。等到这些结果出来,我们才能知道 G0.5 缩短的究竟只是模型图里的连线,还是从理解任务到修正动作的真实路径。
