让小脑替大脑把关:当世界模型进入 whole-body control
统计 阅读时间大约9分钟(3205字)

2026-09-08 让小脑替大脑把关:当世界模型进入 whole-body control

来源:豆包
作者:JaneZhang  出品:具身纪元SONIC之后,人形机器人的“底层大脑”还需要解决什么?上次和鹏翔交流时,我们特别聊到了这个问题对...

作者:Jane Zhang    出品:具身纪元

SONIC 之后,人形机器人的“底层大脑”还需要解决什么?

上次和鹏翔交流时,我们特别聊到了这个问题对话best paper得主,在全身智能时代定义移动操作新范式。

今天,人形机器人已经能跳舞、跑跳,完成不少高难度动作。但走进真实生活,它们还需要迈上台阶、坐到椅子上、搬起重物,并在这些过程中保持平衡。

这些任务的难点在于:机器人不仅要控制自己的身体,还要学会借助周围的环境。

极佳视界联合清华大学最近发布的 GigaBrain-WBC-0.5 核心亮点放在前面:

让控制身体的“小脑”也学会预测。

除了决定下一步怎么动,还要预测身体会怎样变化,以及接下来哪些行为比较合理。

从动作里找回缺失的环境。

根据脚在哪里落下、身体在哪里获得支撑,反推出台阶、座面等几何结构,让已有动作数据能用于地形交互训练。

让小脑能够适度调整上层指令。

遇到超出经验范围的动作要求,尽量保留操作意图,完成一个更稳妥的版本。

d20f0946ba9ab31b1da0ae0a3e39b2bc.png

先来看看 demo。

机器人搬运长箱上台阶,台阶撤掉了还能继续拿稳;有椅子时机器人坐在椅子上,椅子撤走后,机器人会将同一条“坐下”指令自主修正为“下蹲”,不摔跤;同一策略还能完成深蹲跳、高踢、低位太极姿态等高难度动作。

a1b4be92358aabe1817c9aeb153805b9.jpg

有台阶时正常踩上;台阶撤走后,机器人仍能拿稳手里的箱子

ce54425310ef25d2ff585388ee13a73e.jpg

有椅子时把体重交给椅面;椅子撤走后,机器人将同一条“坐下”指令自主修正为“下蹲”,避免坐空

d60efb5fe54bc5e8ca5215fd1a869a2f.jpg

同一模型完成太极等高难度动态平衡动作

我们接下来看看极佳具体是怎么做的。

通用的不能跨地形,跨地形的不通用

上一代 tracker 已经能用一个策略覆盖大量动作类型,也能接入 VR 遥操作和 VLA 等多种指令来源。SONIC 证明了人形控制的 scaling law,HoloMotion-1 把数据来源从动捕扩展到野外视频,Humanoid-GPT 把模型从浅层 MLP 换成因果 Transformer,并将训练语料扩展到 20 亿帧。

但现有的跨地形策略基本只能接收前后左右这类遥控指令,做不了操作任务。而 SONIC 这种能听懂全身指令的又仅限于平地。

而人形机器人终将是要跨越各种地形,并完成复杂操作的,这正是 GigaBrain-WBC-0.5 想往前推进的方向。极佳展示了一组与 SONIC 进行真机对比的 demo。同一个操作员同时操控两台机器人,GigaBrain-WBC-0.5 能坐到箱体上承重、踏上平台稳定站立、抬起并稳持箱子,SONIC 则分别表现为停在半蹲状态、无法登上平台、无法稳定抓握。

2eb9deb12c4412662256fd18341ad985.jpg

同一条“坐下”指令:SONIC(左)坐空,GigaBrain-WBC-0.5(右)坐实

c379e3b4ad638f6e737504cfe15ef8d5.jpg

SONIC(左)无法利用台阶,GigaBrain-WBC-0.5(右)稳定登上

ce1e05365f8267d5e0a5e1cd0942b583.jpg

抱箱:SONIC(左)难以正确发力,GigaBrain-WBC-0.5(右)稳定完成

9559c9f4db4be003a11ad14274d672af.jpg

持灭火器:GigaBrain-WBC-0.5 在负载变化下保持平衡

SONIC 在这些场景中失败,根本原因是它还是一个平地策略。它训练的数据集是没有地形交互的,所以台阶箱体就是 OOD 了。加上操作,就更加难以控制。

GigaBrain-WBC-0.5 让模型学习了与环境的交互,并及时做出调整。我们跟论文一作程子扬聊了聊,子扬认为,人形机器人的 whole-body control 如果要落地,需要满足三个条件:具备通用性、能够进行环境交互、能通过遥操作采集数据。

他们在论文里做了一张能力对比表。以 SONIC 为代表的大规模 tracker覆盖了多样全身追踪、全身遥操作,但在地形交互和稳健性上是缺失的。PHP、GALLANT 等策略能跨地形,但这类策略往往针对单一技能族训练,不支持手臂、躯干和双手的操作任务。

0201b9b78bec9b7cd6e33a596f6142ce.png

子扬认为,对于人形机器人来说,实现通用且跨地形的策略是刚需,人形的硬件成本和平衡复杂度都高于轮式底盘,唯一的优越性在于它能进入轮式到不了的地方。

因此,GigaBrain-WBC-0.5 试图补上表格里剩下的空白:做一个同时支持全身追踪、遥操作、地形与物体交互,并且在面对分布外指令或发生跌倒时仍然可控的统一策略。

b6f15124e3b3e85c5812acd383af87af.png

论文在仿真中做了四个场景的系统评测。可以看到,在地形交互、OOD、跌倒恢复这些复杂场景中,GigaBrain-WBC-0.5 的表现显著优于 SONIC 等方案。在标准的平地追踪测试上,GigaBrain-WBC-0.5 的表现也略优于其他 tracker,说明模型学习跨地形能力后并没有牺牲平地的基础表现。

389e4de2d5a727c9032295a49d5c4ff0.png

从平地走向复杂地形的两个难点

SONIC 的成功,让大家知道数据和算力的力量。要解决人形机器人更多的难题,同样也要解决数据问题,但让 whole-body control 从平地走向复杂地形,还存在两个难点。

第一个是动作数据缺少配套地形。

SONIC 的成功依赖 tracking 数据的规模化,但跨地形数据的采集门槛远高于平地。

现有大规模动捕数据集里其实不缺走楼梯、坐椅子、踏上平台等动作数据,问题在于采集时只录了人的运动,没录场景几何,机器人拿到的是“凭空走上楼梯”的轨迹,直接进仿真训不出来。

当前的做法都存在一定局限性,MeshMimic从单目视频出发同时重建人体轨迹和场景,会受视频质量制约;OmniRetarget 基于预置场景资产做约束优化增广,规模依赖预先拥有的场景资产。两者都很难扩展到现有动捕数据集的量级。

第二个是如何让模型能真正理解自己所处的环境,并在环境改变时做出判断。

平地环境相对固定,但在跨地形场景下,机器人必须根据环境变化实时调整动作。

同一条“坐下”指令,椅子的高度、位置和朝向变了,可行轨迹就完全不同。同一段搬箱子的动作,空箱和重箱需要的发力也不同。

因此,仅仅记住更多动作还不够。控制器需要根据身体实际受到的影响,调整执行方式。

这也是这篇论文引入世界模型的关键动机:从 learning behaviors,进一步走向 learning how behaviors evolve in the world。

给小脑装一个世界模型

普通 tracker 的核心任务,是根据身体状态和参考动作,决定下一步怎么控制关节。GigaBrain-WBC-0.5 利用世界模型同时回答三个问题:

现在怎么动?动了以后身体会怎样?根据当前经历,接下来哪些行为比较符合经验?

25dcb4dae17d76b25e4ced9437c4ccc4.png

World Action Model 此前主要用于视频下一帧预测,接到人形全身控制上,GigaBrain-WBC-0.5 还是首个尝试。

为什么预测会有帮助?比如,机器人手里多了一件重物,身体的加速度、姿态和关节运动都会受到影响。如果模型要准确预测下一时刻的身体状态,就需要学到这些变化与负载、接触之间的关系。

一旦模型内化了这种因果结构,它就不再依赖训练数据对每种地形—动作组合的逐一覆盖,而是能够从有限的交互经验中泛化到未见过的情境。

预测“接下来哪些行为比较符合经验”,是为了过滤掉那些不合理的上层指令。

上层策略或操作员给出的动作,并不总能执行。子扬用坐下举了一个例子:

“上层策略可能不知道当前环境的约束,比如大脑不知道要坐下来的时候后面有没有椅子,就想坐下试试看,如果实际上没有椅子,它就只能退化成下蹲,否则就坐空了。”

论文为此设计了一个在线指令过滤器。

模型根据此前的身体状态和动作历史,预测接下来比较符合训练经验的行为范围。新指令到来后,过滤器检查它是否偏离这个范围太远。

如果偏离太远,过滤器就适度修改这条指令,再交给控制器执行。这正是论文所说的 best effort:在能力范围内,尽量完成你的意图。

从两千小时动捕里挖出 72 小时地形

再说数据来源的问题。

动作数据规模很大,配套的地形数据却很少。GigaBrain-WBC-0.5 的做法是基于动作数据反推地形数据。

7eac9833f4ed3e137c3ad1e7d64eb56c.png

这里的核心观察是,在高质量动捕数据中,脚踏上表面的瞬间会有速度骤减、加速度突变的信号。

系统检查身体表面一些点的速度和减速情况,区分真实支撑接触和短暂停顿,找出可能发生稳定接触的位置;再把这些接触点清洗、聚类,拟合成台阶踏面、椅面、平台等简单几何结构。

最终他们从 Bones-Seed(288小时)、MotionMillion(900 小时)、MotionDecode(1000 小时)三个大规模动捕语料里识别出约 72 小时的地形交互数据。

SceneBot 是和 GigaBrain-WBC-0.5 思路近似的优秀作品。它同样从动作中反推场景,但仅限于 2.5D 的高度图,数据规模也只有 7.5 小时。GigaBrain-WBC-0.5 则进一步强调三维支撑几何,能够表示桌子下方的空间等复杂结构,数据规模也增加了一个数量级。

要在每一次接触与发力中,真正读懂身处的环境

过去,SONIC 证明了动作数据的 scale up 能在平地上带来通用性。但在走出平地并进入复杂的真实环境之后,仅靠扩大动作覆盖已经不够,真实任务中的数据也不只是身体轨迹,还包含地形、物体、接触,以及动作产生的后果。我们需要让小脑从数据中真正理解自己所处的环境,并在环境改变时做出判断。

这也是我们觉得世界模型加入 WBC 的巧妙之处。

全身控制的核心命题正在从“学更多动作”变成“学动作与环境的关系”,让机器人在每一次接触与发力中,真正读懂身处的环境。

无论是在平地上跳舞还是跨越障碍,具身智能终究要以“对物理世界产生有效作用”为最终度量。

把 GigaBrain-WBC-0.5 放回极佳视界的整体技术架构中,它的意义不只是一项更强的 whole-body control。

极佳正在形成一套更清晰的“大小脑”分工:GigaBrain-0.7 对应“具身大脑”负责理解任务、预演变化并规划行动,GigaBrain-WBC-0.5 对应“具身小脑”负责把意图落实为连续的全身动作,同时处理平衡、接触、负载和能力边界。前者决定“要做什么”,后者持续判断“现在能不能这样做、怎样做更稳”。Maker L01承载机器人本体,PingPong 等系统级验证则把模型、控制与硬件放回真实交互中检验。

这条路径要走到物理AGI,当然还有很长的路要走,但 WBC 意味着极佳的世界模型研究已经进入机器人最底层、最实时的控制环节:从“看见和预测世界”,进一步走向“约束身体并真正作用于世界”。

当小脑不再只是盲目追赶关节轨迹,而是懂得用身体去感知接触、借力与承载,人形双足形态所承担的高昂硬件成本与控制复杂度,才真正换来了无法被轮式底盘替代的核心价值——去往任何地形,完成任何交互。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×