阅读时间大约10分钟以上(4491字)
作者:天南 出品:天南具身公园
大家好,我是天南,具身算法研究员。
这半年我一直在找下一个可以押注的方向。
从灵巧手、数据,再到本体和模型。四层产业链的口径交叉验证,稿子我和瓦力也写了很多。包括肌电手环,逻辑是它可能替换掉数据手套。
但这几个方向,我心里清楚是细分赛道。也许会诞生出好的公司,但不会涌现新的智能阶段。
我真正想知道的是另一个问题:WBC 之后是什么?
如果我们承认具身这两年的能力是逐级提升的,跳舞和后空翻是运控,是第一级;
然后是 manipulation,完成一些基础的桌面任务;再然后是 loco-manipulation,边走边干,也就是过去一年很多人都在冲的全身。
那再往上一级是什么?
我自己的判断是,最后一定会落到多台机器协作上。
因为单机的能力天花板是可预见的。沿着这个思路往下想,脑子里立刻跳出来两个画面。
一个是宇树在春晚舞台上的机器人,齐刷刷地表现武术、转手绢。
另一个是 Figure。他们展示过两台机器人从冰箱里拿东西,后来还展示过两台人形一起铺被子、叠衣服。

两台03整理被子。
但这两个画面都让我说不清楚。
宇树没什么太大说法,我一直认为是中心式的编排。而 Figure 的能力藏得太深,我个人是有偏见的。以他们的作风,大概率是过拟合的场景,两台人形其实没有交互也能做成。
之前他们家庭场景的 demo,遥控器每次都摆在同一个角度,丝毫不差。
所以我就想找找国内有没有在认真做这件事的,一位投资人朋友给我介绍了芝诺机器人。
确实没听过。翻了下背景,CMU 系。再翻到他们最近的 Zeno-1,协同这个概念上我觉得做得挺有意思。
这周四晚上快十点,我跟芝诺机器人联创 Andrew,还有研究员子豪,线上聊到十一点半。
今天的文章我想干三件事:先把协同讲清楚,再讲自己的一些思考,最后老老实实列一下我到现在还不知道的东西。
两台机器人各干各的,还不叫协同
交流的开始,我们就达成了一个共识。
子豪给了一个判断协同真假的依据:多台机器人在同一个空间里一起动,是同步。真正意义上的协同得在时间和物理性质上耦合到一起。
最简单的检验就是搬运,Zeno-1 给了很多例子,比如收拾家务、整理床铺、铲猫砂再配合扔到垃圾桶等等。
他的原话是,如果能一起搬一个大箱子,是典型的协同任务。如果只是排成队列,彼此之间毫无接触地运动,不属于 Zeno-1 想突破的协作智能的范畴。
如果用这把尺子定义协作的边界,之前的工作可能大部分都会筛掉。
剩下一些协作主要是 靠外部指派 来实现的。
他提到 Chelsea Finn 团队在今年6月 arxiv 了一篇工作 CHORUS,探讨的是在 VLA 或者世界模型系统里,把 agent ID 直接喂进去,模型能不能学到多机协作。结论是有效的。
而 Figure 的双机叠被子,子豪认为本质是同一套思路,只不过 ID 是隐式给进去的,靠的是自然语言指令去描述谁先做、谁等待。

斯坦福的多机协作 CHORUS。
所以分野在于谁指派任务,也就是有没有中央控制器。
Zeno-1 走的是另外一条路径,同一个模型独立跑在每台机器人上,没有中央控制器,彼此也不访问对方的内部状态。用 blog 里的说法,协调接口就是共享的物理世界本身。
子豪提到团队在 CoRL 2026 上发表的 SAI 工作,这是Zeno-1的铺垫性工作,区别于从同步采集的多机器人遥操作示范中学习。
SAI 更强调让已经部署的 learned agents 彼此交互,从 autonomous partner 实际产生的延迟、失误和动作变化中学习。
Zeno-1 则在SAI的基础上更进一步。
伙伴的动作、物体的响应、任务的进度,共同决定每台机器人的下一步。
这句话听着有点玄,但工程上做了不少东西:比如 30hz 的闭环视觉运动推理,跑在本地。如果推理要上云或者要走中心节点,去中心化就只是话术。
我当时看到下面这个demo的时候,有被吸引到。左边机器人抬手的高度比右边低了一些,所以再往床上抬被子的时候,右手后面又抬了一下。
这是我认为去中心化的证据之一,如果有中央控制器,两边的抬手高度还是很好统一的。

还有一点,中心化的方案想加第三台机器人,就得重新训一遍。
因为中心化推理模型的权重已经固定好了,机器人数量变了分工结构就变了,整体训练得重做。这对于机器人要规模化部署就非常不友好了。
除了去中心化,Zeno-1 还有三块能力值得先记住。
1)协作被推进到了接触层面。
握手、共享抓取、可变形物体、工具使用,这些是通过接触把两台机器人耦合起来的。
子豪给的例子比 blog 还要具体:左边的机器人抬高了,右边的要感知到物体姿态在变;右边慢了,左边得减速等;一台短暂停顿,另一台不能把任务判成失败;接触位置变了,双方得重新建立一个稳定的工作关系。
用他们的话讲,灵巧性成了交互的属性,而不只是单台机器人的属性。
2)长程连贯。
单个策略连续跑十分钟以上,走完八个子任务,中间不重置、不切策略。这条靠的是持久交互记忆,我们后面详细和大家聊。
3)预测性内省。
分两层,一层预判自己的动作会怎么影响伙伴接下来的行为,一层用世界模型预判共享状态会怎么演化。
这块是 blog 里差异化最大的一处,但坦率讲,目前技术披露的不是很多,访谈的时候没聊到。所以今天我只能点到为止,后面拿到论文再单独说。
一些比较核心的数字,先列出来。

四十小时加四个小时,就把协作练出来了。
协作能力是撞出来的
Zeno-1 的训练分四段,像 Andrew 说的,等于从零养一个小孩。
先让他理解世界,再学会行动,最后变成会协作的状态。
第一阶段是广泛的物理预训练,用第一人称和第三人称的大规模视频。
第二阶段是四十小时的遥操示例,带力反馈,但主要是单机的全身操作,把能力迁移到本体上。这两阶段都是业内常用思路,没有什么新东西。
第三阶段才是关键,叫闭环伙伴交互(Closed-loop Partner Interaction,CPI),四个小时数据。
在交流前,我一度以为 CPI 数采是人类在环的,因为我实在搞不明白没有人类参与,多机协作的训练数据怎么才能有效的搞到手。
Andrew 说这个理解太窄了。
他说重点压根不在那条两个人配合好的轨迹上。他们要的是部署的时候,让意外真的发生。
机器人动了,世界被改变成了一个所有数据里都没有过的状态,不管是观测还是接触,都没见过。这个状态才是真正高价值的数据。
blog 里对应的表述更学术一点:同步示范展示了成功的协作长什么样,但对于「行为一旦偏离原有序列该如何改变」,监督很有限。
然后是 Zeno-1 里一条比较硬核结论,在 Fig 1 中:在同等数据量下,提高闭环伙伴交互的占比,带来的协作性能,明显强于追加等量的同步多机示范数据。

CPI 交互占比与协作性能的关系曲线。
行业现在采的双机协同数据,绝大部分就是两台机器人按剧本同步走一遍。这条结论等于说,同步示范的数据可能不是最优解。
为什么会这样,我自己也有体感。
之前用 π0.5 做过一个很小的实验。采数据的时候让它抓红瓶子,采完之后我在红瓶子旁边放了个黄瓶子,把指令改成去抓黄的,它照样去抓红的。
这个现象不新鲜,其实就是 VLA 过拟合了,语言和动作的模态在相当程度上是被视觉占掉了。我们在访谈里也交流到了这个问题。
这也是为什么上面我会说有去中心化的证据。按照剧本采的同步示范,模型很可能学到的根本不是配合。两台机器人各自过拟合一条轨迹,因为剧本一致,看起来配合无间。
那怎么拆穿?Fig 2 给了办法:部署的时候故意扰动伙伴的时序。

时序扰动下的协作保持对比。
blog 给的结果是,在同步示范的策略已经崩掉的延迟下,Zeno-1 还能维持协调。
模型可以学会减速、等待、让位、维持接触、重新调整、恢复。他们有句话我觉得很有 insight:
恢复不该是失败之后才调用的那种独立能力,它本身就长在维持协调的过程里。
这也是我为啥觉得 figure 那个不太靠谱,太完美的同步协作了,所以很难让我相信能够泛化。
我觉得这条比那个 3B 和 30 赫兹都重要。因为它给了整个行业一个成本极低的验尺:任何一个协作 demo,把其中一台的动作延迟几秒,是真协同还是联合过拟合,当场见分晓。
第四段是定点纠错,只针对协作出问题的那些关键时刻。模型已经做得不错的行为,不再往上堆监督。
子豪还给了一组能力提升的口径:四十小时的单机数据,把场景覆盖率从零拉到 60% 上下;四个小时的协同,能力可以从 60% 提升到 90%。
大家参考下意思就可以。
至于这四个小时里人到底介入多少,他的说法是,项目初期确实要人来交互和纠错,这个阶段需要些耐心;飞轮一旦转起来,就快了,后面就是机器人自己去发现这些数据。
我也总结一下自己感受:协作能力来自偏差,不来自配合。
省成本的说法是四小时。但真正的说法是,这四小时必须是机器人自己撞出来的四小时。
那问题就来了,四个小时就能学会的壁垒是什么?
四个小时就能学会,那壁垒在哪?
我在交流过程中,直接问了子豪和 Andrew。
子豪的原话是:「我一直认为算法不是壁垒,数据、硬件和场景其实才是。」
他接着说,虽然四个小时的闭环交互数据就能得到一些协作能力,但这四个小时背后是一条很深的场景护城河,再加设备的护城河,再加算法的护城河,三者叠加才算壁垒。
单纯一个算法,或者单纯四个小时的数据,不构成一个成功的范式。
我也和大家一起探讨下这个问题。数据和场景是强绑定的,所以其实算两条护城河。
1)数据和场景,是当下比较明确的壁垒。
他们从第一天就打算做预训练,而当时几乎所有人都在做后训练。做预训练要解决两个问题,数据和算力。
数据这块,市场上买不到你客户的场景,他说十万小时量级的有效数据你是采购不来的。芝诺办法是跟头部产业方合作,由对方按照他们的要求去部署采集。
有的合作伙伴,可以按他们指定的方式做第一人称和第三人称的采集,每天都在迭代数据。
我也想建议有私有场景的大脑公司,多挖掘挖掘。比如协作、长程和稳定工作。
目前行业处于阶段性的冷静期,认真做事的公司可以多披露一些机器人落地的进展,我和瓦力也一直在关注。
2)算力也有自己判断力。
芝诺早期不自建集群,走租赁。
他们的做法是在海外搭,同时与国产算力龙头合作,逻辑是如果国产算力到了某个水平,那时候再去排队国产平台,头部算力厂的供给有限,你根本挤不进去。
所以他们选择早期就和国内做战略绑定。
不过换个角度,一般初创公司也不建议大家自建集群。
光千卡的集群投入都是上亿的成本,融资的钱怕是都撑不到集群搭起来。
记不住,就谈不上协作
好,扯远了。回到技术上。
Zeno-1 还有一点是长程的能力,而且是和协作相辅相成的能力。
两个理由。一是协作本质上是多机长程,单机的长程都做不了,多机更没戏。
二是 Zeno-1 把持久交互记忆明确列成了协作的支柱之一,机器人记的东西包括伙伴那一份:先前的接触状态、物体被怎么操纵、以及伙伴的协调状态等等。
子豪讲这块的时候给了个比喻。生活里前十秒拿了个东西放在某处,中间十秒看不见它,再过十秒你得想起来它到底放哪了。
主流的解法是开一个固定的历史窗口,把历史帧全都放进去。
这个方案能用,但不优雅。窗口就那么长,超出窗口的历史就丢了,十秒之后窗口刷新,对任务有效的信息全部忘光。
他认为这是对数据的浪费,所以做法是不设窗口。
所有历史,图像也好轨迹也好,全部增量式更新,压进一个隐空间。第一,这个空间的维度是有限的,不随时间膨胀;第二,隐变量占用小,同样大的空间能存下多得多的信息。
那存进去怎么取出来?他们把机器人自己的历史轨迹当成钥匙,拿这把钥匙去池子里检索,取出来的形式也是隐变量。
团队 TRACE 这篇工作的核心主张是即插即用,也已经高分中稿 CoRL 2026。
blog 里对应的表述是,持久交互记忆维护的是任务相关的视觉和机器人状态证据的紧凑表示,不保留不断增长的观测历史,只保留对未来决策有用的部分。
视频里面通过单个策略连续跑十分钟以上,走完八个子任务,中间不重置、不切策略,这些已然是最好的佐证。
再补充一下目前我还不知道的事情。
比如任务成功率,像 blog 里的挂裤子、装枕头这些 demo,真实的成功率能有多少目前还拿不到。
核心的论文TriPilot、TRACE、SAI都已经挂在了ArXiv。CPI、模型优化这些技术细节等之后详细版本的报告挂出来再找机会和大家交流。
还有一点,就是四小时的协作数据。我很好奇采集这四小时的数据花了多长时间,有效率以及能否迁移到新本体上。
或者说,我干活的机器人坏了,再安排一台新机器人进场要花多长时间达到现有的能力。
说这些不是唱衰,只是我对技术之外延展出来的一些思考。
也希望能和大家多交流交流。
尾声
访谈结束,不知不觉又到了凌晨。
真的很荣幸,能和认真做事的同行坦诚交流想法。这也是为什么我会有热情做天南 IP 的原因之一吧。
不像你去学控制、学CV,对于一个成熟的方向,你学一点可能就少一点。
但对具身来说,确实还有太多我还没有触达的领域。
每了解一些,就会发现不懂的地方是更多的。
我和瓦力一直也希望给大家输出有价值的文章,从信息、数据,到观点和判断。
Zeno-1 让我感觉他们团队很有自己的思考和理解,机器人协作还在早期探索阶段,背后毕竟还要依赖单机能力。
