阅读时间大约10分钟(3691字)
作者:瓦力 出品:天南具身公园
大家好,我是瓦力,具身算法研究员。
七月在WAIC,我第一次在展台上听到「具身全模态数据」这几个字,就感觉到多模态的风还是吹到数采。
八月到了WRC,天南沿着触觉一路问下去,前前后后跑了几十家,告诉我明显感觉到讲「全模态」的公司越来越多。
像光轮发布的 EgoSuite-Open100K 全模态数据,诺亦腾展台上就有写全模态,启智的全身外骨骼采集服,官方的名字就叫「人类全模态数据采集服」。
再往后数,还有帕西尼、章鱼、无界、京东,口径都在向全模态靠拢。
有意思的是,大家都知道要搞全模态,但各家提供的模态却并不一样。
所以我就想着做一期调研,看看各家所谓的全模态到底提供了哪些信息,以及有哪些模态是必须的,哪些模态可能还要打问号。
全模态这个词倒不新鲜,我之前训大模型的时候就有搞过。在大模型领域,全模态指的是输入的信息可以是多样的(文本/语音/图像/视频等等),输出也是多样的。
以cosmos3为例,输入是多模态,输出也是多模态。

但在具身领域还不是,更多的是讲输入模态的多样性,输出层面的多模态几乎还不太可能,当然 Action 的输出肯定有的。
这一轮调研下来的核心信息总结一下:
1)市面上所谓的全模态大概有六类:视觉、动作、力和触觉、生物电、语义还有本体状态,这其中触觉和生物电我认为值得推进,语义的模态要打个问号;
2)新增模态可能会和老模态起冲突,这个部分还需要进一步验证,尤其是数采手套;
3)全模态本身不是模态数量的竞赛,是「每个模态都能被模型真正消化」的竞赛。
4)长期来看,我仍然坚持数采要走轻便和无感的路线,终局的胜负手我认为是做减法。
下面进入正文。
拆开看全模态,里面到底有几样东西
我根据交流的一些公司,总结了当前输入模态的种类:
1)视觉(第一视角、腕部、第三人称、深度);
2)动作(手部姿态、全身位姿、物体位姿与轨迹);
3)力与接触(触觉、滑移、末端力矩);
4)生物电(肌电、神经腕带);
5)语义(语音描述、任务标签);
6)本体状态(关节状态,以及所有模态的时间戳)。
现场调研后,各家的模态口径可以总结成下面这张表:

横着看一行是一家公司,竖着看一列才是行业现状。
看完的感受是,每一家的「全」,目前还局限在自家硬件能采到的边界。光轮不采触觉,所以全模态里就没有触觉;章鱼不采全身,章鱼的全模态里就没有全身。
那到底哪些模态是必须的。我在现场问过好几家,答案基本都是「我们采的都很重要」。所以我换了个方式:看市场愿意为哪个模态付钱。
一位一线数据服务的从业者给了我们一份报价,非常符合各家实际的使用情况:头戴Ego第一视角约150元/小时;加上外骨骼或动捕、同步记录全身关节和轨迹的高密度穿戴式数据约400元;仿真数据价格比较便宜 70 - 80元;高质量真机数据价格在千元左右;而复杂的灵巧手精密操作任务则在中千的价格。
这里面离不开的有视觉和动作,是最基础的模态。
而从150到400,中间隔的就是「全身状态」的模态,价格翻了 2.7 倍。
使用这两种数据带来的训练效果,差不多和价格可以对应上。加上高密度穿戴式数据的有效训练效果,大概是纯Ego的2到3倍。
但还有另外一半。
决定一份全模态数据能不能用的,不单是你有几个传感器,是同步。行业验收标准已经很明确:完整率不低于99%,损坏率低于0.5%,多模态信号的时间同步误差控制在10ms以内。
10ms的要求还是挺严格的,所以「全模态」的重音不在「全」,还有一部分是对齐。
这一点在展台上是看不见的,展台上只能看见传感器的数量。
哪些模态可以上了,哪些还得再看看
1)确定的模态:视觉、全身位姿
尤其是涉及到之后的全身灵巧操作,高密度的穿戴式设备是近期正在走量的数采设备,这一点数据专家也有和我们强调,他说现阶段最紧缺的还是这类Whole-body数据。
我们之前在 Curr-0 和大家聊到的 HumanEx 套件,和在 WAIC/WRC 上看到了启智 HALO采集服都是在做类似的事情,而调研下来的信息来看,这次启智展示的模态信息应该也是比较全的。

左图是元流之前发布的全身外骨骼,右图是启智发布的HALO采集服
刚好在展台上,我们也采访到了启智的董志鹏博士。我们问:你们没有自己的灵巧手,那数据到下游做重定向(retargeting)的时候会不会有问题?
他说他们不用retargeting这个词,用的是引导(guide)。
「引导和retargeting最大的区别在于,retargeting是要严格意义上去follow,而引导更多的是告诉他,你现在该这么做。」
以及董博提供的视角:全身运动给模型的是趋势性信息,它不一定非要跟视觉坐标系有很精确的对齐。
他的理由是,视觉模型学的是「什么叫做成了」,不是像VR那样需要绝对对齐的严格视觉。所以在他们的体系里,全身运动更偏长程的任务规划层,而不是动作层。
目前这部分还在验证中,没有明确的结论。
我想聊这个观点的原因在于。其他家都在跟我强调「我能采什么」,提供的数据模型一定是需要的,并且做不好模型的效果就会变差。
并且说下游的客户需要这些,大多数做数采设备的公司,其实自己没有做数据验证和模型训练。
启智的董博提供了一个新的视角,对不对我还不敢下定论,所以也期待他们后续有一些开源数据和模型发布。
2)大家都抱有很高期望的模态。触觉。
触觉和大家讨论很多次了,但在WRC上,我们明显感觉到触觉被打包到了全模态里面,并且灵巧手上的渗透率估计已经到了70-80%,后续应该会成为标配。
只是目前还没有哪家的模型能让我认可,触觉在精细装配、柔性物体、遮挡抓取上,它的价值物理上就成立。
你在黑暗里摸书包找钥匙靠的完全是触觉,但在通用任务上它能带来多少提升,目前还没有一个我非常认同的结论。
后面也值得我和天南继续关注。
3)方向没问题,但还得再看看:生物电。
这部分大家可以看看我们前几天的文章,如果肌电手环能走通,那数采的很多逻辑或许要重新改。
群里讨论也很多,包括其他平台也有聊到这个话题,肌电和肌力传感之争。在这里我就不展开了,主要说下我的看法:
目前还没有办法完全确定肌电提供的力信号一定可用,至少从章鱼展台上呈现的效果来看,作为算法我是有计划推进的。
章鱼展台上展示的也不是一个非常成熟的肌电大模型。
你说硬件壁垒能有多大,最多一个月你就能搞到一样的肌电手环,但后面的数据采集、训练模型、再下发给不同采集人员验证泛化,这个过程我估计2-3月就能看到一个初步的效果。

肌电手环解算出来的手部位姿
我在这里想强调的是,肌电或者肌力提供的模态是一个值得探索的方向,是一个非常清晰的无感采集可能的形式。
至于结论,还需要大家一起来验证。
启智那天其实也带了肌电手环,但 WRC 上没时间细看了。这个动作本身挺说明问题的,大家都知道这是方向,也都在做可行性验证,但还没到敢当主力模态宣传的时候。
4)最后有个模态可能需要祛魅:语音。
有好几家都把「语音」列成一个模态。
但采集员一边干活一边说「我现在把杯子放到左边架子上」,这不是感知信号,是标注的替代品,省的是后面人工打标签的钱。
就我个人而言,语音的模态我现在是存疑的,如果说思维链我做不了,那这个模态可能有价值。
或者说,语音要提供什么样的信息才能证明价值?在当下,难度还是挺大的。
这些模态凑在一起,可能会打架
前面聊的都是加法。这个部分聊点没人在展台上说的:这些模态互相之间是有冲突的,你把一个采准了,往往会把另一个弄脏。
最典型的是手套。
诺亦腾采手部用的是光学加惯性的混合方案。他们展台的负责人跟我说了一个不错的工程判断,我听完觉得有些道理:
为什么手上要同时上 IMU 和光学 marker,身体上却不用?
因为身体表面积够大,贴足够多的反光点摄像头一看就能分开。但手太小,手指挨得近还互相遮挡,纯光学要区分两个marker,至少得用三四个反光点拼出一个独特形状,手上没那么大地方摆。
所以手套上加IMU的真正作用,不单单是测量姿态,还要给每一个光学刚体加一个ID。
「所以之所以能把手上那个tracker做得那么小,是因为它本身有光学和惯性,惯性更多的还是作为它的ID识别服务。」
IMU 在这里被当成身份证,这个思路我之前是真没想到。

展会忘拍了,扒了下官网的图
好,问题来了。
为了把手采准,你得给人戴上一副黑色的、布满反光marker的手套。然后把这条数据交给模型的时候,视频里那只手,已经不是人的手了,和本体的灵巧手也有差距。
诺亦腾自己承认了这个坑:
「这个方案其实有一个弊端,就是你有视觉的gap。你在戴上手套去做采集的时候,会发现好像我的手在视频里面,那不是人的手了。」
这事天南在启智那边也得到了类似的结论。数采手套在我看来,大概率是数据的中间形态。
因为手套是黑的,跟平台的移动数据对不齐,误差没有想象中那么好收敛。
一个模态采得越准,对另一个模态而言未必是好事。这是全模态潜在的弊端。
更有意思的是,两家给出了方向完全相反的解法。
诺亦腾是把假的补回真的。反正手的骨骼动画(BVH)有,那就把视频交给AI,让AI把手套抹掉还原成人手,用骨骼动画作条件约束生成。
我的第一反应是不太乐观,和天南交流之后也是这个看法。
假如两根手指穿进一个桶的提手里,模型很可能把它俩画成分开的,它压根没见过这种case。为了修一个模态引入生成模型,等于引入一整套新的不确定性。
启智则认为这一层根本不需要对齐。也就是董博上面的判断。既然全身运动给的是趋势性信息,那为什么非要让它跟视觉坐标系严丝合缝。
这个部分我会更认同启智的做法一些,因为其实就可以大力出奇迹,主要数据够多,是可以得到一些更趋势的对齐方式。
当然,大家有不同想法也可以在评论区一起聊聊:
使用不同模态会不会有问题,以及增加新的模态带来的哪些收益。
写在最后
以上差不多就是目前我对全模态数据的理解。
据我了解,目前头部公司的数据大多已经积累到了数十万小时,三十万小时应该不算夸张。不过里面还包含开源数据、互联网和仿真数据,真正跟物理交互高度相关的可能只有20万。
在我看来,明年肯定有很多公司可以冲到一百万小时,但一千万小时我真的建议再等等。
至少要等到这些模态验证之后,不然到时候缺失的模态没有办法再补了。
我的看法是,全模态本身不是模态数量的竞赛,是「每个模态都能被模型真正消化」的竞赛。
采了但对不齐的模态等于没采;采了但没人知道怎么用的模态等于负债,占带宽、占成本,还拖慢产能。
我和天南昨天深夜交流,仍然会坚持数采要走轻便和无感的路线。
至少这两个月,没有哪家公司在跟我说还在搞大批量遥操数据了。
换个角度看,现在所有人都在往身上加东西。
而我认可的胜负手,可能是谁先能把东西摘下来。
