阅读时间大约10分钟以上(4269字)
作者:瓦力 出品:天南具身公园
今天看到一个消息,才发现具身行业真的挺草台班子的。
拿着融资的钱去山东河南农村找农村大姨去采集Ego数据,好像还不给钱。

来自小某书「黄大荣叨叨叨」
呵呵呵呵,看完这个消息,我才想明白「具身数据的毛利都超过 50%了,看起来相当滋润」是怎么来的了。
除了上面提到的这种乱象,而据我们调研下来,卖数据的大概是当下行业里唯一能回血的产业。
我想说,如果因为信了这些信息而就想去干具身数据,那大概率要是末班车了。
因为从自驾来看,一般成熟的数据生意可能也就5-10个点,现在的数据赛道其实已经是红海一片了。
这就有几个问题。
这些数据企业真的对如何做数据有非常深刻的理解么?
未必,或许大家都是草台班子摸索着干,不然也不会出现白嫖农村大姨的劳动力这种情况了。
我们也希望能够帮助行业减少这种草台班子的情况,最近做了不少调研,刚好也看到了国外一家数采公司 UNIDATA 分享的 blog。我和天南评估下来这套系统还是蛮靠谱的。
所以有了今天的文章,系统地和大家过一下具身数据的全流程,从采集、标注再到训练等,也加上我的一些理解。
也希望各位具身数据的从业者,真的可以从里面学到一些「真」东西,真正踏踏实实的做些事情。
一、训练数据分几种,为什么要那么多传感器
先聊一个很基础的的问题:机器人训练到底要什么数据,粗略地可以分为三大类。
1)原始感知数据。
相机画面、激光雷达点云、麦克风的声音,是硬件输出的未加工信号,用来训练感知模型:目标检测、语义分割、深度估计。
其实现在图像方面的基础模型有很多了,像SAM分割/DINO检测还有各种VLM模型等。而这些标注在十年前,其实非常耗人力标注。现在的话,如果你不要求99%的准确性,基本上一些开源的模型就可以做得七七八八。
这也是大模型思路带来的改变。。
以及点云的话基础模型不太多,现在倒也不是强需求。如果要用到点云数据,不追求准确的标注,可以做一些聚类方面的工作配合图像标注使用。如果做点云上的的一些标注,标注投入还是比较大的。
2)低层级的周期信号。
关节角度、电机力矩、力传感器读数、触觉数据,采样频率从每秒 30 次到 1000 次,用来训动力学模型和底层控制器。这类量也不小,但标注负担极低,因为信号的时序结构本身就承载了绝大部分有效信息,不太需要人去解释。
但比较难的是如何把高频信息给加到模型中训练。
3)任务级遥测。
一整段从启动到成功或失败的完整任务日志/prompt之类的,是模仿学习和强化学习的核心输入。
这类看着最少,标注却最密:要划任务阶段边界、标成功失败、记物体状态,有时还得标操作员的意图。
一句判断:
只做固定拾取放置的工业臂,通常前两类就够;要从人类演示里学操作的灵巧机器人,三类缺一不可。
采集前把类别选错,可能钱就白烧了。

下一个问题,为什么需要这么多的传感器?
用人话讲,机器人干一件活,得同时知道三件事:我看到了什么(相机、雷达)、我身体现在什么状态(关节、IMU)、我碰到了什么(力和触觉),少一路传感器,它对世界的感知就少一环。
包括最近我们接触的触觉手套等,本质上也是再补机器人理解世界的信息源。这跟你闭着眼在包里摸钥匙一个道理,光靠眼睛不行,真的要手上的触感。

不同模态的标注成本也不一样。
得益于现在视觉的基座模型,图像的标注(分类/2D框/关键点等)单帧价格大多在毛的级别,分割的话会贵一些,要到元的级别。
点云的话现在标注还是很贵,3D 框的标注价格要到元的级别,一帧点云标下来要到两位数的价格。听起来点云标注要烧很多钱?
不是的,有了初始的标注之后,后面的标注可以依赖时序关系做位置移动,不是每一帧都要重新标注。
而 IMU 负责朝向和加速度,触觉和力传感器负责接触和压力,是精细操作绕不开的传感器,音频类的提供语音指令等等。
落地系统基本都至少有两种模态,这就出现一个硬约束。
所有数据流的标签必须时间戳同步,第 N 帧相机标注,得对齐同一时刻的雷达扫描帧或者IMU。
这里面的坑比想象中的更深,做不好同步,很多标注都会错位。对于模型来说不是说不能用,但算法肯定会很难受。所有的问题优化不上去都会甩锅到这里面。
采集这块,市面主流就两条路。
1)众包采集,派出去让很多人在各种真实环境里采。
好处是分布性好一些,家用机器人要适配不同厨房、光照、家具,单一实验室根本覆盖不全;
坏处是一致性差,录制质量、标注准确度参差,需要配一套标准化软件加自动质控,人工复核模糊样本。

也让我们想起来了印度工厂的ego采集
2)受控采集,固定场地固定流程。
好处是精准干净可复现,手术器械那种场景就得这么来,厨房里那点光照多样性对它毫无意义;坏处是数据多样性很差,换个场景就泛化不动。
实操上一个稳妥的起手式是:
先用受控采集把整条 pipeline 跑通、建立质量基准,再上众包做规模化。

Egocentric 的数据我们也有一些经验。
有头戴设备配合末端的夹爪,需要保证手全程在画面里,配动捕还能同步输出全身骨骼和单指关节位姿。
但它有个天生的短板:手部位姿追踪靠头戴相机,一旦抓杯子这种手被物体挡住的场景,位姿数据就会失真甚至丢失。
目前的解决办法不是换方案,只能在设计场景时尽量少遮挡,标注时把遮挡帧单独打标记,不当干净样本用(明天要分享的 DYNA-2 会有不一样的看法)。
但是吧,你能感觉到这玩意不合理,非常不合理。因为人不是这样的,正如我在写这篇文章的时候,我眼睛盯着的是显示器,根本不是我的手。
最后提一个采集前容易被跳过、但影响巨大的技术选择:动作表征。
你是用关节角度还是末端执行器位姿?用绝对坐标还是增量坐标?这个选型的影响远超多数团队的预期,而且一旦采完再改,历史数据基本要重来。
务必在开采之前,就跟模型架构对齐。
二、标注才是真正的脏活
如果说采集是体力活,标注就是又累又脏。
采集的要吐槽,标注的要吐槽,用的人也会吐槽。。。
但标注确实是 infra 层面很核心的一环,初版模型的性能很大程度上依赖标注的丰富度和精度,很多问题最后都会排查到数据层面。
大多数人以为机器人标注就是画个框、框个物体。真做过就知道,机器人标注有一堆普通 2D 图像工具压根适配不了的硬要求。我挑几个点说。
1)全视频帧内物体 ID 一致。
同一个杯子,在几百帧里得始终是同一个 ID,中间被手挡住、转个身又出现,还得能接上。物体互相遮挡时自动追踪一定会断,必须人工校正。ID 一乱,模型拿到的就是自相矛盾的追踪目标。
2)点云的三维空间精度。
激光雷达的长方体标注得贴合物体的三维边界,差几厘米,抓取预测就错。这意味着标注界面必须有 3D 可视化,只在 2D 投影上标点云,会带来系统性的精度偏差。

点云标注示意图
3)跨模态的毫秒级时间戳同步。
就是前面说的坑:第 N 帧相机标签必须对齐同一时刻的雷达扫描,偏差超过 50 毫秒,就会给融合感知模型灌进去鬼影一样的伪信号。这个事后处理救不回来,只能靠标注工具原生支持时间对齐。
4)物体的功能关联。
任务级学习不光要标物体是什么,还要标它们之间的关系:谁是容器、谁是支撑面、谁是工具。缺了关系标签,模型只认得物体,读不懂整个任务在干嘛。
5)最关键的是最后一个:任务阶段划分与意图边界。
一个抓取动作,得标清楚哪一帧开始算「接近」、哪一帧算「抓取」、哪一帧算「搬运」,这个边界是策略判断下一步该干嘛的依据。

任务阶段划分与意图边界
而实际项目里破坏性最强的错误,恰恰就出在这。
标注员 A 把抓取的起点定成手接触物体,标注员 B 定成机械爪闭合,两套标准混合训练,模型学出来的阶段切换决策边界就是模糊的,在最需要精准的抓取环节就会失败。
顺便说一下哪些注释错误对训练的影响最大。

说到这,正好回答大家问最多的一个问题:数据是不是越多越好,现在要不要拼命堆量。
我的看法是:量重要,但量已经不是当下模型的壁垒了。
三、你的场景到底需要什么数据
这一章是写给看项目的老师的。不同赛道,要看的数据不太一样,拿一个标准量到底,一定出错。
1)工业机器人。
环境固定、任务已知,要的是特定任务的高精度演示,外加产线高频故障的修复演示,标注精度优先于场景多样性。这个赛道标错的代价比别处都高,因为机器人没有额外环境信息兜底,标签一错可能直接是生产事故。
2)家用服务机器人反过来。
环境天天在变,光照、摆放、人的行为都没规律,要的是广度不是深度,众包几乎是规模化落地的唯一路,同时标注和质控的工作量会陡增。
3)自动驾驶。
最大的负担是长尾极端场景的规模化覆盖:罕见天气、模糊路口、奇怪的行人行为,全是安全事故高发点,再加多传感器同步和海量轨迹、语义标注,是整个机器人领域标注量最大的赛道。
4)人形机器人,现在最难。
它要在人类专属环境里干全品类的人类活动,需要全身运动、多步骤演示、人机交互序列,绝大多数项目前期都低估了数据规模。
现在市面上的开源数据也是五花八门,暂时还没有形成最终共识。阶段性共识是人类视频做大规模预训练打地基。

五、真正拉开差距的,是数据 infra
以上差不多就是关于数据层面,我认为有价值的信息。
下面的部分我和大家重点聊聊数据 infra 为什么重要,就是昨天文章里面强调的「能转向的基础设施」。
坦白讲,我觉得这才是真正的分水岭。
机器人的数据 pipeline 是个闭环,不是一次性的流水线。

WAIC上看到穹彻展示的云端infra
其实各家都知道要做闭环,采集、处理、标注、校验、训练、部署、线上监控,再根据线上问题回头补采,这个最小闭环看起来就形成了。
如果有这么简单,就真好了。就我个人做算法的体感而言,规模化之后容易出现问题的地方有几块:多套设备没有统一格式,每次采完都需要人工对齐;标注前没有自动质量筛选,标注员大把时间耗在无效数据上;线上部署的故障没有机制回流到训练集。
我习惯把它拆成四条链路来看。
1)云端链路,负责海量原始数据的存储、传输和版本管理。
2)标注链路,负责数据从进来到标注的流转和质量监控。
3)训练链路,负责数据怎么组织成训练集、配比和复现。
4)推理链路,也就是部署之后的回流,这块也容易被忽略、也最能拉开差距。
我本来还想解释一下几块链路之间的协同关系,思考了之后还是删掉了,这块的 Knowhow 太大,我就不在这里班门弄斧了。举一个例子吧:
现在我有一个新的业务场景需要做,初步设计了需要采集的细则安排数采员采集。
OK,带着设备进场了,采集的数据是直接回传到云端还是拿硬盘到时候拷贝回去。 数据有了,进到数据工厂标注,前面的数据初筛、自动标注、版本管理、Log记录,再到后面的人工精修、质检筛选、算法抽检。
标注完了,进到训练的一环,新数据如何计算配比和老数据混合使用,如何保证模型已有的能力不掉点,并且新场景上性能提升。
模型产出之后,如何下放到业务端验证和做新一轮的数据回流。
针对业务端回流的模型表现,如何针对性挖掘问题场景,做问题分析和下一轮的需求设计。
这上面的每一个环节,都强依赖 infra 的能力。
我给大家提供个时间对比,在我没做好 Infra 之前,我可能需要2-3个月做一轮模型优化。
但如果有一套完善的 infra 之后呢,答案是 2-3 天,完全没见过的新场景可能要 10 天左右。
这就是 infra 所带来的护城河。
六、正在变的,和还没有答案的
科普到最后,聊聊这个方向正在发生的变化,再抛几个开放性的问题和大家一起探讨。
先说一个最容易被误读的趋势:具身的基础模型来了,数据是不是就不重要了?
答:不是的。基础模型改变的是数据人力投入的分配方向,不是减少数据总量。我们现在大多数使用的还是互联网领域的基础模型,具身的基础模型目前还没影子。像VLA、WAM仍然依赖大模型领域的基座模型。
如果具身的预训练没有了争议,那下一个阶段私有化场景可能会成为模型差异化的核心。
换句话说,拥有一套高效、高质量的数据 infra,优势反而可能会更大。
下面是几个我最近在思考的问题,和大家一起讨论下:
1)目前我们所设计的数据形式,是否能满足三年之内的具身模型发展需求?
2)人类可以做一些视觉不可见的操作,在数据层面我们还需要如何思考改进?
3)在具身模型基础模型确定之前,如何尽可能的保证现有数据的价值?
这些思考,与大家共勉。
