人形机器人公司都在卷通用基础模型,我感觉这可能是错的....
统计 阅读时间大约7分钟(2530字)

8小时前 人形机器人公司都在卷通用基础模型,我感觉这可能是错的....

来源:豆包
过去两年,我看过不少人形机器人演示。最近WRC刚结束,看到了不少机器人公司的Demo,同质化也越来越严重,我越来越觉得,对于一家机器人本体厂商而言,继续从头追求...

过去两年,我看过不少人形机器人演示。

最近 WRC刚结束,看到了不少机器人公司的 Demo,同质化也越来越严重,我越来越觉得,对于一家机器人本体厂商而言,继续从头追求一个大而全的通用基础模型,可能并不是现阶段最现实的选择。

原因在于,通用能力并不会自动转化为工业生产力。

在行业内我们就看到一种反差:模型会做的任务越来越多,机器人演示也越来越精彩,但一个新技能真正进入工业现场,开发过程仍然很重。

在我看来,通用基础模型解决的是“机器人原则上能做什么”,工业落地解决的则是“这台机器人能否在这个工位上,长期、稳定、连续地把任务做完”。

具身智能行业现在缺少的,可能不是另一个“什么都会”的通用大脑,而是一层能够把通用能力转化为特定机器人、特定行业能力的中间层。这就是垂域基座模型。

为什么机器人每换一个任务,都要从头学一遍?

垂域基座模型的定义其实并不是对通用基础模型的否定,也不是一个只会完成单项任务的小模型。

通用基础模型提供广泛的视觉、语言和动作能力;垂域基座模型完成特定机器人本体的适配,并沉淀某一行业的共性操作;具体技能则针对实际物料、工位和流程进行训练与部署。

问题在于,过去很多机器人技能开发,实际上把这三层能力混在了一起。

每增加一项任务,模型不仅要学习新的物料和流程,还要重新适应机器人的动作空间、运动特性和控制规律,甚至重新学习识别、定位、抓取、搬运和放置等基础操作。这样的开发方式或许可以完成单个项目,却很难支撑工业技能的规模化复制。

垂域基座要解决的,正是这些重复学习的问题。

如果这些能力已经被提前训练进模型,那么面对一个新任务时,开发团队就不需要再次从头学习机器人的“身体”和工业操作的基本规律,而只需要重点适配物料、工位和流程的差异。

所以,垂域基座真正改变的,不是机器人能不能完成某一个动作,而是新技能的开发起点。

通用基础模型负责把能力做宽,垂域基座负责把这些能力真正用到一台具体机器人、一个具体行业里。眼下,后一个问题显然更急。

衡量工业模型,不该只看它会多少任务

也正因为如此,乐聚推出 KUAVO-VLA 1.0 时,真正引起我注意的并不是“又发布了一个 VLA 模型”,而是它对自身位置的判断。

KUAVO-VLA 1.0 没有试图重新讲述一个“大而全”的通用模型故事,而是在通用基础模型与具体工业技能之间,建立一层面向 KUAVO 本体和工业任务的垂域基座。

从技术路线来看,KUAVO-VLA 1.0 Lingbot-VLA 2.0 为能力起点,使用 600+ 小时 KUAVO 同构型高质量真机数据进行二次训练,训练数据覆盖 100 项工业任务,包括分拣、搬运、上下料和装配等典型操作。

“同构型数据”是其中一个值得关注的关键词。

这些数据全部来自 KUAVO 机器人,因此模型持续学习的是同一套动作空间、运动特性和控制规律。相比跨本体混合数据,这种方式的目标更加明确:把过去每个项目都要重做一遍的本体适配,提前变成 KUAVO 的默认能力。

与此同时,100 项工业任务所沉淀的也不只是 100 套固定流程。不同任务中反复出现的识别、定位、抓取、搬运、放置和双臂协作等环节,可以被模型逐步提炼为工业共性能力。

f74f57484da1a856ec08312c83f8adcf.jpg

KUAVO机器人执行快消品下料任务

为了检验这种垂域训练的效果,乐聚设置了 25 项任务评测,包括 20 项定制工业任务和 5 项 GM100 公共任务。这组结果可以分成两步来看。

第一步是选择能力基座。在同一组任务中,Lingbot-VLA 2.0 的任务成功率为 16.27%、过程分为 42.06%;π0.5 分别为 12.80% 和 32.11%;GR00T N1.7 分别为 6.67% 和 21.22%。在本次参与比较的三个候选基础模型中,Lingbot-VLA 2.0 表现最好,因此被选为 KUAVO-VLA 1.0 的能力起点。

c1d95f6c9634abba2d5af7eb235f9b4e.png

三个候选基础模型在25项任务中的评测结果。图中SR为任务成功率,PS为过程分。

第二步是在 Lingbot-VLA 2.0 的基础上,加入 KUAVO 同构型数据和工业任务训练。经过这一步,KUAVO-VLA 1.0 的整体任务成功率达到 48.27%,过程分达到 74.51%;相较作为能力基座的 Lingbot-VLA 2.0,分别提高 32.00 和 32.45 个百分点。

adb5984cc20eb899ecb37db5a8da3dc1.png

KUAVO-VLA 1.0基于Lingbot-VLA 2.0的性能提升。图中SR为任务成功率,PS为过程分。

这两张图需要连起来看。它们并不是要证明 KUAVO-VLA 1.0 在完全相同的训练条件下“赢了”其他通用模型,而是在说明:选择通用基础模型作为起点,再针对具体本体和工业任务“补课”,模型确实会变得更好用。

相比综合评测中的排名,我更关注两个具体适配案例。

在流水线开关分拣任务中,KUAVO-VLA 1.0 使用 5 小时任务示范数据进行后训练适配,取得 80% 的成功率;在 GM100 的 BM-45 零食分拣任务中,模型使用 150 条示范数据进行适配,成功率达到 73.33%

工业客户其实不太关心模型在榜单上排第几。他们问得更直接:这个新任务要几个人做、要采多少数据、多久能够跑稳。

据乐聚提供的项目总结,这套路线带来的变化很直接:部分新任务的开发周期由数月缩短到一周;使用 150 条数据即可完成适配,相关成本降至传统方案的三分之一以下;在成熟任务中,平均成功率达到 80%—90%,部分任务达到 100%。简单说,就是时间更短、成本更低,效果也更好。

这些数字之所以值得关注,不是因为机器人又多会了几个动作,而是它们说明,机器人之前学到的东西开始能够带到新任务里。对工业客户来说,这意味着下一个任务不一定还要从零开始。

真正的门槛,是让机器人在岗位上越用越好

对本体厂商来说,通用基础模型可以选择合作,也可以基于现有模型继续训练。但机器人怎么动、在现场遇到过什么问题,这些经验只能靠自己一点点攒下来。它们比模型参数更难复制,也更可能成为一家本体厂商真正的壁垒。

今天不少机器人项目仍然是“一单一做”。项目交付了,数据留在客户现场;换一条产线,团队又从采数据、调动作开始。垂域基座如果有价值,首先就应该改变这件事:这一次踩过的坑,下一次不能再踩一遍。

真正有用的数据也不会只在实验室里产生。机器人到了产线,才会碰到物料批次变化、光照波动、工位偏移和设备磨损。哪些动作失败了,为什么重抓,换了位置后怎样恢复,这些不起眼的记录,才是下一版模型最需要的东西。

当部署的机器人足够多,这些现场数据能够持续回到模型里,模型变好后又能降低下一次部署的难度,数据飞轮才算真正转起来:机器人越多,数据越多;数据越多,下一批机器人就越好用。

04cded49b6d04f54c4c295b9cda65288.jpg

到那一步,我们或许不必纠结它算不算传统意义上的 AGI。对工厂来说,它已经不再是一台每换一个任务就要重新编程的设备,而更像一个熟悉这类工作的“熟练工”。如果一定要给它一个名字,这大概就是特定工业场景里的 AGI。

KUAVO-VLA 1.0 现在还只是这个过程的开头。600+ 小时真机数据和 100 项工业任务说明乐聚已经开始积累,25 项任务评测和两个适配案例则让这种积累有了初步结果。接下来更关键的,不是再增加几个演示,而是让更多机器人真正进入岗位,在长期运行中把数据带回来。

区别于行业里直接用通用基础模型承接具体技能的常见做法,乐聚选择在两者之间增加一层“本体+行业”的垂域基座。这是一条不同的路:不急着让机器人覆盖所有场景,而是先进入足够多的真实岗位,把本体经验和行业数据沉淀下来,再让数据飞轮转起来。

这条路最终能不能走通,仍然要看真实部署规模和长期运行数据。但全能 AGI 也许还很远,在一个具体行业里先做出能够举一反三的机器人,并没有那么遥远。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×