这个机器人模型,把几个月的技能开发压缩到一周
统计 阅读时间大约5分钟(1935字)

9小时前 这个机器人模型,把几个月的技能开发压缩到一周

来源:豆包
出品:机器人技术笔记给人形机器人换一个新任务,听起来很像给电脑装软件:点几下,重启,然后开工。现实没有这么省心。模型也许认识零件,听得懂“放进左边料盒”,甚至知...

出品:机器人技术笔记

给人形机器人换一个新任务,听起来很像给电脑装软件:点几下,重启,然后开工。

现实没有这么省心。

模型也许认识零件,听得懂“放进左边料盒”,甚至知道下一步该抓哪里。可一到真实工位,它还是会碰上一堆很“身体”的问题:手臂够不够长,关节该转多少,夹爪什么时候合上,传送带会不会趁它犹豫时把东西送走。

大脑听懂了,手还没练熟。

过去开发一个新技能,常常要把本体适配、基础动作和场景任务一起重学。换个工位,再来一遍。多少有点像员工每次转岗,都得先重新学走路。

KUAVO-VLA 想省掉的,就是这部分重复工作。它在通用基模和具体技能之间加了一层“工业专业课”:先熟悉 KUAVO 的身体,再练好工业操作的基本功。新任务来了,模型只需重点学习新的物料、工位和流程。

能听懂指令,为什么还不等于会干活?

VLA(视觉—语言—动作模型)这个名字听上去很学术。放在工厂里,它干的事很好理解:摄像头替机器人看,人告诉它要做什么,模型再指挥手臂去完成动作。

假设传送带上混着黑色和白色的工件,任务是“把黑色工件放进左边料盒”。机器人认出黑色工件,只能算听懂了。真要干活,它还得追上传送带,找准下手的位置,夹稳工件,再把手收回来。早半拍,夹爪抓空;晚半拍,工件已经溜走;夹得不稳,走到半路还可能掉下来。

换一台机器人,麻烦又变了。手臂长短不同,夹爪开合速度不同,伸手的路线也得跟着改。就像一位熟练工换了一套陌生工具:他知道产品该怎么装,但手上还得重新找感觉。

通用模型先学会“怎么做事”,KUAVO-VLA 再把这些能力真正练到 KUAVO 这副身体和工业场景里。这样开发新技能时,就不用反复从头适配机器人本体,而能把更多精力放在新的物料、工位和流程上。

600 多小时,它不是在死记任务

可以把这套训练分成两步来看。

第一步,先让模型掌握一套比较通用的“动作语法”。LingBot-VLA 2.0 要兼容多种机器人,因此会把不同本体的关节和动作整理到统一的表示中。机器人虽然各有各的身体,但抓取、移动和放置这些动作,可以先放进同一个学习框架。

第二步,再把训练范围收回到 KUAVO。KUAVO-VLA 使用 600 多小时 KUAVO 真机数据继续训练,覆盖 100 项工业任务,而且全部数据都来自同一种机器人构型。

为什么只盯着这一副“身体”练?

因为每次抓取、搬运和放置,都对应同一套关节、动作空间和控制规律。模型不用一边学任务,一边猜不同机器人到底该怎么动,可以把注意力集中在 KUAVO 身上。

这 100 项任务也不是让模型背 100 份操作流程。识别、定位、抓取、搬运、放置,会在不同物料和工位中反复出现。练得多了,这些动作就从“某个任务的做法”变成了可以重复调用的工业基本功。

3716840e0b1400c2e8f6710f53dc0f02.jpg

快消品下料真机演示。

2e63b1d8cfdcb8ff1696385fa018d5f4.jpg

罐装商品上料真机演示。

它的范围也很清楚:这套能力更贴合 KUAVO 和目标工业场景,不是一块插到任何机器人身上都能用的万能芯片。

换个好懂的说法,通用基模像大学通识课,垂域模型像工业专业课,最后的技能训练才是具体岗位的入职培训。三层都要学,只是不用每换一个岗位,就从小学一年级重新读起。

25 道实操题,它到底做对了多少?

KUAVO-VLA 接受了一组包含 25 项任务的测试,其中 20 项是定制化工业任务,另外 5 项来自公共任务集 GM100。一起参加对比的,还有 π0.5、GR00T N1.7 和 LingBot-VLA 2.0。

结果是,KUAVO-VLA 的整体任务成功率达到 48.27%,过程分达到 74.51%,两项指标都排在第一。相较于 LingBot-VLA 2.0 的成绩分别是 16.27% 和 42.06%,都有明显的提升。

6496162fb267544579b2abc4c24dca57.jpg

图:25 项任务综合评测结果

成功率和过程分为什么差这么多?可以把一项任务想成十个步骤。机器人做完前八步,最后把零件放歪了,成功率会记作失败,过程分却会记录它已经走到第八步。48.27% 和 74.51% 放在一起看,说明不少任务不是完全不会做,而是卡在了后面几步。

两个具体案例更直观。第一个是流水线开关分拣:机器人要看准移动中的开关,两只手配合把它抓起来,再放到正确位置。模型看了 5 小时示范,训练后做 10 次,大约能成功 8 次。

第二个是零食分拣:桌上混着多种零食,机器人要先认出它们,再逐个抓起、分到对应位置。这个任务用了 150 条示范数据,做 10 次大约能成功 7 次,统计成功率为 73.33%。

8efe781b3f632f82ec0d9a08bda5c1f2.jpg

流水线开关分拣真机演示。

97aa903aed601a4d08c254ff58e325ba.jpg

零食分拣真机演示

从几个月到一周,省下的是什么?

比排行榜更直接的,是开发周期。

过去采用“基模直接训练技能”的路线,做出一项完整任务通常要花数月,采集数百到上千条数据。任务一换,数据、训练和调试又得重新走一轮。

有了垂域模型,机器人已经熟悉 KUAVO 的身体,也练过工业基本动作。新任务适配可以压缩到一周左右,典型任务用约 150 条数据就能启动,整体成本下降 3 倍以上。

技能落地的成功率平均达到 80%—90%,部分任务可以做到 100%。开发团队终于可以少花时间教机器人“手该怎么抬”,把精力留给真正不同的部分:这次抓什么、工位怎么摆、生产节拍有多快。

c2709b866dd471e9c2fa61369c3dd822.jpg

捏尖叫鸡任务真机演示。

3a49ac800633e70b2891428c1244c37a.jpg

更换卷纸任务真机演示。

2c248d4aa5bec9adf76fe15dfbbb0c32.jpg

鸡蛋装填任务真机演示。

b05930719acafb0f88df963ae6fdf8d6.jpg

图:基模、垂域模型与技能训练的能力分工

机器人终于不用每换个工位就“失忆”

KUAVO-VLA 做的事情,可以归结为一次更清楚的分工。

通用基模负责见多识广,垂域模型负责熟悉 KUAVO 的身体和工业操作,技能训练再解决具体物料、工位与流程。一个任务积累下来的高质量数据,还能回到垂域能力池里,给下一个相近任务打底。

对机器人入门者来说,记住这一点就够了:给机器人装上一个聪明的“大脑”,不代表它马上就能进厂上班。它还要熟悉自己的手脚,也得把行业里的基本功练扎实。

当这些重复课程被提前学好,新任务就不用每次从“学会抬手”开始。机器人少走一段重复路,工业落地自然能快一步。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×