已超13TB!智元AgiBot World 2026把“失败、接管、强化学习”装进数据集,具身数据开始记录机器人怎么犯错了?
统计 阅读时间大约10分钟以上(4077字)

1天前 已超13TB!智元AgiBot World 2026把“失败、接管、强化学习”装进数据集,具身数据开始记录机器人怎么犯错了?

来源:豆包
作者:陈钶如果只看容量,AgiBotWorld2026的最新变化,似乎只是一次普通的“数据集又变大了”。截至2026年8月18日,智元官方HuggingFace...

作者:陈钶

如果只看容量,AgiBot World 2026 的最新变化,似乎只是一次普通的“数据集又变大了”。

截至2026年8月18日,智元官方 Hugging Face 的 AgiBot World 2026 Dataset Card 已经显示总文件规模13.2TB,仓库根目录已经同时出现模仿学习、强化学习、深度交互 三类数据。

但这次真正值得关注的,不是13TB这个数字。因为上一代 AgiBot World Beta 早已做到 1,003,672条轨迹、约43.8T。2026版本更有意思的变化,是数据的“颗粒度”和“价值密度”正在改变:从完整的一轮任务(Episode)级任务标签,继续往下拆到标注到了单帧任务画面、二维包围盒、分段的动作指令;除此之外新增了非常实用的元数据字段:专门记录失败帧、成功帧、人类介入干预帧,同时标注出失败原因、故障能否恢复、是否需要人类接管等关键信息。

换句话说,具身数据正在从“机器人成功做过什么”,走向“机器人在哪里做错、为什么错、能不能救回来、什么时候需要人接管”。

这可能比再多堆一批“完美示范”,更接近机器人真正进入工厂、商超和家庭以后产生的数据形态。

7c94cae9799f6856140df655fda5cdf7.png

01

先把三个事实说清:这不是简单的“失败数据集”

第一,AgiBot World 2026 并不是突然从“成功示范”跳到了强化学习。

智元最初公布2026计划时就明确表示,数据将分 五个阶段 释放。首阶段聚焦 模仿学习,包含任务级描述、动作序列、原子技能、2D目标框,而且明确写了一句:错误恢复轨迹也会被保留和标注。随后 Theme 2 Rich Interaction 又把采集逻辑往前推了一步:不只要求把任务做成功,而是主动探索真实物理交互,抓空、碰撞、物体掉落、接触不稳定、液体飞溅,都可以成为数据。

第二,当前 Hugging Face 里出现强化学习目录,而且家庭、工业任务仍在持续加入;

第三点得单独拎出来说清楚 —— 对错误帧、人工干预帧和人工接管这几个概念,千万别理解得太想当然。

这套数据的格式框架,确实提前给失败记录、人工接管这类信息都留好了专门的位置,相当于表格里都给你列好栏目了。但这不等于这 13.2TB 里的每一段任务数据,都老老实实把所有字段填得满满当当。

真正的信号不是“智元已经把所有失败都标完了”,而是数据集的 Schema 开始承认一件过去经常被忽略的事情:

失败不是脏数据,人工接管也不一定是必须剪掉的“后台痕迹”,它们本身可能就是训练信号。

02

为什么要从Episode一路拆到Skill、BBox、Error?

过去很多机器人数据集的基本单位很简单:一段视频、一串动作、一个任务说明,最后再给一个成功或失败。

这种格式训练“照着做”的策略够用,但任务一旦变长,问题马上出现。

比如一句“把购物车里的饮料和酸奶放进冷柜第五层”,机器人真正执行时至少要经历找目标、靠近、抓取、搬运、对准货架、放置、确认等多个阶段。若最终失败,只给整段 Episode 一个结果,模型很难知道究竟错在第一步抓偏了,还是最后摆放时碰倒了旁边商品。

AgiBot World 2026 的层级标注,实际上是在给不同模型补不同的“监督接口”。

Episode 保留完整长任务与高层语义,是 VLA 理解“我要完成什么”的总任务单位;Task Frame 把一个长 Episode 拆成多个 Subtask,让层级 Planner 知道“现在做到哪一步、下一步该干什么”;2D Bounding Box 把语言中的“红盖饮料”“白色酸奶”落到真实视觉区域,可服务目标条件策略、语言视觉 grounding 与抓取选择;再往下的 Instruction Segments 则把动作细化成 Pick、Place、弯腰等 Skill 和步骤级指令,用于技能模仿、primitive discovery 与多粒度语言条件训练。官方 README 对这些用途都有明确说明。

而 Error、Success、Intervention 属于另一条轴:它们不再回答“机器人在干什么”,而是回答“机器人干得怎么样”。

两条轴叠起来后,数据就从一条平铺的录像带,变成了一棵带状态的任务树:机器人正在做哪个子任务、操作哪个物体、调用什么技能、哪里出了错、是否可恢复、有没有人工介入,都可以落回具体时间段。

d5d213908d3cb9331342be03c4bcb84c.png

这也是为什么这些标签分别对应 VLA、Planner 和 RL 的不同需求:VLA需要语言、视觉、动作对齐;Planner需要长任务结构;而 RL 和 value model 真正关心的,是一个状态—动作发生之后,结果究竟变好了还是变坏了。

03

失败和接管,到底比成功示范多了什么?

成功示范告诉机器人的是:“这条路能走通。”

失败数据告诉它的是:“哪些路会掉坑里”;恢复数据进一步告诉它:“掉进去以后,哪一步还能爬出来”;人工接管记录的则是一类极其珍贵的边界——模型自己继续做已经不可靠,但人知道这里应该如何纠正。

这其实对应的是机器人学习里一个很现实的问题:机器人不仅要知道“这次任务最后成功没成功”,还要逐渐学会判断“眼前这一步,是在把任务带向成功,还是已经走偏了”。

智元 Finch 团队今年发布的 Learning While Deploying(LWD),核心思路可以简单理解为:让机器人在真实部署中边干边学。

论文在数学上把机器人的执行过程看成一连串连续决策,并采用一种非常简单的“成败打分”:任务最终成功,记 r=1;没有成功,则记为 0。对于连续 H 个动作组成的一小段动作序列(action chunk),它的折扣回报可以写成:

9ecdec953ad7dc5fd62694a03c6caddb.png

通俗的理解就是:机器人不需要每走一步,都由人工告诉它“这一步做对了还是做错了”。只要最后知道任务有没有完成,就可以把这个成败结果逐步“往前传”,反过来判断前面的哪些状态和动作更有价值。

论文进一步通过 TD target 和 value learning,把稀疏的终局结果逐步向前传播。

公式看起来不复杂,意义却很关键:真正有用的“训练标签”不一定需要人工逐帧写出来。只要知道最终是否成功,再结合轨迹中的状态与动作,价值模型就有机会学习哪些行为更可能通向成功,哪些会把任务带进低价值区域。

所以,失败轨迹不是成功轨迹的低配版,它提供的是决策边界。

尤其在长任务中,机器人可能前80%都做对,最后一步失败;也可能前面抓歪,后面通过重新抓取成功恢复。如果简单删除这些轨迹,只留下“完美Demo”,模型反而永远看不到真实部署中最值钱的那部分状态空间。

LWD给出了一组相当直接的验证:团队在 16台双臂机器人、8个真实操作任务上进行 offline-to-online RL,其中包括执行时间3—5分钟的长时序任务;随着舰队部署经验持续积累,一个共享 generalist policy 最终达到 95%的平均成功率。论文还明确指出,真实部署经验天然包括 success、failure、recovery、partial progress、rare edge cases 与 human intervention。

7ed4795763d5fb96a9f5e2f6d9fb24ad.png

再往前一步,SOP 已经把“人工接管”变成在线学习系统的一部分:多台机器人持续把 on-policy experience 和 human intervention signals 发送给中央学习器,再异步拿回更新后的策略。论文报告,有效的 post-training 可以在数小时真实交互内发生,而且性能随机器人数量增加呈近线性扩展。

智元官方实验还给出一组更直观的数据:使用1、2、4台机器人训练3小时后,成功率分别达到 80.5%、88.7%、92.5%;达到80%成功率所需时间,则从173.6分钟缩短至71.7分钟。更有意思的是,在其对比实验中,3小时 on-policy experience 带来约30%提升,而额外增加80小时预训练数据只贡献约4%的增益。

163925ef4662860063da78a0ec10f4c7.jpg

这解释了为什么“接管数据”可能比额外堆一批普通示范更贵。

接管出现的位置通常并非随机,而是在模型能力边界附近。对数据工厂来说,一小时采到1000次重复成功,与采到10次真正暴露策略漏洞的失败,再附带5次高质量纠正动作,训练价值可能完全不是一个量级。

但需要注意的是,记录了“哪里出错”或“什么时候人工接管”,并不意味着这些数据可以直接拿来训练模型。 要真正用于强化学习、判断动作好坏,或者训练机器人从错误中恢复,还需要进一步明确“什么算好、什么算坏”,并把错误发生的时间、当时执行的动作以及后续是否恢复等信息对应起来,再配合相应的学习方法。

AgiBot World 2026 更像是把这些关键线索先完整地记录下来;而 LWD/SOP 展示的,则是如何进一步把这些真实部署中的成功、失败和人工纠正,转化成模型能够学习的经验。

如果把这套数据进一步用到机器人评测上,就可以不只问一句:“这次任务成功了吗?”

对真正投入使用的机器人来说,还有两个更实际的问题:

第一,机器人工作多久,才需要人接手一次?第二,机器人出了错以后,有多少次能够自己救回来?

第一个可以用人工接管频率来观察:

cd72eb97149bdad9538d613c0764acdd.png

它统计的是机器人在一定工作时间内,需要人工接手多少次。数值越低,说明机器人越能独立完成任务,也越不需要人在旁边频繁“救场”。

第二个可以看失败恢复率:

05ddd0b8d462a8c374b97e7696c1bdaa.png

它统计的是:在那些原本还有机会挽回的失败中,机器人有多少次能够靠自己重新回到正确的任务流程。数值越高,说明机器人遇到意外以后,自我纠错和继续完成任务的能力越强。

需要说明的是,这两个指标是本文为了观察机器人真实部署表现提出的建议。相比只看一次任务“成功还是失败”,它们回答的问题其实更接近真实使用者关心的事情:机器人多久需要人搭把手一次?出了问题以后,能不能自己把事情接着做完?

04

数据工厂正在换产品:从“专家示范”到“完整部署经验”

回头看 AgiBot World 的两代路线,这个变化会更加明显。

2025年的 AgiBot World Colosseo 首先解决的是“规模”问题:超过 100万条轨迹、217个任务、5类部署场景。论文报告,使用其数据预训练的策略,相比 Open X-Embodiment 平均提升30%;GO-1在复杂任务上成功率超过60%,并较RDT高32%。这至少证明了一件事:大规模、高质量真机数据本身确实可以换来能力提升。

到了2026年,问题开始变成:

当成功示范已经很多,下一TB数据究竟应该采什么?

答案正在从“再做一遍正确动作”,转向“把真实世界的完整分布留下来”。

Rich Interaction 主动留下抓空、碰撞、掉落、不稳定接触;RL目录开始持续加入家庭和工业任务;Schema给 Error、Intervention、error_cause、restorable 留出结构;LWD/SOP则把部署、回放、价值学习、再部署串成闭环。

过去的数据工厂更像“摄影棚”:追求每一条素材干净、标准、可模仿。

下一阶段的数据工厂,可能更像机器人的“黑匣子中心”:成功、失败、重试、恢复、接管全部保留,而且必须有时间戳、任务上下文和结果信息。

4182ded3476cc29a4f47ad3376c55d3f.png

这并不只是企业自己在押方向。

2026年6月,工业和信息化部、国务院国资委联合开展人形机器人与具身智能实景实训专项行动,提出到2026年底凝练形成 百个以上高价值应用场景,带动形成 万台级规模落地能力。更关键的是,文件直接提出,要持续丰富“异常处置、突发干扰、边界工况”等真实场景数据,并强化复杂或异常工况下模型的泛化与容错能力。

国家数据局主管、全国数据标准化技术委员会归口的《高质量数据集 具身智能 数据来源与构成要素》也已经于2026年4月登记立项;同一体系下还包括面向训练基地的数据采集与模型训练规范、可信赖测评指标与方法、具身智能评测指南等标准项目。

国家数据局此前公布的人形机器人具身操作数据集典型案例,已经做到 超5000平方米训练场、100多台异构机器人、100万条以上真机数据、2.5PB规模,并建立“场景—任务—原子技能”的采集与管理体系。

这说明国内具身数据基础设施竞赛其实早就不缺“大数字”。

真正稀缺的是,能不能把部署过程中那些最棘手的长尾问题,变成结构化、可学习、可回放、可验证的数据资产。

下一道分水岭,可能不是“多少小时”,而是“每小时有多少信息”

如果继续只用“小时数”“轨迹数”“TB数”衡量今天的具身数据竞争,这套指标很可能会越来越失真。

因为当一个策略逐渐成熟以后,大量重复成功会快速变成低边际价值数据。真正推动模型继续进化的,反而是新物体、新摆法、新用户习惯、边界工况、罕见失败、恢复动作,以及人类不得不伸手接管的那几秒。

因此,未来具身公司的数据壁垒,可能出现四个新的观察维度。

第一是干预密度:每100小时部署到底需要人接管多少次,而且新模型上线后下降得有多快。

第二是恢复覆盖率:常见失败原因中,有多少不仅被记录下来,还拥有“失败→修复→重新成功”的完整轨迹。

第三是长尾命中率:数据集有没有覆盖真正决定商用稳定性的稀有异常,而不是把重复成功做成更大的硬盘。

第四是闭环速度:今天线上暴露的问题,需要多久完成定位、标注、训练、验证,再变成下一版策略回到机器人身上。

这些目前还不是统一的行业标准,但它们可能比“又采了多少小时”更接近部署时代真正的核心问题。

真正的数据飞轮,从来不是硬盘越堆越高。而是机器人每一次真实工作,都能产生下一轮改进所需要的信息。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×