阅读时间大约6分钟(2246字)
出品:人形机器人场景应用联盟
当地时间9月17日,美国人形机器人企业 Figure 发布 Helix 2.5,搭载该模型的 Figure 03 在30个此前未接触过的真实家庭中,完成了整理客厅、叠毛巾和铺床等任务。
更值得关注的是,机器人没有在这些家庭中采集训练数据,也没有针对新环境进行微调或适应。
对于长期依赖场景训练、任务复现的人形机器人来说,这意味着一个重要变化:机器人开始尝试把已经学会的能力,迁移到此前没有接触过的环境中。
从“技能复现”走向“环境泛化”,是人形机器人迈向真正通用化的一大进步。
01.
一次“不提前预习”的考试
Figure这次实验的设计逻辑,可以用一句话概括:不给机器人任何“作弊”的机会。
Helix 2.5是Figure迄今构建的最先进神经网络。它的底子是一个经过Index数据集预训练的基础模型。Index是Figure打造的全球规模人类行为数据集,通过众包方式收集了超过1600万个人类操作视频,覆盖108个国家,周活跃用户超过4.4万。
在这个基础模型之上,Figure训练了三种全身行为:整理客厅、叠毛巾和铺床。然后,他们把机器人带进了30个从未进入过的旧金山住宅。这些住宅此前没有采集过任何数据,评估中使用的玩具、毛巾、床上用品也从未出现在任务指定数据中。机器人直接用陌生家庭里的沙发、床和毛巾完成任务,不微调模型参数,不针对新环境调整任何设置。
而且,这些任务并不只是机械臂在固定位置完成抓取,机器人需要在家庭环境中移动、寻找物品、调整身体姿态,并通过双手完成对刚性和柔性物体的操作。
这也意味着,任务同时涉及环境感知、移动、双臂协同、灵巧操作和全身控制。
Figure公布的测试结果显示,在保持任务数据、模型架构、训练和评估条件一致的情况下,使用Index预训练的模型,其零样本成功率从9%提升至56%。
02.
从“训练一个场景”,到“适应一类环境”
Figure上一代模型Helix 02已经能完成洗碗、铺床、整理卧室等长时程任务,但存在一个根本问题:每到一个新环境,就需要重新采集数据。这意味着机器人的部署成本会随着场景数量线性增长,规模越大,现场适配负担越重。
Helix 2.5打破的就是这个范式。它仅使用Helix 02一半的适应性数据,就在30个从未见过的家庭里追平了后者在单一场地的成功率。行为规范的成本降低了一半,覆盖范围扩大了30倍。
更深层的突破在于“全身智能”的迁移方式。Helix 2.5证明了全身智能可以从人类经验中学习并迁移到新场景,而无需每次都重新构建,同时将“在陌生环境下完成任务”变成一项可以量化的考核指标,推动行业跳出样板间 Demo 的评价逻辑。
03.
除了Figure,还有哪些企业在推进机器人泛化?
泛化能力并不是Figure一家企业正在探索的方向。近年来,Google DeepMind、Physical Intelligence等公司,以及多家人形机器人企业,都在尝试通过视觉语言动作模型、跨机器人适配和更广泛的数据训练,提升机器人对新任务、新物体和新环境的适应能力。
Google DeepMind在2025年发布Gemini Robotics模型,探索将多模态理解能力用于机器人控制。在相关研究中,Google展示了模型在新物体、新环境和不同指令下的任务泛化能力,并进一步探索通过少量示范学习新任务,以及适配不同机器人本体。今年7月,Google DeepMind又发布了Gemini Robotics 2,进一步强调全身控制、灵巧操作和多机器人协作。其展示方向包括让机器人通过移动、蹲下、伸展和操作物体等方式,完成更加复杂的环境任务;同时,模型还可以适配不同机器人形态,并支持本地运行。

Google的探索说明,机器人泛化并不只存在于同一种机器人、同一个场景中,也包括模型能否在不同机器人身体和不同任务之间迁移的能力。
银河通用在今年6月发布了全球首个人形机器人通用小脑GPT基础模型AstraBrain-WBC 0.5。它采用GPT风格的因果Transformer架构,将全身控制重构为连续序列预测问题,训练数据覆盖2万小时人类运动数据、20亿帧,实现了篮球、拳击、舞蹈、协作搬运等训练中从未出现的高动态动作的零样本执行。

星海图则在今年6月发布并开源了VLA基础模型G0.5,实现了从任务后训练到零样本泛化的跨越。机器人第一次进入新场景,无需额外训练就能直接干活,在真实场景中展现出跨场景任务泛化和通用抓取能力。
众擎的EngineAI Awaken引擎融合了WAM与VLA模型,仅需2小时实机部署与微调训练,长程动作成功率即可超过98%,走的是“低样本高效泛化”路线。
宇树科技则选择了开源路线。今年9月开源的UnifoLM-WLA-1.0基座模型,实现了单模型统筹64个任务、覆盖桌面操作与全身移动操作、支持跨任务和跨末端执行器的泛化能力。

这些企业的共同点很清晰:泛化能力已经从论文概念,变成了可验证的工程指标。差异则在于场景侧重——Figure更偏向家庭场景,任务也多是长时程、全身性的家务操作;另一些企业则专注工业场景,希望让机器人适应更灵活的流水线作业。尽管场景不同,但泛化能力却都是企业非常重视、也正在集中攻克的核心能力。
04.
人形机器人走向通用化,还要跨过哪些门槛?
56%的成功率,距离“放心把家交给机器人”还有很长的路。Figure自己在官网中也强调:“并不是说通用的人形机器人问题已经解决。”

但这次实验指出的方向是清晰的。人形机器人的泛化正在从以概念为主,走向更多能落到实地。泛化能力或许会成为下一阶段人形机器人竞争的重要分水岭——毕竟,一个只能在特定环境中重复固定动作的机器人,本质上仍然是一台昂贵的自动化设备,而不是通用劳动力。
然而,真正决定人形机器人能否成为通用劳动力的,不是泛化本身,而是泛化之后的可靠性、自主性和规模化成本。
可靠性意味着56%需要变成90%以上,而且是在真实用户的使用条件下,不是实验室的受控评估。自主性意味着机器人需要在没有人监控的情况下持续工作,遇到意外情况能自己处理,而不是等待人工干预。规模化成本则意味着整机价格、部署成本和维护成本必须降到客户愿意买单的水平。
Figure的Helix 2.5是一个里程碑,但不是终点。它证明了一件事:人形机器人的全身智能可以从人类经验中学习,并迁移到从未见过的场景。但要把这种能力变成可交付、可管理、可持续优化的生产力,需要的远不止一个神经网络。
正如人形机器人行业正在经历的:第一轮竞争是谁能造出更像样的本体,第二轮竞争是谁能实现规模量产,第三轮竞争可能就是谁能让机器人在客户现场稳定工作。泛化能力给了第三轮竞争一个技术支点,但支点之上,还有整个服务体系、供应链体系和商业模式的重量。
Figure走出了第一步。下一步,是整个行业的事。
