英伟达推出ENPIRE:机器人自己搞科研,不用人类熬夜调参了?
统计 阅读时间大约8分钟(2994字)

2026-08-17 英伟达推出ENPIRE:机器人自己搞科研,不用人类熬夜调参了?

来源:机器人产业应用
如何让AI像研究员一样做机器人研究

出品:机器人产业应用

2026年6月中旬,英伟达GEAR实验室联合CMU和UC Berkeley,在arXiv发布论文《ENPIRE: Agentic Robot Policy Self-Improvement in the Real World》(真实环境下具备自主智能的机器人策略自优化)。次日,实验室负责人Jim Fan在LinkedIn正式宣布该项目。

数据令人震撼:在PushT(自研推 T 字块任务)、插针整理、扎带穿扎与剪切、GPU插拔四项真实世界灵巧操作任务中,ENPIRE均达到99%成功率;8机并行将插针任务迭代时间从1.5小时压缩至40分钟;Push-T任务中,8个Agent团队2小时达99%成功率,而单Agent需近5小时。

但ENPIRE的真正意义,远不止于"机器人学会了装显卡"。

它不是让AI写代码控制机器人完成任务——那是上一代技术已能做到的事。ENPIRE做的事情是:让AI像研究员一样做机器人研究——自主研读论文、提出假设、修改代码、真机验证、分析失败、总结经验,不满意则换个思路重新来过。这也是机器人研发从"手工作坊"迈向"自动化流水线"的范式级变革。

b1136f313bc5f66cb90a06e3d338ea31.jpg

关键点速览

技术解构:ENPIRE如何重塑“研究”本身

效率革命:精准打击三大行业痛点

范式重构:从“人才竞赛”到“基础设施竞赛”

冷静审视:ENPIRE的能力边界与潜在风险

未来预判:具身智能的“CI/CD”时代

01

技术解构:ENPIRE如何重塑“研究”本身

(一)Harness Framework:把混乱的物理世界包装成可迭代的“软件环境”

理解ENPIRE的颠覆性,首先要理解一个根本性的难题:物理世界没有强化学习仿真环境标准接口。

在仿真环境里,一次实验失败后,研究员只需要敲一行代码就能重置场景。但真实世界完全不同——实验失败后,物体会歪掉,场景会乱掉,机器人甚至可能把东西碰飞。如果每轮实验都要靠研究员手动复位、记录结果、整理数据,那么Agent根本不可能24小时连续做研究。

ENPIRE的核心贡献,正是解决了这个“物理实验难以自动化”的痛点。论文中将这一框架称为 Harness Framework——它为Coding Agent配齐了一整套做物理实验所需的基础设施。

这套基础设施由四个核心模块构成,恰好对应ENPIRE这个名称:

微信图片_20260817165029_1687_6.png

四个模块串联成完整闭环:提出想法→训练策略→真机测试→自动评分→总结经验→再提出新想法。整个过程不需要人工值守。

e1073cad357bdf3548c0927a8f7874bb.png

其中最关键的一环是环境模块。ENPIRE的一个关键观察是:对许多机器人任务而言,重置环境往往比完成任务本身更容易。因此,ENPIRE的做法是先让Agent通过Code-as-Policy构建自动重置环境。以GPU插拔任务为例,机器人需要先把GPU从主板上拔出来、移动到指定位置释放、再退回初始状态,整个过程涉及复杂的力控操作。自动评分同样需要Agent自行设计——扎带穿扎任务中,Agent甚至为此设计了一套双摄像头视觉检测方案。

(二)Idea Tree:当AI拥有了“研究思路”

ENPIRE的Agent不是暴力搜索,而是真正在“做研究”。

研究团队在实验中分别测试了三类主流AI编程Agent:基于OpenAI Codex与GPT-5.5的Agent、基于Anthropic Claude Code Opus 4.7的Agent,以及基于月之暗面Kimi Code K2.6的Agent。

在最具代表性的插针任务中,Agent仅用了3小时就将成功率从0一路拉到99%。论文公开了Agent的完整研究思路演化过程——从行为克隆开始,效果一般;加入在线强化学习数据后性能提升;再增加正则化项,成功率出现跃升;随后调整Batch Size、补偿控制器延迟,进一步推向100%。整个过程像人类研究员一样,一步一步往上试。

在扎带任务中,Agent的表现更加令人印象深刻。面对操作链过长的困境——找剪刀→抓剪刀→找扎带→对准→剪切——端到端训练效果不佳。Agent主动切换路线:先用VLA(视觉-语言-行动)模型完成粗定位,再调用工具API执行精细操作。某种程度上,它自己完成了一次系统架构设计。

这种根据任务特性动态调整研究路线的能力,已经模糊了自动研究与人类科研的界限。

7162dc8e04a73ae451516ce33d12f83e.png

(三)核心跃迁:“文本化经验迁移”vs传统迁移

ENPIRE最具颠覆性的创新,是“文本化研究经验”的跨任务迁移。

传统迁移学习依赖模型权重的共享(参数迁移)或预训练架构的复用(模型迁移)——本质上是“数据资产”的传递。而ENPIRE的Agent将插针任务中积累的环境复位技巧和视觉检测方案整理成文字总结后,直接应用于GPU插拔任务。

936e06d0b6b44ff22202ec4472a3b2f3.png

这种不依赖模型权重或训练数据的经验传承方式,与人类实验室的“传帮带”模式异曲同工。Agent学会的不是某个具体任务的解法,而是“如何做研究”的方法论。ENPIRE开创了具身智能经验传承的新范式,标志着具身智能研究开始具备可扩展性。

02

效率革命:精准打击三大行业痛点

(一)三大痛点的精准打击

ENPIRE带来的效率提升,精准击中了当前机器人研发的三个核心瓶颈:

1216669fba1349acf1419dc11459bceb.png

在插针与整理任务上,AI驱动的训练方案甚至比由人类参与的“前沿人类参与式方法”更快达到近乎100%的成功率。

研究团队为此提出了两个新指标来量化资源效率:平均机器人利用率(MRU) 和平均Token利用率(MTU)。随着Agent数量增加,Token消耗呈指数级增长——“没日没夜的烧Token”成为真实写照。

9aa3ddd8e86e5f8d48e8b30b58166c20.png

(二)厘清定位:ENPIRE与现有工具的互补关系

ENPIRE并非要取代仿真训练和自动化测试,而是与它们形成互补:

0215c1f8f45d5411b3d5a6948d5736c8.png

三者组合,形成了一条完整的研发流水线:仿真密集探索→自动化测试筛选→ENPIRE真机自主验证与迭代。

03

范式重构:从“人才竞赛”到“基础设施竞赛”

(一)研发组织架构的重构

ENPIRE模式对机器人企业的研发组织架构将产生深远影响:

a4685f05c4c7d527eccd0d48c52e6ae3.png

机器人研究正在变成一种环境设计工作——即为Coding Agent搭建可以在其中进行自动化研究的环境。

(二)人才需求的剧变

如果ENPIRE模式普及,行业对“手调参数型”算法工程师的需求将下降,而对能够设计自动化研究框架的系统架构师的需求将上升。

这不是消灭算法工程师,而是让算法工程师从重复劳动中解放出来,去解决更高层次的问题——如何定义任务目标、如何设计自动复位方案、如何构建有效的经验迁移机制。算法工作上移到了更高一层,转向构建Agent能够自行闭合的反馈循环。

(三)中小企业的历史性机遇与现实门槛

ENPIRE项目计划完全开源,Jim Fan表示“任何人都可以在家里搭建自己的自运行机器人实验室”。

这对中小企业意味着:软件层的“经验壁垒”正在被打破。传统上,头部企业凭借人才储备和经验积累构建的竞争壁垒,在ENPIRE模式下可能被大幅削弱。中小企业无需从零组建顶尖算法团队,也能拥有24小时不间断自主迭代的研发能力。

但现实门槛同样不容忽视。每个实验单元配备两条6自由度YAM机械臂、一台Intel RealSense深度摄像头,以及一台搭载单块NVIDIA RTX 5090显卡(32GB显存)的工作站。8台机器人的硬件成本、GPU算力和Token预算,对初创企业仍是沉重负担。

ef7a09407333a37d6cfac289125e1904.jpg

不过,软件带来的“追赶窗口”已经打开。行业竞争正从“谁有人”转向“谁先用好工具”。

04

冷静审视:ENPIRE的能力边界与潜在风险

(一)当前能力的“天花板”

ENPIRE的突破令人振奋,但冷静审视其能力边界同样必要。

首先,场景限制明显。 当前平台多适用于结构化桌面操作——PushT、插针、GPU插拔、扎带剪切都是高度结构化的任务,环境相对可控。在更开放、更非结构化的场景中(如户外作业、家庭服务),自动复位和自动验证的难度将指数级上升。

其次,创新边界清晰。 Agent的“研究”本质上仍是在预设算法空间内搜索最优组合——它可以尝试行为克隆、强化学习、启发式规则的不同组合,但不太可能“发明”一种全新的学习范式。系统仍需人工预设验证逻辑,人类科研人员在“定义什么是有价值的问题”这一层面仍不可替代。

(二)“研究经验”的错误传导与认知固化风险

ENPIRE的“文本化经验迁移”机制虽然强大,但也带来了新的风险:

0846aa5963f52a713772d989043691f2.png

7ee92c65f89141f9043764c51212bee5.png

现有的校验机制是多Agent竞争——通过Git共享代码、放弃不理想的想法、自主挑选彼此的最佳运行结果——提供了一定的纠偏能力。但系统化的经验追溯、版本回滚、异常隔离框架仍是空白。

05

未来预判:具身智能的“CI/CD”时代

从AutoML到物理世界的AutoResearch,AI正在从“自动化调参”走向“自动化科研”。

ENPIRE让物理世界第一次拥有了可迭代性。它把机器人研发从“写完上线、出bug崩溃”的瀑布模式,推向“持续集成、持续部署”(CI/CD)的敏捷模式。

如果ENPIRE成为行业基础设施,机器人技术的迭代速度将从“年”为单位缩短到“月”甚至“周”。传统研发节奏受限于“研究员工作时间”——每天8小时、每周5天。ENPIRE实现的是24/7不间断迭代。单任务迭代周期从1.5小时压缩到40分钟,不仅是60%的压缩,更意味着“并行化”成为常态——8台机器人可以同时探索8条不同的技术路线。

具身智能的核心竞争正在从“人才密度”转向 “基础设施质量” ——谁的自动化研究框架更完善、谁的物理实验平台更高效、谁的经验迁移机制更聪明。

Jim Fan在LinkedIn上写道:“GEAR实验室的一部分现在已经在彻夜自我改进了。我们只需要早上来读报告。”他半开玩笑地描述了终极愿景:“大家都去度假,黄仁勋都不会发现。”

这并非玩笑,而是对“研发不再受限于人类工作时间”这一严肃命题的概括。ENPIRE目前能覆盖的任务有限、成本高昂、仍需人工预设框架。但方向已经清晰:机器人研发正在告别“人工调参时代”,迈入AI驱动的物理世界自主科研阶段。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×