阅读时间大约6分钟(2355字)
出品:机器人产业应用
前言
2026年6月底,北京首钢园。当图灵奖得主、“强化学习之父”理查德·萨顿按下启动光柱的那一刻,全球首个“机器人幼儿园”正式揭牌落地,
这不是一个比喻意义上的“幼儿园”,这是一个由萨顿和他山科技共建的具身智能强化学习实体试验场。拥有4000平方米的真实物理空间,没有示教器,没有预设脚本,只有供机器人自由穿梭、主动触碰、自主试错的安全环境。
萨顿在现场援引了艾伦·图灵1950年的经典洞见:“与其开发一个类似人类一样思考的程序来模拟成年人的思维,不如尝试开发一个模拟儿童思维的程序,让他不断地成长,学会思考。”
这句话,几乎概括了萨顿过去四十年学术生涯的核心信念,也精准定义了这座“机器人幼儿园”的全部意义。
01
从“人类数据时代”到“经验时代”
要理解机器人幼儿园为什么重要,先得理解萨顿一直在反对什么。2019年,萨顿发表了那篇后来被AI领域奉为经典的《The Bitter Lesson》。他尖锐地指出,AI研究在过去70年的一大教训,是过于重视人类既有经验和知识,而忽视了让系统自身通过试错和计算去探索。

2025年4月,萨顿与DeepMind强化学习副总裁David Silver联合发表了论文《Welcome to the Era of Experience》。文章将AI发展划分为三个阶段:模拟时代、人类数据时代,以及正在兴起的经验时代。
在萨顿看来,当前绝大多数AI系统仍停留在“人类数据时代”——依赖人类已有的知识和标签进行训练,缺乏持续学习与创造新知识的能力。但人类数据红利正逼近极限。“我们逐渐达到人类数据的极限,现有的方法不能生成新的知识,不适合持续学习。”萨顿说。
那怎么办?答案是:让智能体以第一人称视角与世界直接交互,生成一种被称为“经验”的新数据源。这正是人类和其他动物的学习方式——通过与认知水平相匹配的自我体验获取发展所需的数据。
机器人幼儿园,就是这套理论在具身智能领域的第一个实体落地项目。
02
模仿学习vs强化学习:复刻动作vs理解因果
当前具身智能行业的主流训练路径是什么?模仿学习。简单说,就是让人类演示一遍动作,机器人照着学。这像什么呢?他山科技CEO马扬曾这样说:“就像在套用题库。”
模仿学习有三个致命缺陷:
第一,能力上限被锁死。以人类行为数据训练机器人,其能力上限受限于人类自身水平。机器人永远无法超越它的老师。
第二,很难学到因果。人类示范的“拿杯子”动作,不包含“为什么此时拿”“若杯子是烫的怎么办”“如果用户正打电话是否应等待”等因果链。机器人学会的是动作映射,而非情境推理。
第三,无法动态适应。模型训练完成即定型,环境一变就失灵。萨顿的判断更直接:传统从人类示例中训练出的机器人行为 “不够强大” 。

强化学习走的则是另一条路。AlphaGo的进化是最好的例子——早期通过学习棋谱(模仿学习),后来只输入围棋规则,通过自我对弈不断试错,最终下出了人类从未见过的“第37手”,战胜了人类冠军。模仿学习只能复刻动作,强化学习才能形成真正的物理因果认知。
萨顿对此有一段极为精彩的表述:“没有体验,谁能说什么是正确的做法?但如果你有经验,你会对将来发生的事有一些信念。”经验不是数据堆砌,而是通过反馈校正预期偏差的过程。机器人幼儿园的核心逻辑正是如此:不预设具体技能,只提供基础规则,让机器人通过大量试错自主演化。
03
为什么是触觉?视觉不够用
机器人幼儿园另一个关键创新,是以触觉感知为核心突破口。
萨顿的强化学习框架需要系统在行动中获得即时反馈。触觉传感器能够实时反馈接触点的三维力分布、物体的局部形变以及滑移趋势。有了这些信息,机器人才能迅速调整力量、角度,决定收紧还是放松。
更重要的是,触觉是机器人与物理世界发生真实接触的重要通道。碰撞前的预警、抓握时的力度反馈——这些高频信号是奖励函数得以运作的现实基础。
纯视觉无法单独支撑真机强化学习,因为视觉数据是“第三人称”的——机器人看到的是别人做了什么,而不是自己“摸”到了什么。只有触觉才能提供第一人称的物理经验。
04
安全试错:四大核心条件
强化学习在理论上很美好,为什么过去几十年很少在真机上大规模应用?答案很简单:试错成本太高了。在学会抓取前,机器人的减速器可能已经报废。随机的探索动作随时可能导致机器人伤人或自残。极低的采样效率让一个简单任务需要耗费数周实验时间。
这就像让一个婴儿在满是尖角的房间里学走路——还没学会,已经遍体鳞伤。机器人幼儿园要解决的核心问题,就是让“试错”变得安全、可持续。
要让“试错”成为可行路径,项目需要在物理安全、真实环境交互和实时反馈等方面满足一定的技术条件。

在机器人幼儿园中,他山科技提供了触觉预警与微秒级动态感知方案,用于在碰撞发生前提前响应;机器人被置于真实的物理空间内反复尝试、失败和修正,而不局限于仿真模拟器;同时,触觉传感器以高频方式提供接触力的实时反馈,为强化学习的奖励函数构建第一人称的物理交互依据。
萨顿在现场谈到,过去这条路径之所以未能广泛实践,主要受限于硬件本身的脆弱性——传感器灵敏度有限、抗冲击能力不足。近年来,随着相关硬件技术的成熟和成本下降,机器人通过实时试错实现持续学习的设想才具备了落地的技术基础。
05
五年长跑:挑战与野望
机器人幼儿园的规划是五年合作周期,目标是找到最适合具身智能的学习方法论。五年,在AI行业以“月”为单位的迭代节奏里,显得格外漫长。萨顿本人也坦言,这种“婴儿般的成长”需要极大的时间与坚持。这与当前行业急功近利的节奏形成了鲜明对比。
但萨顿的立场极为坚定。他在现场说了一句看似矛盾却充满力量的话: “具身智能不需要老师,也不需要训练,需要的是自己主动地在环境中进行探索、学习。”
“不需要训练”——因为真正的学习发生在探索之中,而非课堂之上。
机器人幼儿园的揭牌,不仅仅是一个项目的启动。它标志着具身智能行业正在经历一次根本性的路线分流。
一条路是“数据驱动的模仿路线”——依赖海量人类标注数据,让机器人复刻人类动作。这是当前的主流。
另一条路是“经验驱动的强化学习路线”——让机器人在真实物理环境中自主试错、积累第一人称经验、形成物理因果认知。这是萨顿押注的未来。
两条路线并非完全对立,目前的训练路径是“冷启动”:先用模仿学习加仿真训练提供大量数据,建立初步能力,再进入真实环境通过强化学习持续进化。
但底层逻辑已经不同了。
模仿学习的终点是“像人一样做”——能力上限是人类。强化学习的终点是“理解物理世界为什么是这样”——可能超越人类。
萨顿在启幕大会上说的最后一句话,或许是对整件事最好的总结:“让他不断地成长,学会思考。”
这所没有围墙的幼儿园,正在孵化一种全新的智能形态——不是被教出来的,是自己长出来的。
