让人形机器人荡单杠,比让它跑步难多了...但是ETH做到了!
统计 阅读时间大约6分钟(2317字)

1天前 让人形机器人荡单杠,比让它跑步难多了...但是ETH做到了!

来源:豆包
作者:Yuanxq   出品:具身智能研究室项目链接:https://nemantor.github.io/sparse-3d-t...

作者:Yuanxq     出品:具身智能研究室

项目链接:https://nemantor.github.io/sparse-3d-traversal-website/

苏黎世联邦理工团队让众擎 PM-01 完成了一套连续动作:从地面起跳,挂上横杆,交替换杆向前荡行,再脱杆落地。机器人根据头部激光雷达的观测控制动作,在三种横杆配置上进行了 15 次实机测试,成功 14 次,最高荡行速度达到 0.5 m/s。

cc3c259ea0cced03d23d43ee7b7c6b97.png

横杆对感知和控制的要求都很苛刻。训练中的杆半径为 1—3 cm,雷达扫描只能获得少量、间断的回波;起跳和摆动又不断改变观测角度。挂接时,末端位置、相对速度和接触时刻必须匹配。进入悬挂阶段后,上肢承担身体重量,换杆与落地还伴随着支撑关系和动量的变化。

论文采用教师—学生训练,将起跳、荡行和下跳三个教师蒸馏为一条感知控制策略。作者同时改造了末端挂钩,并根据真机上的电压下降、执行器发热和雷达边缘噪声调整仿真。这些细节直接关系到动作能否执行:起跳曾因负载过高导致欠压掉电,连续悬挂则要求肩肘承受持续负荷。

这项工作的价值在于把上肢支撑和双足起落连成了一套可执行的运动流程。它为人形机器人利用横杆等环境结构移动提供了实机经验,也给高动态控制的仿真建模提出了具体要求。随着动作接近硬件极限,供电和传感器误差会进入控制问题本身,需要与策略训练一起处理。

方法

PM-01 的手部被替换成水刀切割的不锈钢挂钩。挂钩开口可容纳直径 60 mm 的圆,为挂接误差留出余量。脱杆时,腕部偏航关节将挂钩转出横杆平面,省去抬升身体以释放接触的额外负荷。对称形状支持前后两个方向的运动,也便于用简单碰撞体模拟。

头部的 RoboSense E1R 固态激光雷达提供横杆和周围环境的观测。作者选择固态扫描,是为了减少快速全身运动中的扫描畸变。其视场为 120°×90°,原始扫描按 192×144 的网格排列,策略读取其中经过降采样和裁剪的部分。

9c65a0946a67cf346f5ec0191bb839f2.png

动作训练在 IsaacLab 中进行。作者先用 PPO分别训练起跳、荡行和下跳三个教师。教师能直接读取横杆端点坐标,以及接触状态、机体速度、电池和热负荷等仿真信息。在这一阶段,横杆位置已经给定,强化学习主要负责探索怎样建立接触、转移支撑和完成落地。

三个阶段的奖励各有侧重。起跳奖励手与躯干接近横杆、挂接后承载并保持悬挂;荡行奖励身体与末端向目标推进,同时惩罚停滞;下跳奖励释放后的下降控制、足底接触和最终站稳。关节位置、速度、力矩、接触滑动及碰撞约束贯穿整个训练。横杆高度和间距随课程逐渐增加,摩擦、质量、执行器参数和外部扰动也参与随机化。

三个教师的行为随后被蒸馏到同一个学生网络。学生接收雷达、本体感知和任务命令,其中本体感知包括关节位置、速度、IMU 信息和历史动作,命令包含平面目标及下跳触发量。荡行任务使用 36 行、35 列的雷达网格,每个位置保留回波的三维坐标和距离。

雷达首先经过由 AME-2 适配而来的注意力编码器。编码器聚合与任务有关的局部和全局特征,再由 GRU 与本体状态、任务命令共同形成循环隐藏状态。这样,当前扫描中的缺失信息可以结合此前观测处理。动作头读取隐藏状态,输出 23 个关节目标位置,由 PD 控制器跟踪。雷达更新频率为 10 Hz,策略运行频率为 50 Hz。

训练还加入了最近横杆中心线的预测,监督内容是横杆的相对位置和方向。这个辅助头与动作头共享 GRU 隐藏状态,给感知网络提供直接的几何学习信号。动作头直接根据隐藏状态生成关节目标。实机系统另外使用激光惯性里程计估计位姿,目标位置在里程计坐标系中给定。

17371b63937983a21047ab7cb03639f1.png

蒸馏时,阶段调度器根据动作进度选择教师,提供对应的动作和奖励。学生先通过 DAgger式行为克隆学习教师动作,循环网络采用截断反向传播训练。接着,价值网络拟合回报目标,动作网络继续进行行为克隆。待价值估计具备基础后,再进入 PPO 优化,逐渐降低模仿约束。

后续 PPO 训练让学生在实际接收的观测条件下调整行为。教师提供的动作依赖完整几何信息,学生要根据有噪声的雷达和观测历史完成同一任务,需要一定的优化空间。由于三个阶段的奖励尺度不同,作者分别标准化优势,并根据回报方差调整价值损失权重,避免某个阶段主导共享网络的更新。

真机迁移中,电池压降是一个明确的故障来源。各关节共用电池,全身同时发力会拉低供电电压,改变电机可用输出。作者根据关节总负荷模拟电压变化,再调整电机的堵转力矩和空载转速,并惩罚低电压状态。模型参数用真实起跳日志校准。论文报告,加入压降惩罚后,实机测试中未再发生此前出现的欠压掉电。

悬挂和连续摆动带来的负荷则用热积分状态处理:大力矩持续时间越长,热代理量累积越多,并随时间逐渐恢复。该状态供教师和价值网络使用,同时进入奖励。这使训练能够考虑肩肘持续输出的代价,其物理含义是负荷积累的近似。

雷达噪声需要结合横杆几何建模。真实光束具有一定宽度,在细杆边缘可能同时覆盖横杆与背景,产生混合距离或回波缺失。训练因此加入光束方向扰动、距离噪声、边缘丢点、前景与背景混合,以及安装误差和观测冻结。用于验证的 MuJoCo 模型则在每个扫描位置发射 16 条子射线,更细致地近似光束覆盖范围。、7fbc070133020f0d54a427904d7ffa88.png

实验

实机测试使用三组横杆,结果如下。

09f950906e5e831aba7d7504cd846d3f.png

唯一一次失败出现在起跳成功后,挂钩未能继续前进到下一根杆。测试中也包含受力后会移动的支撑结构。三组横杆的高度和间距均位于训练随机化范围内,因此这组结果反映的是当前挂钩平台在不同横杆配置上的迁移表现。15 次测试中有 9 次集中在配置 A,另外两组的样本仍较少。

MuJoCo 测试将横杆高度从 1.65 m 调整到 1.90 m,间距固定为 0.35 m,每种高度测试 10 次。完整流程成功率为 70%—90%,失败主要发生在起跳阶段。进入荡行后的完成情况较稳定,首根横杆的接触建立是这组测试中最明显的瓶颈。

作者还用同样的感知架构单独训练了低身避障策略。机器人在 10 次实机测试中均通过了随机摆放的细木条,木条截面为 2×2 cm。这项实验展示了架构经过重新训练后,在另一类细结构任务中的使用效果。

编码器消融比较了学生初始蒸馏后的行为克隆误差。注意力编码器约有 1.38 万参数,CNN 约有 10.67 万,MLP 约有 131 万;注意力编码器的动作模仿误差最低,加入中心线辅助监督后进一步下降。参数量统计针对感知编码器。

这组消融主要说明编码器的参数效率与动作拟合效果。接触任务的成败还取决于少数关键时刻的位置和速度误差,最终任务成功率需要另外评估。论文没有给出不同编码器、循环记忆和训练阶段对应的完整流程成功率,也缺少电压、热负荷和雷达噪声模型的系统对照,各部分对实机表现的贡献仍有待进一步分离。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×