阅读时间大约10分钟以上(10033字)
作者:Yuanxq 出品:具身智能研究室
让人形机器人走到桌前,弯腰拿起一个箱子,再把它搬到另一处,需要多少种能力?
它先要理解目标和路线,判断身体能否通过,再找到合适的站位,建立抓握,并在箱子离地后维持平衡。一次完整任务,把数据、预测、感知、控制和接触串在了一起。任何一处衔接出现偏差,都可能让前面的准备失效。
围绕这个问题,文章以人形机器人的任务能力为主线,也纳入通用操作、四足移动操作等研究,借助它们讨论可迁移的数据、学习与控制方法。
阅读顺序沿着六个问题展开:让数据可用,理解动作后果,感知接入控制,身体接触环境,调动整个身体,走向连续任务。每篇配有对应的方法框架图,可以顺着输入、模块和输出,理解它在系统中的作用。
让数据可用
机器人学习首先遇到的是经验如何表达的问题。人类视频记录外观变化,动捕保存身体姿态,机器人日志给出关节和控制命令。三者需要建立明确的对应关系,才能共同用于训练。
这一章从身体几何开始,逐步扩展到场景、共享动作空间、生成数据和模型表征。
UMR
项目:https://github.com/hanyang9/UMR
UMR把人体与机器人的表面对应纳入动作重定向。
沿着GMR等方法的稀疏身体部位匹配继续向前,它先在标准姿态下学习两种身体表面的点云对应,再根据人体运动求解机器人根姿态和关节参考。
表面信息让手掌朝向、前臂扭转、脚底贴合等细节进入优化。以抱球为例,手掌到达球附近之后,还需要让掌面贴近合适的位置。几何关系越完整,下游控制器获得的参考就越有用。

UMR|左侧学习标准姿态下的表面点对应,右侧利用对应关系与接触约束求解机器人动作。
UMR提供了保留接触几何的运动学参考。实际执行还需要可靠的网格与标准姿态对齐,并由控制器继续处理摩擦、负载和接触力。
EgoHTR
项目:https://egohtr.github.io/
身体对应建立之后,还要知道动作发生在哪里。人走过石墩时的一次抬脚、踏上窄梁时的一次侧移,都与地形位置有关。单独保存姿态,会丢掉这些动作选择的依据。
EgoHTR把动捕、第一视角观测和三维场景扫描对齐,保存复杂地形中的4D示范。
由此得到的人体轨迹与场景几何,可以一起进入机器人重定向和训练。

EgoHTR|从多传感器采集出发,完成人体参数化、时间对齐与空间对齐,再衔接机器人重定向。
论文对参考位置的扰动表明,石墩和窄梁任务对厘米级偏差已经相当敏感。数据质量因此取决于人体与场景能否精确对齐。当前机器人验证采用逐片段训练的专家策略,展示了这套采集与重建流程的执行价值。
UCAG-P
项目:https://public-bots.github.io/UCAG-P
当数据来自多种机器人,接下来要统一的是动作的含义。单臂、双臂、人形和人手的关节结构各异,却可能描述相近的拿取意图。
UCAG-P用手腕或末端执行器、抓取中心两类锚点,建立相机坐标系中的共享操作几何。
模型先预测锚点运动,再由结合本体状态与运动学的翻译器生成机器人命令。

UCAG-P|异构示范先进入共享的相机中心运动空间,再经几何条件翻译器转换为各本体动作。
这一分层让共享学习保留共同的操作意图,也为具体身体留下执行接口。相机中心表示已有前序探索,UCAG-P进一步引入双锚点、人手数据和几何条件翻译。其单一模型覆盖多个已参与训练的基准,结果体现了联合学习的覆盖能力。
AnyWorld
项目:https://xpeng-robotics.github.io/anyworld/
前面三篇在改善已有数据的表达,AnyWorld进一步讨论经验怎样扩充。
它保留人类操作中的运动结构,改变执行者、观察视角或场景,生成目标机器人域的训练样本。
方法分别控制动作、相机和本体/场景条件,并通过动作校准,建立视觉、语言与动作之间的对应。这样可以围绕已有交互,生成更多目标机器人可能遇到的观察。

AnyWorld|动作视频、相机控制和本体条件共同驱动生成;训练经过人类视频预训练与人机混合微调。
生成样本的训练价值,来自视觉内容与可执行动作的一致性。
目标机器人数据、首帧编辑和动作迁移都参与这条流程。论文展示了下游策略收益,真机量化验证仍集中在有限任务和样本规模内。
VLAct
项目:https://starvla.github.io/VLAct/
数据整理和扩充之后,还要考虑模型从中学到了怎样的表示。
VLAct关注持续预训练中的表征质量,让有限机器人数据形成更容易迁移的视觉—动作能力。
它冻结视觉编码器和部分语言模型浅层,混入图像描述数据以保留原有先验;同时让OFT、PI和GR00T三个动作头监督同一主干,降低表征对单一解码方式的依赖。下游再重新初始化动作头,结合任务数据微调。

VLAct|持续预训练保护视觉语言先验,以多个动作头共同监督共享主干,再用新的动作头适配下游任务。
这与UCAG-P从动作几何建立共享接口形成补充:接口决定数据怎样表达,预训练配方影响模型怎样吸收。论文在仿真基准、Franka实机及持续预训练未见的本体上进行评测,跨本体结果仍经过下游微调;更大模型和更广泛身体的适用性还需验证。
这五篇逐步补齐了数据中的几种关系:身体怎样对应,动作发生在哪里,不同命令共享什么含义,经验怎样扩展,以及模型怎样学到可迁移的表示。接下来,模型还需要理解这些动作会带来什么变化。
理解动作后果
搬箱子时,机器人需要结合此前的执行进度,决定下一步怎样伸手;也需要预判这次动作能否建立抓握。历史与未来共同影响当前决策。
这一章先看动作条件预测及其用途,再看预测怎样与策略结合,最后回到执行历史。比较时抓住两个问题即可:模型输出什么,这个输出怎样影响下一步动作?
WALL-SS
项目:https://x2robot.com/pages/ss
WALL-SS学习动作条件下的长时视觉预测。
相同的初始场景中,夹爪向左或向右移动,应当产生相应的不同后果;一次抓取失败,也应当延续为后续预测中的失败状态。
它对齐末端轨迹与多视角画面,通过下一尺度自回归生成未来片段,再以固定预算的时间—尺度记忆保留历史。训练中加入带误差的生成历史,帮助模型适应长时间递归推演。

WALL-SS|动作条件进入逐尺度视觉生成,时间—尺度记忆支持连续推演,并通过策略对齐改善预测。
论文将不同水平的策略分别放进真实机器人与生成环境,比较成功率和排序,报告约0.93的相关系数。这项评估对应一个控制需求:预测应当反映动作质量的差异。精细插入和接触失败仍是检验预测可靠性的难点。
Pelican-Sim 1.0
项目:https://zoushilong1024.github.io/Pelican-Sim1.0/
动作条件预测还需要覆盖不同身体和场景。
Pelican-Sim 1.0同时使用关节等数值动作,以及通过机器人模型与相机标定生成的骨架动作视频,把控制量和像素空间的运动联系起来。
两条条件分支交错注入视频模型,稀疏专家结构学习异构经验。随后通过因果适配和少步蒸馏提高生成效率,使模型能够用于数据扩充、策略评估和候选动作比较。

Pelican-Sim 1.0|数值动作与相机对齐的骨架动作视频通过两条分支进入视频模型,稀疏专家模块处理异构数据。
它与WALL-SS共同将视觉预测向机器人学习的实际用途推进。论文在RoboTwin中展示了生成数据带来的策略收益,动作选择实验的10候选决策约需15.9秒。相关结果需要连同仿真任务、评估器适配和推理开销理解,尚未构成真机实时闭环控制的验证。
Riemann-1.0
项目:https://riemann-dynamics.github.io/Riemann-1.0-Website
沿着动作与视觉未来的关系继续向前,
Riemann-1.0把动作生成也放进同一条因果序列:先根据历史输出当前动作,再根据动作预测后续视觉状态。
部署为策略时,机器人执行动作,真实相机与本体观测返回历史;作为视觉模拟器时,后续画面由模型生成。两种模式采用相近的历史组织方式,并保留不同本体的动作与状态接口。

Riemann-1.0|视觉状态与动作按因果顺序进入统一序列,共享主干连接视觉预测与本体专属的动作输出。
训练从人类视频中的潜在动作出发,逐步加入手部轨迹、UMI和机器人数据,将经验转向可执行控制。策略成功率与视觉模拟质量对应两类能力,需要分别验证;前者的提高并不能单独证明接触预测已经准确。
GE-Act 2.0
项目:https://ge-act-v2.github.io/
GE-Act 2.0采用模块化的连接方式:
视觉规划器生成未来状态,逆动力学模型结合当前观测与本体状态,将视觉变化转换为动作。
这种分工允许规划器利用指令—视频数据,控制模块利用观测—动作数据,再通过联合训练建立配合。它也带来一个具体问题:同样是抓杯子,预测可能选择从左侧接近,而监督动作来自右侧,两者需要先在行为上匹配。

GE-Act 2.0|当前观测编码后进入视觉规划器,预测的未来视觉状态再由逆动力学模型解码为动作块。
KASO在训练时筛选与监督动作兼容的候选未来,减少模块之间的冲突。部署时则沿着“预测未来—解码动作—重新观察”运行。两阶段结构能否有效,取决于未来表示是否提供了控制所需的信息。
TemporalFlow-VLA
论文:https://arxiv.org/abs/2608.26821
未来预测要有可靠的当前状态作起点,而当前状态的含义常常藏在历史中。夹爪停在杯子旁边,可能是准备抓取、刚刚失败,也可能已完成放置。相似画面对应不同的后续动作。
TemporalFlow-VLA用两个时间查询压缩不同跨度的执行历史,并通过机器人表面时间流提供训练监督。
时间流由记录的机器人状态、几何和相机标定计算,使历史表示与身体此前怎样运动联系起来。

TemporalFlow-VLA|上方几何分支生成训练用时间流,时序查询压缩历史观测,再把执行信息交给动作模块。
这项工作位于历史表示环节,部署时使用学到的查询表达,无需再运行几何监督分支。它与前面几篇形成互补视角:预测未来需要动作条件,选择动作也需要知道之前发生了什么。
数据由此可以支撑动作生成、未来预测和进度判断。要把这些能力用于真实执行,还需要可靠的当前状态,以及对外部环境和接触变化的持续感知。
感知接入控制
参考动作提供目标,传感器帮助机器人判断当前能否实现这个目标。脚下支撑是否可靠,前方地形怎样变化,手指有没有建立接触,都可能改变下一步决策。
接下来的六篇从状态估计出发,依次讨论误差积累、地形适应、记忆、视觉反馈和触觉,让感知信息进入控制过程。
FOCUS
论文:https://arxiv.org/abs/2609.02222
控制器首先需要知道身体怎样运动。脚碰到地面时,打滑、滚动接触和关节误差仍可能让足部运动学给出不可靠的速度约束。
FOCUS为左右脚预测连续的观测可靠性,再用它调节本体里程计。
因果Transformer读取IMU与下肢关节历史,输出权重;滤波器据此融合足部运动学速度与IMU预测,并调整相关观测噪声。仿真训练通过速度一致性学习权重,无需人工标注连续可靠性。

FOCUS|历史本体观测输入因果Transformer,输出双脚的连续可靠性,进一步调节速度融合与滤波噪声。
五台A3 Ultra上的步行和动态动作测试支持了这种加权方法。激光与动捕轨迹用于离线评估,运行时模型读取本体传感器。它补上的是感知与控制之前的状态估计环节,跨不同运动学结构的迁移仍需另行验证。
SOLO
项目:https://sunpihai-up.github.io/solo/
在状态估计之外,
SOLO处理长时间行走中的感知与控制误差积累。
一次落脚偏差会改变身体姿态和相机视角,继而影响下一次地形估计,感知与控制之间的相互影响会随着连续运行扩大。
它使用位置专属查询重建局部高度图,保留楼梯和踏脚石的边界;同时将下一状态的教师—学生动作分歧纳入奖励,让当前动作也受到后续控制难度的约束。

SOLO|查询重建器从深度与本体历史估计地形,教师—学生训练结合后续状态的动作分歧;部署保留重建器与学生策略。
这将地形重建精度与蒸馏的时间关系联系起来。论文在天工平台展示连续1.5公里户外路线,为方法在长距离执行中的稳定性提供了验证。
PGMT
项目:https://luyili.github.io/pgmt/
对于更多日常地形,控制器要在跟踪意图和调整身体之间分配自由度。上半身可以继续完成参考动作,下肢则需要根据楼梯、坡面和箱体改变落脚。
PGMT结合运动意图选择局部地形信息,并为部分下肢跟踪误差设置容差。
多头价值网络分别估计不同目标的回报,让跟踪、接触和稳定性共同参与训练。

PGMT|先学习运动跟踪,再注入感知;运动意图指导地形局部信息的选择,多头价值网络支持多目标训练。
地形训练本身已带来较强收益,额外高度信息进一步帮助困难地形和精细跟踪。结果对应了数据分布、奖励和感知的共同作用,也给出了一个实用方向:为环境适应留出合理的动作调整空间。
WM-LOCO
论文:https://arxiv.org/abs/2609.02542
允许调整动作之后,策略仍需估计眼前无法完整看到的状态。机器人跨过沟隙时,当前深度图只覆盖局部区域,之前的观察与动作可以补充判断。
WM-LOCO将循环状态空间模型接入视觉运动策略。
模型根据历史状态、动作和当前观测更新内部状态,再把记忆特征交给策略;重建、奖励预测和状态一致性等目标共同训练这段记忆。

WM-LOCO|策略分支负责动作,循环世界模型分支学习动态状态;记忆特征进入控制,多个预测目标提供辅助训练。
世界模型在这里承担状态形成的工作,部署时直接输出特征。论文在沟隙和石墩等落脚区域受限的地形上验证了完整设计的收益。记忆具体保存了哪些退出视野的信息,还需要遮挡等直接对照进一步分析。
ViBe
项目:https://lok-i.github.io/vibe-control/
前面的研究将地形与记忆纳入控制,ViBe进一步从已有全身跟踪器出发,探索视觉反馈怎样接入成熟的运动能力。
它冻结视觉编码器和控制器的原有参数,训练特征提取器与LoRA适配器,使控制器能根据环境修正落脚、物体操作或闪避动作。
参考继续表达运动目标,视觉提供当前场景下的修正依据。

ViBe|特征提取器结合视觉、任务与本体状态生成感知表示,再经LoRA适配器接入预训练全身跟踪器。
已有运动基座可以通过任务训练获得环境适应能力。
ViBe为不同任务分别训练策略,展示的是同一套适配方法在多个任务上的应用。结合PGMT与WM-LOCO看,环境反馈既可以影响跟踪目标的执行,也可以进入状态表示和网络适配结构。
STAR
项目:https://stardex-web.github.io/Star/
视觉可以说明手与物体的相对位置,接触建立之后,触觉还能反馈手指怎样受力。
STAR围绕触觉信号的稀疏性设计表示与训练,让灵巧操作策略更有效地利用接触信息。
它先联合预训练视觉与触觉表示,再保留接触激活区域的局部token与每只手的全局token,并预测动作视野内若干未来时刻的触觉变化。触觉由此同时提供当前接触状态和变化趋势。

STAR|视觉—触觉联合预训练建立表示,稀疏与全局触觉token保存接触信息,未来触觉预测辅助动作学习。
论文使用200小时双手操作数据,并在四项实机任务上验证。评测物体在预训练阶段留出,各方法随后仍使用每任务100条轨迹后训练,因此结果包含了任务适配。传感器覆盖、噪声漂移以及换用不同手型的影响,仍决定这条路线能够扩展到多大范围。
感知的作用由此覆盖了多个层次:估计身体状态,识别可通行区域,记住短时不可见的信息,以及判断手物接触。下一步要看,身体怎样利用这些接触改变自身运动。
身体接触环境
人形机器人的运动可以借助不同的支撑关系:双脚在地面迈步,双手通过杆件承重,骨盆由椅面支撑。每一种接触安排都会改变动力学和可行的动作。
这组三篇以特殊运动场景为例,观察接触方式、硬件设计与控制策略如何共同决定能力。
稀疏结构穿越
项目:https://nemantor.github.io/sparse-3d-traversal-website/
ETH与众擎相关团队把环境难度推进到细杆结构:机器人起跳挂杆、交替荡行,再脱杆落地。此时,接触建立的速度、肩肘持续出力和供电状态都直接影响动作可行性。
方法先训练起跳、荡行和下跳教师,再蒸馏为统一的感知策略。
仿真同时针对细杆雷达回波、电池压降和执行器热负荷作了调整。

稀疏结构穿越|子任务教师与阶段调度提供训练目标,带雷达注意力和循环记忆的学生通过多阶段蒸馏学习统一控制。
实机使用专门改造的被动挂钩末端。
这一硬件条件与感知、训练共同构成结果的基础,也说明高动态运动的能力边界需要结合末端结构、驱动力和电源特性理解。
SwingBot
项目:https://ttbray.github.io/SwingBot/
与稀疏结构穿越共同关注挂杆运动,
SwingBot进一步围绕连续交替摆荡,组织关键帧引导、全身发力和接触状态估计。
训练早期,释放、摆动和捕获的稀疏关键帧帮助策略找到可行行为,随后逐步把控制权交给学习策略。循环世界模型从本体感觉与动作历史估计相对当前杆的位移和左右钩接触,成功终止状态还被用于下一段训练,让前一摆的结果成为后一摆的起点。

SwingBot|关键帧引导逐步过渡到学习策略,循环世界模型估计摆荡中的位移与钩接触,支持左右手交替衔接。
v1版本的实机使用被动腕钩,依靠全身惯性和腿部摆动完成换手,尚未接入外部视觉,杆距需处于方法覆盖的范围。每个条件仅测试5次,左右领手命令由人工切换。持续运动还受到肩部电机发热与扭矩余量的影响。这些条件表明,接触切换的学习与硬件的持续输出能力需要一起评估。
Stay Seated
论文:https://arxiv.org/abs/2608.28090
接触提供的支撑也可以来自一把椅子。
Stay Seated让人形机器人坐在被动万向轮椅上,用双脚与地面的间歇接触推动身体和椅子运动。
方法建模可分离的骨盆—座面接触与被动脚轮,并通过非对称actor-critic训练策略:执行策略读取本体感觉和速度指令,训练中的价值网络额外使用椅子与接触状态。对称正则、脚滑惩罚和指令课程用于调节腿部配合、推进与跟踪。

Stay Seated|椅子与骨盆接触进入仿真,策略通过本体感觉跟踪速度指令,对称正则、脚滑约束和课程共同影响坐姿运动。
论文将策略直接部署到G1,在单一椅子和地面设置下展示前进、后退、侧移和转向。实机部分仍属定性验证,未量化速度跟踪与抗扰性。它提供了一种利用环境支撑组织运动的方式,距离完整的坐姿取放和桌面操作还需要任务层面的扩展。
悬挂和坐姿运动共同说明,身体与环境之间的支撑关系可以成为任务的一部分。进一步面向移动操作,这种协调还需要延伸到被操作的物体。
调动整个身体
搬箱子时,站位影响手臂可达范围,骨盆高度影响操作姿态,箱子离地又会改变全身受力。导航、操作和接触需要相互配合,训练也要覆盖它们之间的状态变化。
这一章先看任务接口与身体协调,再看视觉策略怎样学会交互、复杂接触任务怎样探索,最后落到手指与物体共同受控的全身操作。
TANGO
项目:https://tango-vla.github.io/
常见导航接口主要表达路点或速度,人形机器人通过狭窄通道时,还需要决定肩膀朝向和身体高度。
TANGO让视觉语言策略预测全身运动参考,把身体姿态带入导航。
Plan–Edit–Track流程通过规划、动作编辑和物理跟踪筛选生成数据,底层再由SONIC等跟踪器执行。
TANGO|上方通过规划、编辑和跟踪构造全身通行数据,下方由视觉语言主干与动作模块生成参考,再交给跟踪器执行。
上层接口由此能表达侧身、下蹲和跨越,数据生成也承担了相应的几何约束。真机障碍实验的指令包含行为要求,验证了按指令调整身体的能力;仅给出目的地时的自主通行方式选择,仍需单独评估。
WholeBodyWAM
项目:https://wholebodywam.github.io/
身体通过环境之后,还需要为操作创造条件。目标过远时向前迈步,手臂接近极限时调整躯干,都要求手部意图及时影响全身控制。
WholeBodyWAM保留预训练世界动作模型的视觉—操作能力,并共同生成操作动作与全身控制命令。
它通过统一命令表示对接不同控制器,再利用手臂沿任务方向的可操作性,调节全身控制对操作信息的注意力。

WholeBodyWAM|共享主干联合预测视觉、操作与全身命令;右侧根据手臂可操作性调节操作信息对全身控制的影响。
这让手臂的局部运动学需求参与身体协调。论文的跨控制器结果来自分别微调后的模型,统一接口仍需配合具体控制器的数据与适配;碰撞、平衡和接触则由学到的行为及下游执行共同处理。
DreamMimic
项目:https://dreammimic.github.io/
全身任务接口明确之后,还需要让策略从可获得的观察中学会交互。
DreamMimic借助世界模型,把能够使用物体状态和接触信息的教师蒸馏到视觉学生。
学生以深度、分割、本体感觉和目标条件行动,循环模型从历史中形成潜在状态。训练同时匹配当前动作与动作条件下的多步潜状态变化,并根据师生回报调整教师指导比例,使学生逐步适应自己实际访问的状态。

DreamMimic|特权教师指导视觉学生,世界模型学习预测表示,依据师生表现调节指导强度,帮助稳定全身交互蒸馏。
与WM-LOCO一样,预测模型在这里服务于控制所需的表示;DreamMimic进一步把它用于教师—学生的时序对齐。论文主结果依赖仿真直接提供的深度与分割真值,尚未报告真机实验,严重遮挡和精细手物接触仍是执行难点。
SMPC2RL
项目:https://pages.rai-inst.com/smpc2rl/
复杂交互的训练还面临探索困难:推箱、立起轮胎或滚动重物,需要连续尝试才能获得成功反馈。
SMPC2RL先用采样式模型预测控制生成专家轨迹,再以稀疏任务奖励开展离线到在线强化学习。
训练早期将专家转移混入经验池,随着策略成功率提高逐步降低依赖。高层输出底座速度、机械臂和躯干目标的增量,冻结的全身控制器负责跟踪与稳定,使任务探索能够建立在已有运动能力上。

SMPC2RL|采样MPC生成离线示范,稀疏奖励强化学习混合离线与在线经验,再将策略部署到不同移动操作平台。
论文在Spot四足机械臂与G1上验证了多项操作,部分任务的策略完成时间优于示范控制器。MPC收集阶段仍需要设计代价,示范质量与分布也影响学习上限;当前状态式部署还需补充视觉感知,才能覆盖更开放的环境。
Contact-Guided RL
项目:https://tolomeis.github.io/contact-guided-exp/
SMPC2RL通过完整示范帮助发现有效行为,Contact-Guided RL则把探索引导落到接触位置上。推、拉、滑动物体时,末端首先需要找到可以施力的位置。
方法从物体几何生成候选接触点,用独立的探索目标引导末端靠近。
任务、接触探索和正则化三个价值头分别估计回报,再按日程调整它们对策略更新的影响,使训练逐步从寻找接触转向稳定完成任务。

Contact-Guided RL|物体几何提供候选接触点,任务、探索和正则化价值头分开估计回报,再按训练日程混合,指导移动操作。
高层共同输出机械臂目标与底座命令,预训练腿部策略负责运动稳定。实机验证使用ALMA四足移动操作平台,物体位姿由外部动捕提供。它为人形接触任务提供了探索方法上的参考,具体迁移仍需结合不同身体的支撑与操作约束。
WEAVE
项目:https://xiaohu-art.github.io/Weave/
从非抓取接触扩展到双手抓握,任务是否成功还取决于接触能否持续带动物体。手臂抬起时,箱子应当随之离地;移动过程中,抓握需要持续承受负载。
WEAVE从人类—物体交互示范出发,依次完成全身重定向、手部接触优化和接近动作补全,再训练共同控制身体与双手的策略。
参考构造考虑指尖贴合、力闭合与穿透,训练检查身体、物体和接触的执行结果。

WEAVE|交互示范经过重定向与接近动作补全,形成身体、物体和接触参考,再训练统一的全身灵巧交互策略。
UMR提供了接触几何的迁移思路,WEAVE进一步在物理交互中检验参考能否产生预期效果。其结果目前来自仿真:训练交互成功率92.45%,同一组物体的未见交互为64.98%。策略使用物体状态与外部参考,真实部署仍需验证感知与接触迁移。
从表达身体姿态,到生成全身命令,再到学习有效接触,这组工作让任务目标逐渐贯穿上层决策与底层执行。完整系统还需要统一状态、动作语义和控制频率,并在连续运行中检验这些连接。
走向连续任务
一次动作能够完成之后,能力还需要经受复用和连续运行的检验。换一个身体、改变表达风格、连接多项技能、加入推理延迟,或突然收到停止指令,都会改变策略面对的条件。
最后五篇依次讨论跨本体共享、动作表达、技能衔接、异步执行和安全停止。
X-WBC
项目:https://logosroboticsgroup.github.io/x-wbc/
X-WBC让多种机器人共同训练一个全身控制主干。
人体动作、机器人参考和五点VR观测先进入共享运动表示,再由共享Transformer学习时序结构,各机器人保留专属的状态编码与动作输出模块。
这与前面的UCAG-P形成呼应:操作锚点和全身运动表示,都为跨本体学习提供了共同语义;具体执行差异则通过本体接口表达。

X-WBC|不同来源的运动命令进入共享表示和Transformer主干,再按机器人身份路由到对应的状态与动作接口。
论文在九种仿真配置上训练,并部署到G1、R1、H1-2和H2四种实机,支持了多本体联合训练的价值。新身体接入仍需要相应模块和训练,共享能力建立在清楚的接口分工之上。
PAMoR
论文:https://arxiv.org/abs/2608.28213
同一身体还可能需要用不同方式表达相同动作。交互场景中的挥手,可以舒展或收敛,可以轻缓或活跃,内容与风格都应当可以调节。
PAMoR用文本控制动作内容,以连续的效价和唤醒度条件调节身体扩张程度与运动能量。
生成过程直接面向机器人运动空间,再由跟踪器完成执行。

PAMoR|数据处理计算连续风格标签,生成模型组合文本、历史与情感条件,再经运动跟踪器实现机器人动作。
这项工作扩展了动作生成的可控范围。效价与唤醒度标签来自运动学代理指标,人的情感感知另由用户研究提供证据。它对应的是身体表达这一能力分支,可以与任务控制的研究并列理解。
SkillX
项目:https://yzc0731.github.io/SkillX/
当机器人从一项技能转入下一项,前一阶段留下的状态会影响后续表现。带球之后射门,球可能仍在滚动,支撑脚也未必处于单独练习时的理想位置。
SkillX用同一策略学习停球、带球与射门,并通过课程逐步缩短技能切换间隔。
技能相关运动先验与价值估计帮助兼顾不同动作,历史状态编码和球速估计则为切换时的决策提供依据。

SkillX|统一策略结合技能专属运动先验、价值估计与物体历史编码,在逐步变化的切换课程中学习连续技能。
由此,训练覆盖了技能连接产生的状态分布。论文困难组合任务的81.7%来自仿真,实机平均成功率72.5%使用外部动捕位置观测;机载视觉展示采用另一套感知设置。连续任务的判断需要连同这些条件一起保留。
SmoothRL
项目:https://www.astribot.com/en/AI/SmoothRL/
技能衔接之外,模型计算也会改变执行时序。新动作块正在推理时,机器人仍执行旧指令;结果返回后,开头部分可能已经过时,尾部又可能被下一轮输出覆盖。
SmoothRL让价值判断考虑已承诺的动作,将策略梯度限制在当前模型实际执行的部分。
异步采集、经验池和在线更新采用一致的执行节奏,使观察到的结果能够对应到真正产生影响的动作。

SmoothRL|异步执行产生真实轨迹,经验池连接基础策略与在线强化学习,更新围绕实际执行的动作区域进行。
它为接近完成任务的策略提供现场校准路径,应用条件包括固定延迟预算和相应的真机后训练流程。把推理、执行和学习放到同一时间线上,是大模型持续控制机器人时需要解决的具体问题。
Safe-Stop
项目:https://junfeng-long.github.io/safestop/
持续执行也包含主动结束任务的能力。机器人收到停止指令时,当前动量和支撑状态会影响它能否在避免跌倒的同时恢复稳定。
Safe-Stop将停止策略与可停止性判断分别学习。
一个估计器预测停止成功概率,另一个估计能否避开跌倒并到达稳定站立状态;部署时结合短时间窗口中的检查结果,决定继续执行停止策略,或切换到后备跌倒控制。

Safe-Stop|采样状态训练停止策略与两类可停止性估计器,部署时通过窗口检查决定继续停止或切换跌倒后备控制。
96.4%的停止成功率来自Isaac Lab中的179650个有效未见初态。论文还检查了5段G1实机动作,硬件失败判定来自预测器日志。当前后备控制较简单,也未规划“继续原动作后可能重新进入可停止区域”的过程。安全停止需要与日常任务能力一起接受独立验证。
能力从单项演示走向持续使用,需要覆盖身体差异、切换状态和时间约束,也需要为中止任务留下可执行的处理方式。这些问题共同决定机器人能否稳定地使用已经学到的技能。
三点观察
共享能力依赖清楚的动作语义。
UMR的表面对应、UCAG-P的操作锚点、X-WBC的运动表示和WholeBodyWAM的全身命令,都在为经验迁移建立接口。VLAct进一步把关注点放到模型内部,讨论动作监督怎样形成可迁移表征。读这类论文时,可以顺着输入和输出检查:共享了哪些信息,身体差异由哪个模块处理,接入新平台还需要什么数据。
有效反馈需要贯穿整个执行过程。
FOCUS从足部观测的可靠性改进状态估计,TemporalFlow-VLA帮助判断执行进度,SOLO关注误差怎样影响后续控制,STAR将触觉变化带入操作。SkillX和SmoothRL又把连续性延伸到技能切换与异步推理。由此,评估需要覆盖更长的过程,包括换地形、漏抓、切换技能之后能否继续完成任务。
完整任务需要同时考虑物体结果与停止条件。
走到目标附近、关节跟踪准确、手指建立接触,都是任务中的中间条件。箱子是否被搬到指定位置,接触能否承受移动中的负载,失败后能否恢复,以及收到停止指令时能否稳定退出,都影响任务的完成质量。WholeBodyWAM、WEAVE和Safe-Stop分别从协调、接触和中止执行切入,使评估更接近持续使用的要求。
回到开头的搬箱子场景,这30篇论文展示了一条逐渐清晰的研究脉络:先让经验具有可执行的表达,再利用历史和预测形成决策,让感知持续修正控制,进一步把身体、物体和时间上的连续性纳入任务。
下一次再看到一个新方法,可以沿这条线判断它补上了哪一环,并继续追问:它的输出能否被下一环使用,验证覆盖了哪些执行条件,还需要怎样的数据和控制配合?这样读下来,单篇论文的进展就能放进一个更完整的机器人系统里理解。
