阅读时间大约9分钟(3555字)
作者:刘俐杉 编辑:许丽思 出品:机器人前瞻
机器人前瞻7月30日报道,近日,斯坦福大学和哥伦比亚大学联合发布论文《Transformer Transformer:面向运动条件引导下机器人协同设计的统一模型》。
这篇论文最特别的地方在于,其提出的Transformer Transformer模型可直接参与机器人的本体设计,只需向该模型输入一段条件轨迹,即可生成完整的、适合完成这些动作的机器人结构,涵盖连杆、关节、电机及惯性属性。
也就是说,你可以给模型输入一段人类干活的示范,例如,将人类“整理布料”的演示轨迹输入模型,模型即可生成一台适合该动作的双臂机器人本体。在真实ALOHA平台测试中,该模型优化后的设计方案使轨迹跟踪误差降低73%,最大关节速度降低30%。
Transformer Transformer中,第一个“Transformer”指的是形态可变的机器人;第二个“Transformer”则指自注意力神经网络架构。
Transformer Transformer是一个动力学预测模型,是基于RoboTokens训练的扩散Transformer,在同一个网络架构可跨多种构型空间和应用场景通用。
在推理阶段,该模型将与奖励无关的预测转化为特定奖励下的价值预测,随后通过“动力学自引导”的技术路径来引导构型扩散生成过程。
在三种设计空间下的对比实验表明,该方法能够对未见过的奖励函数和运动轨迹实现零样本优化,且性能与运行效率均显著优于基于进化算法的基准线。
论文链接:Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design项目链接:https://transformer-transformer.github.io/
01.
先建立一套通用的语言
把机器人的身体变成token
要让一个模型同时理解千差万别的机器人形态,首先需要一套通用的“语言”来描述它们。为此,研究团队设计了RoboTokens,一种对机器人构型、状态和动作进行统一代币化的表达方式。

▲每个机器人都变成一个类型化的标记序列
每一个机器人都可以转化为一段带类型的Token序列。RoboTokens为每一个连杆、关节、电机、状态和动作都定义了带类型的Token,使得单条Token序列既能描述机器人的构型,又能描述其动力学特性。RoboTokens主要遵循完整性、灵活性、一致性、可扩展性和可优化性:
完整性:
一条RoboToken序列需要包含了刚体连杆机构的所有信息,包括连杆、固定关节、旋转/移动关节、球关节、电机5种构型 Token类型,以及状态Token和动作Token。
灵活性:
Token之间可通过ID互相引用。例如一个关节Token知道它所连接的两个连杆Token的ID,这样同一套格式就既能表达6自由度机械臂,也能表达35自由度的双足机器人。
一致性:
Tokenizer对冗余的空间偏移量进行了规范化处理,并将惯性参数和转换矩阵统一存储在单一坐标系下,从而降低了模型需要学习的数据方差。
可扩展性:
RoboTokens无需修改整体架构,即可直接插入新的Token类型。在进行轨迹跟踪时,只需将目标末端执行器的位姿Token指向对应的末端执行器ID和时间步ID即可,无需对机器人的其余部分重新进行代币化。
可优化性:
与MJCF等自回归文本格式不同,对连续值的RoboTokens进行扩散建模既赋予了其全局可控性,又保证了可微性,这两点正是推理阶段基于梯度进行奖励优化的必要条件。
研究团队对来自MuJoCo Menagerie的11台机器人进行了代币化,其质量跨越了两个数量级,从0.65kg的灵巧手到67.5kg的四足机器人,主动关节数量从6个延申至35个不等。
每台机器人仅需28到101个RoboTokens即可完整描述,比MJCF文本格式紧凑27到110倍。用普通语言分词器表达一台机器人的完整描述需要数千个Token,而使用RoboTokens只需要数十个带有类型的Token即可。
如下图显示,一个灵巧手只需要60个RoboTokens,而使用普通语言分词器却需要3019个Token

▲ 用RoboTokens、text Token描述机器人硬件
RoboTokens足够精简,这让Transformer模型可以直接对其进行扩散去噪生成,而无需再像大语言模型那样,以自回归的方式去逐字撰写 XML代码。
02.
统一的网络架构:采用DDIM噪声调度策略
拥有了统一的机器人“语言”后,研究团队训练了一个基于RoboTokens的扩散Transformer(DiT),采用了DDIM噪声调度策略。除了作为约束条件的Token外,系统会对所有输入Token添加噪声,通过改变被掩码的Token集合,同一个网络可扮演不同的角色。
如果掩码所有内容就能得到一个无条件的机器人生成器;掩码动作Token,则能够得到一个跨构型控制器;掩码构型Token,能够得到一个给定运动条件的机器人设计器。
在推理阶段,模型不仅生成构型,还将自身预测结果转化为奖励预测,并利用梯度引导生成过程朝向更高奖励的硬件设计迭代。
具体来看,该模型具备两大核心能力:
1、构型感知控制器
研究团队对在程序化生成的四足机器人空间中训练的强化学习专家模型进行了行为克隆。控制器输入完整的物理构型,该模型可以根据当前所驱动的机器人实时调整控制策略。同一个控制器可以在具有连续变化以及离散变化的不同四足机器人上,精准跟踪同一条运动轨迹。
无论是对连杆惯量、关节行程范围还是电机增益进行修改,同一个策略都能持续进行轨迹跟踪,无需再针对每台机器人单独重新训练。

▲ 同一控制器跟踪运动轨迹
2、覆盖多样化机器人品类的通用生成器
同一个模型基于相同的噪声调度策略,在完全没有任何条件约束的情况下运行该模型,它能从高斯噪声中直接扩散生成出完整的机器人。
仅凭在MuJoCo Menagerie的多样化机器人数据集上进行训练,单个Transformer Transformer模型就能生成固定基座机械臂、四足机器人、人形机器人以及灵巧手。但由于扩散过程具有随机性,每一次运行都会生成截然不同的机器人硬件方案。

▲ 机器人的扩散生成
03.
动力学自引导:
输入奖励函数,输出机器人方案
在协同设计的问题上,对于一个模型在训练阶段从未见过的奖励函数,我们该如何生成一台高奖励的机器人?
通常来说,因为同一个模型既能预测物理构型,又能预测其对应的动力学过程,因此可以将预测结果直接输入到用户定义的奖励函数中,从而计算出预测奖励值。之后,团队就能在GPU上进行大规模并行采样,预测每个候选方案的奖励,并最终返回最优的那一个。这本质上是最佳N采样。
但动力学自引导将其进行优化,由于预测奖励值是关于构型Token的可微函数,所以团队对其求梯度,并将该梯度注入回扩散去噪过程中,在每一个去噪步数中推导样本朝更高的奖励方向演进。
所以该模型的核心在于,如何修改这台机器人的硬件设计,才能提高这项任务的奖励。

▲ Transformer Transformer预测状态和动作令牌
而该模型能够对奖励函数进行零样本优化,即该模型基于动力学建模进行训练,在推理阶段,针对写下的任意奖励函数进行在线硬件优化。
以一台在动态抛甩动作中会跌倒的随机生成四足机器人为例,如果仅给出“轨迹跟踪奖励”,但设置条件要求模型针对相同的运动轨迹生成一套新机器人,那么模型就会降低机器人的质心,并拓宽其支撑多边形。
但现在,如果在此基础上加入“转矩惩罚项”,整个优化空间就会发生转移,该模型会生成一台尺寸更小、重量更轻的机器人,它依然能精准跟踪运动轨迹,但平均电机转矩降低了30%。如果再加入“尺寸惩罚项”,优化空间会再次发生改变。
无论是替换目标运动轨迹,还是额外加入尺寸惩罚,该模型都会重塑优化空间,生成完全不同的机器人形态,整个过程无需任何重新训练。
04.
真机验证:甩布任务轨迹跟踪误差降低73%
研究团队并不希望只是针对单一动作轨迹进行优化,于是他们利用开源的UMI双臂洗碗数据集组织扩散模型,以不同的动作轨迹作为输入条件进行并行运行,并在逐步去噪的过程中计算预测噪声的平均值,就能获得一个针对所有轨迹同时进行过优化的通用生成器。
研究团队利用UMI双臂洗碗数据集,保留了26条验证轨迹。该团队将其与Random和CMA-ES两种基线方法进行了对比,给所有方法设定了同样的任务,针对给定的目标轨迹和奖励函数,生成一台机器人并对其进行控制,最终汇总并报告其达到的奖励值。
如下图所示,在三种设计空间和多个奖励函数下,无论采用零阶引导还是动力学自引导变体,随着并行采样数量的增加,该模型都能生成更高奖励的设计方案。

▲ 奖励更高,速度快好几个数量级
甚至该模型能够在几秒内达到CMA-ES运行数小时才能达到的设计质量。以多轨迹双臂协同优化为例,CMA-ES虽以1.8 cm的精度略胜一筹,但耗时超过3个小时,而Zeroth和DGS分别仅需62秒和53.5秒即达到约1.9 cm的相近精度,耗时仅为CMA-ES的0.5%。

▲ 多轨迹双臂协同优化任务数据
在真机验证上,研究团队利用两台ALOHA平台进行甩布测试,一台是原始ALOHA,另一台则是经Transformer Transformer优化后的ALOHA。
在相同的任务和目标轨迹条件下,优化后的ALOHA平台成功展开了布料,而原始设计则无法做到。

▲ 甩布测试
甩布任务的考验主要在于手臂必须高于上方,同时该平台还会受到空气阻力、布料自重和摩擦力的影响,原始的ALOHA硬件设计甚至连轨迹跟踪都难以完成。
观察整个甩布动作过程中的关节速度变化,优化后的硬件设计相比原始设计拥有更少的速度峰值以及更低的最大关节速度。
在真实ALOHA平台测试中,该模型优化后的设计方案使轨迹跟踪误差降低73%,最大关节速度降低30%。
与原始设计相比,优化方案发生了两项核心改变,该平台设置了更长的连杆长度,使手臂能够完整覆盖甩布轨迹,同时保持足够轻量,以确保关节载荷处于Dynamixel舵机/电机的扭矩包络线的安全范围内。
其次,该平台设置了倒置安装形态,双臂倒挂悬挂于工作区后方,能够实现更省力的“下抛甩动”。
05.
结语:编码、泛化、数据采集成本
三大技术难题仍需攻克
Transformer Transformer 为机器人协同设计开辟了一条新路径,其性能和效率在真机实验中得到初步验证。然而,研究团队在论文中也阐述了该模型的不足与局限。
目前,RoboTokens仅支持基本几何体描述,尚无法处理任意网格、可变形物体,且暂未对周围环境场景及接触目标进行编码;在未见过的机器人构型上,跨构型控制器和强化学习专家模型的相关性仅为皮尔逊系数0.53,虽有潜力但泛化能力仍存在短板。
其次,测试时计算扩展与其他引导扩散方法类似,约一分钟后收益即进入平台期,过度的推理时长无法带来持续的性能提升;最后,基于强化学习的全身控制器数据采集成本高昂,这成为将该模型拓展至新设计空间的主要瓶颈。
当下机器人领域软硬件均处于快速迭代周期,模型算法持续更新、硬件设备不断升级,而上述现存短板,也明确划定了后续机器人模型需要重点突破的技术方向。
