阅读时间大约6分钟(2008字)
作者:Yuanxq 出品:具身智能研究室
PAMoR 研究的是:如何让真实人形机器人在执行指定动作的同时,以连续、可解释的方式控制动作所传达的情感,并支持实时生成和在线修改。
它的输入包含三类信息:一是文本动作指令,例如行走、挥手或出拳;二是效价,表示动作整体偏积极还是偏消极;三是唤醒度,表示动作偏平静还是偏激烈。模型需要保证文本主要决定“做什么”,效价和唤醒度主要决定“以什么情感风格去做”。

图 1:PAMoR 在真实 Unitree G1 上生成的八种代表性情感动作。由左至右,动作整体从负效价区域过渡到正效价区域。
一、核心问题
现有情感动作生成通常采用两种方式:给模型一段参考动作,让它迁移其中的风格;或者直接在文本中加入“开心地”“悲伤地”等情绪词。这两类方法的问题是,情感通常是离散标签或不可量化的参考风格,难以精确控制程度,也容易与动作内容纠缠。
此外,很多系统先生成标准人体动作,再重定向到机器人。重定向可能改变身体姿态、动作幅度和速度,从而破坏原本的情感表达。PAMoR 因此选择直接在 Unitree G1 的运动空间中训练和生成,避免在线人体到机器人的动作转换。
二、如何构造连续情感条件
论文采用心理学中常见的效价—唤醒度二维情感模型,但没有依赖人工情绪标注,而是直接从机器人的运动学特征中计算两个条件。

图 2:机器人动作在效价—唤醒度平面中的组织方式。水平方向表示效价,垂直方向表示唤醒度,八个情绪词对应情感空间中的不同区域。
效价被定义为身体姿态的扩张程度,主要考虑三个特征:手臂展开幅度、身体根节点高度和躯干俯仰角。身体越开放、越直立、越舒展,效价越高;身体越收缩、越低矮、越前倾,效价越低。
唤醒度被定义为运动能量,主要由身体关键点的平均速度和平均加速度决定。动作越快、加速度越大,唤醒度越高;动作越慢、越平缓,唤醒度越低。
作者对这些特征进行训练集统计标准化,并将其映射到统一的连续范围。由此,每段训练动作都能自动获得效价和唤醒度标签,不需要逐段人工判断情绪。
这一方法的准确定位应当是“基于运动学的情感代理指标”。它具有可测量、可复现和低标注成本的优点,但并不等同于客观的心理学情感真值。其数值还依赖当前训练数据的统计分布,换机器人或换数据集后可能需要重新校准。
三、可组合潜扩散模型
PAMoR 先使用一个 Transformer 运动变分自编码器,将机器人运动压缩到共享潜空间。随后在该潜空间中分别训练三个扩散先验:
文本先验学习动作语义;
效价先验学习身体姿态扩张程度;
唤醒度先验学习动作速度和能量。
三个先验结构相同但参数独立。生成时,它们在每一步去噪过程中进行组合:文本先验负责保持动作类别,两个情感先验分别调节姿态和运动能量。
这种设计针对的是联合条件模型中的条件纠缠问题。如果让同一个模型同时接收文本、效价和唤醒度,修改情感参数时可能连动作身份也一起改变。把三个条件分开学习,再在推理阶段组合,可以提高条件的独立可控性。
模型以自回归方式生成运动。它使用最近两帧历史预测后续八帧,在 20 Hz 数据频率下,每次生成约 0.4 秒动作。新片段生成后,其末尾继续作为下一次输入,因此可以连续运行,并在片段之间修改文本或情感条件。

图 3:PAMoR 的完整框架。系统首先构建并筛选 G1 运动数据,依据机器人运动学生成连续情感标签,再组合文本、效价和唤醒度三个扩散先验,最后通过运动跟踪器部署到真实机器人。
四、训练数据与实体部署
数据来自三部分:BABEL 标注的 AMASS人体动作、从普通视频恢复的三维人体动作,以及在 G1 上遥操作采集的动作。人体动作先被重定向到 G1,随后使用全身动作跟踪器在仿真中回放,过滤无法稳定跟踪、身体过低或倾斜过大的样本。
最终数据包含 15 类动作、约 3 万个训练片段和 7200 个测试片段。作者还将多个单动作片段连接成运动链,使模型能够学习不同动作之间的过渡。
生成器在 RTX 5090 上生成一个 0.4 秒运动片段约需 78 毫秒,因此从吞吐量上满足实时要求。不过这一结果基于高端桌面 GPU,论文没有充分报告机载平台上的完整系统延迟、显存和功耗。
五、主要实验结果
在标准文本到动作指标上,PAMoR 与 TextOp、ECHO 两个机器人动作生成基线基本相当。它的文本动作匹配率略低于 TextOp,但运动分布质量接近 ECHO;同一动作下的生成多样性明显更高。这说明加入情感条件没有造成明显的动作质量损失,并扩大了同一动作的风格变化范围。
在数值控制实验中,生成动作重新测得的效价和唤醒度与命令值均呈约 0.95 的秩相关,两个轴之间的交叉相关低于 0.06。这表明模型能够较稳定地控制作者定义的姿态扩张和运动能量,而且两个条件基本不会相互漂移。
但这里存在同源评估问题:训练标签和测试时的测量都来自同一套运动学函数,因此该结果主要证明模型学会了控制这些代理指标,不能单独证明人类一定会感受到相应情绪。
论文进一步进行了用户研究。实验包含 7 种动作和 8 个情绪类别,共 140 个机器人视频、12 名参与者和 840 次判断。参与者需要从八个情绪词中选出最可能的三个,并评价动作自然度。

图 4:用户研究界面。左侧为待判断的情感动作,右侧为同一动作的中性参考;参与者需要选择最可能的三个情绪,并对动作自然度进行评分。
PAMoR 的第一选择正确率为 38.4%,前三选择覆盖率为 84.5%,明显高于随机水平和两个基线;自然度平均为 4.05 分,也高于 TextOp 和 SMooDi。即使参与者没有选中目标情绪,错误答案通常也是情感环上的邻近类别,而不是方向完全相反的情绪。
这说明 PAMoR 生成的八个代表性情感区域确实能被人类区分。不过实验仍然是八个离散情绪的分类任务,并没有直接验证人类能否连续、准确地感知任意效价和唤醒度数值。
