阅读时间大约10分钟(3944字)
作者:毛不毛 出品:具身智能前沿
加了触觉反而更笨:一个 17% 掉到 6% 的实验
先说这场实验是什么。
视觉—语言—动作模型(Vision-Language-Action Model,VLA)是现在机器人操作的主流范式:模型读入摄像头图像和语言指令,直接输出机器人动作。物理智能(Physical Intelligence)发布的 π0.5 就是其中代表性的预训练模型。T-Rex 团队做了一个看似理所当然的尝试:把灵巧手指尖的触觉信号也拼进 π0.5,让它一边看一边摸。
结果在 12 项真实灵巧操作任务上,平均成功率不升反降,从 17% 掉到 6%。翻书页从 36% 掉到 8%,抽卡从 8% 掉到 3%,拧灯泡和发牌更是从 11%、9% 直接归零。
这个对照有个容易被忽略的前提:17% 和 6% 用的是同一个预训练模型、同一套后训练数据(约每任务 100 条演示)、同样的评测协议(每任务 16 次试验,物体位置和朝向随机),两组之间唯一的变量就是有没有把触觉拼进去。模型不是没给机会练——练了,只是触觉这条路本身没接对。需要说明的是,π0.5 基线并没有经过 T-Rex 那 100 小时中期训练,架构和数据配方在 T-Rex 里是捆绑在一起的,这一点后面展开。
论文里还有另一组数字:他们自己提出的 T-Rex 系统,同样 12 项任务平均成功率 65%,比最强的纯视觉基线 EgoScale的 35% 高出 30 个百分点。也就是说,触觉既可能是毒药,也可能是特效药,差别全在怎么接。
这篇论文 2026 年 6 月中旬发布在 arXiv(编号 2606.17055),全名 T-Rex: Tactile-Reactive Dexterous Manipulation,7 月已有第一轮中文报道。现在回头看它的价值反而更清楚:代码和约 50 小时触觉数据集已经开源,论文经过两轮修订,我们可以完全按一手材料核对机制和数字,而不是停留在发布时的新闻转述。
作者名单很长,共 34 人,共同一作是 UC Berkeley 的牛丹彤、刘卓洋和 Zekai Wang,资深作者包括李飞飞(Stanford)、Jitendra Malik、Pieter Abbeel、Ken Goldberg、Trevor Darrell(后四位都在 UC Berkeley)、徐丹飞、朱玉可和 NVIDIA 的 Jim Fan。实验平台是 Dexmate Vega-1 双臂机器人,配两只 22 自由度的 Sharpa Wave 灵巧手,每只手五个指尖各有一个触觉传感器。

图片说明:T-Rex 由 22,889 小时人类第一视角视频预训练、100 小时触觉同步遥操作数据中期训练、混合 Transformer 专家模型和 12 项接触密集型任务组成。图片来源:T-Rex 论文 Figure 1(arXiv:2606.17055)
触觉为什么拼不进去:数据、频率、表征三道墙
论文把「触觉加不进 VLA」的原因归纳为三层,每一层都能在那个掉分实验里找到影子。
第一层是数据。现有的大规模机器人操作数据集主要面向平行夹爪——两根手指一捏一放,遥操作门槛低。灵巧手是另一回事:22 个自由度需要操作员戴数据手套,每个手势都要重定向映射到机械手指令,视觉、触觉、关节状态还要严格时间对齐。T-Rex 的遥操作栈用 Manus 手套加 VIVE 追踪器,以 30Hz 统一记录三路相机、双臂本体状态、手腕位姿和十个指尖的触觉,底层再挂一个 300Hz 的控制线程。这套流水线的成本决定了:触觉数据天然稀缺,而且稀缺的不是某一个任务的数据,是多样化接触的数据。
第二层是频率。视觉模型处理一帧图像要几百毫秒,动作规划大约跑 5Hz;但触觉反应是毫秒级的生意,论文中触觉专家以约 20Hz 工作,才能在「正在滑」和「已经滑了」之间做出区别。两种信号塞进同一个低频 Transformer,结果是视觉来不及看、触觉来不及反应——拼接进去的高频信号不但帮不上忙,还会扰动模型已经学好的视觉表征。π0.5 加触觉后全面掉分,这是最直接的解释。
第三层是表征。很多方法把触觉当成一个静态数字:当前压力 5 牛顿。但触觉本质上是时序信号——按压、插入、滑动、搓动,每种接触状态对应一段力随时间变化的独特模式。一个孤立的力值既读不出「正在滑动」,也读不出「插到位了」。静态编码器喂给模型的,是被抽掉了动力学的触觉。
三道墙互相咬合:数据少导致模型没见过多样接触,频率错配导致触觉信号在架构里无处安放,表征浅导致仅有的信号也丢失了动态信息。T-Rex 的解法因此也是三件套,分别对着三层病因。

第一副药:给触觉单开一条高速通路
核心思路一句话:别让触觉和视觉挤在同一条慢车道上,给它单独修一条高速路。
T-Rex 的主干叫混合 Transformer 专家(Mixture-of-Transformers,MoT),三个专家共享一套多模态注意力,分工明确:
潜变量专家(Latent Expert):处理头部相机图像和语言指令,预测未来的视觉潜变量,给系统提供「接下来大概会发生什么」的大局感。它和动作专家都以 Qwen3VL-2B 为骨架,各约 1.41B 参数。
动作专家(Action Expert):做低频动作规划,约 5Hz 跑一次,用流匹配(Flow Matching,一种从噪声逐步去噪生成动作轨迹的方法,和扩散策略是近亲)生成一个包含 16 步的动作块,参数量同样约 1.41B。
触觉专家(Tactile Expert):做高频触觉精修,约 20Hz 触发,只有 0.62B 参数,轻量到可以频繁调用。

图片说明:动作专家先以约 5Hz 完成 6 步去噪生成半成品动作块,触觉专家再以约 20Hz 复用缓存的视觉语言上下文完成后 4 步精修。图片来源:T-Rex 论文 Figure 3(arXiv:2606.17055)
关键机制是异步级联流匹配。一次完整去噪共 10 步:前 6 步由动作专家完成,产出一个「大方向正确但缺乏手感细节」的半成品动作块;后 4 步交给触觉专家,注入实时触觉数据完成精修。触觉专家并不重新跑一遍视觉大模型,而是复用缓存的视觉语言上下文,只做轻量精修,这是高频触发在算力上成立的前提。
为什么在第 6 步交接?论文做了切分点消融:切得太早,动作专家去噪步数不够,继承不到大规模人类视频预训练带来的运动先验;切得太晚,动作分布已经定型,触觉信号进来也改不动了。实验曲线显示最优点随任务在 4 到 6 步之间浮动,论文取 6 加 4 的配置。
执行时两个速率异步并行:动作专家约 5Hz 更新动作块,触觉专家在同一块内约 20Hz 反复微调。打个比方,动作专家像主编定好文章框架就去忙别的,触觉专家像值班编辑在每个句子上轮番检查细节,不需要主编每次回来重看全文。
消融实验给了这个设计一个量化注脚:把异步机制改成同步,平均成功率从 65% 降到 60%;把触觉输入全部拿掉,则降到 42%。
第二副药:把半秒力历史压成 64 个「触觉词」
高速通路有了,路上传什么信号?
触觉传感器有两个毛病:零点漂移和高频噪声。直接把原始电压喂给模型,它很可能把传感器噪声当成接触特征学进去。T-Rex 的做法是用时序 VQ-VAE(向量量化自编码器,一种把连续信号压缩成离散编码的模型)给触觉建一套「词表」。
每个指尖记录两类信号:接触形变深度和六维力/力矩(三个方向的力加三个方向的扭矩),十个指尖共一套。对每个指尖,模型取过去 16 帧、大约半秒的力历史,经过一维时序卷积压缩成一个 256 维向量,再映射到一个只有 64 个码字的码本上;当前时刻的力向量则直接投影保留,以免丢失瞬时接触。按压、插入、滑动这些不同接触状态,会自动聚类到不同码字——模型学到的不是「压力 5 牛顿」,而是「这是一段怎样的接触」。
论文里还有两个论文正文不会大书特书、但做工程的人一看就懂的细节。
一是让码本「活起来」。VQ-VAE 训练时常见码本坍塌:大部分码字闲置,少数几个塞满各种状态。T-Rex 用指数滑动平均更新码本,并定期把闲置码字用当前批次的数据重新播种,保证 64 个抽屉都在用。
二是给关键接触更高权重。一次操作里绝大多数时间手是空的或静止的,如果均匀学习,模型会把大部分容量花在「零接触」这个最容易学的状态上。T-Rex 改用幅度加权的损失函数,高力接触帧承担更高的学习权重,把算力逼到真正有价值的接触瞬间。
消融数据可以对照看:把时序 VQ-VAE 力编码器换成轻量 MLP,平均成功率从 65% 降到 58%;去掉形变信号、只保留力信号是 59%,反过来只保留形变、去掉力信号则降到 54%。动态时序编码、力信号与形变信号各自的贡献,这样被分开量了出来。
第三副药:100 小时「基元 × 物体」,学手感而不是背任务
第三层病因是数据,T-Rex 的答案不是简单堆时长,而是换配方。
论文发布了 T-Rex 数据集:100 小时双臂遥操作数据,7755 条轨迹,覆盖 207 种日常物体和 22 个动作基元——抓、放、缠、折、按、插、剥、拧、挤、抽等等。数据收集不是按任务组织,而是系统地枚举物体和基元的组合:207 乘 22 共 4554 种候选,只保留物理上可行的 502 种。目标是让模型见到「搓」在不同物体上分别怎么做、「捏」需要多大的力,而不是死磕某一个具体任务。
训练分三阶段:先在 22,889 小时人类第一视角视频上预训练,让模型看懂人怎么动;再用这 100 小时数据做中期训练,把「看来的」人体运动知识迁移到机器人本体上,同时从零训练触觉专家;最后用约 100 条任务演示做后训练,快速适配具体任务。目前约 50 小时、5400 多条轨迹已经以 LeRobot v3 格式在 Hugging Face 开源。

图片说明:横轴为后训练演示数量,蓝线为经过 T-Rex 数据集中期训练,绿线为没有中期训练;10 条演示时两者成功率相差约两到三倍。图片来源:T-Rex 论文 Figure 5(arXiv:2606.17055)
中期训练值不值,数据效率曲线最直观。只有 10 条任务演示时,经过中期训练的模型在挤牙膏、分杯、抽卡三项任务上分别有 29%、36%、26% 的成功率;没有中期训练的模型只有 9%、17%、12%。演示增加到 200 条,差距依然明显:71%、85%、78% 对 36%、55%、50%。

图片说明:左半为后训练任务,右半为没见过的零样本任务;多样数据中期训练在零样本 Pick Cube 上达到 45%,无中期训练只有 5%。图片来源:T-Rex 论文 Figure 6(arXiv:2606.17055)
更能说明问题的是零样本。在四个完全没给演示的简单任务上,用 T-Rex 多样数据做中期训练的模型,抓方块(Pick Cube)达到 45%、按按钮 35%;用单一任务数据中期训练的只有 15%、10%;没有中期训练的几乎全归零。这说明模型从 100 小时里学到的是可迁移的「手感」,而不是把训练任务背下来。
成绩怎么读,边界在哪里
回到 12 项任务的总成绩单。T-Rex 平均 65%,最强基线 EgoScale 35%,π0.5 为 17%,而朴素加了触觉的 π0.5 只有 6%。分项看,翻书页 96% 对 68%,酸碱中和 76% 对 43%,抽卡 70% 对 41%,靠指尖形变分辨牌面纹理的麻将分拣 65% 对 36%。
但有两个数字值得单独说,因为它们比平均分更能定义边界。
一是开锁只有 47%(基线 19%),拧灯泡只有 35%(基线 18%)。这类紧公差、长时序的插入装配任务,恰好是论文作者自己点名的局限:遥操作本身就难采集、接触协调要求极高的任务,未来可能需要强化学习或在线交互精修来补。65% 的平均分说明触觉路线成立,但它不意味着灵巧操作已经解决。
二是消融里那个 42%。把触觉全部拿掉,模型仍有 42%——视觉先验撑起了相当大的基本盘,触觉贡献的主要是最吃接触手感的那部分任务。论文的表述因此很克制:触觉不是锦上添花,但也不是独自成事,它和大规模视觉预训练是并行关系,不是主从关系。
作者还划了另外两条硬件边界:传感器会畸变,不同设备间存在标定漂移;目前触觉只覆盖十个指尖,手掌没有密集触觉,全手操作无从谈起。论文明确把跨传感器统一表征和全手触觉硬件列为未来工作。换句话说,T-Rex 能跑起来,一个前提是 Sharpa Wave 这双手提供了 22 自由度全驱动和稳定的指尖传感;算法够到的是硬件给出的上限,同时又反过来对硬件提出了新要求。
收尾:瓶颈已经从传感器移到了架构
T-Rex 的三件事拆开看都不是新数学:异步双速率在控制系统里是老思路,VQ-VAE 是成熟的离散编码工具,基元组合的数据采集法也谈不上发明。但把它们按触觉的物理特性组合成一套可复现的系统,并且把 50 小时数据和代码开源出来,这件事本身就是进展。
更值得记住的是那个 17% 到 6% 的实验。它给所有「多模态融合」的乐观叙事提了个醒:模态不是拼上去就算融合,频率不匹配、表征不对齐、数据不配套,新感官只会干扰旧能力。灵巧手的触觉传感器这几年进步很快,真正稀缺的,是让模型消化触觉的架构——谁先解决「触觉怎么加」,谁才谈得上把手感变成能力。
