阅读时间大约7分钟(2724字)
作者:Vincent 编辑:吕鑫燚 出品:先验实验室
今年以来,触觉赛道有了新变化。
从WRC可见,一些玩家讲的不再只是传感器硬件能力有多高,而是开始摆出自己的数据集、模型,甚至评测基准。围绕触觉的竞争,正在从从一块传感器,扩展到数据采集、模型训练和能力评估的整条链条。
这背后有一层容易被忽略的悖论:触觉能补上纯视觉模型看得见、摸不透的短板,让世界模型对物理世界的“想象”更靠谱;但同一次接触,换一个传感器、换一只手,反馈信号可能完全不同。这既是触觉眼下最大的价值,也是它最大的麻烦:它让模型更懂物理,也更容易被焊死在某一套硬件上。

如果只看出货,触觉还是一门硬件生意,但如果看2026年以来的投融资和产品消息,它却正在变成一门向着数据与模型靠拢的生意。
7月,千觉机器人同时发布数采夹爪、千小时视触觉数据集TacVerse 1k和触觉模型X-TouchMind V1。三者对应一条连续的技术链:采集设备记录操作中的画面、触觉和动作,数据集汇总这些记录,模型再从中学习如何完成任务。

类似变化也出现在其他公司。戴盟机器人4月发布含触觉的全模态数据集Daimon-Infinity,据其公开信息,首批1万小时数据已在阿里魔搭社区开源;6月又与银河通用发布触觉操作评测基准RobOmni,其亿元A轮融资也明确投向物理交互数据和物理世界模型。他山科技在触觉传感器月交付量达数万枚的同时,开始建设触觉训练平台,并提出研发“触觉原生模型”。
企业向数据和模型端延伸的同时,研究界也在往同一个方向靠拢。RSS 2026大会的触觉专题研讨会上,来自头部企业和学界的研究者们认为,过去很多机器人论文习惯把触觉留到“未来工作”部分一笔带过,如今它正被重新拉回机器人基础模型的核心设计环节。新加坡国立大学、复旦大学等机构联合提出的OmniVTA,以及哈尔滨工业大学团队推出的TouchWorld,都不约而同地把触觉纳入“预测接下来会发生什么”的范畴,这正是世界模型的核心任务。

当然,模型侧的公开成果目前仍限于论文预印本、展会Demo和技术验证,商业收入与长期生产部署都很有限。但变化已经足够清楚:触觉企业不再只争夺机器人身上的硬件位置,也开始争夺触觉数据如何采、如何表示、如何进入模型的定义权。在底层标准尚未收敛时,企业先同时掌握传感器、标定、数采和模型,建立一套能够运行的内部闭环,最大程度减少各环节之间的适配成本,成了相对常见的工程思路。
当然,这本身也并不是新概念。2019年,加州大学伯克利分校与脸书AI团队发表的论文《Manipulation by Feel》,已经在利用触觉预测模型控制机器人操作。近期变化在于,触觉开始进入规模更大、同时处理视觉和动作的世界模型体系。
而触觉预测能力,恰恰是纯视觉世界模型最容易露怯的地方。华盛顿大学与Meta FAIR团队今年2月发布的论文《Visuo-Tactile World Models》指出,纯视觉世界模型在物体被遮挡或接触状态模糊时,经常凭空想象出违反物理规律的画面,加入触觉后,模型在理解物体恒存性上的表现提升33%,符合运动规律的比例提升29%,在真实机器人上的零样本任务成功率最高提升35%。

新智具身与复旦团队7月发布的N₀-TWAM模型,在公开的UniVTAC仿真基准上取得84.5%的平均成功率,高于同一实验中表现最好的纯视觉世界动作模型FastWAM的48.0%。消融实验显示,去掉对未来触觉的预测或当前触觉输入,成功率都会明显下降。
这些结果都在说明,触觉确实能让世界模型的“想象”更贴近真实物理。但一个更棘手的问题也随之浮出水面。
今年6月,斯坦福、伯克利与英伟达团队联合发布的T-Rex论文(作者包括李飞飞、Jim Fan等人)给出了一个直接的反例:把触觉信号直接拼接进一个已经训练好的VLA模型后,平均成功率由17%降至6%;采用独立的高频触觉专家、时序编码和专门训练流程后,成功率才提高到65%。作者把触觉与视觉的频率差异、同步方式和表示方法列为重要挑战。RSS 2026研讨会上,斯坦福大学教授Mark Cutkosky也佐证了这一点,他把触觉信号的时序结构类比为声音而非静态画面,认为这个领域至今没有摸索出一套专门处理这种高频、多速率信号的标准流程。
这就是触觉进入世界模型后绕不开的核心难题:模型学到的,究竟是“物体打滑时摩擦力会如何变化”这样可以迁移的规律,还是“这套传感器在打滑时电压会怎么跳”这样和具体硬件绑定的规律?如果是后者,换一个传感器、换一只灵巧手、换一套控制系统,模型积累的“手感”可能就要从头学起。
视觉领域早年之所以能形成模型和数据的良性循环,很大程度上是因为有摄像头这样相对标准化的硬件底座;触觉硬件本身还没有形成通用方案,电容、压阻、霍尔磁和视触觉等路线记录的并不是同一种信号,同一次抓取,有的传感器输出压力数值,有的测量不同方向的力,有的则记录接触面的形变图像。
RSS 2026研讨会上也有类似的讨论,专家们直言触觉领域至今缺少一个类似的硬件规范,太多种互相竞争的传感器方案并存,让整个领域长期处于割裂状态。他山科技把这归纳为触觉数据"跨设备迁移难";新智具身则给它起了个更形象的名字,叫触觉的“方言问题”。
也有人试图为不同触觉硬件建立一层“翻译器”。清华大学、加州大学伯克利分校与Sharpa等8家机构联合提出的FTP-1,是一套跨传感器训练的触觉基础策略。它没有强行把不同传感器的原始信号直接混在一起,而是先用不同的编码器处理图像、阵列和力状态等输入,再根据这些信号来源位置(是来自指尖、手掌还是手腕),将编码结果放入统一的触觉表示空间,供同一个触觉专家和动作策略使用。
FTP-1聚合了26个数据源、21种传感器和约3000小时触觉操作数据进行预训练。在两套训练阶段未见过的传感器配置上,研究者重新训练相应的传感器编码器,并分别使用每项任务50条或100条示范进行微调。最终,FTP-1在三项任务中的平均成功率为46.6%,高于同一实验中基线模型的15.0%。
但FTP-1还不是通用触觉的最终答案。接入新传感器时,它仍要从头训练相应编码器;三项新任务还是分别使用了50条或100条示范数据,并非直接迁移;实验也只覆盖了两套新配置和三项任务。它证明了一部分触觉经验能够跨硬件迁移,却还远未把所有传感器翻译成同一种可以直接互换的“手感”。
对世界模型来说,这意味着触觉暂时还不是一种可以直接汇入同一训练池的数据。数据规模因此也不能只用小时数衡量:如果不同传感器的数据无法共同训练,再大的数据集也可能只是在扩大一套软硬件系统的经验,而没有同步扩大世界模型对物理规律的理解范围。
对触觉企业而言,这将决定它们向上延伸后,建立的是一套围绕自家产品运行的软硬件体系,还是一种能够连接更多传感器、机器人和模型的数据基础设施。前者更有利于特定产品快速落地并形成商业壁垒,后者则更符合世界模型跨硬件、跨本体扩展的长期构想。
我们可以预想,在当前硬件与数据条件下,在商业化要求下,未来一段时间,能够形成自家可用体系的“全栈派”可能更有落地希望,毕竟目前客户需要的就是能跑通的方案,而不是与研发团队一同探索“通用触觉”的技术愿景。千觉、戴盟等同时做传感器、数据和模型,本质就是以系统集成闭环换商业落地速度。
而在更久的时间维度上,只做全栈的公司恐怕会被锁死在自有硬件的出货量天花板里。真正能跑出大估值的,是那个能做出“触觉界ImageNet”或者“触觉界Transformer架构”的玩家。不管它是FTP-1这样的产学研体系化成果,还是某家愿意开放数据接口的公司。
触觉要让世界模型经得起真实接触的检验,也让世界模型原本看似直接的规模化路径多了一些曲折。触觉真正进入通用世界模型的标志,不会停留在模型能够生成一段逼真的触觉信号,而是模型不必跟着每一款传感器,重新认识一次物理世界。
