阅读时间大约9分钟(3281字)
出品:机器人产业应用
前言
过去两年,具身智能行业最常见的画面是:机器人学会抓杯子、叠衣服、开抽屉、拧瓶盖。但产业内的人都知道,真正难的不是让机器人在展台上完成一次动作,而是让它换一个杯子、换一只机械臂、换一个场景后,仍然知道自己该怎么做。
这正是RoboScience机器科学发布Visics通用具身大模型时,试图回答的问题。6月24日,RoboScience机器科学发布自研通用具身大模型Visics,并首次完整披露VLOA,即Vision-Language-Object-Action技术架构。发布会展示了家具拼装、跨本体灵巧抓取、精细力控、动态流水线抓取等真实场景 Demo。
其核心主张是:具身智能不能只学习“机器人动作”,而应学习“物体如何被改变”。这句话听起来像技术口号,但背后其实指向一个更底层的问题:机器人行业到现在,还没有形成类似大语言模型“文本Token”那样的统一基础表征。
RoboScience给出的答案,是Object Trajectory,也就是物体3D点云轨迹。简单说,Visics不再只问“机械臂关节应该转多少度”,而是先问:“这个物体最终应该怎样运动、变形、受力、到达哪里?”
01
先看公司:RoboScience机器科学
RoboScience机器科学成立于2024年12月,公司官网将其定位为通用具身智能企业,核心产品是具备跨本体泛化操作能力的Visics通用具身大模型,并采用“仿真+视频”数据进行训练。
创始人兼CEO田野,本科毕业于中国科学技术大学物理专业,硕士毕业于斯坦福大学计算与数学工程专业,曾任Apple AI Platform技术负责人;创始人兼首席科学家邵林是新加坡国立大学助理教授,博士毕业于斯坦福,研究方向长期聚焦机器人操作;联合创始人刘朋海有科沃斯产品量产和供应链经验;联合创始人汪涛则有产业投资与募资背景。
这意味着RoboScience的组合并不是单纯的“算法创业”,而是“基础模型+机器人操作研究+硬件量产+产业落地”的混合型团队。
官网还显示,公司在2026年6月完成10亿元A轮融资,此前已在2026年2月完成数亿元Pre-A轮融资。这类背景不能直接证明Visics已经成为行业标准,但能说明:RoboScience不是在讲一个孤立模型,而是在试图把模型、数据、仿真、本体和商业化路径打包成一套具身智能基础设施。
02
VLOA和VLA,到底差在哪里?
过去主流的具身大模型路线,常被称为VLA:Vision-Language-Action,视觉、语言、动作。
Google DeepMind在RT-2中提出的VLA思路,是把视觉语言模型和机器人控制连接起来,让模型从网络图文数据和机器人数据中学习,并将知识迁移到机器人动作中。
RT-2 论文也明确将机器人动作表达为token,和自然语言token一起进入训练。
VLA的优势很明显:它能听懂语言、看懂场景、输出动作,路径清晰,工程上相对直接。但问题也很明显:很多VLA模型学习的是“某个机器人在某个场景下如何执行动作”。一旦换机械臂、换夹爪、换灵巧手,原来的动作轨迹就不一定能复用。
RoboScience的VLOA,多了一个“O”——Object。这个O不是泛泛地“识别物体”,而是Object Trajectory(物体轨迹):物体在三维空间中的连续点云轨迹,包括位置、姿态、形变、时间步和预测置信度。
RoboScience 官方技术文章称,其具身世界模型的输出不是下一帧像素,而是物体未来运动路径的3D点云轨迹。
可以用一句话区分:VLA更像是在学“机器人怎么动”;VLOA更像是在学“物体应该怎样被改变”。

这也是VLOA最有意思的地方:它不是简单给VLA加一个模块,而是试图换掉中间层的“语言”。
03
为什么说Object Trajectory可能是具身智能的“Token”?
大语言模型的基本单位是文本Token。无论模型最后生成诗歌、代码还是合同,本质上都在处理Token序列。自动驾驶里,车道线、障碍物、点云、BEV空间表征,也构成了系统理解世界的基础格式。
而机器人操作更麻烦。它不仅要“看见”,还要“接触”;不仅要“判断”,还要“改变物理世界”。所以,具身智能的基础表征必须同时回答三个问题:
第一,任务要达到什么状态?
第二,物体会如何运动或变形?
第三,不同机器人怎样把这个目标执行出来?
Object Trajectory的价值就在这里。它把“任务目标”从机器人的身体里抽出来,放到物体本身上。抓杯子不是“夹爪闭合30度”,而是“杯子以稳定姿态从桌面移动到目标位置”;拼家具不是“双臂执行一串关节角”,而是“板件、螺丝、插槽按照正确关系被移动、插入、锁定”。

如果这套中间表征足够稳定,它就可能带来三个好处。
第一是跨本体。不同机器人身体不同,但它们面对的“物体目标状态”可以相同。
第二是跨物体。新物体不一定需要从零采集动作数据,而可以先预测它该如何运动。
第三是长程任务更容易拆解。多步骤任务不再只是动作序列,而是一个个可检查的物体状态变化。
04
Visics的双引擎:一个负责“想”,一个负责“做”
Visics采用双引擎架构:上层是具身世界模型,下层是通用操作模型。具身世界模型负责“想”。它输入语言和视觉信息,预测物体未来会怎样运动。
RoboScience官方文章称,这一路线不是做传统2D视频预测,也不是静态3D重建,而是做3D动态世界建模,即预测物体在三维空间中随时间变化的连续轨迹。
通用操作模型负责“做”。它接收世界模型生成的Object Trajectory,再转换成接触点、力控命令和关节角指令。官方技术文章称,该模型输入的是物体和环境的点云轨迹,并能基于点云进行闭环控制;其目标不是重新学习“去哪里”,而是学习“怎么到那里”。
这套设计的关键,是把认知和执行解耦。传统端到端模型像一个“黑盒学生”:看到杯子,听到“拿起来”,直接输出机械臂动作。VLOA更像一个“先规划再动手的工人”:先想清楚杯子应该如何移动,再决定用哪只手、哪个角度、多少力去执行。
这种分层设计不一定比端到端更简单,甚至工程上更难。但它更符合机器人产业的现实:未来市场上不会只有一种机械臂、一种灵巧手、一种人形机器人。如果每换一个硬件都要重训一个大模型,通用具身智能很难规模化。
05
数据降本:真正的产业变量在这里
具身智能绕不开数据。语言模型可以吃互联网文本,视觉模型可以吃互联网图片和视频,但机器人模型需要真实交互数据。
问题是,真实机器人数据太贵、太慢,还和硬件强绑定。
RoboScience的解法是“仿真 + 视频”双数据飞轮。公开报道中,RoboScience称其通过自研高精度仿真引擎 RoboMirage和自动标注清洗管线,把单条数据获取成本降到传统方案的1/20至1/200,并以每周数十万小时速度扩展视频数据;
报道还称,公司目标是在2026年构建超过1T的高质量 manipulation操作轨迹数据集。RoboMirage的定位是面向具身智能的高精度通用物理仿真平台,支持刚体、1D/2D/3D可形变体、多关节结构和多种机器人末端执行器的接触建模,并强调高精度多体动力学和GPU加速。
这套路线有明显优势:
一是规模。如果数据生产主要依赖算力,而不是遥操作人员,产能上限会高很多。
二是覆盖。仿真可以制造大量真实世界中难以采集的边界案例,比如失败、碰撞、形变、遮挡和异常接触。
三是安全。高风险动作可以先在仿真中训练,再迁移到真实机器人。
但它也有一个核心挑战:仿真永远不是现实。
家具板件的微小误差、软材料的摩擦变化、真实传感器噪声、现场光照和遮挡,都可能让模型在真实环境中失效。所谓sim-to-real,不是把仿真数据堆大就自然解决,而是要靠足够高精度的物理建模、真实数据校准、在线反馈和场景闭环共同完成。
所以,数据成本下降会重构研发门槛,但不会让中小团队立刻都能训练通用具身模型。它会降低一部分门槛,同时把竞争焦点转移到仿真引擎、数据清洗、真实场景验证和硬件闭环能力上。
06
VLOA能成为新标准吗?
结论可以分三层说。
第一,VLOA抓住了真问题。
具身智能确实缺少统一基础表征。Open X-Embodiment项目曾汇集22种机器人本体、超过100万条真实机器人轨迹,并强调用统一数据格式促进跨机器人策略学习。
这说明行业早已意识到:机器人不能永远停留在“一个任务一个模型、一个本体一套数据”的阶段。
第二,Object Trajectory是一个有解释力的候选答案。
它把机器人学习的中心从“本体动作”转向“物体状态变化”,天然更接近操作任务的本质。邵林团队此前在 D(R,O) Grasp中也围绕“机器人-物体交互”的统一表示做过研究,并获得ICRA 2025 Robot Manipulation and Locomotion最佳论文奖。
第三,它还没有成为标准。
判断一个技术能否成为标准,不能只看发布会Demo,而要看四个条件:

因此,最客观的说法是:VLOA不是已经成为新标准,而是提出了一个可能成为标准的方向。它的价值不在于又多了一个机器人Demo,而在于把行业争论从“谁的机械臂更灵巧”,推进到了“机器人到底应该用什么基础语言理解物理世界”。
07
真正的看点:不是机器人会不会拼家具,而是行业会不会换语言
在发布会上,Visics展示了机器人读取说明书完成家具拼装,并在过程中应对人为拆解后继续恢复执行;还展示了开信封、立硬币、抓薯片、针管注射、动态传送带抓取等任务。相关演示能力来自公司和媒体报道,仍需更多第三方测试验证。
但从产业角度看,这些Demo的意义不只是“机器人又会干活了”。更关键的是,它们在展示一个路线判断:未来的机器人模型,不能只学动作库,也不能只靠真机示教堆数据。它需要一种能连接语言、视觉、物体、物理和动作的中间表征。
如果Object Trajectory最终被证明足够通用,VLOA可能带来类似操作系统接口的作用:上层应用不必关心底层硬件细节,底层机器人只要理解同一种物体轨迹接口,就能执行不同任务。
那时,具身智能产业的协作方式会发生变化。机器人厂商不必每家都从零训练大脑;灵巧手、机械臂、人形机器人可以共享部分模型能力;零售、物流、康养、家庭等场景的数据,也能以更统一的格式反哺基础模型。
但这一天还没有到来。VLOA要真正成为行业标准,至少还需要经过三关:更多真实场景的长期稳定性验证,更多非自研本体的跨平台部署,以及更多外部开发者和合作伙伴对Object Trajectory接口的采用。
