WAIC 2026,世界模型的面貌又清晰了一些
统计 阅读时间大约8分钟(2850字)

1天前 WAIC 2026,世界模型的面貌又清晰了一些

来源:先验实验室
三个趋势显现

作者:Vincent     编辑:吕鑫燚     出品:先验实验室

世界模型仍是人工智能领域最受关注的概念之一。它被资本与舆论密集追逐,也始终顶着概念滥用与定义混乱的批评:太多目标和技术路径被压缩进同一个词,多条路线共享一个名字,却在解决完全不同的问题。

而在WAIC 2026上,行业讨论的重点正在发生变化。会场中硬件展台的人流量仍火爆,但本体已不再是唯一焦点。具身大模型的展示与解说正成为头部玩家的热度叙事,围绕世界模型的讨论在各大论坛反复出现……过去大家问:世界模型生成的世界逼不逼真?世界模型在宏观上到底有多大作用?世界模型和VLA如何取舍?但会场上,大家开始关注的,则是模型到底能否在细节上理解物理规律?采取一个动作后,模型能否预测世界怎样变化?模型到底能否帮助机器人完成任务?

几天的展会结束之后,我们发现,世界模型确实仍未收敛为统一路线,但关于它的趋势与共识,正在三个方向显现出更加清晰的轮廓:模型不只要生成未来,还要预测行动的后果;数据不只追求数量,还要记录原生、真实的物理交互;部署也不只是商业化的最后一步,而是验证能力、产生数据并继续训练模型的新起点。

7681a4eb891c1eb367917910faff53bc.jpg

本届WAIC展馆里,生成路线仍在继续演进,一些企业展示尝试维持长时序中的空间关系,另一些系统则将可交互的三维空间积极延伸到影视制作、游戏、数字孪生等等。这说明,生成模型仍然是世界模型的一条重要分支。随着技术的进步与需求的落地,它的商业价值正在各行各业开花结果。

但同样在展馆里,生成在产业中的位置发生了转变,它越来越多地被表述为现实场景与本体动作的上游:为机器人提供虚拟训练场、为仿真提供素材,而不再是世界模型的终点。行业更多地要求世界模型回答另一个问题:给定当前状态和一个动作,接下来会发生什么。

为这一转向提供理论参照的,是诺贝尔经济学奖得主、纽约大学教授托马斯·萨金特。他在世界模型主题论坛上区分了两类模型:开普勒式的描述模型拟合数据、描述现象,但不解释机制;牛顿式的结构模型则负责解释物理因果。放到行业语境里,它恰好提供了一种理解当前转向的方式:生成模型更擅长复现现象,而面向物理AI的世界模型,需要进一步迈入理解物理、推演因果的“牛顿领地”。

产业端的思考也在向这一方向靠近。智元合伙人、觅蜂科技董事长兼CEO姚卯青在主论坛上提出:“世界模型最重要的功能,是预测世界的下一个状态,而不是简单渲染世界的下一个画面。”还有另一种声音是,世界模型是对动作与状态的高频联合预测,不仅告诉机器人下一个动作是什么,还要告诉它,做了这个动作之后,世界会怎么变。

55c0ad1a19a5e08aa5a0c8a4c950bd89.jpg

目标换了,评测标准自然也在变。在WAIC 2026世界模型“六小龙”巅峰论坛上,几大玩家就世界模型的评测标准给出许多答案,包括泛化性、预测精度、决策有效性、反事实评测或多任务真机成功率等等。这些思考表面上不尽相同,但内在逻辑却相对一致:面对真实物理的世界模型,必须要从“画得像”往“理解得对、行动得可靠”迈步。大晓机器人联合创始人、首席科学家陶大程的总结十分到位:做具身世界模型,不是为了复刻像素,而是为了控制行动。像素复刻是给人看的,物理推演是给机器人用的,拿给人看的标尺去衡量机器,本身就存在缺陷。

就这样,理论与产业合在一起,共同指向了世界模型“六小龙”论坛的结语:世界模型的研发,正从生成得像不像到执行得可不可靠转变。世界模型由此被推向一项更具体的任务:从生成可能的未来,走向预测行动的后果,并尝试把这种预测转化为实体控制。

定义收敛尚未完成,但行业已经开始用“能否可靠行动”重新衡量世界模型的价值。

62e24022b47ea83d7cb94ac701b6e134.jpg

当世界模型的目标从生成画面转向预测行动,作为当前不少路线所依赖的训练数据来源,互联网视频也暴露出了明显的天花板。WAIC主论坛的演讲中把视频称为“不完备的物理数据”,"单纯看一段视频,是发现不了牛顿第二定律的。”视频数据本身的可信性与可用性也值得商榷。姚卯青也在论坛上指出,互联网视频中包含大量娱乐性、创作性甚至违反物理规律的内容。它们可以帮助模型形成广泛的视觉先验,却不能直接承担具身智能的全部训练任务。

ba6482450b9cf5e2f71518bd58bba88f.png

也就是说,拿简单的视频训练复杂的物理任务,先天不足。

于是,“原生”这个词在数据和架构上的分量都更重了。智元机器人AI算法总监任广辉在论坛上指出,当前大量视频素材并不适合直接训练实体机器人,行业需要大规模原生具身交互数据集;无界动力联合创始人兼CTO夏中谱进一步指出,视觉、触觉等不同模态承载的物理信息并不相同,行业仍缺少适合它们的统一表征,而仅靠模仿人类动作,也不足以保证机器人形成超越示范数据的能力。

蚂蚁灵波首席科学家沈宇军则提出了一个更基础的问题:触觉是模型最不可或缺的模态,“一旦触觉真正进入模型,物理世界模型就会在输入层面与普通视频生成模型拉开距离”。

与此同时,仿真和生成数据的重要性并未因此被否定。WAIC展馆里,出现了多种连接人类操作、三维场景和数据采集的方式:工作人员佩戴采集设备完成制作咖啡等任务,人的动作和环境变化被记录下来,再在数字空间中扩展;可交互三维场景则被用于构造机器人难以在现实中反复采集的环境和长尾情况。

因此,WAIC呈现出的第二个趋势,不再是“缺数据”这个简单的旧问题,而是“缺数据”瓶颈被不断细化、对数据原生性的要求不断提升、数据的可信度越来越被当成工程问题处理……行业也不再简单争论真实数据与仿真数据谁更重要,而是开始重新安排二者的关系:真实交互提供物理锚点,仿真负责扩大规模和场景覆盖,真机执行再将成功与失败反馈给模型。

4c8e97353996a541b8bede18d0617e55.jpg

而这道命题在本届WAIC上被算得很细。自变量机器人联合创始人兼CTO王昊直言,模型效果从0提升到90%时,投入尚相对可控,但90-99%、99%-100%,投入成本却和第一阶段几乎持平。部署,看的就是企业能付出多少成本,“部署阶段如果成本大于收益,那就是宣告失败了”。

真实世界的随机性也会增添另一大成本,沈宇军举出了大会现场的例子,他把产品演示交给观众,需求的随机性立刻显现,类似情境一旦反复出现,模型往往还要回炉训练,部署成本也会随之上升。时间也是成本,机器人进入产线后,不同层级的决策都受到严格时延约束,底层控制尤其无法长期依赖云端和不稳定网络,一旦酿成错误,安全责任、产线损失将令部署成本再度攀升。

于是,在成本约束下,高频刚需、确定性强、有容错空间的简单任务;交互数据密集、任务成败标准明确、人类操作数据丰富的制造业场景,逐渐成为行业部署的优先选择。正因此,各家在部署上比拼的,已不能再是单一维度的领先。模型能力要够高,否则连入场券都拿不到;泛化性要够强,换条产线就要重训,成本便难以在不同场景中摊薄;真实表现要够稳,demo的漂亮数字一进产线就打折,折损的是企业的信任度。

最后,成本还要压得够低。这几个方面往往互相掣肘,而真正的功夫,就是在这张不断拉扯的网里找到那个当下收益为正的平衡点。

毕竟,模型再怎么聪明,行业也不会为理论上的聪明买单,只会为稳定可靠的落地效果买单。

总结来看,世界模型的能力需要在真实场景中接受验证,模型所需的原生数据又有赖于部署中的持续交互。本届WAIC的第三个趋势由此显现:部署,这个一般意义上从技术原型到商业验证的终点,正转变为关乎世界模型技术迭代快慢及商业化成败的起点。而如何在成本可控、运行稳定且收益为正的前提下形成有效部署,也将是企业下一步应当着重考虑的命题。

结语

到这里,本届WAIC让世界模型变得更清晰的,并不是某条路线已经胜出,也并非宣布在真实世界中进行可靠行动即将实现,而是世界模型,正在被逐渐剥离那个无所不包的概念外壳,被放回定义、数据、部署等等构成的现实约束中。

下一阶段,单纯模型和技术路线的竞争或许将不再是全部。模型能力、真实数据、仿真环境、机器人本体、评测标准与部署成本等等共同参与的系统竞争,会将世界模型,推向下一个更真实、更有力,也更让人有所期待的发展阶段。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×