WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟怎样转化为机器人动作?
统计 阅读时间大约7分钟(2756字)

10小时前 WAIC世界模型六小龙都在谈物理AI,我更关心一个问题:世界模型的预测究竟怎样转化为机器人动作?

来源:豆包
作者:Yuanxq   出品:具身智能研究室7月19日,WAIC2026世界模型六小龙巅峰论坛在上海举行。大晓机器人在现场发布Ka...

作者:Yuanxq     出品:具身智能研究室

7 月 19 日,WAIC 2026 世界模型六小龙巅峰论坛在上海举行。大晓机器人在现场发布 Kairos 3.1、环境式数据采集方案 2.0 和三套行业方案,Physical IQ具身物理智能统一评测平台也在同场亮相。

现场内容很多,背后都指向同一个技术问题:一个世界模型怎样从预测未来画面,继续走到机器人可以执行的动作

Kairos 技术报告给出的答案包含三层。模型先从视觉、语言和机器人状态里压缩出与控制有关的内部状态,再用视频生成和动作预测共同训练这组状态,部署时可以跳过未来视频,直接生成动作片段。数据则按照开放世界视频、人类行为和机器人交互逐步加入,让物理先验最终落到具体本体上。

Kairos希望用同一组内部状态,同时表达物理变化、任务进度和机器人动作。它试图让视频中的物理变化、任务进度和机器人动作,共用同一组内部状态。

f2527a66d1658fb10b0042002eea4303.jpg

WAIC 2026 世界模型六小龙巅峰论坛现场

技术报告基本信息

技术报告:https://arxiv.org/abs/2606.16533

开源代码:https://github.com/kairos-agi/kairos

模型权重:https://huggingface.co/kairos-agi

控制充分状态为什么需要力触数据

论坛上反复出现的一个词是控制充分状态。它来自 Kairos 技术报告,指机器人完成当前任务时必须保留的内部信息:物体在哪里、双方怎样接触、任务进行到哪一步、继续执行可能产生什么结果,以及当前判断有多大不确定性。

机器人拿杯子时,桌面纹理很少改变动作选择;杯子位置、抓取姿态、摩擦和滑动状态会直接影响下一步。论文用后悔值衡量压缩状态造成的信息损失:模型只看内部状态做出的决策,与读取完整历史后能做出的决策相比,会增加多少碰撞、失败、恢复和人工介入成本。

内部状态的好坏,最终要看丢掉的信息会不会改变动作选择。

c291ed9a886a0dd9d8b45250f4ffe81f.png

控制充分状态希望用紧凑信息支撑低代价决策

这个定义也解释了大晓为什么同时发布环境式数据采集方案 2.0。只记录画面,模型很难区分手指已经接触、正在受力,还是物体已经开始滑动。新方案把头、手、胸多视角画面与三维力触觉、手部动捕放到同一条采集链路,现场公布的指标包括 0.01N 力触觉灵敏度、低于 2° 的关节角误差,以及 20 余种传感器低于 1 毫秒的同步误差。

95da731e177707fc59a8dc9c60973a2d.png

视觉、手部动作和力触状态共同描述一次真实接触

论文里的控制充分状态目前仍是一项目标定义,并没有直接证明这组隐变量已经完整恢复摩擦、受力和失败边界。数采系统提供的同步力触数据,恰好补的是后续验证所需的观测基础。

一次开冰箱怎样串起理解、生成和动作

Kairos 由多模态理解、视频扩散变换器和动作扩散变换器组成。图像经过视觉自编码器压缩,任务指令由视觉语言模型编码,机器人状态由状态编码器处理,随后进入共享的视频动作注意力。

5e1f6903b1616447050f7bad40df789b.png

论文架构中,理解、未来视频和动作预测共享同一组状态表征

理解模块读取历史视觉、任务指令和机器人状态,整理当前任务进度。视频分支采用流匹配训练,在干净视频隐变量与噪声之间学习速度场,用未来画面约束物体持续性、空间布局和接触变化。动作分支读取同一段历史,生成后续动作片段。

训练序列分为历史视频、未来视频和未来动作三组令牌。未来视频与未来动作都读取历史信息,动作分支却不读取未来视频令牌。联合训练时,视频分支提供世界动力学监督;部署时可以关闭未来视频解码,只对动作令牌去噪,减少推理成本。

发布演示里的开冰箱任务把这套结构放到了具体操作中。系统从同一初始状态展开不同接触方案,比较三指、右手反关节和左手触摸门体等轨迹,再选择行动代价更低的方案。

e310b28837a892e5020617fb70653c88.png

发布演示展示了同一状态下的多条动作轨迹推演

这里需要区分两层证据。开冰箱展示的是完整产品链路;技术报告验证的是模型结构、视频动作联合训练和标准基准。多条想象轨迹与真机执行结果是否稳定对应,论文仍把它列在后续验证中。

三阶段训练为什么和 ACE-Data-0 一起发布

Kairos 按照干预世界的强弱组织训练数据,开放世界视频、人类行为和机器人交互依次进入模型。

f4f0cafa0c1fd0988367a93acddb8d6c.png

跨本体数据课程逐步完成物理规律、任务意图与机器人动作的对齐

开放世界阶段训练视频扩散变换器。模型从 256P 图像开始,逐步扩展到 720P、最长 241 帧的视频,先获得物体运动、碰撞、支撑和时间连续性等一般先验。

人类行为阶段加入第一视角、第三视角的人类行为和机器人视角视频。模型开始学习工具使用、操作顺序、任务目标和恢复过程,训练文本也逐渐从画面描述转为任务指令。

机器人交互阶段引入时间对齐的视频、动作、本体状态和接触信号,同时训练 Video DiT与 Action DiT。失败、滑动、危险接触和恢复片段会组成偏好样本,让稳定、安全、可恢复的执行结果获得更高训练权重。

大晓同场开放的 ACE-Data-0 面向家居复杂任务,强调力触过程、失败恢复和长程标注。它与三阶段课程的关系很直接:公开视频解决覆盖范围,人类行为补任务结构,机器人数据把这些知识压到具体动作空间;失败与恢复数据继续标出动作边界。

c62afa2f2127d3ac8c52a4db35efdd93.png

ACE-Data-0 记录家居任务里的物理交互与过程状态

125 毫秒之后,运动控制怎样接住动作

长程任务还会遇到记忆和计算量问题。接触变化发生在短时间内,取物、移动和放置跨越多个阶段,遮挡后的物体位置与失败历史又要保存更久。Kairos 将时间建模拆成三条通路:滑动窗口处理局部运动,扩张窗口连接中程事件,门控线性注意力维护物体持续性、任务进度和失败历史。

2b66728204401891922b635b0374d536.png

局部窗口、中程扩张窗口和全局线性记忆分担不同时间尺度

这套结构也服务端侧部署。大晓在现场公布的测试条件为 NVIDIA Jetson Thor、BF16 精度,Kairos 3.18B 的平均延迟是 125 毫秒。模型还使用四步扩散蒸馏、推理缓存、算子融合、混合精度量化和异步动作运行压缩推理链路。

4ce05f2c34910efe47f021a031d36e4f.png

现场延迟数据对应端侧动作推理,需要与完整未来视频生成区分

125 毫秒仍高于电机级控制周期。世界动作模型适合更新任务状态并生成动作片段,底层控制器继续负责关节跟踪、平衡、接触稳定和安全保护。模型、动作接口与运动控制器会运行在不同频率上,本体反馈负责把它们重新对齐。

论文成绩为什么还要接统一评测

动作侧实验使用 RoboTwin 2.0 和 LIBERO-Plus。Kairos 在 RoboTwin 2.0 上取得 96.1% 平均成功率;LIBERO-Plus 平均成绩为 89.0,推理时同时对未来视频和动作联合去噪的 Kairos-joint 达到 90.8

b3f10fd46f2030c847bc5e8ae792c844.png

Kairos 与 Kairos-joint 在不同视觉和场景扰动下的结果

加入人类行为预训练后,LIBERO-Plus 从 83.0 提升到 89.0;动作分支单独训练为 65.8,视频和动作联合训练后达到 89.0。这个结果说明,视频动力学监督确实向动作预测提供了有效信息。世界模型侧,Kairos 4B 在 WorldModelBench、VideoPhy 和 15 秒 PAI-Bench 上也给出了物理合理性与长程一致性结果。

这些仍是标准数据集上的代理证据。真实任务还会改变光照、物体状态、本体结构、控制频率和接触条件。论坛发布的 Physical IQ 物智评测平台,目标是把不同模型和本体放到统一协议下,在零售、工业和家居环境中继续测试物理智能。

725d6526ece634cf8707811493c5c8fe.jpg

Physical IQ 尝试建立跨模型、跨本体的统一评测入口

三套行业方案把闭环问题带回现场

大晓发布的三套方案面向即时零售、酒店洗衣和开放场景作业。它们的任务流程和机器人形态不同,却都会反复遇到同一组问题:现场状态是否看准、动作片段能否及时生成、低层控制能否稳定执行、失败后系统能否找到接续位置。

9d12492e987ebe7efcd6ffe5462ad4d1.png

即时零售、酒店服务和开放场景作业对应三类连续任务环境

技术报告中当前的自我改进实验主要发生在提示词和视频生成层。模型生成候选结果,评估器按照物理合理性、任务完成度和视觉质量打分,再改写提示词并继续生成。真实机器人上的执行前失败预判、安全过滤、恢复学习,以及想象数据能否提高策略成功率,仍需要后续实验。

Kairos 已公开代码和 4B 系列权重,RoboTwin 2.0 与 LIBERO-Plus 版本提供动作预测入口。现场公布的 8B 端侧能力还需要更完整的权重、测试配置和真机复现材料。

这次发布把论文、数据采集、端侧推理、统一评测和行业场景放到了一条路线上。下一步要看的,是想象出来的未来能否持续对应真实物理结果。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×