具身世界模型缺的不是感知,而是“别人眼中的世界”
统计 阅读时间大约7分钟(2406字)

1天前 具身世界模型缺的不是感知,而是“别人眼中的世界”

来源:豆包
出品:具身智能前沿一个杯子,为什么能暴露世界模型的盲点?假设A把杯子从桌上放进柜子,B没有看见。现在问:B会去哪里找?只记录“杯子在柜子里”的系统,很容易给出物...

出品:具身智能前沿

一个杯子,为什么能暴露世界模型的盲点?

假设 A 把杯子从桌上放进柜子,B 没有看见。现在问:B 会去哪里找?

只记录“杯子在柜子里”的系统,很容易给出物理上正确、行为上错误的答案:去柜子找。但 B 的行动不是由真实世界直接决定的,而是由 B 所看见、所相信的世界 决定的。对 B 来说,杯子仍在桌上。

206156acce058d01345b5092dd68ee87.png

这不是给模型多塞一个“情商标签”。它把一个经常被混在一起的问题拆开了:全局世界是什么状态,和行动者以为世界是什么状态,并不是同一件事。

7 月 29 日公开的《Mental World Modeling》把后一类变量称为心智状态(mental state):信念、目标、意图、情绪,以及主体认为哪些行为合乎关系和规范。论文的主张很克制:它不是要读取某个人不可观察的内心体验,而是基于可见上下文维护一份与任务有关、可检查的推断状态,用来预测行动会如何改变物理世界和心智—社会状态。

对具身智能来说,这个区分很实际。机械臂抓起杯子时,关键往往是位姿、碰撞和抓取力;家庭服务机器人决定要不要把杯子递过去时,问题就多了一层:对方是否注意到了?现在递是帮助、打扰,还是误导?

这也是面向人的具身世界模型为什么要考虑它。本文聚焦的具身世界模型,指帮助机器人预测“我这样做,环境接下来会怎样”,以便规划动作的模型。若任务是避障、定位或抓取,环境主要由几何、动力学和固定规则决定,物理世界模型通常已经够用。但机器人进入照护、递送和多人协作场景后,人的知情程度、意图、信任和社会规范会改变“下一步什么动作才合适”。这时只预测物体会怎样移动不够,还要判断人会怎样理解机器人的动作、又会据此如何回应。

MWM 补上的,不是“更多感知”,而是两个视角的落差

许多面向物理任务的具身世界模型擅长回答:场景里有什么、在哪里、下一刻如何变化。MWM 在这个物理状态旁边,增加了心智状态,并要求模型先为某个目标主体生成局部观察,再推测它会如何行动。

可以把它理解成三步关系:

1.全局状态同时保存物理事实与和行动有关的心智—社会变量。

2.目标主体只能获得其中一部分信息;它看不见的内容不能偷偷泄漏进决策。

3.系统比较不同动作分支时,要同时模拟“物理上发生什么”和“其他人会怎样理解这件事”。

这里最关键的是第二步。很多“模型懂人”的演示,最后只是模型站在全知视角替人回答。MWM 则要求系统明确分开:世界模型可以知道杯子已被移动,B 的局部观察却不该知道。这才有机会解释 B 为什么会做出在旁观者看来不合理、对自己却合理的动作。

放到互动里看,这是一条连续的因果链:机器人的动作会改变人实际能看到的信息;信息改变人的信念;信念再改变人的回应。MWM 要模拟这条链:预测对方的可能回应,是比较自身候选动作、决定行动、询问或等待的依据。

这也解释了为什么它更像一套建模框架,而不是一个新的端到端机器人策略;感知、控制和具体模型能力仍需要单独解决。

MENTIS 把“理解别人”拆成六个可检查的动作

MWM 规定系统应表示什么:物理事实、局部观察与心智—社会状态;论文的参考实现 MENTIS 则是一套训练无关的 LLM基线,用六个阶段近似并检验这套表示,而不是直接要求模型猜最终行为。

cc529a77a24f968ad38217f30078e26f.png

图片说明:该图展示的是论文中的候选动作决策流程,不是机器人真实执行控制链路。图片来源:Mental World Modeling 论文 Figure 5

先把文本、图像或带声音的视频情境解析成结构化状态;再为目标主体渲染它实际能够看到、听到和推断的信息。接着,MENTIS 把每个候选动作拆成物理载体和可能的心智—社会含义,为每个分支预测下一状态,最后按心智一致性、物理合理性与社会恰当性评分,并用确定性规则选出答案。

这套流程最有价值的地方,不是多调用几次模型,而是留下可追问的中间产物。答案错了,可以查是状态解析错了、给目标主体漏了不该知道的信息、状态转移不合理,还是最后的价值判断失准。对需要调试人机协作 Agent 的团队,这比一句“模型推理错了”有用得多。

项目入口

论文: https://arxiv.org/abs/2607.27201

项目主页: https://mental-world.github.io/

代码与 Menti-Bench: https://github.com/mental-world/Mentis

仓库在 8 月公开了代码和完整 Menti-Bench。它要求配置兼容 OpenAI Chat Completions 的模型接口;视频样本还依赖 ffmpeg。因此“开源”在这里意味着流程、实现与评测集可获得,不等于不需要模型服务或可以直接上真机。

实验说明了什么,又没有说明什么?

作者构建了 448 条情境决策记录,覆盖文本、图像序列和带声音视频;在论文设定的八个 LLM 世界模型上,完整 MWM 的平均最终动作 F1 为 87.9。去掉心智通道后为 75.8,去掉物理通道后为 71.4。

dad9e79b1d7f3b27518f0e69474b8c08.png

图片说明:横轴与数值均是论文在 Menti-Bench 受控多选决策任务上的最终动作 F1,不能当作真实机器人部署成绩。图片来源:Mental World Modeling 论文 Figure 6

这组结果支持的是一个窄而有价值的结论:在作者构造的、答案依赖局部观察和社会情境的任务里,显式区分心智变量会提升最终动作预测。

它还不支持三件更强的说法。第一,F1 提升不等于系统拥有主观体验,更不等于“会共情”。第二,MENTIS 面对的是预给的候选动作;现实机器人还要生成动作、感知噪声、处理不完整的人类反馈。第三,Menti-Bench 是研究团队构建并质控的 448 条基准,外部真实场景能否复现同样增益,仍需要独立评测。

把边界说清,反而能看见这项工作的工程价值:它让“模型是否考虑了人的心智”从一句模糊宣传,变成可以检查状态、观察、分支和评估器的系统问题。

什么时候值得引入这层复杂度?

不是每个具身世界模型都该带着一套心智状态。论文给出了一个很实用的判断法:下面三个条件同时出现时,MWM 才更可能值得。

第一,局部观察和真实世界存在关键落差。例如用户没有看到物品被移动,或协作对象只收到了一部分消息。若每个主体都能获得同一份准确状态,单独维护“他以为怎样”带来的收益会变小。

第二,信念、目标、信任或规范会改变哪一个动作更合适。抓取控制里,杯子可不可达可能就够了;照护提醒、递送物品、主动介入协作时,对方是否愿意、是否理解,可能会改写最优动作。

第三,同一个物理动作带有社会含义。递出物品、打断对话、移动药瓶,表面动作相同,可能被理解为帮助、施压或越界。若系统只优化任务完成率,就容易错过这层后果。

反过来,若任务的成败几乎完全由几何、动力学或固定规则决定,例如避障、定位、抓取轨迹,先把物理模型和控制闭环做好,通常比给系统追加一套不可靠的心智推断更重要。

真正该学的,是让系统知道何时别自作主张

“理解人”听起来很大,但 MWM 给出的落点其实很具体:当系统不确定对方是否知情、是否同意、是否感到不适时,不一定要硬猜一个最优动作。它可以询问、延后、升级给人,或把选择权交回用户。

这也是我觉得这篇论文值得关注的原因。它没有证明机器已经读懂人心,却把一个经常被跳过的环节写进了系统状态:人并不生活在全知视角里。对面向人的 Agent 和机器人而言,少做一次“物理上对、关系上错”的动作,往往比多预测一个物体轨迹更重要。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×