世界模型能预测一切物理轨迹,却猜不对人的下一步动作

2026.08.22 18:36
牛津大学和新加坡国立大学团队提出的Mental World Modeling(MWM)框架揭示了当前世界模型的根本缺陷:Sora、Genie等模型精确模拟物理世界,却完全忽略人的信念、意图和情绪状态,导致在预测人类行为时频频出错。实验显示,即使较弱的语言模型只要显式建模心智状态,其决策预测准确率也反超更强但无心智建模的模型。当前最大瓶颈在于如何模拟物理与心智的耦合演变。

世界模型能预测杯子掉落的轨迹、碰撞的角度和碎裂的声响,却猜不到一个人会去拿杯子。

这听起来像一句悖论。但如果你把场景稍微改一下:有人趁你不在时,把你的杯子挪进了柜子里。你回来时,房间的样子和离开时一模一样,只是杯子消失了。一个只追踪物理物体的世界模型会预测:你直接走向柜子。但现实中,你大概率会先在自己原来的桌面上找一圈。

你找的不是杯子真实的位置,而是你相信它应该在的位置。这个差距,正是当前世界模型集体失明的地方。

2026年7月,来自牛津大学和新加坡国立大学的研究团队发表了一篇题为《Mental World Modeling》的论文,给出了一个直击要害的诊断:当今最受关注的世界模型——OpenAI的Sora、Google DeepMind的Genie、Meta的JEPA、李飞飞World Labs的Marble——都只模拟了世界的一个维度:物理层。它们知道物体在哪里、怎么运动、怎么遮挡,但完全不知道这个世界里的人在想什么。

模型预测对了场景,却预测错了行为。

当世界模型看不透人心

世界模型是当前AI领域最炙手可热的方向之一。它的理念很直观:如果一个AI系统能像人类一样在脑中模拟世界如何运转,它就能在行动之前推演后果,做出更聪明的决策。OpenAI的Sora用文字生成逼真视频,Google DeepMind的Genie 3生成可交互的3D世界,Meta的JEPA学习压缩世界的潜在表征,World Labs的Marble做到3D场景的生成、编辑和导出。

但论文作者Hao Fei和Yiran Zhao指出,这些模型存在一个共同的盲区。今天的世界模型大致分三类:表征式(Dreamer、JEPA)、视频生成式(Sora、Genie)、3D交互式(Marble)。它们回答的是一组物理问题:世界里有什么?它们在哪里?动作之后物体会怎么变?

对人类行为预测来说,这远远不够。论文用一个简单的例子切入本质:一个人把杯子放在桌上后离开房间,期间另一个人把杯子挪进了柜子。当主人回来时——场景从物理上看完全正确,杯子确实在柜子里。但一个只追踪物理状态的世界模型会预测主人走向柜子。而实际上,主人因为不知道杯子被挪动,会先在原来的桌面上寻找。

人的行为不仅由世界的真实状态驱动,更由他相信的世界状态驱动。物理状态决定什么可能发生,心智状态决定同一件事对不同的人意味着什么。

从63分到88分:心智建模的量化飞跃

论文的核心贡献不在于提出心理因素很重要这个直觉性判断——毕竟心理学和认知科学早已研究Theory of Mind数十年。MWM的真正突破在于:它把心智推断从一道静态问答题变成了物理-心智联合状态动态模拟。

在Menti-Bench数据集上,研究团队测试了8个基于LLM的世界模型,覆盖两个模型家族,在448个经过精细标注的场景决策样本上展开实验。样本涵盖文本、图片和带声音视频三种模态。实验设计了一个必要性阶梯:从完全不建模心智(只预测物理)到逐步增加心智建模承诺,每个台阶加入一个建模选择。

结果令人瞩目。在完全不建模心智的情况下,8个模型的直接回答平均F1分数仅为63.3。而完整MWM配置将这一数字推至87.9,提升超过24个点。更关键的是,这一增益与模型规模无关:即使是一个较弱的语言模型,只要采用MWM框架显式建模心智状态,其预测人类决策的准确率就能超过更强但无心智建模的模型。

这直接挑战了行业的主流直觉——更大的模型、更多的数据、更强的算力是解决一切问题的万能钥匙。在预测人类行为这个任务上,架构选择比规模更关键。

一个动作的两层含义:物理载体与心智载荷

MWM的框架设计有一个非常巧妙的核心拆解。论文将世界状态定义为一个耦合状态空间,其中物理状态存储物体、位置、遮挡关系等信息,心智状态存储信念、注意、目标、意图、情绪、社会规范、角色关系等信息。世界模型不直接从全局状态预测行为,而是先做一次视角渲染——为目标人物生成一个第一人称局部观察,严格排除该人物不知道的信息。

论文把全知叙述者知道的偷偷塞给局部行动者的错误称为视角泄漏(perspective leakage)。如果目标人物没看见杯子被挪走,他的观察里就不能出现杯子在柜子里。

在此基础上,每个动作也被拆解为两层:物理载体(说话、指路、抓取)和心智载荷(安慰、欺骗、拒绝、提醒)。同一个递杯动作,可能是道歉、是帮助、是施压,也可以是服从。只有同时追踪物理和心智状态的世界模型,才能区分这些含义。最后,系统模拟动作如何同时更新物理状态和心智状态——杯子到了哪里,以及每个人的信念、情绪和关系发生了什么变化。

最大瓶颈:物理与心智的耦合演变

论文没有回避问题。在进一步的瓶颈分析中,团队通过将每个阶段的输出替换为人工标注的黄金答案,逐段测量各阶段的误差贡献。

8个模型在完整MWM配置下平均F1达到87.9,但距离人类参考线仍有7.8分的差距。其中6.3分(81%)来自中间阶段的预测错误,主要是转移模拟和状态解析;1.5分(19%)残留在价值评估和决策规则中。

转移模拟是第一大瓶颈。当模型直接使用黄金标注的下一状态时,性能从87.9提升到最高94.2(以gpt-5.6-sol为例),弥补了人类性能差距的45%。这意味着MWM框架当下最薄弱的一环,不是不知道当前世界是什么,而是不知道世界会怎样变化——特别是人的信念、意图和情绪如何因为一个动作而改变。

物理状态的变化可以依赖物理引擎模拟,但心智状态的变化——一个人的信念如何因为一句话改变?情绪如何因为一个动作波动?社会关系如何因为一次互动重新配置?这些动态目前还没有成熟的数学模型。论文将这一瓶颈锁定为未来研究的首要突破方向。

三种场景:什么时候该揣摩人心

论文没有宣称所有场景都需要MWM。它给出了三个同时成立时最值得使用MWM的条件。

第一,部分可观测性:目标人物的视角和世界真实状态之间存在信息差。第二,心智变量决定决策:信念、目标、信任或社会规范会改变合理的行为选择。第三,动作具有社会含义:同一个物理动作在不同的心智语境下意味不同。

当这三个条件同时出现时——服务机器人判断现在把杯子递过去是否合适,医疗助理理解病人为什么拒绝推荐方案,教育Agent评估一次解释有没有真正让学生理解——物理世界模型就是不够的。

世界模型的下一个战场

MWM的提出恰逢世界模型赛道进入一个关键十字路口。2026年3月,OpenAI关闭了Sora消费端应用,转而聚焦世界模拟在机器人方向的研究。Google DeepMind的Genie 3仍限于研究预览。世界模型到底是什么这个最根本的问题,行业还没有共识。

MWM在这个时间点给出了一个清晰的回答:世界模型的下一步,不是更逼真的像素,不是更大规模的参数,而是从模拟物理世界走向模拟那个在物理世界中行动的心智。论文的最终判断是:我们期望MWM成为世界建模的下一个阶段——从模拟物理场景,到模拟在场景中行动的心智。

这个转向如果被行业采纳,将意味着一系列深远的改变。AI Agent的评估基准需要从任务完成率扩展到对人类行为预测准确率。人机协作系统需要从任务规划升级到共同知识维护。服务机器人的核心能力将从理解环境变为理解用户。

从63.3到87.9分,MWM已经证明了物理世界模型缺失的那一半有多大。从87.9到97.0分,剩下的路需要回答一个更本质的问题:当AI系统被部署到真实世界中,它们真正需要理解的不是世界本身,而是由无数个信念、意图和情感交叠而成的人的世界。

杯子在哪里不重要。重要的是人相信杯子在哪里。

作品声明:内容由AI生成