AI 能“看”懂一个视频,但它真的“理解”这个视频吗?
2026年8月27日,AI 研究实验室 MirroS 发布了一项名为 Code-as-World 的工作,给出了一个足以让整个行业重新思考的答案。他们用一个智能体循环,把真实视频一步步改写为可以在 MuJoCo 物理引擎中运行的完整物理程序。这个程序不仅视觉上复现了原始视频,而且真正理解了场景中的质量、重力、摩擦力、碰撞关系,并能精确复现和预测物理运动。
当一段球体滚下斜面的视频被送入视觉语言模型(VLM),大多数模型能“看”出这是一个球在下滚。但如果追问:这个球的质量是多少?离开斜面时的速度是多少?它会不会和另一个球发生碰撞?绝大多数模型会卡住。这并非模型的错。因为像素只是证据,不是本体。
现象层:从“看”到“理解”,一次范式的跃迁
当前的视觉 AI 系统,无论是 GPT-4o、Gemini 还是开源 VLM,都擅长识别。它们能指出画面中有一个蓝色球体、一个红色球体、一个黄色斜坡,甚至能描述出球在滚动。但当你要求它们输出精确的物理量,比如球的直径是多少厘米、离开坡面时的速度是多少米/秒、碰撞前后的动量变化,它们的能力急剧衰减。
这不是偶然。斯坦福大学发布的 QuantiPhy 基准测试专门设计来测量 VLM 的定量物理推理能力。该基准包含超过 3300 个视频-文本实例,要求模型从单目视频中推断物体的大小、速度和加速度。结果残酷:即便最强大的开源模型,在 MRA 指标上也只拿到约 40 分。而人类基线是 55.6。
MirroS 用 Code-as-World 给出了一个全新的解题思路。与其让模型从像素中猜测物理量,不如先让模型把视频还原为可执行的物理程序,再从这个程序里读出精确的物理数据。
具体来说,Code-as-World 将物理场景表示为一种称为“可执行世界表示”(Executable World Representation, EWR)的三元组结构:Composition(组成,包含物体的几何、质量、摩擦系数、重力等)、Evolution(演化,包含初始状态、力、接触、碰撞、终止条件等)、Appearance(外观,包含视觉渲染参数)。整个场景被打包成一个结构化的 scene.json 文件,可以直接送入 MuJoCo 执行。
更关键的是,这个三元组不是人工标注的,而是由一个智能体循环自动从视频中“发现”的。这个循环最多只需要 5 轮迭代:提出假设,在 MuJoCo 中执行,渲染对比,验证一致性,修正假设。每一轮,仿真结果都与原始视频进行像素级和物理级对齐验证,直到误差收敛。
分析层(一):像素是证据,不是本体
MirroS 技术报告的开篇引用了《白鲸记》中的一句名言:“All visible objects, man, are but as pasteboard masks”——所有可见之物,不过是纸糊的面具。这句话精准概括了 Code-as-World 的核心哲学。
传统视觉模型的核心假设是:像素包含了理解场景所需的全部信息。但 MirroS 的论证恰恰相反。像素只是场景的证据,而不是场景的本体。你可以在完全不理解质量、接触和重力的前提下,预测出“合理”的下一帧画面。视频模型能生成流畅的帧序列,却可能完全不知道画面中的物体有多重、碰撞是否违反动量守恒。
这是视觉 AI 长期存在但被选择性忽略的根本矛盾。3D 重建试图从多视角视频中恢复几何结构,但它不关心物体是否真实受力;语言描述会说“球滚下斜坡”,但不告诉你是多少秒滚完的、加速度是多少。三者都恢复了一个场景的一部分,但没有一个恢复场景的机制。
Code-as-World 选择了一个更根本的表示方式:代码。代码天然精确、天然可执行、天然可验证。一个 scene.json 文件包含球体的质量(0.2 kg)、重力(9.8 m/s²)、摩擦系数、时间步长(1/240秒)——所有这些参数组合在一起,决定了物理系统如何演化。这不是“大致正确”的描述,而是精确到浮点数的物理本体。
分析层(二):从视频到物理程序的五轮炼金术
Code-as-World 的智能体发现循环是一个典型的溯因推理过程。
给定一段真实视频,系统使用 SAM 3、DA3、VGGT-Omega 等视觉基础模型提取证据:物体分割、3D 位置、相机轨迹、场景几何。这些构成初始假设的基础。然后语言模型基于这些视觉证据撰写一个初始的 scene.json,包括物体定义、物理参数、初始状态和重力设置。MuJoCo 执行这个 scene.json,生成一帧帧仿真的渲染结果,并与原始视频进行像素级对齐验证:物体位置是否匹配?运动轨迹是否一致?碰撞时间点是否同步?如果不匹配,将差异反馈给语言模型,修正物理参数后重新执行。
整个过程最多迭代 5 轮。在 MirroS 报告的定性分析中,仅 2 到 3 轮后,仿真与原始视频的像素级拟合度就能收敛到视觉不可区分的水平。
值得注意的是,MuJoCo 的选择本身就承载了强烈的方法论信号。与 NVIDIA Isaac Sim 这类端到端 GPU 物理引擎相比,MuJoCo 是轻量级的、确定性可微的物理引擎,由 Google DeepMind 维护,广泛应用于机器人强化学习。选择 MuJoCo 意味着 Code-as-World 追求的不仅仅是视觉真实感,而是物理上的精确性和可复现性。仿真结果不应该“看起来差不多”,而必须“物理上一致”。
分析层(三):55.4 vs 54.8——开源模型凭什么超越 Gemini
Code-as-World 的最直接应用,是为视觉语言模型提供可扩展的物理监督信号。
真实世界视频虽然丰富,但缺乏精确的物理标签。你无法从一段监控录像中直接读出“物体质量=0.2 kg”或“碰撞速度=1.3 m/s”。这导致 VLM 在定量物理推理上长期停滞。模型可以描述物理现象,却无法精确测量物理量。
Code-as-World 的 EWR 自动携带了完整的物理参数。一旦视频被成功转化为可执行世界,你就可以从这个世界中提取任何想要的物理数据:任意时刻的位置、速度、加速度、动能、动量。这本质上是在制造无限量、高精度的物理标注数据。
MirroS 用这套数据微调了两个模型:Code-as-World-VL-4B 和 Code-as-World-VL-9B,分别基于 Qwen3.5-4B 和 Qwen3.5-9B。在 QuantiPhy 验证集上,9B 版本取得了 55.4 MRA 的得分。
这个数字需要放在对比中理解。同一基准上,Google 的 Gemini-3.1 Flash 得分是 54.8。一个 9B 的开源模型以 0.6 分的优势,超过了 Google 的最新一代闪存版模型。而未经 Code-as-World 数据训练的同等规模最强开源模型(如 Qwen3-VL-Instruct-8B)得分约 40.5,被拉开了约 15 个点的差距。技术报告还提及了 Code-as-World-VL-27B 版本(尚未开源),其表现进一步超越了 9B 版本和所有被评估的基线模型。
用可执行世界的物理监督训练出的 9B 模型,击败了 Google 的旗舰闪存版模型。这背后传达的信息是:在定量物理推理这个维度上,训练数据的质量比模型参数的规模更重要。
分析层(四):开源、开放,但距离生产还有多远
MirroS 将 Code-as-World 以 Apache 2.0 协议完全开源。GitHub 仓库提供了完整的推理代码和 QuantiPhy 评估流程,HuggingFace 上可以直接下载 BF16 的 4B 和 9B 模型权重,通过 vLLM 部署在 OpenAI 兼容的 API 后端上,输入为每视频 16 帧采样。
但必须指出,这套系统目前仍处在研究和内部原型阶段,离生产环境还有明显距离。
依赖链过长是第一重约束。Code-as-World 的视觉感知管道需要 SAM 3、DA3、VGGT-Omega、SAM 3D 等多模型串联,任何一个环节的精度瓶颈都会传导到最终的 EWR 质量。物理假设空间有限是第二重约束。报告明确指出当前 EWR 主要覆盖刚体动力学和简单碰撞场景,对于柔性体、流体、热力学等更广泛的物理现象尚未涉及。视频输入限制在 16 帧采样是第三重约束。对于高速运动或长周期物理过程,采样密度可能不够。
但与这些局限相比,方向上的一致性和清晰度更值得关注。Code-as-World 选择了一条与其他“世界模型”路线截然不同的路径。它不追求用一个大模型端到端地生成像素或潜变量,而是坚持“代码作为世界表示”。代码的精确性、可执行性和可验证性,是像素和潜变量无法替代的。
结论与展望
Code-as-World 的意义不限于一个基准测试的排名。
它回答了一个更本质的问题:什么叫“理解”物理世界?是能从视频中描述发生了什么事,还是能构建出一个精确复现并预测物理过程的、可执行的世界模型?MirroS 选择了后者,并用一整套工程体系证明,这条路不仅走得通,而且能产出现在最高水平的定量物理推理模型。
展望未来,Code-as-World 的范式将对几个关键领域产生深远影响。在具身智能领域,机器人可以从真实操作视频中自动提取物理模型,用于策略学习和 sim-to-real 迁移。在自动驾驶中,从行车记录视频中恢复精确的物理场景,可用于边缘案例生成和安全性验证。在物理教育和科研中,一个物理现象的视频可以被自动转化为可交互的 MuJoCo 仿真,供学生和研究者探索。
当所有 AI 都在学着“看”世界的时候,Code-as-World 选择教它“算”世界。从像素到代码,从描述到执行。理解物理世界最深刻的检验方式,从来不是你能说出什么,而是你能重新造出什么。






快报