WorldPrompt:Runway 不再只想当视频生成公司

2026.09.25 11:19
2026年9月3日,Runway发布GWM Worlds 2,将高保真视频和音频生成变成实时交互模拟。其核心创新WorldPrompt,通过持久世界上下文与事件流的两层结构,试图回答一个根本问题——当世界模型不再是生成视频,而是生成可交互的世界,人类应该用什么方式来描述这个世界?本文从技术路径、工程代价与交互边界三个维度,拆解Runway如何试图定义世界模型的交互范式,以及这个赌注有多大风险。

“视频生成像一台自动售货机:你投一个 prompt,它吐出一段剪辑,然后结束。这是 explainx.ai 对当下视频生成赛道的一句精准比喻。2026 年 9 月 3 日,Runway 发布了 GWM Worlds 2,一款“将高保真视频和音频生成变成实时交互模拟”的通用世界模型。它不吐剪辑,它吐一个你可以一直待下去的世界——720p、24 帧、48kHz 同步音频,没有预设时长限制。在所有这些数字背后,真正耐人寻味的是一个叫 WorldPrompt 的新输入格式。它试图回答一个根本问题:当世界模型不再是生成视频,而是生成一个可交互的世界,人类应该如何描述这个世界?

两个方向的分岔口

2026 年的世界模型赛道正在加速分岔。

一边是 Google DeepMind 的 Genie 3。2025 年 8 月发布的 Genie 3 能在 720p 和 24fps 下生成可交互世界,用户可以用文字、图片甚至扫描的餐巾纸涂鸦来创建关卡。但 Genie 3 有一条明确的边界:世界一致性只能维持数分钟。超出范围后,场景开始漂移。Google 自己对此的表态是,Genie 3 “can currently support a few minutes of continuous interaction, rather than extended hours”。

另一边是 World Labs 的 RTFM(Real-Time Frame Model),由李飞飞团队于 2026 年中推出。RTFM 走的是空间智能路线:从 2D 图像输入开始,在用户交互的同时实时生成新视角画面,但始终不构建显式的 3D 世界表达。Odyssey-2 Pro 则是另一个方向上的探索者——2026 年 1 月,其 CEO Oliver Cameron 直接以“世界模型的 GPT-2 时刻”来定义这一节点,开放了开发者 API。

Runway 的选择是三者中最激进的:不做 3D 重建,不做短时一致性,而是直接从视频生成模型出发,尝试做一件“没有预设时长”的实时交互世界。

GWM Worlds 2 是 2025 年 12 月第一代 GWM Worlds 的实质性升级。关键改进集中在三个方向:原生 48kHz 同步音频合成、WorldPrompt 结构化输入格式、以及无限制持续会话。这三个方向都不是渐进式的——它们从架构层面改变了世界模型的使用方式。

这个能力建立在 Runway 迄今为止 8.6 亿美元的融资基础之上。2026 年 2 月,Runway 完成 3.15 亿美元 Series E 融资,由 General Atlantic 领投,估值达到 53 亿美元。投资方中出现了 NVIDIA、Adobe Ventures 和 AMD Ventures。它们投的不仅是一家视频生成公司,更是“交互式模拟”这个新赛道的基础设施卡位——尤其是 NVIDIA,它在 GTC 2026 上专门开设了“模拟现实:通用世界模型内部”专场。

WorldPrompt 的双层结构为什么是工程关键

WorldPrompt 的核心不是 prompt,而是它的两层结构设计。

第一层是“持久世界上下文”。它定义生成世界的环境描述、布局、材质、光照、环境音、场景中的主体及其属性,以及这个世界的物理法则——重力、碰撞行为、主体的能力边界、摄像机视角。这层信息在会话开始时定义一次,原则上持续整个会话。

第二层是“事件流”。它是一系列带时间戳的、可叠加的动作,每个动作可以指向某个特定主体,也可以作用于整个场景。Runway 的官方表述是:一个动作可以是“一剑斩出、一句对话回应、一个房间被水淹没、一场沙暴正在逼近——或者任何你能用语言描述的事情”。

这两层区分解决了世界模型的核心矛盾:一致性与实时性之间的张力。如果每一帧都从零开始生成,世界就像没有状态的游戏,每次动作都忘掉前面发生了什么。而有了持久规则层加上滚动事件流,原则上世界可以无穷运行——因为底层规则不会被每次交互重新推导。

首席研究科学家 Robin Kahlow 在 Latent Space 的访谈中把这个设计类比为电子游戏:“就像游戏中有一个 NPC,它可能走向你并说点什么。通过这种模型,你能实现同样的效果——对整个场景内的所有元素进行非常精细的控制。”

但 WorldPrompt 仍然是 prompt,不是编程语言。CTO Kamil Sindi 对此的表述更接近于愿景声明:“你能按需创建可 prompt 的世界,视频和音频同步,覆盖各种不同的领域和环境。这并非遥远未来的假设。”从 prompt 到编程语言的跨度,正是世界模型走向实用化的核心命题。

从双向扩散到自回归:实时化背后的工程代价

GWM Worlds 2 被 Runway 称为“自回归扩散模型”。这本质上是一个混合方案。联合 CEO Anastasis Germanidis 在 Latent Space 播客中解释了技术路径:“从双向扩散出发,它一次性生成整段视频,然后改造成自回归的,一帧或几帧一帧地生成。”

实时化的关键步骤是知识蒸馏。Germanidis 描述了两种可行的蒸馏路径:把大模型蒸馏成小模型,或者减少去噪步数。他给出了一个具体数字:“一个模型可能从约 50 个去噪步数降到 4 步。”

50 步到 4 步——超过 90% 的步数压缩。这揭示了所有实时世界模型共同面对的根本矛盾:保真度与速度不可兼得。Runway 自己坦承,“实时生成以保真度换速度”,快速摄像机旋转会导致“细节、纹理和几何体的退化”,长期记忆“也不完美”。

GWM Worlds 2 的技术架构包含三个上下文输入:全局上下文(genesis prompt 加上第一帧)、当前帧输入(摄像机加上文本动作)、以及滑动窗口内的历史帧缓存。视频和音频解码器都是因果的,配合缓存实现加速解码。每一帧的视频、音频、文本和摄像机 token 关注全局 token 和过去的帧,但更早的帧会被逐出缓存。

这套架构解释了一个关键事实:世界模型的“记忆力”不是无限的。它与大语言模型面临的上下文长度瓶颈如出一辙,只是现在发生在空间和时间的维度上。

自然语言操控世界的边界

WorldPrompt 的本质是一个 prompting 机制。它不给确定性,只给概率分布。

当 Latent Space 问到“通过一个指令创建物理法则如重力或角色能力,能有多可靠”时,Robin Kahlow 的回答很坦率:“这是个研究预览,并不完美。可靠性取决于动作的难度——移动类指令相对可靠。”Sindi 补充说,“更多训练加上数据和模型的扩展正在带来更好的遵循能力”。

这个问答暴露了世界模型的一个根本问题:prompt 的可信度。在 Minecraft 和 Roblox 这类确定性脚本世界中,每次交互的结果是确定的——按 W 角色就往前走。但在 prompt 驱动的世界模型中,每次输出都是一个概率采样。你告诉模型“这个房间正在被水淹没”,它可能让你看到水从地板蔓延上来,也可能让你看到水从天花板往下流,还可能画面出现不相关的视觉变形。

对于探索性和实验性场景——比如快速 prototype 一个游戏概念、生成体验性短片——这种不确定性能产生惊喜。但对于需要精确控制的场景——电影分镜的精确执行、游戏机制的稳定实现、机器人训练场景的可重复性——概率输出的不可预测性就成了硬伤。

这个区别可能会像大语言模型领域一样催生分岔:一侧是“探索型”生成,另一侧是“执行型”生成。WorldPrompt 当前显然更适合前者。

谁在定义世界模型的底层规则

如果只看表面,GWM Worlds 2、Genie 3、RTFM 和 Odyssey-2 Pro 在做同一件事。但底层技术的分岔远比表面大。

Runway 从视频生成出发,用自回归扩散加蒸馏工程解决了实时性问题,但保留了 prompt 交互的表层。Google DeepMind 的 Genie 从强化学习和游戏环境生成出发,一路从 Genie 1 进化到 Genie 3,支持多模态输入但时长仍然受限。World Labs 的 RTFM 从空间智能出发——它与 Runway“画面优先”的思路形成鲜明对比。Odyssey 则从自动驾驶仿真出发,训练数据天然偏向物理准确性和几何一致性。

四条路线冲向同一座山,但每条的登山路径完全不同。

值得注意的是,这场竞争并不是一场零和游戏。NVIDIA 投资 Runway 的同时也在 GTC 上讨论世界模型;Runway 自己的目标是定义“可 prompt 的世界”这个品类,而不是成为唯一的供应商。当基础设施提供商开始押注整个方向,说明这个方向已经超越了单个公司的战略赌注。

世界模型正在经历自己的GPT-2时刻

世界模型正处于 2023 年大语言模型所处的阶段:技术路线未定、产品形态模糊、但资本和人才已经大量涌入。

Runway 的赌注是“范式先行”:不等模型完美,先定义交互范式。它在战术上是聪明的——当竞品都在卷生成质量时,它卷交互格式。WorldPrompt 的存在意义不亚于 GWM Worlds 2 本身的生成能力,因为它问了一个更根本的问题:如果世界模型是下一代计算平台,人机交互的接口应该长什么样?

但这个赌注的风险同样清晰。如果 prompt 的不可靠性在未来几代模型中未被持续解决,它在需要确定性的领域将始终停留在辅助工具的位置,而非执行工具。

一个更大的趋势正在浮现。NVIDIA、Google DeepMind、Runway、World Labs 同时重注同一个方向。当四股力量从各自擅长的出发点同时冲向同一个目标,这个目标就不再是一个实验。实时生成世界正在从技术演示变成产品命题——2026 年一年内信号密度高得惊人。

世界模型正在经历自己的 GPT-2 时刻。没人知道它最终会长成什么样子,但所有人都能感觉到,某些根本性的东西正在被重塑。

作品声明:内容由AI生成