一个玩家坐在屏幕前,手指在手柄上笨拙地搓动。摇杆推偏了三度,角色一头撞上墙壁;跳跃键按早了半秒,角色坠入深渊。这段"辣眼睛"的操作被上传到平台,被数十万人围观嘲笑。但也许,它也将被喂给下一代人工智能。
英国一家名为 Worldmodeldata 的初创公司正在做这件事:从游戏工作室授权玩家操控数据,打包成训练数据集,卖给那些急需物理世界数据的 AI 实验室。"成千上万款出色的游戏,它们越来越像真实世界,"Worldmodeldata 的 CEO Rhea Loucas 对 WIRED 表示,"为什么我们不拿这些海量、丰富、多样化的游戏体验,去教会 AI?"
这不是一个孤立的赌注。另一家公司 General Intuition 从游戏剪辑平台 Medal 拆分出来,手握每年 20 亿条游戏视频的独家数据池,种子轮就拿到了 1.34 亿美元,由 Khosla Ventures 和 General Catalyst 联合领投。据 The Information 报道,OpenAI 曾试图以 5 亿美元收购 Medal,虽然双方均未置评,但这足以说明游戏数据对于物理 AI 的诱惑力有多大。
当 AI 产业将大语言模型一个又一个"GPT 时刻"收入囊中时,一个关键问题浮出水面:下一场革命,让 AI 真正理解物理世界,要用什么来训练?
互联网没有教 AI 的课
大语言模型是幸运的。整个互联网的文本,维基百科、Reddit 帖子、书籍、代码库,构成了它们的教材。OpenAI、Google、Anthropic 烧掉数十亿美元 GPU 算力,把这一切压缩进数百亿参数里,最终得到了会写诗、会编程、会推理的对话机器人。
但世界模型——被李飞飞、Yann LeCun 等顶尖研究者视为 AI 下一个前沿的方向——没有这样的好运。
世界模型的目标是让 AI 理解三维空间的物理规则:一个物体的重量,两个物体碰撞后的运动轨迹,一只机械臂抓取杯子时该用多大力度。大语言模型从文本中学到的知识是"描述性"的,而世界模型需要的是"原因和结果"。用萨里大学 AI 副教授 Xiatian Zhu 的话说,"你需要在动作和数据之间建立因果关联,而互联网上几乎没有这类数据。"
这种数据枯竭是整个物理 AI 领域最大的瓶颈之一。没有数据,就无法验证模型;无法验证,就无法迭代;无法迭代,性能就停滞不前。一些实验室尝试用传感器记录人类和机器人在测试环境中执行任务的全过程,这就是所谓的"动作数据"。但这种方法成本高昂、规模有限,而且无法覆盖模型在真实世界中可能遇到的"边界案例",比如一只狗突然冲到自动驾驶汽车前,或者仓库机器人遇到一个翻倒的箱子。
"你可以花钱请人一遍遍演示抓取-放置任务,但重复本身无法捕捉到你要求机器运行的那个世界的混乱性,"Khosla Ventures 合伙人 Nicole Fraenkel 说。
垃圾数据里有黄金
正是在这个困局中,游戏数据以令人意外的方式浮出水面。它的本质是"附带产物":玩家每搓一下摇杆、每按一次扳机,都在产生一个"视觉状态加动作"的因果对。每小时的游戏时间里,这种配对数据以数千次的频率产生,而且每一局游戏都有不同的操作方式。
Worldmodeldata 的做法是把自己定位为"数据中间商",不开发游戏,不构建模型,只做一件事:从游戏工作室那里获取玩家操控数据,整理、标注、打包,卖给急需数据的世界模型实验室。公司 CEO Loucas 告诉 WIRED,他们已经从多款热门游戏的工作室授权了接近 100 万小时的操控数据。但这个目标尚未完全兑现:据 TNW 报道,截至 7 月的公开披露,Worldmodeldata 还没有最终敲定的客户合同,也没有营收,团队规模约 10 人。它的核心赌注在于,游戏数据最终将成为世界模型训练素材的主力,"之后再利用特定真实环境或任务的数据进行微调优化"。
而 General Intuition 走了另一条路。它背靠 Medal 平台每年 20 亿条游戏剪辑和 1000 万月活用户,覆盖上万款游戏。这个数据池不仅庞大,而且自带筛选偏差:玩家自发上传的往往是表现最好或最翻车的极端案例。CEO Pim de Witte 解释道,"当你玩游戏时,你本质上是在把自己的感知,通常是第一人称视角的摄像头画面,迁移到不同的环境中。"更关键的是,玩家的上传行为天然提供了正负样本标签,一个完美的一穿五和一个脸接大,这些正是训练智能体最有价值的边缘案例。
General Intuition 的技术路线尤为值得关注:它的模型只通过视觉输入来理解环境,然后自动预测并执行动作,完全不需要依赖游戏引擎的底层数据接口。这意味着它的训练方法可以天然迁移到物理系统,机械臂、无人机、自动驾驶,因为这些设备往往也是通过类似游戏手柄的方式在操控。
物理引擎 vs 游戏引擎:一场关于真实的路线之争
但并不是所有人都对游戏数据如此乐观。Nvidia 选择了完全不同的路径。
Nvidia 世界模型开发负责人 Ming-Yu Liu 对游戏数据用于精细操控任务持明确的保留态度。在他看来,游戏物理往往是"偏心"的,开发者走捷径来创造"真实的错觉":角色伸手从桌上拿起一个苹果时,你看到的画面和真实世界一样,但游戏中往往没有编码手指施加在苹果表面的压力分布,也没有防止苹果滑落的细微握力调节。"我会对使用游戏数据进行精细操控训练持更保守的态度,"Liu 说,"操控需要的物理要复杂得多。"
Nvidia 推出 Cosmos 世界基础模型平台正是基于这一判断。Cosmos 不依赖现成的游戏数据,而是用自定义的物理引擎生成训练数据。这套引擎专门为复现真实物理规律,重力、摩擦、动量、碰撞,而设计,生成的视频数据可以用于训练机器人策略和自动驾驶系统。同时,Nvidia 也在将游戏数据应用在更务实的场景:Liu 认为,对于生成超写实视频或 3D 环境这类任务,游戏数据是完全合适的。
这本质上是一场"质量 vs 规模"的路线之争。Nvidia 的赌注是:对于自动驾驶、机器人操控这类容错率极低的任务,物理精度的优先级高于数据规模。"一辆汽车、一架飞机、一台无人机、一辆工厂叉车或一个自主四足机器人的错误成本极高,"Fraenkel 说。而游戏数据的拥护者则认为,大量多样化的边界案例数据本身就在弥补精度的不足:粗糙但覆盖广泛,比精确但狭小更有价值。
萨里大学的 Zhu 给出了更中立的判断:"视频游戏本质上是模拟器。它们确实有一定程度的物理基础,但非常粗糙,而且近似。"
三条赛道,一个终点
这场竞赛的参与者清晰地分成了三种模式。
第一种是"数据中间商"。Worldmodeldata 为代表,不碰模型、不碰游戏,只做数据的采集和加工。商业模式最轻,但挑战在于:游戏工作室是否愿意长期授权数据?每个玩家的操控数据是否涉及隐私和所有权?Loucas 透露他们正在探索让个体玩家也获得补偿的途径,这可能形成"玩家贡献数据、获得报酬、持续贡献"的数据飞轮。Origin Lab 等竞争对手也在同一赛道。
第二种是"垂直整合者"。General Intuition 和 Niantic 为代表,既拥有独家数据源,又自研基础模型。General Intuition 手握 Medal 的独家数据壁垒(OpenAI 想买没买到),而且成立 8 个月后就在以 20 亿美元估值寻求新一轮 3 亿美元融资,Jeff Bezos 和 Eric Schmidt 出现在投资者名单中。Niantic 则有数亿用户通过 Pokémon GO 积累的 AR 地理空间数据。这条路数据护城河最深,但资本消耗也最大,1.34 亿美元只是种子轮。
第三种是"模型壁垒者"。Nvidia 和 World Labs 为代表,不依赖外部数据源,而是通过生成合成数据来训练模型。Nvidia 的 Cosmos 用自定义物理引擎自建数据,World Labs 的 Marble 模型则从静态图像生成 3D 世界。这条路线技术壁垒最高,一旦模型从"足够好"变成"足够真实",可以绕过整个数据供应链。但在此之前,需要极大的研发投入和时间。
世界模型的课本
回顾大语言模型的发展史,一个令人深思的类比浮现出来:GPT 的成功不仅来自 Transformer 架构,更来自互联网这个"免费的超级教科书"。没有海量文本,再好的架构也无济于事。
世界模型正在寻找自己的"互联网文本"。游戏数据是目前看上去最有希望的一个候选:因为它像文本一样,以"附带产物"的方式存在,规模巨大,且持续产生。但它可能不是终点。随着智能体进入更多物理场景,自动驾驶、仓储物流、手术机器人,真实世界的数据将不断回流,形成对游戏数据训练结果的验证和微调。
Nicole Fraenkel 说了一句也许是整个行业最好的总结:"通往应许之地有很多条路。真相是,哪条路最能走通,目前还没有定论。"
但有一点是确定的:当你的角色在手柄的迟钝操控下一次次撞墙、一次次坠落时,你正在为一个全新的 AI 时代提供最原始的教材。那些被嘲笑为"辣眼睛"的操作片段,也许正在为机器理解这个三维世界,写下第一行底稿。






快报