“我们做这些事,不是因为它们容易,而是因为我们原以为它们会很容易。”
Open Dreamer 团队在博客里写下这句话时,语气里没有半分得意。他们花了 800 小时 B200 GPU 时间,才搞清楚为什么一个看起来在正常下降的损失函数,背后正在悄悄毁掉整个模型的生成质量。
2025 年 9 月,Danijar Hafner 和 Wilson Yan 发布了 Dreamer 4 论文。它展示了一个能在 Minecraft 中从零学会钻石收集的智能体——全程只用离线视频数据,不与环境做任何交互。这是世界模型领域的一个里程碑。但论文没有开源训练代码。
10 个月后,2026 年 7 月 21 日,三位研究者用 JAX/Flax 把 Dreamer 4 的训练管线完整复现了。他们不仅开源了代码,还附上了一本用 800 小时 B200 试错换来的“训练避坑指南”。
世界模型赛道里,最硬的一块骨头
世界模型不是什么新概念。从 2018 年的 World Models 论文到 2020 年的 Dreamer、2022 年的 DreamerV3,再到 2025 年的 Dreamer 4,这个方向一直在回答一个问题:AI 能不能像人类一样,在脑子里“想象”出世界的运行规律,然后利用这个想象进行决策,而不是在真实环境里一次次碰壁?
Dreamer 4 的突破在于——它是第一个纯靠离线数据就在 Minecraft 里学会钻石采集的智能体。Minecraft 钻石采集需要 20,000 步以上的长序列决策,涉及复杂的物体交互和游戏机制。Dreamer 4 做到了,而且实时推理只需要一张 GPU。论文编号 arXiv:2509.24527。
但和 AI 领域许多前沿论文一样,训练代码没有公开。想要复现?你得自己从零开始。而任何做过世界模型训练的人都知道,从零开始意味着什么。
三个人,三个仓库,一本圣经
Open Dreamer 的团队规模不大。Edward Hu 用 CoinRun 搭出了初始版本,Francesco Sacco 和 Diego Marti Monso 接手重建为完整系统。项目由 Reactor 赞助——这是一家专注于世界模型实时推理开发平台的公司,团队来自 Apple、Netflix、Meta、Google 等。
他们发布了三个东西。
第一个是 next-state/open-dreamer 训练代码仓库,包含因果视频分词器、动作条件潜空间动力学模型、rollout 生成和 FVD 评分工具。第二个是 reactor-team/open-dreamer 轻量推理代码,可以在本地加载训练好的模型,从 MP4 视频和动作文件中生成新帧。第三个是一个在线 Demo,在 Reactor 运行时上运行,实时生成 Minecraft 世界画面,并提供了一个 Game ⟷ Dream 切换开关——你可以在真实游戏画面和模型生成画面之间一秒切换,直观感受世界模型的预测能力。
但真正让这个项目在同类复现中脱颖而出的,不是代码本身——而是那份“训练圣经”。
一个骨干,两个模型
Open Dreamer 的架构可以用一句话概括:一个骨干,两个模型。
骨干是 block-causal transformer。它交替使用两种注意力层:空间层在同一帧内传播信息,因果时间层在不同帧之间传播信息。这种设计既保留了空间建模能力,又避免了全连接 transformer 在长视频序列上的计算爆炸。
分词器不是常见的 VAE,而是基于 transformer 的 Masked Autoencoder。团队报告了约 100 倍的压缩率,并指出这种设计不需要 KL 散度或对抗损失,训练起来比 VAE 轻松得多。更重要的是,掩码操作让潜空间更“可扩散”——这对后续的 flow matching 训练非常有利。原始 360×640 帧被填充到 368×640,保证两个维度都能被 16×16 的 patch 整除。分词器编码器深度 12 层、d_model 1536,解码器深度 8 层、d_model 1024,MAE 掩码概率最高 0.9,LPIPS 权重 0.2。
动力学模型做的是“下一帧预测”,用 diffusion forcing、flow matching 和 shortcut models 进行训练。这里有一个关键的设计细节:团队把 rollout 过程折叠进了时间步块中。每个块包含(上一个动作,当前状态,当前策略),空间注意力在块内运行,因果时间注意力跨块连接。世界模型 token 不能读取策略 token——这意味着任务和策略信息只能通过下一个动作来影响未来状态。这个设计保证了世界模型不会“偷看”答案。
Minecraft 配置下的动力学模型具体参数:1.6B 参数,30 层 block-causal,d_model 1920,30 注意力头,3 KV heads(分组查询注意力)。每 4 层中有一层是时间注意力层,每个时间步携带 32 个学习到的寄存器 token,packing_factor 设为 2。时间注意力使用 192 步滑动窗口。VPT 动作被解析为 27 个二进制动作通道加上 121 个分类鼠标类别。
训练中的“幽灵”:损失在下降,质量在退化
这是整篇文章最有价值的部分。
团队坦言,稳定性问题消耗了他们最多的时间。他们发现了一个让人头疼的悖论:大部分稳定性问题发生时,损失函数一直在下降。MSE 平滑改善,但生成质量却在退化。最危险的不是训练炸了,而是训练看起来一切正常,结果却越来越差——这是世界模型训练者的共同噩梦。
他们记录并发布了六条关键修复。
第一条,Muon 取代 LaProp。LaProp 会随机出现越来越频繁的尖峰,两次训练各跑了大约 400 B200 小时都失败了——也就是说约 800 小时的 GPU 算力付诸东流。换用 Muon 后稳定性大幅改善。
第二条,EMA 权重不可省略。扩散推理必须使用 EMA 指数移动平均权重,跳过会导致质量暴跌。
第三条,混合精度边界敏感。参数保持 float32,大部分矩阵乘法和注意力输入用 BF16,归一化层和动力学 flow 输出头用 float32。这条边界线划错了,训练就会出问题。
第四条,x-prediction 加 v-space loss。用 x-prediction 配合 v-space loss,本质上是一种加权项,分母加了平方项。虽然改动小,但效果明显优于 Dreamer 4 原文的损失加权方案。
第五条,小批量重心最优传输。在噪声序列和潜空间序列之间做最优传输配对,让 rollout 生成更稳定。最优传输找到让“移动距离”最短的配对,给 flow matching 提供了更短、歧义更少的路径。
第六条,μ-parametrization 不必要。因为 Muon 本身已经让超参数在不同模型规模下保持稳定,而且最小的 Minecraft 模型只比最终模型小一个数量级,μP 的收益不明显。
这六条经验,论文里没有,审稿人看不到,但任何试图复现 Dreamer 4 的人都会在上面卡住几个月。
算力效率:57% 的 FLOPs 利用率,以及它背后的故事
团队报告了 57-58% 的模型 FLOPs 利用率,距健康 transformer 训练的 60% 基准仅一步之遥。在 B200 上,带宽受限和计算受限的交叉点出现在 292 FLOP/byte。每张 GPU 喂入 256 帧,将工作负载推过了这个分界点。通俗地说:世界模型训练对算力带宽的需求极高,你买的 GPU 没有在偷懒。
分片策略也出乎意料。1.6B 参数的模型状态——参数、梯度、优化器状态和 EMA——总共约 24 GiB,B200 装得下。真正的瓶颈是激活值。团队尝试了数据并行、FSDP、张量并行和序列并行,最终选择了数据并行加激活检查点的方案。数据加载也被精心设计:整个数据集被预分词成 .arrayrecord 文件,然后使用 Grain 库配合 GPU 端预取缓冲区,因为 ffmpeg 解码的速度不够快,喂不饱 GPU。
世界模型赛道的“开源时刻”正在到来
Open Dreamer 的发布不是孤立的。2026 年 4 月,阿里云发布了 HappyOyster,一个能实时生成交互式 3D 环境的世界模型;同在 4 月,腾讯开源了混元 3D 世界模型 2.0;LingBot-World 则更早释放了 140 亿参数的开源世界模型。世界模型正在从论文概念走向产品化。
但 Open Dreamer 的独特之处在于,它填补的是一个更基础的空缺——训练基础设施。HappyOyster 和腾讯混元是面向最终产品的世界模型,它们的训练细节依然是黑箱。Open Dreamer 则把从零开始训练一个世界模型的全流程公开了,包括分词器、动力学模型、超参数配置、硬件需求、数据预处理——以及所有的失败经验。
这和 2023 年 LLaMA 开源后大模型领域的格局变化很相似。当训练基础设施和配方公开后,整个领域的创新速度会急剧加速。世界模型研究者现在可以在 Open Dreamer 的基础上直接改进,不需要从零开始。
盒子里还缺什么
Open Dreamer 目前还不是完整的 Dreamer 4 复现。它缺少 BC(行为克隆)和 RL 训练循环——这是 Dreamer 4 论文中真正实现“在想象中训练智能体”的核心组件。团队在 Roadmap 上明确写了“Full Dreamer 4 Behaviour-Cloning / RL agent training loop”。CoinRun 阶段做的策略工作没有用于 Minecraft,也没有发布。博客没有公布 FVD 分数,虽然 eval_fvd.py 脚本已经配好了 I3D 评估框架。
这些缺口意味着,Open Dreamer 目前是一个“世界模型训练工具包”,而不是一个“可出厂的智能体”。要做 Dreamer 4 论文中展示的完整智能体训练,还需要等待 Roadmap 的后续实现。
世界模型的分水岭时刻
Open Dreamer 的发布,标志着世界模型领域正在经历一个重要的分水岭。
过去两年,世界模型的热度一直在上升,但最大的瓶颈不是算法创新——而是复现鸿沟。Dreamer 系列论文提供了核心思想,但训练世界模型涉及大量工程细节:如何配置分词器?如何稳定动力学训练?混合精度策略怎么划界?数据处理 pipeline 长什么样?这些“脏活”没有论文会写,但任何一个环节出错,数千 GPU 小时的训练就可能白费。
Open Dreamer 把这条鸿沟填平了一部分。它给后来者提供了三样东西:一个可以直接跑起来的训练代码库;一份经过验证的超参数配置;一本记录了所有失败经验的“避坑指南”——六条稳定性修复,每一条都是真金白银换来的。
最直接受益的是世界模型领域的研究者。Open Dreamer 大幅降低了入门门槛——以前要从零复现 Dreamer 4,即使有经验的团队也需要数月。现在几天就能开始跑训练。但这也意味着竞争将加速。世界模型不再是少数顶尖实验室的专属游戏。当训练配方公开后,更多中小团队和独立研究者可以加入这个赛道。对于 HappyOyster 这样的商业化世界模型,开源竞争的压力会越来越大——它们的工程优势在代码公开后将被快速追赶。
而对于不开源的世界模型研究,Open Dreamer 实际上划了一条红线:如果你的代码和训练配方不公开,你的论文影响力将大打折扣。这和 2023-2024 年大模型领域发生的事情如出一辙。
世界模型的未来,不再取决于谁提出了最聪明的算法,而取决于谁愿意把最脏的活写成文档。那 800 小时的 B200 试错,不是 Open Dreamer 的代价——是它送给整个领域的一份礼物。






快报