深度学习最常用的优化器,正在触及一道看不见的天花板。
你可能没听过 AdamW 的名字,但几乎一定用过它的成果。从 GPT 到 LLaMA,从 Stable Diffusion 到 Gemini,过去十年里几乎所有改变世界的 AI 模型,底层都跑着同一个优化器——AdamW。它是深度学习界的“默认选项”,以至于大多数从业者已不再思考“要不要用别的”。
但英伟达刚刚发表的一篇论文,正在挑战这个默认选项。
7月13日,英伟达团队在 arXiv 上提交了一篇题为《SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales》的论文(编号 2607.20548),直接抛出了一个尖锐的问题:AdamW 是否存在规模天花板?答案是肯定的。英伟达不仅找到了天花板的位置,还给出了替代方案。
AdamW 的“天花板”在哪里
论文的核心发现极其直接:在下一 token 预测任务中,当 batch size 扩展到 100M token 时,AdamW 的训练稳定性开始急剧下降,而 SOAP 和 Muon 这两个高阶优化器仍然保持稳定。
这意味着什么?训练大模型时,更大的 batch size 通常意味着更高效的并行训练和更短的训练时间。但如果优化器本身在 batch size 变大时开始“掉链子”,那无论堆多少 GPU,最终都会在训练质量上打折扣。
AdamW 的退化不是偶然的。它的设计本质上是“一视同仁”的,对每个参数独立计算更新量,用梯度的一阶矩和二阶矩做自适应调节。这个方法在过去十年里效果惊人,但它的局限也恰恰源于此。它忽略了参数之间的结构关系。
而 Muon 和 SOAP 的做法完全不同。它们不是把每个参数看作孤立的个体,而是尊重神经网络层的矩阵结构。AdamW 像是给每个士兵单独发指令,Muon 和 SOAP 则是给整个连队做战术协同。在小型任务上,前者足够。但当规模大到一定程度,后者的优势就显露出来了。
高阶优化器:迟到十年的“第二春”
高阶优化器不是新概念。
早在 2018 年,Shampoo 优化器就提出了用 Kronecker 乘积近似二阶信息的思路。此后,SOAP(Shampoo with Adam in the Preconditioner's eigenbasis)、Muon 等变体不断涌现。理论上,它们能捕捉损失曲面的几何结构,实现更快的收敛。但长久以来,学术界和工业界对它们的核心质疑有两个:计算成本太高,以及大规模训练时的数值不稳定。
这两个问题,恰好是英伟达这篇论文重点攻克的。
在数值稳定性方面,研究团队发现 SOAP 在超大 batch size 下会出现 loss spike,但他们通过“每步 QR 正交化”和“改进的预条件策略”彻底消除了这一问题。对于 Muon,团队没有想当然地假设其正交化质量,而是做了实证测量。这在之前的研究中几乎没人做过。
在计算成本方面,这也是最精彩的部分。英伟达团队开发了一个与 Megatron-LM 兼容的“逐层分布式优化器”(layer-wise distributed optimizer)。它的设计哲学是:不近似优化器数学,不牺牲收敛收益,同时平衡内存并隐藏通信开销。
传统的数据并行方式会把权重和优化器状态均匀分布到各 GPU 上,但这对于 Muon 和 SOAP 这类需要完整矩阵梯度的优化器来说行不通。每个 GPU 手上的碎片数据不足以计算完整更新。英伟达的方案是把不同层的完整参数分布到不同 GPU 上,每个 GPU 拥有完整的一层参数,从而既能计算完整的预条件器,又能保持负载均衡。
正如一位 X 用户 @shaped 在评论区指出的那样:“wild that the blocker was mostly never the math, it was nobody wanting to write the distributed version。”这句话点出了关键:高阶优化器落地的最大障碍,从来不是数学,而是工程。没人愿意写那套分布式代码。
不是纸上谈兵:万亿 token 级别的实证
这篇论文的另一个令人信服之处在于,它不是在玩具模型上做的实验。
英伟达团队在数十亿参数的多层模型上进行了验证,训练数据量达到万亿 token 级别。结论是:SOAP 和 Muon 在所有测试规模上一致优于 AdamW。
这不是孤立的实验室发现。Muon 的工业级应用已经在加速。
2025 年,Moonshot AI 的 Kimi K2(1 万亿参数,MoE 架构,32B 激活参数)、智谱 AI 的 GLM-4.5(355B 参数)、以及 INTELLECT-3(106B 参数)三个生产级模型先后确认在生产环境中使用了 Muon 优化器。PyTorch 2.9 也将 Muon 原生纳入 torch.optim.Muon,DeepSpeed 和 NVIDIA NeMo 随之跟进支持。
如果这些名字还不够有说服力,再看一组数据。Moonshot AI 在 arXiv:2502.16982 中报告,Muon 在计算最优训练条件下对比 AdamW 实现了约 2 倍的训练效率提升。2 倍意味着什么?在动辄上亿美元的大型模型训练成本面前,这对应着数千万甚至上亿美元的潜在节省。
谁在危险区
对于正在训练下一代大模型的公司来说,这篇论文传递了一个明确信号:继续用 AdamW 可能在看不见的地方吃亏。
尤其是那些依赖极端大规模 batch size 训练的团队。比如追求 100M token 以上 batch size 的千亿参数模型训练,AdamW 的退化效应可能已经在悄悄侵蚀它们的训练质量。而改用 Muon 或 SOAP 的成本,在英伟达提供了分布式实现之后,已经大幅降低。
但切换优化器并非零成本。优化器状态不兼容意味着不能直接从中途切换,而且需要手动划分参数组。2D 权重矩阵用 Muon,其余参数(embedding、bias、layer norm 等)仍用 AdamW。这要求工程团队对模型结构有清晰的了解。
对于英伟达自身而言,这篇论文也暗含更深层的商业逻辑。作为全球最大的 GPU 供应商,任何能提升大模型训练效率的创新,最终都会转化为对 GPU 算力的更大需求。更高效的训练意味着团队敢尝试更大的模型,更大的模型意味着更多的 GPU 采购。这或许才是英伟达愿意投入如此多工程资源去解决高阶优化器落地问题的真正原因。
结语
AdamW 的统治持续了十年,这本身就是一个非凡的成就。但深度学习的规模已经膨胀到了十年前无法想象的程度。从数百万参数到数万亿参数,从单 GPU 到万卡集群。当基础设施发生了量级变化,底层算法也必须随之进化。
英伟达这篇论文的意义不在于“AdamW 不好”,而在于“我们知道怎么让你做得更好”。而那个曾被视作最大障碍的工程问题,最终也由提出问题的同一批人亲手解决了。
AdamW 统治了十年,但没人能永远坐在王座上。当英伟达亲手把王座搬走,整个行业都该问自己一句:下一个十年,谁还在用昨天的工具训练明天的模型?






快报