GB300用256卡改写MoE训练天花板

2026.07.22 14:45
7月21日,英伟达宣布Blackwell架构GB300 NVL72系统在MoE模型预训练中创下世界纪录,每GPU达到1648 TFLOPs,仅用256块GPU即可完成DeepSeek-V3 671B模型训练。这一成绩的背后,是第五代NVLink互联架构对MoE通信瓶颈的彻底突破,以及超过25万种配置模拟和140万小时GPU测试的软件优化积累。当MoE成为大模型标准答案,英伟达正在用全栈协同重新定义训练效率的竞争规则。

训练一个6710亿参数的大模型,需要多少张GPU?

两年前,答案是“越多越好”。集群规模从几千张一路卷到几万张,谁的卡多谁就快。但到了2026年7月,英伟达用一组数据给出了一个截然不同的答案:256张卡,就够了。

7月21日,英伟达宣布其Blackwell架构GB300 NVL72系统在MoE(混合专家)模型预训练中创下世界纪录。每GPU达到1648 TFLOPs的算力,仅用256块GPU就完成了DeepSeek-V3 671B模型的训练任务。这个数字的意义,远不止一张新卡跑得更快那么简单。

一组数字,三重冲击

先看第一组数字:1648 TFLOPs/GPU。

这是GB300 NVL72在DeepSeek-V3 671B预训练中交出的成绩。对比上一代GB200 NVL72的606 TFLOPs/GPU,提升约3倍。对比6个月前同系统的测试结果,提升50%。这不是换个芯片就能做到的,而是6个多月、超过25万种配置的自动化模拟,以及累计140万小时的GPU测试,硬生生从硬件和软件的每一寸缝隙里挤出来的。

这背后,是英伟达对Blackwell平台所做的38项重大软件优化。超过90%的优化不仅适用于DeepSeek-V3,还可以迁移到其他AI模型上。换句话说,英伟达不是在为一款模型做特调,而是在为整个AI生态打底。

再看第二组数字:256块GPU,训一个671B参数模型。

DeepSeek-V3的参数量是6710亿,但每次推理只激活其中370亿个参数。这就是MoE架构的精髓。训练这样一个模型,传统方案需要数千张GPU。但GB300 NVL72用256张卡就完成了,而且每张卡都在高效运转。

第三组数字来自同一天发布的MLPerf Training v6.0结果:CoreWeave用8192块GB300 NVL72 GPU(公开基准中最大的GB300集群),在2.02分钟内完成了DeepSeek-V3的训练。两分钟训完一个671B模型。放在两年前,这几乎是科幻小说里的数字。

这三组数字放在一起,揭示了一个正在发生的深层变化:大模型训练的竞争规则,正在被重写。从“谁的卡多”转向“谁把卡用得更透”。

为什么是“用得更透”?因为MoE架构给AI训练带来了一场“通信危机”。

MoE的囚徒困境:算力没变,但通信卡住了

MoE(混合专家)架构已经成为前沿大模型的事实标准。从DeepSeek-V3到Mixtral到Qwen2.5-MoE,几乎所有最强开源模型都选择了这条路。原因很简单:MoE用更少的算力,做更大的模型。

以DeepSeek-V3为例,671B总参数,但每个token只激活约37B。这意味着,你的计算量只有同等规模稠密模型的5%左右。但代价是什么?代价是通信。

在MoE架构中,每个token需要被路由到分布在多个GPU上的专家网络。每次前向传播和反向传播,GPU之间都要进行密集的all-to-all数据交换。这个通信过程不在并行路径上,它在关键路径上。

英伟达在官方技术博客中描述得很清楚:“因为每层都有通信,每次训练步骤都有通信,微小的延迟也会层层叠加,直到all-to-all无法再被计算掩盖,此时增加GPU也不再能提升吞吐量。”

翻译成大白话:MoE模型训练,瓶颈已经从“算力够不够”变成了“数据传得快不快”。

第五代NVLink:把72张卡变成一台超级GPU

要解决MoE的通信瓶颈,靠更快的芯片是不够的。你需要的是一个能让所有GPU像一个人一样思考和行动的互联系统。

这就是GB300 NVL72的核心设计哲学。它不是一个72卡服务器,而是一个机架级系统。72张Blackwell Ultra GPU通过第五代NVLink连接成一个单一的计算域。

数字是最诚实的语言。第五代NVLink给每张GPU提供1.8TB/s的带宽,整个机架实现130TB/s的非阻塞全互联带宽。这意味着,任何一张GPU都可以通过单跳访问机架内的任何其他GPU,而且带宽是均匀的,不会因为通信模式的变化而打折扣。

有多重要?看看扩展效率就知道了。当集群从256张GPU扩展到1024张GPU时,每GPU的吞吐量保持率在Megatron Core上达到98.5%,在TorchTitan和JAX上达到97%以上。这意味着,你加了4倍的卡,实际效率几乎不打折扣。

实现这一点的关键,不仅是NVLink本身,还有800Gbps的ConnectX-8 SuperNIC。它负责跨机架的数据同步,让多机架集群也能保持一致的通信效率。同时,BlueField数据处理单元接管了基础设施服务,把CPU资源全部释放给训练任务。

这套系统设计的最终效果可以用一组数据来概括:GB300 NVL72在MLPerf Training v6.0的DeepSeek-V3训练中,512卡规模的性能是GB200的1.6倍。但这只是起点。

软件才是真正的核武器

如果说硬件是英伟达的左手,那软件优化就是右手。

过去6个月,英伟达对Blackwell平台做了38项重大软件优化。这些优化来自超过25万种配置的自动模拟和140万小时的GPU测试。注意这个数字。140万小时,相当于160台GPU连续跑一整年。

效果有多显著?在DeepSeek-V3 671B上,使用TorchTitan(PyTorch原生训练框架)的GB300性能比未经优化的基线提升了6倍;使用JAX的版本提升了10倍,达到1025 TFLOPs/GPU、每GPU每秒4082个token。

但更让竞争对手感到无力的是,英伟达的软件优化并不只针对新卡。同一时间,GB200 NVL72通过软件优化,在3个月内实现了4倍的性能/功耗比提升。这意味着,即使你买了上一代产品,它也在持续升值。

这与传统芯片行业的游戏规则完全不同。在传统半导体行业,芯片交付就是价值的终点。但在英伟达这里,芯片交付只是价值的起点。

从卖卡到卖系统:英伟达的护城河再升级

把硬件、互联、软件、网络、基础设施服务全部整合在一起,GB300 NVL72不再是一张显卡,而是一个完整的AI训练系统。英伟达也不再是一家芯片公司,而是一家AI基础设施公司。

这个转变的意义在于:竞争对手不仅要追平芯片性能,还要追赶NVLink生态、CUDA软件栈、Megatron Core训练框架、JAX和PyTorch的深度优化。每一条都是需要数年积累的护城河。

AMD的MI355X在纸面性能上不断逼近,华为的昇腾910B在特定场景下也有竞争力,但它们都无法提供英伟达这种全栈协同的体验。一张卡可以快,但72张卡能像1张卡一样快地协同工作,这是另一回事。

英伟达创始人黄仁勋反复强调的一个理念正在变成现实:“你买的GPU越多,省的钱就越多。”这句话的底层逻辑是:当你的系统效率足够高,你需要的GPU数量反而更少。256张GB300完成的任务,也许GB200需要近800张,Hopper需要数千张。买更贵的单卡,但买更少的卡,总成本反而更低。

规则正在改写

理解这个世界纪录,需要从三个维度来看。

MoE训练效率的竞争,已经从谁的芯片峰值算力高转向谁的通信系统延迟低。英伟达用第五代NVLink确立了在这一新赛道的绝对领先地位。而软件优化正在成为英伟达最深的护城河。不是因为它做不出更好的硬件,而是因为它能让最好的硬件变得更好,而且持续变好。38项优化、90%可复用、4倍GB200性能提升,这些数字比任何基准测试都更有说服力。

对于AI行业的玩家来说,选择训练基础设施的决策正在变得复杂。峰值算力不再是唯一指标,互联带宽、扩展效率、软件生态的成熟度,每一个都同样重要。

受益的是英伟达的客户。无论是云服务提供商还是大型AI企业,GB300 NVL72让他们能用更少的钱训练更大的模型。CoreWeave用2分钟训完DeepSeek-V3就是最好的广告。

危险的是追赶者。AMD、英特尔、华为等公司面临的挑战比外界想象的更大。它们不仅要在芯片上追平,还要在互联、软件、系统层面补上数年的差距。

当MoE成为大模型的标准答案,谁把通信做到极致,谁就掌握了训练效率的定价权。

作品声明:内容由AI生成

快报

更多

11:49

上海:推动“链主”企业、上市公司等积极开展企业风险投资(CVC) 股权投资集聚区加大对CVC的扶持力度

11:49

上海:推动科技企业适用简易审核程序典型案例落地,鼓励开展第三方并购

11:49

上海:持续强化上市公司并购科技企业审核标准公开,支持交易双方以多元化的评估方法为基础协商确定交易作价

11:48

上海:深化债券市场“科技板”建设

11:48

上海:便利科技企业再融资,推动再融资储架发行制度落地实施

11:44

上海:推动科创板持续深化改革,持续扩大科创板第五套上市标准的适用范围

11:43

A股午评:三大指数早盘集体下跌,贵金属板块高开高走

11:33

中国6月Swift人民币在全球支付中占比 3.1%,前值2.75%

11:33

国内期货主力合约多数上涨,碳酸锂涨超4%

11:26

消息人士称伊朗已准备好应对美军地面入侵

11:16

迪拜为挽救旅游业出台激励措施

11:16

中国信达等在广西成立新合伙企业,出资额7.21亿

11:13

化工板块盘中持续活跃,红宝丽直线涨停

11:02

广期所碳酸锂主力合约大涨5%,报148480元/吨

11:00

马斯克:FSD是拉动特斯拉汽车需求的核心驱动力

10:54

锂矿概念盘中持续走强,国城矿业、永杉锂业涨停

10:39

有色·铝板块震荡走高,宏桥控股涨停

10:36

国家药监局批准2款创新药上市

10:33

香港恒生指数上涨1%至25,141.64点

10:32

广东:上半年工业机器人产品产量同比增长34.2%