训练一个6710亿参数的大模型,需要多少张GPU?
两年前,答案是“越多越好”。集群规模从几千张一路卷到几万张,谁的卡多谁就快。但到了2026年7月,英伟达用一组数据给出了一个截然不同的答案:256张卡,就够了。
7月21日,英伟达宣布其Blackwell架构GB300 NVL72系统在MoE(混合专家)模型预训练中创下世界纪录。每GPU达到1648 TFLOPs的算力,仅用256块GPU就完成了DeepSeek-V3 671B模型的训练任务。这个数字的意义,远不止一张新卡跑得更快那么简单。
一组数字,三重冲击
先看第一组数字:1648 TFLOPs/GPU。
这是GB300 NVL72在DeepSeek-V3 671B预训练中交出的成绩。对比上一代GB200 NVL72的606 TFLOPs/GPU,提升约3倍。对比6个月前同系统的测试结果,提升50%。这不是换个芯片就能做到的,而是6个多月、超过25万种配置的自动化模拟,以及累计140万小时的GPU测试,硬生生从硬件和软件的每一寸缝隙里挤出来的。
这背后,是英伟达对Blackwell平台所做的38项重大软件优化。超过90%的优化不仅适用于DeepSeek-V3,还可以迁移到其他AI模型上。换句话说,英伟达不是在为一款模型做特调,而是在为整个AI生态打底。
再看第二组数字:256块GPU,训一个671B参数模型。
DeepSeek-V3的参数量是6710亿,但每次推理只激活其中370亿个参数。这就是MoE架构的精髓。训练这样一个模型,传统方案需要数千张GPU。但GB300 NVL72用256张卡就完成了,而且每张卡都在高效运转。
第三组数字来自同一天发布的MLPerf Training v6.0结果:CoreWeave用8192块GB300 NVL72 GPU(公开基准中最大的GB300集群),在2.02分钟内完成了DeepSeek-V3的训练。两分钟训完一个671B模型。放在两年前,这几乎是科幻小说里的数字。
这三组数字放在一起,揭示了一个正在发生的深层变化:大模型训练的竞争规则,正在被重写。从“谁的卡多”转向“谁把卡用得更透”。
为什么是“用得更透”?因为MoE架构给AI训练带来了一场“通信危机”。
MoE的囚徒困境:算力没变,但通信卡住了
MoE(混合专家)架构已经成为前沿大模型的事实标准。从DeepSeek-V3到Mixtral到Qwen2.5-MoE,几乎所有最强开源模型都选择了这条路。原因很简单:MoE用更少的算力,做更大的模型。
以DeepSeek-V3为例,671B总参数,但每个token只激活约37B。这意味着,你的计算量只有同等规模稠密模型的5%左右。但代价是什么?代价是通信。
在MoE架构中,每个token需要被路由到分布在多个GPU上的专家网络。每次前向传播和反向传播,GPU之间都要进行密集的all-to-all数据交换。这个通信过程不在并行路径上,它在关键路径上。
英伟达在官方技术博客中描述得很清楚:“因为每层都有通信,每次训练步骤都有通信,微小的延迟也会层层叠加,直到all-to-all无法再被计算掩盖,此时增加GPU也不再能提升吞吐量。”
翻译成大白话:MoE模型训练,瓶颈已经从“算力够不够”变成了“数据传得快不快”。
第五代NVLink:把72张卡变成一台超级GPU
要解决MoE的通信瓶颈,靠更快的芯片是不够的。你需要的是一个能让所有GPU像一个人一样思考和行动的互联系统。
这就是GB300 NVL72的核心设计哲学。它不是一个72卡服务器,而是一个机架级系统。72张Blackwell Ultra GPU通过第五代NVLink连接成一个单一的计算域。
数字是最诚实的语言。第五代NVLink给每张GPU提供1.8TB/s的带宽,整个机架实现130TB/s的非阻塞全互联带宽。这意味着,任何一张GPU都可以通过单跳访问机架内的任何其他GPU,而且带宽是均匀的,不会因为通信模式的变化而打折扣。
有多重要?看看扩展效率就知道了。当集群从256张GPU扩展到1024张GPU时,每GPU的吞吐量保持率在Megatron Core上达到98.5%,在TorchTitan和JAX上达到97%以上。这意味着,你加了4倍的卡,实际效率几乎不打折扣。
实现这一点的关键,不仅是NVLink本身,还有800Gbps的ConnectX-8 SuperNIC。它负责跨机架的数据同步,让多机架集群也能保持一致的通信效率。同时,BlueField数据处理单元接管了基础设施服务,把CPU资源全部释放给训练任务。
这套系统设计的最终效果可以用一组数据来概括:GB300 NVL72在MLPerf Training v6.0的DeepSeek-V3训练中,512卡规模的性能是GB200的1.6倍。但这只是起点。
软件才是真正的核武器
如果说硬件是英伟达的左手,那软件优化就是右手。
过去6个月,英伟达对Blackwell平台做了38项重大软件优化。这些优化来自超过25万种配置的自动模拟和140万小时的GPU测试。注意这个数字。140万小时,相当于160台GPU连续跑一整年。
效果有多显著?在DeepSeek-V3 671B上,使用TorchTitan(PyTorch原生训练框架)的GB300性能比未经优化的基线提升了6倍;使用JAX的版本提升了10倍,达到1025 TFLOPs/GPU、每GPU每秒4082个token。
但更让竞争对手感到无力的是,英伟达的软件优化并不只针对新卡。同一时间,GB200 NVL72通过软件优化,在3个月内实现了4倍的性能/功耗比提升。这意味着,即使你买了上一代产品,它也在持续升值。
这与传统芯片行业的游戏规则完全不同。在传统半导体行业,芯片交付就是价值的终点。但在英伟达这里,芯片交付只是价值的起点。
从卖卡到卖系统:英伟达的护城河再升级
把硬件、互联、软件、网络、基础设施服务全部整合在一起,GB300 NVL72不再是一张显卡,而是一个完整的AI训练系统。英伟达也不再是一家芯片公司,而是一家AI基础设施公司。
这个转变的意义在于:竞争对手不仅要追平芯片性能,还要追赶NVLink生态、CUDA软件栈、Megatron Core训练框架、JAX和PyTorch的深度优化。每一条都是需要数年积累的护城河。
AMD的MI355X在纸面性能上不断逼近,华为的昇腾910B在特定场景下也有竞争力,但它们都无法提供英伟达这种全栈协同的体验。一张卡可以快,但72张卡能像1张卡一样快地协同工作,这是另一回事。
英伟达创始人黄仁勋反复强调的一个理念正在变成现实:“你买的GPU越多,省的钱就越多。”这句话的底层逻辑是:当你的系统效率足够高,你需要的GPU数量反而更少。256张GB300完成的任务,也许GB200需要近800张,Hopper需要数千张。买更贵的单卡,但买更少的卡,总成本反而更低。
规则正在改写
理解这个世界纪录,需要从三个维度来看。
MoE训练效率的竞争,已经从谁的芯片峰值算力高转向谁的通信系统延迟低。英伟达用第五代NVLink确立了在这一新赛道的绝对领先地位。而软件优化正在成为英伟达最深的护城河。不是因为它做不出更好的硬件,而是因为它能让最好的硬件变得更好,而且持续变好。38项优化、90%可复用、4倍GB200性能提升,这些数字比任何基准测试都更有说服力。
对于AI行业的玩家来说,选择训练基础设施的决策正在变得复杂。峰值算力不再是唯一指标,互联带宽、扩展效率、软件生态的成熟度,每一个都同样重要。
受益的是英伟达的客户。无论是云服务提供商还是大型AI企业,GB300 NVL72让他们能用更少的钱训练更大的模型。CoreWeave用2分钟训完DeepSeek-V3就是最好的广告。
危险的是追赶者。AMD、英特尔、华为等公司面临的挑战比外界想象的更大。它们不仅要在芯片上追平,还要在互联、软件、系统层面补上数年的差距。
当MoE成为大模型的标准答案,谁把通信做到极致,谁就掌握了训练效率的定价权。






快报