NVFP4,这个被英伟达视为Blackwell架构最重要创新之一的4位浮点格式,理论吞吐是上一代FP8的整整2倍,在DLSS 5这个当下最强的神经渲染场景上,只换来了不到1%的帧率提升。
《博德之门3》4K分辨率下,纯FP8方案的DLSS 5跑出54.57 FPS,换成FP8/NVFP4混合精度方案后,帧率攀升至55.16 FPS,0.59帧的增幅,约1.08%。Mod开发者wilsjo2借助OptiScaler-DLSSNR项目的0.7.1版本,成功将DLSS 5的神经渲染模型部分迁移至NVFP4格式运行。但实测结果让所有人冷静了下来:神经渲染阶段耗时仅减少1%–2%,而且部分计算因模型形状兼容性问题仍然回退至FP8。开发者在Release Notes中将自己的改进描述为“VERY minor”。即使到了0.7.2版本将混合模式设为推荐选项,他也明确警示:0.59帧的差异“是否可重复尚未确认”。
NVFP4的潜力被严重低估了吗?不。真正的问题或许恰恰反过来——DLSS 5当前的模型架构,根本吃不下NVFP4的红利。
一枚神卡,一项瓶颈技术
2026年9月,DLSS 5正式随NBA 2K27首发。同一周内,两个标志性的测试结果同时在硬件圈引爆了讨论。
一边,独立评测机构Club386在2026年9月3日发布的RTX 5090基准测试揭示了残酷的现实。在《赛博朋克2077》《霍格沃兹之遗》《Control》三个游戏中,开启DLSS 5后帧率暴跌39%至49%。RTX 5090 Founders Edition在《赛博朋克2077》从482W飙升至551W,《霍格沃兹之遗》从417W升至547W,《Control》更是直接顶到575W的板卡功率上限。DLSS 5不再是“免费性能提升”,它成了有史以来计算开销最昂贵的DLSS版本。
另一边,Mod作者wilsjo2在OptiScaler-DLSSNR项目0.7.1版本中,把DLSS 5的神经渲染模型从纯FP8推进到FP8/NVFP4混合精度。Blackwell的第5代Tensor Core原生支持NVFP4格式。英伟达官方数据显示,NVFP4采用微块缩放,每16个4位元素共享一个缩放因子,相比MXFP4的32元素块大小,更细的粒度意味着更少的量化误差。NVFP4的峰值吞吐达到FP8的2倍,内存占用更低。理论上,这简直是给DLSS 5这样高开销的推理任务量身定做的优化路径。
但实测结果让人沉默:55.16 FPS vs 54.57 FPS。
DLSS 5无疑是DLSS史上开销最大的版本。而NVFP4这个Blackwell架构最引以为傲的原生能力,在DLSS 5面前,似乎有力使不出。
三问“NVFP4为什么没能拯救DLSS 5”
第一问:模型精度量化,难道不是换个格式就能跑?
NVFP4的纸面优势没有水分。英伟达官方技术博客明确写道,NVFP4在Blackwell上原生运行,为每个16元素的微块分配独立的缩放因子,量化精度优于MXFP4。在LLM推理和AI训练场景中,NVFP4的4位预训练能力已经被多方验证。MIT Han Lab的研究甚至证明,SVDQuant结合NVFP4能在FLUX.1-dev模型上达到接近16位精度的输出质量。
但“能跑”和“跑得好”是两回事。
一个神经网络从FP8迁移到NVFP4,远不止是改一行数据类型代码。它需要重新进行量化感知训练,需要重新校准模型各层的敏感度分布,需要为低精度路径重新设计推理内核。直接把FP8训练好的模型权重暴力截断到4位,这就是当前Mod的做法,精度损失会迅速累积,模型输出质量退化到不可接受的程度。
英伟达此前已向媒体确认:DLSS 5的官方版本“尚未完成”向NVFP4的全量量化。连英伟达自己的工程团队都还没有把这件事搞定。一个社区Mod能在短短几天内跑通混合精度路径,已经算得上技术成就。但因为缺乏原生的QAT支撑,它只能在模型层面做“表层替换”,无法触及NVFP4的深层优势。Wccftech在报道中引用了英伟达的官方说法:“高效地将一个神经网络迁移到如此低精度的格式,需要适当的量化和优化,而不仅仅是简单转换现有模型。”
直白一点讲,硬转没有用,需要从头训。
第二问:模型形状兼容性,DLSS 5的“隐形天花板”
即便成功启动了混合精度推理,Mod也无法让所有计算都跑在NVFP4上。问题的名字叫:模型形状兼容性。
DLSS 5的神经渲染模型包含多个子网络,不同子层的张量形状各异。NVFP4的Tensor Core实现并非对所有形状都做了等量齐观的优化,某些形状组合在NVFP4路径上没有对应的内核实现,只能fallback回FP8。这就造成了一个尴尬的局面:理论上调配了NVFP4,实际运行中相当一部分计算仍然跑在FP8上。
这指向了一个更普遍的行业困境,低精度AI推理的碎片化生态。FP8本身就有E4M3和E5M2两种格式,各有优缺点。NVFP4在FP8之上又加了一层新格式。每一种格式都有自己最优的张量形状区间、内核调度策略和硬件支持范围。模型越大、结构越复杂,“全格式覆盖”的难度呈指数级上升。
DLSS 5的神经渲染模型恰恰是英伟达有史以来最复杂的实时推理模型之一,它要处理场景几何、光照、材质、反射等多个维度的信息。这种复杂度天然与NVFP4当前的覆盖能力存在冲突。从0.7.1到0.7.2版本的快速迭代也说明了这一点:wilsjo2在两天内就把NVFP4混合模型从“可选模式”升级为Blackwell GPU的“推荐模式”。技术优化的空间肯定存在,但天花板也清晰可见——模型形状的天花板,不是换个内核就能突破的。
第三问:DLSS 5的“性能债务”,英伟达到底多紧迫?
DLSS 5性能开销大,这已经不是一个秘密。
英伟达自己在官方博客中承认,从GTC 2026上演示的双RTX 5090配置一路优化到单个RTX 50系列可运行,团队在6个月内实现了5倍的性能提升,从“双卡才能跑”到“单卡流畅跑”,这个速度本身就是英伟达对“DLSS 5太贵了”的潜在回应。
但5倍性能提升之后,DLSS 5仍然能吃掉RTX 5090近一半的帧率。XenoSpectrum的另一组独立测试也得出了相似的结论:Control在RTX 5090 FE上从87.5 FPS降至50.9 FPS(-42%),性能保留率仅约58%;霍格沃兹之遗从121.1 FPS降至62.8 FPS(-48%),性能保留率仅约52%。这意味着“收益递减曲线”已经非常陡峭。前期的架构优化——算子融合、Pipeline重组、内存访问优化——能快速带来倍数级提升,但越往后,每一步的边际收益越小。NVFP4的1%增益,就是这种边际收益递减的直接体现。
对英伟达而言,DLSS 5不仅是技术产品,更是一项商业武器。它是RTX 50系列“非买不可”的核心卖点之一,如果DLSS 5始终处于“开了降一半帧率”的状态,英伟达就很难说服消费者为Blackwell支付溢价。这也是为什么英伟达在2026年9月4日紧急反转口径,向The Verge和Wccftech确认DLSS 5将支持RTX 40系列。他们需要基数更大的用户群来分摊优化成本,也需要安抚那些手握RTX 4090、本打算跳过50系列的存量用户。
但这里有一个被很多人忽略的竞争维度:如果NVFP4在DLSS 5上只换来1%的增益,那NVFP4在其他端侧推理场景中的价值是否需要重估?AMD的FSR和英特尔的XeSS都在追赶。如果英伟达最强的架构特性在其最重要的应用场景上“失灵”了,竞争对手的追赶窗口可能会意外地变宽。
当然,这个判断必须加一个重要的限定条件:当前Mod只是粗粒度的表层转换。一个经过充分QAT训练的原生NVFP4模型表现会完全不同。但“原生训练”意味着时间和算力成本,在大模型Scaling Law竞争白热化的2026年,英伟达的算力资源同样稀缺。
三个信号,一个判断
第一个信号:DLSS 5的优化已进入边际收益递减区间。从“双卡才能跑”到“单卡流畅跑”用了6个月和5倍提升,但从5倍再往前推,每一步都会越来越难。
第二个信号:NVFP4的潜力释放需要模型原生支持,而不是“后装改造”。这不仅是DLSS 5的问题,也是整个AI推理行业从FP8向更低精度迁移时都会遇到的共性难题——硬件先走了一步,软件还没跟上。
第三个信号:英伟达选择了“先上市、后优化”的路线。DLSS 5在GTC 2026到9月首发之间完成了惊人的5倍优化,但消费者拿到手时,它仍然是一个“半成品”——NVFP4的兼容性、RTX 40系列的正式支持、模型形状覆盖的扩展,全都排在了后续路线图上。
对于RTX 50系列的用户,短期建议可能略显尴尬:在大多数游戏中,DLSS 5的神经渲染目前仍然是一个“画质优先于帧率”的开关。开启它之前,值得先问问自己——你是想要更好的光照反射,还是想要更流畅的战斗体验?
NVFP4绝不是一个失败的技术。它在LLM推理和AI训练场景中的表现已经证明了4位精度的巨大潜力。只是在实时图形渲染这个极端苛刻的场景下——延迟单位是毫秒、帧率波动能被肉眼察觉、575W的功耗墙就在那里——“理论优势”到“实际增益”之间的鸿沟,比大多数人想象的要宽得多。
硬件给了你更快的轮子,但路还没铺好。






快报